Endpoints dédiés#
Ultralytics Platform permet de déployer des modèles YOLO vers des points de terminaison dédiés dans 42 régions mondiales. Chaque point de terminaison est un service à locataire unique doté d'une URL de point de terminaison unique et d'une surveillance indépendante. La taille de ressource par défaut passe à zéro en cas d'inactivité ; les tailles personnalisées conservent une instance chaude et sont facturées au temps de fonctionnement.

Créer un endpoint#
Depuis l’onglet Deploy#
Déploie un modèle depuis son onglet Deploy :
- Accède à ton modèle
- Clique sur l’onglet Deploy
- Consulte la carte du monde et le tableau des régions, trié selon la latence mesurée depuis ton emplacement
- Clique sur Deploy dans la ligne de la région que tu veux utiliser
- Dans la boîte de dialogue, vérifie le processeur (CPU), la mémoire, la tarification et le nom du déploiement, puis clique sur Create Deployment
Le nom suggéré associe le nom du modèle et la ville de la région (par exemple yolo26n-iowa) et peut être modifié avant le déploiement. Le modèle doit posséder des poids, sinon l'onglet affiche un état vide à la place du tableau des régions.
Depuis la page Deployments#
Crée un déploiement depuis la page globale Deploy dans la barre latérale :
- Clique sur New Deployment
- Sélectionne un modèle dans le sélecteur de modèles, qui répertorie tes modèles terminés
- Sélectionne une région sur la mini-carte ou dans le tableau de latence
- Choisis le processeur (CPU) et la mémoire, examine la tarification et modifie le nom du déploiement suggéré si nécessaire
- Clique sur Create Deployment

Cycle de vie du déploiement#
stateDiagram-v2
[*] --> Creating: Deploy
Creating --> Deploying: Service starting
Deploying --> Ready: Service URL published
Ready --> Stopping: Stop
Ready --> Deploying: Replace model
Stopping --> Stopped: Stopped
Stopped --> Deploying: Start
Deploying --> Stopped: Start failed
Ready --> [*]: Delete
Stopped --> [*]: Delete
Creating --> Failed: Error
Deploying --> Failed: Error
Failed --> [*]: Delete
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff
classDef error fill:#F44336,color:#fff
classDef extern fill:#607D8B,color:#fff
class Creating,Deploying,Stopping proc
class Ready out
class Failed error
class Stopped externConnecte les alertes Slack pour recevoir un message lorsqu’un déploiement est prêt ou ne parvient pas à démarrer.
Sélection de la région#
Choisis parmi 42 régions du monde entier. La carte interactive des régions et le tableau affichent :
- Repères des régions : codés par couleur selon la latence, sur un dégradé du vert au rouge (les régions plus rapides sont plus vertes, les plus lentes plus rouges)
- Régions déployées : mises en évidence par un badge « Deployed » dans le tableau
- Régions en cours de déploiement : indicateur de pulsation animé sur le repère et la ligne du tableau
- Mise en évidence bidirectionnelle : le survol de la carte met en évidence la ligne correspondante du tableau, et inversement

Le tableau des régions sur l'onglet du modèle Deploy inclut :
| Colonne | Description |
|---|---|
| Emplacement | Ville et pays avec une icône de drapeau |
| Zone | Identifiant de la région |
| Latence | Temps de ping mesuré depuis ton navigateur |
| Distance | Distance par rapport à ton emplacement approximatif, en km |
| Actions | Bouton Deploy ou badge d’état « Deployed » |
Le tableau permet d’effectuer des recherches par ville, pays et zone, et est trié par latence par défaut.
La boîte de dialogue New Deployment (depuis la page globale Deploy) affiche un tableau des régions plus simple, avec uniquement les colonnes Emplacement, Latence et Sélectionner, et répertorie les 20 régions les plus rapides avec une note concernant les autres. Utilise la mini-carte pour sélectionner une autre région.
Ton navigateur mesure la latence vers chacune des 42 régions, puis les résultats sont mis en cache pendant 30 minutes et partagés entre l’onglet Deploy et la boîte de dialogue New Deployment. Utilise le bouton Rescan dans l’onglet Deploy du modèle pour effectuer une nouvelle mesure depuis ton réseau actuel. La distance est calculée à partir de l’emplacement approximatif de ta requête ; elle constitue donc une indication approximative plutôt qu’une valeur précise.
Régions disponibles#
| Zone | Emplacement |
|---|---|
| us-central1 | Iowa, États-Unis |
| us-east1 | Caroline du Sud, États-Unis |
| us-east4 | Virginie du Nord, États-Unis |
| us-east5 | Columbus, États-Unis |
| us-south1 | Dallas, États-Unis |
| us-west1 | Oregon, États-Unis |
| us-west2 | Los Angeles, États-Unis |
| us-west3 | Salt Lake City, États-Unis |
| us-west4 | Las Vegas, États-Unis |
| northamerica-northeast1 | Montréal, Canada |
| northamerica-northeast2 | Toronto, Canada |
| northamerica-south1 | Querétaro, Mexique |
| southamerica-east1 | São Paulo, Brésil |
| southamerica-west1 | Santiago, Chili |
Configuration de l'endpoint#
Boîte de dialogue New Deployment#
La boîte de dialogue New Deployment te permet de sélectionner un modèle, une région, des ressources et un nom de déploiement :
| Champ | Description |
|---|---|
| Modèle | Tout modèle terminé dans l'espace de travail, sélectionné à l'aide du sélecteur |
| Région | Région de déploiement, sélectionnée sur la mini-carte ou dans le tableau de latence |
| Processeur (CPU) et mémoire | Sélectionne la taille des ressources et examine sa tarification affichée |
| Nom du déploiement | Généré automatiquement une fois le modèle et la région définis, et modifiable |

Choisis la taille du processeur (CPU) et de la mémoire dans les contrôles des ressources et examine la tarification affichée avant de créer le déploiement. La taille par défaut peut utiliser une allocation de déploiement gratuite disponible ; les tailles personnalisées utilisent une tarification à l'utilisation. La taille par défaut passe à zéro en cas d'inactivité. Les tailles personnalisées conservent une instance chaude et sont facturées depuis la disponibilité jusqu'à l'arrêt du point de terminaison, y compris le temps d'inactivité. Agents réutilise cette boîte de dialogue lorsque tu sélectionnes New deployment….

Le nom du déploiement associe le nom du modèle à la ville de la région, par exemple yolo26n-iowa. Dans l'onglet du modèle Deploy, un suffixe numérique est ajouté lorsque ce modèle possède déjà un déploiement dans la région (par exemple yolo26n-iowa-2). Les noms doivent être uniques au sein d'un espace de travail : le déploiement d'un nom déjà existant renvoie une erreur au lieu de le renommer silencieusement.
Onglet Deploy (déploiement rapide)#
Le déploiement à partir de l'onglet Deploy du modèle ouvre la même boîte de dialogue avec le modèle et la région présélectionnés. Examine la taille des ressources, la tarification et le nom généré automatiquement avant de créer le point de terminaison. Le déploiement apparaît dans la liste Active Deployments pendant sa création.
Gérer les endpoints#
Modes d’affichage#
La liste des déploiements propose trois modes d'affichage :
| Mode | Description |
|---|---|
| Cartes | Fiches de détails complètes avec les onglets de journaux, de code, de prédiction et de surveillance éligibles |
| Compact | Grille de cartes plus petites avec les métriques clés |
| Tableau | Tableau de données avec colonnes triables et recherche |

Carte de déploiement (vue Cartes)#
Chaque carte de déploiement dans la vue Cartes affiche :
- En-tête : Nom, drapeau de la région, badge d'état et boutons d'action disponibles pour l'état actuel — mettre à jour la configuration, remplacer et arrêter lorsque Prêt, démarrer lorsque Arrêté, supprimer à tout moment
- URL de l'endpoint : URL copiable avec un lien vers la propre référence API de l'endpoint
- Métriques : nombre de requêtes (24 h), latence P95, taux d'erreur ou « Aucun trafic pour le moment »
- Vérification de l'état : indicateur d'état en temps réel avec latence et actualisation manuelle
- Onglets :
Logs,CodeetPredict; les points de terminaison payants affichent égalementMonitoring - Pied de page : préfixe de la clé API associée au déploiement et date à laquelle il est devenu prêt
- Message d'état : motif de l'échec lorsqu'un déploiement a échoué
L'URL, les métriques, la vérification de l'état et les onglets apparaissent uniquement lorsque le déploiement est Prêt. L'onglet Logs affiche les entrées de journal récentes avec filtrage par niveau de gravité (Tous / Erreurs). L'onglet Code affiche des exemples de code prêts à l'emploi en Python, JavaScript et cURL avec l'URL de ton endpoint, ainsi que la clé API associée pour les propriétaires de l'espace de travail (voir Surveillance). L'onglet Predict fournit un panneau de prédiction intégré pour effectuer des tests
directement sur le déploiement.
Les cartes compactes affichent le drapeau, le nom, la ville, l'état et les trois métriques. La vue Tableau permet de trier selon Nom, Région, État, Requêtes, P95 et Erreurs, et d'effectuer une recherche dans le nom, la région et l'état. Les deux vues conservent l'action de suppression ; les actions démarrer, arrêter et remplacer sont disponibles dans la vue Cartes.
Mettre à jour le processeur (CPU) et la mémoire#
- Ouvre un point de terminaison Prêt dans la vue Cartes.
- Clique sur Mettre à jour la configuration du déploiement.
- Choisis le processeur (CPU) et la mémoire, puis examine le coût horaire affiché.
- Clique sur Mettre à jour la configuration. La configuration actuelle continue de servir les requêtes jusqu'à ce que la nouvelle soit prête.

Les ressources personnalisées utilisent une facturation basée sur le temps de fonctionnement et maintiennent une instance active. Le retour aux ressources par défaut rétablit le comportement de mise à l'échelle à zéro et supprime l'onglet Surveillance payant.
Les graphiques de surveillance et les images d'exemple sont des données légères stockées en mémoire. L'arrêt, le redémarrage, le redéploiement, le redimensionnement ou le remplacement d'un modèle peuvent les effacer. Le redémarrage du point de terminaison ne restaure pas l'historique. Enregistre les exemples utiles dans un ensemble de données et attends la fin de l'ingestion avant de modifier le point de terminaison. Les métriques opérationnelles et journaux disposent de fenêtres d'historique distinctes.
Remplacer un modèle#
Remplace le modèle derrière un endpoint prêt sans modifier son URL :
- Ouvre le déploiement dans la vue Cartes
- Clique sur Remplacer le modèle
- Sélectionne un autre modèle terminé dans le même espace de travail
- Modifie éventuellement le nom du déploiement
- Clique sur Remplacer le modèle
Le modèle actuel continue de traiter les requêtes pendant le démarrage du remplacement. Une fois le remplacement prêt, le trafic est transféré vers le nouveau modèle. L'ID du déploiement, l'URL, la région et la clé API restent inchangés ; son nom d'affichage ne change que si tu en saisis un nouveau. Si le remplacement échoue, le modèle et le nom précédents restent actifs.
Le remplacement nécessite toutes les conditions suivantes et est sinon refusé :
- Le déploiement est Prêt et aucune autre opération de cycle de vie n'est en cours
- Le modèle de remplacement possède des poids et appartient au même espace de travail que le déploiement
- Le modèle de remplacement n'est pas celui qui est déjà déployé
Le remplacement supprime l'ancien modèle du déploiement. Chaque endpoint sert un seul modèle ; crée un autre déploiement lorsque tu as besoin que les deux modèles soient disponibles simultanément.
États des déploiements#
| Statut | Description |
|---|---|
| Création | Le déploiement est en cours de configuration |
| Déploiement | Le conteneur démarre |
| Prêt | L'endpoint est actif et accepte les requêtes |
| Arrêt | L'endpoint est en cours d'arrêt |
| Arrêté | L'endpoint est en pause et indisponible |
| Échec | Échec du déploiement (voir le message d'erreur) |
URL de l'endpoint#
Chaque endpoint possède une URL unique, par exemple :
https://predict-<deployment-id>-<hash>-<region>.a.run.app
Clique sur le bouton de copie pour copier l'URL. Clique sur l'icône de documentation pour ouvrir la référence de l'API du point de terminaison. Le point de terminaison dessert ces chemins :
| Chemin | Méthode | Description |
|---|---|---|
/predict | POST | Exécuter l'inférence ; nécessite la clé API du déploiement |
/health | GET | Vérification de disponibilité indiquant l'état du service et le nombre de modèles mis en cache |
/ | GET | Résumé de l'état du service déployé |
/docs | GET | Référence API interactive générée pour ce déploiement, ce modèle et cette région |
Gestion du cycle de vie#
Contrôle l'état de ton endpoint :
graph LR
R[Ready]:::out -->|Stop| S[Stopped]:::extern
S -->|Start| R
R -->|Delete| D[Deleted]:::error
S -->|Delete| D
classDef out fill:#9C27B0,color:#fff
classDef error fill:#F44336,color:#fff
classDef extern fill:#607D8B,color:#fff| Action | Description |
|---|---|
| Démarrer | Reprendre un endpoint arrêté |
| Arrêter | Mettre l'endpoint en pause |
| Delete | Supprimer définitivement l'endpoint |
Arrêter l'endpoint#
Arrête un endpoint lorsqu'il ne doit plus accepter de requêtes :
- Clique sur l'icône de pause de la carte du déploiement
- L'état de l'endpoint passe à « Stopping », puis à « Stopped »
Les endpoints arrêtés :
- N'accepte pas les requêtes et ne rapporte aucune métrique en direct ni aucun état de santé
- Arrête d'accumuler les frais de temps de fonctionnement
- Perd les statistiques de surveillance temporaires et les images d'exemple lorsque l'instance de service s'arrête
- conservent leur URL, leur région et leur clé API associée, et peuvent être redémarrés à tout moment
- sont toujours comptabilisés dans le quota de déploiements de ton forfait — supprime un endpoint pour libérer sa place
Supprimer l'endpoint#
Supprime définitivement un endpoint :
- Clique sur l'icône de suppression (corbeille) de la carte du déploiement
- Confirme la suppression dans la boîte de dialogue
La suppression est immédiate et irréversible — les déploiements ne sont pas déplacés dans la corbeille. La suppression de l'endpoint supprime son service et libère une place dans ton quota de déploiements. Tu peux toujours créer un nouvel endpoint, mais il reçoit une nouvelle URL.
Les déploiements sont également supprimés lorsque leur modèle ou leur projet est définitivement supprimé, ou lorsqu'un modèle ou un projet placé dans la corbeille arrive au terme de sa période de conservation.
Utiliser les endpoints#
Authentification#
Chaque déploiement est associé à une seule clé API de l'espace de travail qui possède le modèle. Inclus-la dans tes requêtes :
Authorization: Bearer YOUR_API_KEYL'endpoint accepte uniquement la clé associée lors de sa création : aucune autre clé ne permet d'y accéder — pas même une autre clé active du même espace de travail. Pour contrôler la clé associée, effectue le déploiement via l'API authentifiée avec la clé du propriétaire de l'espace de travail : cette clé exacte est associée, et tu la détiens déjà. Les déploiements créés autrement (via l'interface utilisateur de la Platform ou un appel API authentifié en tant que membre de l'équipe) associent automatiquement l'une des clés actives de l'espace de travail propriétaire — identifie-la grâce au préfixe de clé affiché dans le pied de page de la carte du déploiement, puis demande sa valeur au propriétaire de l'espace de travail, car lui seul peut consulter les valeurs des clés (voir Clés API). Les membres de l'équipe qui ne possèdent pas la clé associée peuvent tout de même exécuter l'inférence via le proxy de prédiction de la Platform dans le navigateur.
La suppression ou la désactivation de la clé API associée ne révoque pas l'accès direct à l'endpoint : toute personne qui détient la chaîne de la clé peut toujours appeler l'URL de l'endpoint. En revanche, le proxy de prédiction de la Platform ne fonctionne plus, car il vérifie la clé en temps réel et indique qu'elle n'est plus disponible. Pour révoquer complètement l'accès, arrête ou supprime le déploiement ; après la rotation des clés, recrée l'endpoint afin qu'il associe la nouvelle clé.
Requêtes directes vers l'endpoint#
Envoie les requêtes de production directement à l'URL affichée sur la carte du déploiement. Ces requêtes ne passent pas par le limiteur de débit de l'API de la Platform ; la limite de prédiction de 20 requêtes par minute ne s'applique donc pas. L'endpoint possède toujours sa propre limite de capacité :
- Une seule instance sert chaque endpoint et traite un nombre limité de requêtes simultanément
- Les requêtes qui ne peuvent pas être traitées rapidement renvoient
429avec un en-têteRetry-After - Une seule requête peut s'exécuter pendant 1 heure au maximum, ce qui permet de terminer l'inférence vidéo
- Les réponses de plus de 1 Ko sont compressées avec gzip et les requêtes de navigateur interorigines sont autorisées
Exemple de requête#
import requests
# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Send image for inference
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Paramètres de requête#
| Paramètre | Type | Valeur par défaut | Plage | Description |
|---|---|---|---|---|
file | file | - | - | Fichier image ou vidéo (requis sauf si source est défini) |
conf | float | 0.25 | 0.01 – 1.0 | Seuil minimal de confiance |
iou | float | 0.7 | 0.0 – 0.95 | Seuil IoU de NMS |
imgsz | int | 640 | 32 – 1280 | Taille de l’image d’entrée en pixels |
normalize | bool | false | - | Renvoyer les coordonnées des boîtes englobantes entre 0 et 1 |
decimals | int | 5 | 0 – 10 | Précision décimale des valeurs de coordonnées |
bits | int | 8 | 8, 12, 16 | Quantification de la carte de profondeur, uniquement pour les modèles de profondeur |
source | string | - | - | URL de l’image ou chaîne base64 (alternative à file) |
Consulte Réponses de profondeur pour savoir comment bits modifie la carte de profondeur renvoyée et comment
la décoder.
Les endpoints dédiés acceptent les images et les vidéos via le paramètre file.
- Formats d'image (jusqu'à 100 Mo) : AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
- Formats vidéo (jusqu'à 100 Mo) : ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV
Chaque image vidéo est traitée individuellement et les résultats sont renvoyés pour chaque image. Tu peux également transmettre une URL publique d'image ou une image encodée en base64 via le paramètre source au lieu de file. Les téléversements trop volumineux sont rejetés avec 413.
Format de réponse#
Identique à l'inférence partagée, avec des champs propres à la tâche.
FAQ#
Les limites d'endpoints dépendent du forfait :
- Free : jusqu'à 3 déploiements
- Pro : jusqu'à 10 déploiements
- Enterprise : déploiements illimités
Chaque modèle peut toujours être déployé dans plusieurs régions, dans la limite du quota de ton forfait. Le quota est comptabilisé pour l'espace de travail qui possède le modèle ; les membres de l'équipe qui déploient un modèle partagé utilisent donc le quota du propriétaire. Lorsque la limite est atteinte, une erreur te demande de supprimer d'abord un déploiement existant.
Non, les régions sont fixes. Pour changer de région :
- Supprime l'endpoint existant
- Crée un nouvel endpoint dans la région souhaitée
Le nouvel endpoint reçoit une nouvelle URL. Pour changer uniquement le modèle utilisé par un endpoint, utilise le remplacement de modèle, qui conserve l'URL.
Le temps de démarrage à froid dépend du modèle et du fait que l'endpoint soit ou non descendu à zéro ; la Platform laisse à un endpoint inactif un délai supplémentaire pour démarrer avant de le déclarer non sain. L'exécution d'un contrôle de santé depuis la carte du déploiement avant un pic de trafic réchauffe l'instance.
Non. Chaque déploiement sert le trafic sur l'URL d'endpoint générée et affichée sur sa carte de déploiement. Cette URL reste stable pendant toute la durée de vie du déploiement, y compris lors des remplacements de modèle.
Pour une couverture mondiale :