Points de terminaison dédiés#
Ultralytics Platform permet de déployer des modèles YOLO sur des points de terminaison dédiés dans 42 régions du monde. Chaque point de terminaison est un service à locataire unique, avec une URL unique et une surveillance indépendante. Par défaut, les ressources sont ramenées à zéro en cas d’inactivité ; les tailles personnalisées maintiennent une instance active et sont facturées en fonction de la durée de disponibilité.

Créer un point de terminaison#
Depuis l’onglet Deploy#
Déploie un modèle depuis son onglet Deploy :
- Accède à ton modèle
- Clique sur l’onglet Deploy
- Consulte la carte du monde et le tableau des régions, trié selon la latence mesurée depuis ton emplacement
- Clique sur Deploy dans la ligne de la région que tu veux utiliser
- Dans la boîte de dialogue, vérifie le CPU, la mémoire, le prix et le nom du déploiement, puis clique sur Create Deployment
Le nom suggéré combine le nom du modèle et celui de la ville de la région (par exemple yolo26n-iowa) et peut être modifié avant le déploiement. Le modèle doit avoir des poids ; sinon, l’onglet affiche un état vide au lieu du tableau des régions.
Depuis l’onglet Deployments#
Crée un déploiement depuis l’onglet Deployments de ton profil ou depuis la barre latérale :
- Clique sur New Deployment dans l’onglet Deployments, ou sur
+à côté de Deployments dans la barre latérale - Sélectionne un modèle dans le sélecteur de modèles, qui répertorie les modèles que tu as terminés
- Sélectionne une région sur la mini-carte ou dans le tableau des latences
- Choisis le CPU et la mémoire, vérifie le prix et modifie le nom de déploiement suggéré si nécessaire
- Clique sur Create Deployment

Cycle de vie du déploiement#
Associe les alertes Slack pour recevoir un message lorsqu’un déploiement est prêt ou ne parvient pas à démarrer.
Sélection de la région#
Choisis parmi 42 régions du monde. La carte interactive des régions et le tableau affichent :
- Repères des régions : code couleur selon la latence, avec un dégradé du vert au rouge (les régions plus rapides sont plus vertes, les plus lentes plus rouges)
- Régions déployées : mises en évidence par un badge « Deployed » dans le tableau
- Régions en cours de déploiement : indicateur animé sur le repère et la ligne du tableau
- Mise en évidence réciproque : survole la carte pour mettre en évidence la ligne correspondante du tableau, et inversement

Le tableau des régions de l’onglet Deploy du modèle comprend :
| Colonne | Description |
|---|---|
| Emplacement | Ville et pays avec icône de drapeau |
| Zone | Identifiant de la région |
| Latence | Temps de ping mesuré depuis ton navigateur |
| Distance | Distance approximative depuis ton emplacement, en km |
| Actions | Bouton Deploy ou badge d’état « Deployed » |
Le tableau peut être filtré par ville, pays et zone, et il est trié par latence par défaut.
La boîte de dialogue New Deployment (accessible depuis l’onglet Deployments ou la barre latérale) affiche un tableau des régions simplifié, comprenant uniquement les colonnes Emplacement, Latence et Sélectionner, et répertorie les 20 régions les plus rapides avec une note sur les autres. Utilise la mini-carte pour choisir une autre région.
Ton navigateur mesure la latence vers chacune des 42 régions. Les résultats sont mis en cache pendant 30 minutes et partagés entre l’onglet Deploy et la boîte de dialogue New Deployment. Utilise le bouton Rescan dans l’onglet Deploy du modèle pour effectuer une nouvelle mesure depuis ton réseau actuel. La distance est calculée à partir de l’emplacement approximatif de ta requête ; il s’agit donc d’une estimation et non d’une valeur précise.
Régions disponibles#
| Zone | Emplacement |
|---|---|
| us-central1 | Iowa, États-Unis |
| us-east1 | Caroline du Sud, États-Unis |
| us-east4 | Virginie du Nord, États-Unis |
| us-east5 | Columbus, États-Unis |
| us-south1 | Dallas, États-Unis |
| us-west1 | Oregon, États-Unis |
| us-west2 | Los Angeles, États-Unis |
| us-west3 | Salt Lake City, États-Unis |
| us-west4 | Las Vegas, États-Unis |
| northamerica-northeast1 | Montréal, Canada |
| northamerica-northeast2 | Toronto, Canada |
| northamerica-south1 | Querétaro, Mexique |
| southamerica-east1 | São Paulo, Brésil |
| southamerica-west1 | Santiago, Chili |
Configuration du point de terminaison#
Nouvelle boîte de dialogue de déploiement#
La boîte de dialogue New Deployment te permet de sélectionner un modèle, une région, des ressources et un nom de déploiement :
| Champ | Description |
|---|---|
| Modèle | N’importe quel modèle terminé de l’espace de travail, sélectionné à l’aide du sélecteur |
| Région | Région de déploiement, sélectionnée sur la mini-carte ou dans le tableau de latence |
| CPU et mémoire | Sélectionne la taille des ressources et consulte le tarif affiché |
| Nom du déploiement | Généré automatiquement lorsque le modèle et la région sont définis, et modifiable |

Choisis la taille du CPU et de la mémoire dans les commandes de ressources et consulte le tarif affiché avant de créer le déploiement. Les options de CPU sont 1, 2, 4, 6 ou 8 vCPU et les options de mémoire vont de 2 à 32 GiB ; les tailles de mémoire supérieures nécessitent davantage de vCPU (par exemple, 16 GiB nécessitent au moins 4 vCPU), et la boîte de dialogue explique toute combinaison non valide. La taille par défaut (1 vCPU, 2 GiB) est gratuite et passe à zéro en l’absence d’activité. Les tailles personnalisées maintiennent une instance active et sont facturées au tarif horaire régional affiché, à partir de leur disponibilité et jusqu’à l’arrêt du point de terminaison, y compris pendant les périodes d’inactivité. La création, le démarrage ou le redimensionnement vers une taille personnalisée nécessite des crédits disponibles, et les points de terminaison de taille personnalisée sont arrêtés automatiquement lorsque l’espace de travail n’a plus de crédits. Agents réutilise cette boîte de dialogue lorsque tu sélectionnes Nouveau déploiement….

Le nom du déploiement combine le nom du modèle et la ville de la région, par exemple yolo26n-iowa. Les noms doivent être uniques dans un espace de travail : si le nom est déjà utilisé, la boîte de dialogue affiche une erreur en ligne et désactive Créer le déploiement jusqu’à ce que tu choisisses un autre nom.
Onglet Déployer (déploiement rapide)#
Le déploiement depuis l’onglet Deploy du modèle ouvre la même boîte de dialogue, avec le modèle et la région présélectionnés. Vérifie la taille des ressources, le tarif et le nom généré automatiquement avant de créer le point de terminaison. Pendant sa création, le déploiement apparaît dans la liste des déploiements du modèle, sous le tableau des régions.
Gérer les points de terminaison#
Modes d’affichage#
La liste des déploiements propose trois modes d’affichage :
| Mode | Description |
|---|---|
| Cartes | Cartes avec l’état, la taille, les métriques, la distance et la date de déploiement |
| Compact | Grille de cartes plus petites présentant les principales métriques |
| Tableau | Tableau de données avec colonnes triables |

Les cartes compactes affichent le drapeau, le nom, la ville, l’état et les trois métriques. Le tableau peut être trié selon les colonnes Nom, Région, État, CPU, Mémoire, Requêtes HTTP, Taux d’erreur HTTP, Latence P95 HTTP, Distance et Date de déploiement. Chaque carte et chaque ligne renvoie à la page du déploiement ; les actions sur le cycle de vie se trouvent sur cette page, et l’icône de corbeille à côté d’un déploiement dans la barre latérale permet de le supprimer.
Page du déploiement#
Chaque déploiement a sa propre page à l’adresse /{username}/deploy/{deployment}, qui affiche :
- En-tête : drapeau de la région, nom affiché (clique dessus pour le renommer ; l’URL de la page et le chemin d’accès API deviennent un slug basé sur le nouveau nom, mais pas l’URL du point de terminaison), badge d’état, emplacement, et taille du CPU et de la mémoire
- Actions : Mettre à jour la configuration, Remplacer le modèle et Arrêter le déploiement lorsque l’état est Prêt ; Démarrer le déploiement lorsque l’état est Arrêté ; et un menu Autres actions (…) proposant Informations, Actualiser et Supprimer le déploiement
- Métriques : requêtes HTTP, taux d’erreur HTTP et latence P95 HTTP sur 24 heures avec des graphiques miniatures, ainsi qu’une carte renvoyant au modèle déployé
- Onglets :
Overview,Monitoring,PredictetLogs - Message d’état : raison de l’échec, lorsqu’un déploiement a échoué
L’onglet Overview affiche la carte de l’emplacement, la carte Point de terminaison avec l’URL du point de terminaison à copier, un lien vers la Documentation de l’API et un contrôle d’état, ainsi qu’une carte Informations sur le déploiement avec le tarif, la région, le CPU et la mémoire. L’onglet Logs affiche les entrées récentes du journal avec un filtre par niveau de gravité (Toutes / Erreurs). L’onglet Predict propose un panneau de prédiction intégré pour tester directement le déploiement ; son onglet de résultats Docs contient des exemples de code prêts à l’emploi en Python, JavaScript et cURL, préremplis avec l’URL du point de terminaison et, pour les propriétaires de l’espace de travail, la clé API associée (voir Surveillance). La boîte de dialogue Informations répertorie les propriétés du déploiement et te permet de modifier les métadonnées personnalisées.
Mettre à jour le CPU et la mémoire#
- Ouvre la page de déploiement d’un point de terminaison Prêt.
- Clique sur Mettre à jour la configuration.
- Choisis CPU et Mémoire, puis consulte le coût horaire affiché.
- Clique sur Mettre à jour la configuration. La configuration actuelle continue de traiter les requêtes jusqu’à ce que la nouvelle soit prête.

Les ressources personnalisées sont facturées selon la durée de fonctionnement et maintiennent une instance active ; elles peuvent également maintenir une caméra IP en marche sans frais supplémentaires (voir Caméra en arrière-plan). Le retour aux ressources par défaut rétablit le comportement de réduction à zéro et supprime la caméra en arrière-plan.
Les graphiques de surveillance et les images d’exemple sont des données légères stockées en mémoire. L’arrêt, le redémarrage, le redéploiement, le redimensionnement ou le remplacement d’un modèle peut les effacer. Le redémarrage du point de terminaison ne restaure pas l’historique. Enregistre les exemples utiles dans un jeu de données et attends la fin de l’ingestion avant de modifier le point de terminaison. Les métriques opérationnelles et les journaux ont des périodes d’historique distinctes.
Remplacer un modèle#
Remplace le modèle utilisé par un point de terminaison prêt sans modifier son URL :
- Ouvre la page du déploiement
- Clique sur Remplacer le modèle
- Sélectionne un autre modèle terminé dans le même espace de travail
- Modifie éventuellement le nom du déploiement
- Clique sur Remplacer le modèle
Le modèle actuel continue de traiter les requêtes pendant le démarrage du modèle de remplacement. Une fois le nouveau modèle prêt, le trafic est redirigé vers celui-ci. L’ID du déploiement, l’URL, la région et la clé API restent inchangés ; seul le nom affiché change si tu en saisis un nouveau. En cas d’échec du remplacement, le modèle et le nom précédents restent actifs.
Le remplacement nécessite toutes les conditions suivantes ; sinon, il est refusé :
- Le déploiement est Prêt et aucune autre opération de cycle de vie n'est en cours
- Le modèle de remplacement possède des poids et appartient au même espace de travail que le déploiement
- Le modèle de remplacement n'est pas celui déjà déployé
Le remplacement supprime le modèle précédent du déploiement. Chaque point de terminaison sert un seul modèle ; crée un autre déploiement si tu as besoin que les deux modèles soient disponibles en même temps.
États du déploiement#
| Statut | Description |
|---|---|
| Création | Le déploiement est en cours de configuration |
| Déploiement en cours | Le conteneur démarre |
| Prêt | Le point de terminaison est en ligne et accepte les requêtes |
| Arrêt en cours | Le point de terminaison s'arrête |
| Arrêté | En pause ou échec du démarrage ; clique sur Démarrer |
Sur un déploiement Prêt, le badge de la page affiche Démarrage jusqu'à ce que le point de terminaison réponde à sa première vérification de l'état de santé, et Ne répond pas si la vérification échoue.
URL du point de terminaison#
Chaque point de terminaison possède une URL unique, par exemple :
https://predict-<deployment-id>-<hash>-<region>.a.run.app
Clique sur le bouton de copie pour copier l'URL. Clique sur Documentation de l'API pour ouvrir la référence API propre au point de terminaison. Le point de terminaison sert les chemins suivants :
| Chemin | Méthode | Description |
|---|---|---|
/predict | POST | Exécuter l'inférence ; la clé API du déploiement est requise |
/health | GET | Vérification de disponibilité indiquant l'état du service et le nombre de modèles en cache |
/ | GET | Résumé de l'état du service déployé |
/docs | GET | Référence API interactive générée pour ce déploiement, ce modèle et cette région |
Gestion du cycle de vie#
Contrôle l'état de ton point de terminaison :
| Action | Description |
|---|---|
| Démarrer | Redémarrer un point de terminaison arrêté |
| Arrêter | Mettre le point de terminaison en pause |
| Supprimer | Supprimer définitivement le point de terminaison |
Arrêter le point de terminaison#
Arrête un point de terminaison si tu ne veux pas qu'il accepte de requêtes :
- Clique sur Arrêter le déploiement sur la page du déploiement
- L'état du point de terminaison passe à « Arrêt en cours », puis à « Arrêté »
Les points de terminaison arrêtés :
- N'acceptent pas de requêtes et ne fournissent aucune métrique en direct ni aucun état de santé
- Cessent d'accumuler des frais de disponibilité
- Perdent les statistiques de surveillance temporaires et les images d'exemple lorsque l'instance de service s'arrête
- Conservent leur URL, leur région et leur clé API associée, et peuvent être redémarrés à tout moment
- Continuent de compter dans le quota de déploiements de ton forfait — supprime un point de terminaison pour libérer sa place
Supprimer le point de terminaison#
Supprime définitivement un point de terminaison :
- Ouvre Plus d'actions (…) sur la page du déploiement, puis clique sur Supprimer le déploiement, ou clique sur l'icône de corbeille à côté du déploiement dans la barre latérale
- Confirme en cliquant sur Supprimer
La suppression est immédiate et définitive : les déploiements ne sont pas déplacés dans la Corbeille. La suppression du point de terminaison supprime son service et libère une place dans ton quota de déploiements. Tu peux toujours créer un nouveau point de terminaison, mais il reçoit une nouvelle URL.
Les déploiements sont également supprimés lorsque leur modèle ou leur projet est définitivement supprimé, ou lorsqu'un modèle ou un projet placé dans la corbeille arrive à la fin de sa période de conservation.
Utiliser les points de terminaison#
Authentification#
Chaque déploiement est associé à une seule clé API de l'espace de travail auquel appartient le modèle. Inclus-la dans tes requêtes :
Authorization: Bearer YOUR_API_KEYLe point de terminaison n'accepte que la clé associée lors de sa création : aucune autre clé ne permet d'y accéder, pas même une autre clé active du même espace de travail. Pour choisir la clé associée, déploie via l'API authentifiée avec la clé du propriétaire de l'espace de travail : cette clé précise sera associée, et tu la détiens déjà. Les déploiements créés d'une autre manière (via l'interface Platform ou un appel API authentifié en tant que membre de l'équipe) associent automatiquement l'une des clés actives de l'espace de travail propriétaire — demande sa valeur au propriétaire de l'espace de travail, car seul le propriétaire peut consulter les valeurs des clés (voir Clés API). Les membres de l'équipe qui ne possèdent pas la clé associée peuvent tout de même exécuter l'inférence via le proxy de prédiction Platform dans le navigateur.
La suppression ou la désactivation de la clé API associée ne révoque pas l'accès direct au point de terminaison : toute personne détenant la chaîne de la clé peut toujours appeler l'URL du point de terminaison. En revanche, le proxy de prédiction Platform cesse de fonctionner : il vérifie la clé en temps réel et indique qu'elle n'est plus disponible. Pour révoquer complètement l'accès, arrête ou supprime le déploiement ; après avoir renouvelé les clés, recrée le point de terminaison pour qu'il associe la nouvelle clé.
Requêtes directes au point de terminaison#
Envoie les requêtes de production directement à l'URL indiquée sur la page du déploiement. Ces requêtes ne passent pas par le limiteur de débit de l'API Platform : la limite de prédiction de 20 requêtes/minute ne s'applique donc pas. Le point de terminaison possède toutefois son propre plafond de capacité :
- Une seule instance sert chaque point de terminaison et traite un nombre limité de requêtes simultanément
- Les requêtes qui ne peuvent pas être traitées rapidement renvoient
429avec un en-têteRetry-After - Une requête unique peut s'exécuter pendant une durée maximale d'une heure, ce qui permet à l'inférence vidéo d'aboutir
- La taille des corps des requêtes est limitée à 32 Mo ; les chargements plus volumineux sont rejetés avec
413 - Les réponses de plus de 1 Ko sont compressées avec gzip, et les requêtes navigateur interorigines sont autorisées
Exemple de requête#
import requests
# Point de terminaison de déploiement
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# En-têtes contenant ta clé API de déploiement
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Paramètres d'inférence
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Envoyer une image pour l'inférence
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Paramètres de requête#
| Paramètre | Type | Valeur par défaut | Plage | Description |
|---|---|---|---|---|
file | fichier | - | - | Fichier image ou vidéo (obligatoire sauf si source est défini) |
conf | float | 0.25 | 0.01 – 1.0 | Seuil de confiance minimal |
iou | float | 0.7 | 0.0 – 0.95 | Seuil IoU de la NMS |
imgsz | int | - | 32 – 1280 | Taille de l’image d’entrée en pixels ; par défaut, la taille utilisée pour l’entraînement du modèle (640 si elle n’est pas disponible) |
normalize | bool | false | - | Renvoyer les coordonnées des boîtes englobantes entre 0 et 1 |
decimals | int | 5 | 0 – 10 | Précision décimale des valeurs de coordonnées |
vid_stride | int | 1 | ≥ 1 | Prédire une image vidéo sur N ; les images fixes ne sont pas concernées |
bits | int | 8 | 8, 12, 16 | Quantification de la carte de profondeur, modèles de profondeur uniquement |
source | chaîne | - | - | URL d’image ou chaîne encodée en base64 (alternative à file) ; 4 096 caractères max. via l’API de la plateforme |
Un point de terminaison conserve l'environnement d'exécution d'inférence de son dernier déploiement ; un nouveau comportement, comme la valeur par défaut de taille d'entraînement imgsz ou vid_stride ci-dessus, s'applique donc lors du déploiement d'une nouvelle révision, par exemple après avoir remplacé son modèle ou modifié son CPU ou sa mémoire. Passe explicitement imgsz pour fixer la taille d'entrée.
Consulte Réponses de profondeur pour savoir comment bits modifie la carte de profondeur renvoyée et comment la décoder.
Les points de terminaison dédiés acceptent les images et les vidéos via le paramètre file.
- Formats d'image (jusqu'à 32 Mo par requête) : AVIF, BMP, DNG, HEIC, HEIF, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
- Formats vidéo (jusqu'à 32 Mo par requête) : ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV
Les résultats sont renvoyés pour chaque image vidéo traitée ; les modèles de profondeur acceptent uniquement les images. Tu peux également transmettre une URL d'image publique ou une image encodée en base64 via le paramètre source, au lieu de file. Les chargements trop volumineux sont rejetés avec 413.
Format de réponse#
Identique à l'inférence partagée, avec des champs propres à la tâche.
FAQ#
Les limites de points de terminaison dépendent du forfait :
- Gratuit : jusqu'à 3 déploiements
- Pro : jusqu'à 10 déploiements
- Enterprise : nombre illimité de déploiements
Chaque modèle peut tout de même être déployé dans plusieurs régions, dans la limite du quota de ton forfait. Le quota est imputé à l'espace de travail auquel appartient le modèle ; les membres de l'équipe qui déploient un modèle partagé consomment donc le quota du propriétaire. Si tu atteins la limite, une erreur te demande de supprimer d'abord un déploiement existant.
Non, les régions sont fixes. Pour changer de région :
- Supprime le point de terminaison existant
- Crée un nouveau point de terminaison dans la région souhaitée
Le nouveau point de terminaison reçoit une nouvelle URL. Pour changer uniquement le modèle associé à un point de terminaison, utilise le remplacement de modèle, qui conserve l'URL.
Pour une couverture mondiale :
- Déploie dans plusieurs régions
- Utilise un répartiteur de charge ou le routage DNS
- Achemine les utilisateurs vers le point de terminaison le plus proche
La durée de démarrage à froid dépend du modèle et du fait que le point de terminaison soit descendu à zéro ou non ; le démarrage depuis l'inactivité peut prendre environ une minute, et Platform laisse à un point de terminaison inactif un délai supplémentaire pour démarrer avant de le signaler comme non sain. Ouvrir la page du déploiement ou relancer sa vérification de l'état de santé réchauffe un point de terminaison inactif ; fais donc l'une ou l'autre de ces actions avant l'arrivée d'un pic de trafic.
Non. Chaque déploiement sert le trafic sur l'URL de point de terminaison générée, affichée sur sa page de déploiement, qui reste stable pendant toute la durée du déploiement, y compris lors des remplacements de modèle.