YOLO Vision 2026 :

Terminaux dédiés#

Ultralytics Platform permet de déployer des modèles YOLO vers des endpoints dédiés dans 42 régions mondiales. Chaque endpoint est un service à locataire unique avec un comportement de mise à l'échelle à zéro, une URL d'endpoint unique et une supervision indépendante.

Ultralytics Platform Model Deploy Tab With Region Map And Table

Créer un point de terminaison#

Depuis l'onglet Déployer#

Déploie un modèle depuis son onglet Deploy :

  1. Accède à ton modèle
  2. Clique sur l'onglet Deploy
  3. Examine la carte du monde et le tableau des régions, qui est trié par la latence mesurée depuis ton emplacement
  4. Clique sur Deploy dans la ligne de la région que tu souhaites utiliser

Le déploiement démarre immédiatement sans étape de nommage : le nom est généré à partir du nom du modèle et de la ville de la région (par exemple yolo26n-iowa). Le modèle doit posséder des poids, sinon l'onglet affiche un état vide à la place du tableau des régions.

Depuis la page Déploiements#

Crée un déploiement depuis la page globale Deploy dans la barre latérale :

  1. Clique sur New Deployment
  2. Sélectionne un modèle dans le sélecteur de modèles, qui liste tes modèles terminés
  3. Sélectionne une région sur la mini-carte ou dans le tableau de latence
  4. Vérifie le nom de déploiement généré automatiquement, que tu peux modifier ici
  5. Clique sur Deploy Model

Ultralytics Platform New Deployment Dialog With Model Selector And Region Map

Cycle de vie du déploiement#

stateDiagram-v2
    [*] --> Creating: Deploy
    Creating --> Deploying: Service starting
    Deploying --> Ready: Service URL published
    Ready --> Stopping: Stop
    Ready --> Deploying: Replace model
    Stopping --> Stopped: Stopped
    Stopped --> Deploying: Start
    Deploying --> Stopped: Start failed
    Ready --> [*]: Delete
    Stopped --> [*]: Delete
    Creating --> Failed: Error
    Deploying --> Failed: Error
    Failed --> [*]: Delete

    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
    class Creating,Deploying,Stopping proc
    class Ready out
    class Failed error
    class Stopped extern

Connecte les alertes Slack pour recevoir un message lorsqu'un déploiement devient prêt ou échoue à démarrer.

Sélection de la région#

Choisis parmi 42 régions à travers le monde. La carte interactive et le tableau des régions indiquent :

  • Repères de région : Codés par couleur selon la latence sur un dégradé du vert au rouge (les régions les plus rapides sont vertes, les plus lentes sont rouges)
  • Régions déployées : Mises en valeur par un badge "Déployé" dans le tableau
  • Régions en cours de déploiement : Indicateur de pulsation animé sur le repère et la ligne du tableau
  • Mise en évidence bidirectionnelle : Le survol sur la carte met en évidence la ligne du tableau, et vice versa

Ultralytics Platform Deploy Tab Region Latency Table Sorted By Latency Le tableau des régions sur l'onglet Deploy du modèle inclut :

ColonneDescription
LocationVille et pays avec une icône de drapeau
ZoneIdentifiant de la région
LatenceTemps de ping mesuré depuis ton navigateur
DistanceDistance par rapport à ton emplacement approximatif en km
ActionsBouton Déployer ou badge d'état "Deployed"

Le tableau permet une recherche par ville, pays et zone, et il est trié par défaut selon la latence.

Boîte de dialogue Nouveau déploiement

La boîte de dialogue New Deployment (depuis la page globale Deploy) affiche un tableau des régions simplifié comportant uniquement les colonnes Emplacement, Latence et Sélection, listant les 20 régions les plus rapides avec une note concernant les autres. Utilise la mini-carte pour choisir n'importe quelle autre région.

Comment la latence est mesurée

Ton navigateur mesure la latence vers chacune des 42 régions, et les résultats sont mis en cache pendant 30 minutes et partagés entre l'onglet Deploy et la boîte de dialogue New Deployment. Utilise le bouton Actualiser sur l'onglet du modèle Deploy pour effectuer une nouvelle mesure depuis ton réseau actuel. La distance est calculée à partir de l'emplacement approximatif de ta requête, il s'agit donc d'un ordre d'idée plutôt que d'une valeur précise.

Régions disponibles#

ZoneEmplacement
us-central1Iowa, USA
us-east1Caroline du Sud, USA
us-east4Virginie du Nord, USA
us-east5Columbus, USA
us-south1Dallas, USA
us-west1Oregon, USA
us-west2Los Angeles, USA
us-west3Salt Lake City, USA
us-west4Las Vegas, USA
northamerica-northeast1Montréal, Canada
northamerica-northeast2Toronto, Canada
northamerica-south1Queretaro, Mexique
southamerica-east1São Paulo, Brésil
southamerica-west1Santiago, Chili

Configuration de l'endpoint#

Boîte de dialogue Nouveau déploiement#

La boîte de dialogue New Deployment recueille trois entrées :

ChampDescription
ModèleN'importe quel modèle terminé dans l'espace de travail, choisi à l'aide du sélecteur
RégionRégion de déploiement, choisie sur la mini-carte ou dans le tableau de latence
Nom du déploiementGénéré automatiquement une fois que le modèle et la région sont définis, et modifiable

Ultralytics Platform New Deployment Dialog Fixed Resource Defaults Sous le nom, un panneau Ressources en lecture seule comporte un badge Custom resources coming soon. Les ressources ne sont pas configurables pour l'instant : chaque point de terminaison s'exécute en tant qu'instance unique qui se réduit à zéro en cas d'inactivité.

Noms générés automatiquement

Le nom du déploiement combine le nom du modèle avec la ville de la région, par exemple yolo26n-iowa. Sur l'onglet du modèle Deploy, un suffixe numérique est ajouté lorsque ce modèle possède déjà un déploiement dans la région (par exemple yolo26n-iowa-2). Les noms doivent être uniques au sein d'un espace de travail — déployer un nom qui existe déjà renvoie une erreur au lieu de renommer silencieusement.

Onglet Déploiement (Déploiement rapide)#

Le déploiement à partir de l'onglet Deploy du modèle utilise les mêmes ressources fixes et le même nom généré automatiquement, sans étape de dialogue. Le déploiement apparaît immédiatement dans la liste Déploiements actifs sous le tableau des régions pendant sa création.

Gérer les endpoints#

Modes d'affichage#

La liste des déploiements prend en charge trois modes d'affichage :

ModeDescription
CartesCartes détaillées avec journaux, exemples de code, panneau de prédiction
CompactGrille de cartes plus petites avec des mesures clés
TableauTableau de données (DataTable) avec colonnes triables et recherche

Ultralytics Platform Deploy Tab Active Deployments Cards View

Carte de déploiement (Vue cartes)#

Chaque carte de déploiement dans la vue cartes affiche :

  • En-tête : Nom, drapeau de la région, badge d'état et boutons d'action disponibles pour l'état actuel — remplacer et arrêter lorsque le statut est Prêt, démarrer lorsque le statut est Arrêté, supprimer à tout moment
  • URL du point de terminaison : URL copiable avec un lien vers la référence API propre au point de terminaison
  • Métriques : Nombre de requêtes (24 h), latence P95, taux d'erreur ou "Aucun trafic pour l'instant"
  • Contrôle de santé : Indicateur de santé en direct avec latence et rafraîchissement manuel
  • Tabs : Logs, Code et Predict
  • Pied de page : Le préfixe de la clé API liée au déploiement et la date à laquelle il est devenu prêt
  • Message d'état : La raison de l'échec, lorsqu'un déploiement a échoué

L'URL, les métriques, la vérification de l'état de santé et les onglets n'apparaissent que lorsque le déploiement est Prêt. L'onglet Logs affiche les entrées de journal récentes avec filtrage par gravité (Tous / Erreurs). L'onglet Code présente des exemples de code prêts à l'emploi en Python, JavaScript et cURL avec l'URL de ton point de terminaison, ainsi que la clé API liée pour les propriétaires d'espaces de travail (voir Monitoring). L'onglet Predict fournit un panneau de prédiction intégré pour tester directement sur le déploiement.

Vues compacte et en tableau

Les cartes compactes affichent le drapeau, le nom, la ville, l'état et les trois métriques. La vue en tableau peut être triée par Nom, Région, État, Requêtes, P95 et Erreurs, avec une recherche par nom, région et état. Les deux vues conservent l'action de suppression ; les actions démarrer, arrêter et remplacer sont disponibles dans la vue en cartes.

Remplacer un modèle#

Remplace le modèle associé à un endpoint prêt sans modifier son URL :

  1. Ouvre le déploiement en mode Cartes (Cards)
  2. Clique sur Remplacer le modèle (Replace model)
  3. Sélectionne un autre modèle entraîné du même espace de travail
  4. Modifie éventuellement le nom du déploiement
  5. Clique sur Remplacer le modèle (Replace Model)

Le modèle actuel continue de répondre pendant que le modèle de remplacement démarre. Une fois que le remplacement est prêt, le trafic bascule vers le nouveau modèle. L'ID de déploiement, l'URL, la région et la clé API restent inchangés ; son nom affiché ne change que lorsque tu en saisis un nouveau. Si le remplacement échoue, le modèle et le nom précédents restent actifs.

Le remplacement nécessite l'ensemble des éléments suivants, et est rejeté dans le cas contraire :

  • Le déploiement est Prêt et n'a aucune autre opération de cycle de vie en cours
  • Le modèle de remplacement possède des poids et appartient au même espace de travail que le déploiement
  • Le modèle de remplacement n'est pas celui qui est déjà déployé
Un modèle par endpoint

Le remplacement supprime le modèle précédent du déploiement. Chaque endpoint sert un seul modèle ; crée un autre déploiement si tu as besoin des deux modèles disponibles en même temps.

Statuts du déploiement#

StatutDescription
CréationLe déploiement est en cours de configuration
DéploiementLe conteneur est en cours de démarrage
PrêtL'endpoint est actif et accepte les requêtes
Arrêt en coursL'endpoint est en cours d'extinction
ArrêtéL'endpoint est mis en pause et indisponible
ÉchouéLe déploiement a échoué (voir le message d'erreur)

URL de l'endpoint#

Chaque endpoint possède une URL unique, par exemple :

https://predict-<deployment-id>-<hash>-<region>.a.run.app

Ultralytics Platform Deployment Card Endpoint Url With Copy Button Clique sur le bouton de copie pour copier l'URL. Clique sur l'icône de documentation pour ouvrir la référence API propre au point de terminaison. Le point de terminaison dessert ces chemins :

CheminMéthodeDescription
/predictPOSTExécuter l'inférence ; nécessite la clé API du déploiement
/healthGETVérification de vivacité signalant l'état du service et le nombre de modèles mis en cache
/GETRésumé de l'état du service déployé
/docsGETRéférence API interactive générée pour ce déploiement, ce modèle et cette région

Gestion du cycle de vie#

Contrôle l'état de ton endpoint :

graph LR
    R[Ready]:::out -->|Stop| S[Stopped]:::extern
    S -->|Start| R
    R -->|Delete| D[Deleted]:::error
    S -->|Delete| D

    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
ActionDescription
DémarrerRelancer un endpoint arrêté
ArrêterMettre en pause l'endpoint
SupprimerSupprimer définitivement l'endpoint

Arrêter l'endpoint#

Arrête un endpoint lorsque tu ne veux pas qu'il accepte de requêtes :

  1. Clique sur l'icône de pause sur la carte de déploiement
  2. Le statut de l'endpoint passe à "Arrêt en cours" puis "Arrêté"

Endpoints arrêtés :

  • N'acceptent pas les requêtes et ne signalent aucune métrique ni aucun état de santé
  • Conservent leur URL, leur région et leur clé API liée, et peuvent être redémarrés à tout moment
  • Comptent toujours dans le quota de déploiement de ton abonnement — supprime un point de terminaison pour libérer son emplacement

Supprimer l'endpoint#

Supprimer définitivement un endpoint :

  1. Clique sur l'icône de suppression (corbeille) sur la carte de déploiement
  2. Confirme la suppression dans la boîte de dialogue
Action permanente

La suppression est immédiate et définitive — les déploiements ne vont pas dans la Corbeille. La suppression du point de terminaison retire son service et libère un emplacement dans ton quota de déploiement. Tu peux toujours créer un nouveau point de terminaison, mais il reçoit une nouvelle URL.

Les déploiements sont également supprimés lorsque leur modèle ou leur projet est définitivement supprimé, ou lorsqu'un modèle ou un projet mis à la corbeille atteint la fin de sa période de rétention.

Utiliser les endpoints#

Authentification#

Chaque déploiement est lié à une seule clé API provenant de l'espace de travail qui possède le modèle. Inclus-la dans tes requêtes :

Authorization: Bearer YOUR_API_KEY

Le point de terminaison n'accepte que la clé liée lors de sa création, donc aucune autre clé ne l'ouvre — pas même une autre clé active dans le même espace de travail. Pour contrôler quelle clé est liée, effectue le déploiement via l'API authentifiée avec la clé du propriétaire de l'espace de travail : cette clé exacte est liée, et tu la possèdes déjà. Les déploiements créés par tout autre moyen (l'interface utilisateur de la plateforme, ou un appel API authentifié en tant que membre d'équipe) lient automatiquement l'une des clés actives de l'espace de travail propriétaire — identifie-la grâce au préfixe de clé affiché dans le pied de page de la carte de déploiement, et demande sa valeur au propriétaire de l'espace de travail, car lui seul peut consulter les valeurs des clés (voir Clés API). Les membres de l'équipe ne disposant pas de la clé liée peuvent toujours exécuter une inférence via le proxy de prédiction de la plateforme dans le navigateur.

La suppression de la clé liée ne verrouille pas le point de terminaison

La suppression ou la désactivation de la clé API liée ne révoque pas l'accès direct au point de terminaison — quiconque détient la chaîne de caractères de la clé peut toujours appeler l'URL du point de terminaison. Ce qui ne fonctionne plus, c'est le proxy de prédiction de la plateforme, qui vérifie la clé en direct et signale qu'elle n'est plus disponible. Pour révoquer complètement l'accès, arrête ou supprime le déploiement ; après avoir fait pivoter les clés, crée à nouveau le point de terminaison pour qu'il lie la nouvelle clé.

Requêtes directes d'endpoint#

Envoie les requêtes de production directement à l'URL affichée sur la carte de déploiement. Ces requêtes ne passent pas par le limiteur de débit de l'API de la plateforme, la limite de 20 requêtes par minute pour les prédictions ne s'applique donc pas. Le point de terminaison possède toujours sa propre limite de capacité :

  • Une seule instance dessert chaque point de terminaison, traitant un nombre limité de requêtes à la fois
  • Les requêtes qui ne peuvent pas être traitées rapidement renvoient 429 avec un en-tête Retry-After
  • Une seule requête peut s'exécuter pendant une durée maximale de 1 heure, ce qui permet à l'inférence vidéo de se terminer
  • Les réponses supérieures à 1 Ko sont compressées au format gzip, et les requêtes de navigateur inter-origines sont autorisées

Exemple de requête#

import requests

# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Send image for inference
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Paramètres de requête#

ParamètreTypeDéfautPlageDescription
filefichier--Fichier image ou vidéo (requis sauf si source est défini)
confflottant0.250.01 – 1.0Seuil de confiance minimum
iouflottant0.70.0 – 0.95Seuil IoU NMS
imgszentier64032 – 1280Taille de l'image d'entrée en pixels
normalizeboolfalse-Retourne les coordonnées des boîtes englobantes entre 0 et 1
decimalsentier50 – 10Précision décimale pour les valeurs de coordonnées
bitsentier88, 12, 16Quantification de la carte de profondeur, modèles de profondeur uniquement
sourcecha'ne de caract'res--URL d'image ou chaîne en base64 (alternative à file)

Consulte Réponses de profondeur pour savoir comment bits modifie la carte de profondeur renvoyée et comment la décoder.

Inférence vidéo

Les endpoints dédiés acceptent à la fois les images et les vidéos via le paramètre file.

  • Formats d'image (jusqu'à 100 Mo) : AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Formats vidéo (jusqu'à 100 Mo) : ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Chaque image vidéo est traitée individuellement et les résultats sont renvoyés par image. Tu peux également passer l'URL d'une image publique ou une image encodée en base64 via le paramètre source au lieu de file. Les téléversements surdimensionnés sont rejetés avec 413.

Format de réponse#

Identique à shared inference avec des champs spécifiques aux tâches.

FAQ#

  • Les limites des endpoints dépendent du plan :

    • Gratuit : Jusqu'à 3 déploiements
    • Pro : Jusqu'à 10 déploiements
    • Enterprise : Déploiements illimités

    Chaque modèle peut toujours être déployé dans plusieurs régions dans la limite du quota de ton abonnement. Le quota est décompté de l'espace de travail qui possède le modèle, de sorte que les membres de l'équipe déployant un modèle partagé consomment l'allocation du propriétaire. Atteindre la limite renvoie une erreur te demandant de supprimer d'abord un déploiement existant.

  • Non, les régions sont fixes. Pour changer de région :

    1. Supprime l'endpoint existant
    2. Crée un nouvel endpoint dans la région souhaitée

    Le nouveau point de terminaison reçoit une nouvelle URL. Pour modifier uniquement le modèle sous-jacent à un point de terminaison, utilise le remplacement de modèle, qui conserve l'URL.

  • Pour une couverture mondiale :

    1. Déploie dans plusieurs régions
    2. Utilise un équilibreur de charge ou un routage DNS
    3. Route les utilisateurs vers l'endpoint le plus proche
  • Le temps de démarrage à froid dépend du modèle et du fait que le point de terminaison ait été réduit à zéro ; la plateforme accorde à un point de terminaison inactif un délai supplémentaire pour démarrer avant de le signaler comme non sain. L'exécution d'une vérification de l'état de santé depuis la carte de déploiement avant un pic de trafic réchauffe l'instance.

  • Non. Chaque déploiement dessert le trafic sur l'URL de point de terminaison générée qui est affichée sur sa carte de déploiement, laquelle reste stable pendant toute la durée de vie du déploiement — y compris lors des remplacements de modèles.

Commentaires