Ultralytics YOLO27 :

Endpoints dédiés#

Ultralytics Platform permet de déployer des modèles YOLO vers des points de terminaison dédiés dans 42 régions mondiales. Chaque point de terminaison est un service à locataire unique doté d'une URL de point de terminaison unique et d'une surveillance indépendante. La taille de ressource par défaut passe à zéro en cas d'inactivité ; les tailles personnalisées conservent une instance chaude et sont facturées au temps de fonctionnement.

Onglet de déploiement d’Ultralytics Platform avec carte des régions et tableau

Créer un endpoint#

Depuis l’onglet Deploy#

Déploie un modèle depuis son onglet Deploy :

  1. Accède à ton modèle
  2. Clique sur l’onglet Deploy
  3. Consulte la carte du monde et le tableau des régions, trié selon la latence mesurée depuis ton emplacement
  4. Clique sur Deploy dans la ligne de la région que tu veux utiliser
  5. Dans la boîte de dialogue, vérifie le processeur (CPU), la mémoire, la tarification et le nom du déploiement, puis clique sur Create Deployment

Le nom suggéré associe le nom du modèle et la ville de la région (par exemple yolo26n-iowa) et peut être modifié avant le déploiement. Le modèle doit posséder des poids, sinon l'onglet affiche un état vide à la place du tableau des régions.

Depuis la page Deployments#

Crée un déploiement depuis la page globale Deploy dans la barre latérale :

  1. Clique sur New Deployment
  2. Sélectionne un modèle dans le sélecteur de modèles, qui répertorie tes modèles terminés
  3. Sélectionne une région sur la mini-carte ou dans le tableau de latence
  4. Choisis le processeur (CPU) et la mémoire, examine la tarification et modifie le nom du déploiement suggéré si nécessaire
  5. Clique sur Create Deployment

Boîte de dialogue New Deployment d’Ultralytics Platform avec sélecteur de modèles et carte des régions

Cycle de vie du déploiement#

stateDiagram-v2
    [*] --> Creating: Deploy
    Creating --> Deploying: Service starting
    Deploying --> Ready: Service URL published
    Ready --> Stopping: Stop
    Ready --> Deploying: Replace model
    Stopping --> Stopped: Stopped
    Stopped --> Deploying: Start
    Deploying --> Stopped: Start failed
    Ready --> [*]: Delete
    Stopped --> [*]: Delete
    Creating --> Failed: Error
    Deploying --> Failed: Error
    Failed --> [*]: Delete

    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
    class Creating,Deploying,Stopping proc
    class Ready out
    class Failed error
    class Stopped extern

Connecte les alertes Slack pour recevoir un message lorsqu’un déploiement est prêt ou ne parvient pas à démarrer.

Sélection de la région#

Choisis parmi 42 régions du monde entier. La carte interactive des régions et le tableau affichent :

  • Repères des régions : codés par couleur selon la latence, sur un dégradé du vert au rouge (les régions plus rapides sont plus vertes, les plus lentes plus rouges)
  • Régions déployées : mises en évidence par un badge « Deployed » dans le tableau
  • Régions en cours de déploiement : indicateur de pulsation animé sur le repère et la ligne du tableau
  • Mise en évidence bidirectionnelle : le survol de la carte met en évidence la ligne correspondante du tableau, et inversement

Ultralytics Platform Deploy Tab Region Latency Table Sorted By Latency

Le tableau des régions sur l'onglet du modèle Deploy inclut :

ColonneDescription
EmplacementVille et pays avec une icône de drapeau
ZoneIdentifiant de la région
LatenceTemps de ping mesuré depuis ton navigateur
DistanceDistance par rapport à ton emplacement approximatif, en km
ActionsBouton Deploy ou badge d’état « Deployed »

Le tableau permet d’effectuer des recherches par ville, pays et zone, et est trié par latence par défaut.

Boîte de dialogue New Deployment

La boîte de dialogue New Deployment (depuis la page globale Deploy) affiche un tableau des régions plus simple, avec uniquement les colonnes Emplacement, Latence et Sélectionner, et répertorie les 20 régions les plus rapides avec une note concernant les autres. Utilise la mini-carte pour sélectionner une autre région.

Comment la latence est mesurée

Ton navigateur mesure la latence vers chacune des 42 régions, puis les résultats sont mis en cache pendant 30 minutes et partagés entre l’onglet Deploy et la boîte de dialogue New Deployment. Utilise le bouton Rescan dans l’onglet Deploy du modèle pour effectuer une nouvelle mesure depuis ton réseau actuel. La distance est calculée à partir de l’emplacement approximatif de ta requête ; elle constitue donc une indication approximative plutôt qu’une valeur précise.

Régions disponibles#

ZoneEmplacement
us-central1Iowa, États-Unis
us-east1Caroline du Sud, États-Unis
us-east4Virginie du Nord, États-Unis
us-east5Columbus, États-Unis
us-south1Dallas, États-Unis
us-west1Oregon, États-Unis
us-west2Los Angeles, États-Unis
us-west3Salt Lake City, États-Unis
us-west4Las Vegas, États-Unis
northamerica-northeast1Montréal, Canada
northamerica-northeast2Toronto, Canada
northamerica-south1Querétaro, Mexique
southamerica-east1São Paulo, Brésil
southamerica-west1Santiago, Chili

Configuration de l'endpoint#

Boîte de dialogue New Deployment#

La boîte de dialogue New Deployment te permet de sélectionner un modèle, une région, des ressources et un nom de déploiement :

ChampDescription
ModèleTout modèle terminé dans l'espace de travail, sélectionné à l'aide du sélecteur
RégionRégion de déploiement, sélectionnée sur la mini-carte ou dans le tableau de latence
Processeur (CPU) et mémoireSélectionne la taille des ressources et examine sa tarification affichée
Nom du déploiementGénéré automatiquement une fois le modèle et la région définis, et modifiable

Ultralytics Platform New Deployment Dialog Fixed Resource Defaults

Choisis la taille du processeur (CPU) et de la mémoire dans les contrôles des ressources et examine la tarification affichée avant de créer le déploiement. La taille par défaut peut utiliser une allocation de déploiement gratuite disponible ; les tailles personnalisées utilisent une tarification à l'utilisation. La taille par défaut passe à zéro en cas d'inactivité. Les tailles personnalisées conservent une instance chaude et sont facturées depuis la disponibilité jusqu'à l'arrêt du point de terminaison, y compris le temps d'inactivité. Agents réutilise cette boîte de dialogue lorsque tu sélectionnes New deployment….

Ultralytics Platform New Deployment Dialog Custom CPU Memory Pricing

Noms générés automatiquement

Le nom du déploiement associe le nom du modèle à la ville de la région, par exemple yolo26n-iowa. Dans l'onglet du modèle Deploy, un suffixe numérique est ajouté lorsque ce modèle possède déjà un déploiement dans la région (par exemple yolo26n-iowa-2). Les noms doivent être uniques au sein d'un espace de travail : le déploiement d'un nom déjà existant renvoie une erreur au lieu de le renommer silencieusement.

Onglet Deploy (déploiement rapide)#

Le déploiement à partir de l'onglet Deploy du modèle ouvre la même boîte de dialogue avec le modèle et la région présélectionnés. Examine la taille des ressources, la tarification et le nom généré automatiquement avant de créer le point de terminaison. Le déploiement apparaît dans la liste Active Deployments pendant sa création.

Gérer les endpoints#

Modes d’affichage#

La liste des déploiements propose trois modes d'affichage :

ModeDescription
CartesFiches de détails complètes avec les onglets de journaux, de code, de prédiction et de surveillance éligibles
CompactGrille de cartes plus petites avec les métriques clés
TableauTableau de données avec colonnes triables et recherche

Ultralytics Platform Deploy Tab Active Deployments Cards View

Carte de déploiement (vue Cartes)#

Chaque carte de déploiement dans la vue Cartes affiche :

  • En-tête : Nom, drapeau de la région, badge d'état et boutons d'action disponibles pour l'état actuel — mettre à jour la configuration, remplacer et arrêter lorsque Prêt, démarrer lorsque Arrêté, supprimer à tout moment
  • URL de l'endpoint : URL copiable avec un lien vers la propre référence API de l'endpoint
  • Métriques : nombre de requêtes (24 h), latence P95, taux d'erreur ou « Aucun trafic pour le moment »
  • Vérification de l'état : indicateur d'état en temps réel avec latence et actualisation manuelle
  • Onglets : Logs, Code et Predict ; les points de terminaison payants affichent également Monitoring
  • Pied de page : préfixe de la clé API associée au déploiement et date à laquelle il est devenu prêt
  • Message d'état : motif de l'échec lorsqu'un déploiement a échoué

L'URL, les métriques, la vérification de l'état et les onglets apparaissent uniquement lorsque le déploiement est Prêt. L'onglet Logs affiche les entrées de journal récentes avec filtrage par niveau de gravité (Tous / Erreurs). L'onglet Code affiche des exemples de code prêts à l'emploi en Python, JavaScript et cURL avec l'URL de ton endpoint, ainsi que la clé API associée pour les propriétaires de l'espace de travail (voir Surveillance). L'onglet Predict fournit un panneau de prédiction intégré pour effectuer des tests directement sur le déploiement.

Vues compacte et Tableau

Les cartes compactes affichent le drapeau, le nom, la ville, l'état et les trois métriques. La vue Tableau permet de trier selon Nom, Région, État, Requêtes, P95 et Erreurs, et d'effectuer une recherche dans le nom, la région et l'état. Les deux vues conservent l'action de suppression ; les actions démarrer, arrêter et remplacer sont disponibles dans la vue Cartes.

Mettre à jour le processeur (CPU) et la mémoire#

  1. Ouvre un point de terminaison Prêt dans la vue Cartes.
  2. Clique sur Mettre à jour la configuration du déploiement.
  3. Choisis le processeur (CPU) et la mémoire, puis examine le coût horaire affiché.
  4. Clique sur Mettre à jour la configuration. La configuration actuelle continue de servir les requêtes jusqu'à ce que la nouvelle soit prête.

Ultralytics Platform Deployment Update CPU Memory Configuration

Les ressources personnalisées utilisent une facturation basée sur le temps de fonctionnement et maintiennent une instance active. Le retour aux ressources par défaut rétablit le comportement de mise à l'échelle à zéro et supprime l'onglet Surveillance payant.

Données de surveillance temporaires

Les graphiques de surveillance et les images d'exemple sont des données légères stockées en mémoire. L'arrêt, le redémarrage, le redéploiement, le redimensionnement ou le remplacement d'un modèle peuvent les effacer. Le redémarrage du point de terminaison ne restaure pas l'historique. Enregistre les exemples utiles dans un ensemble de données et attends la fin de l'ingestion avant de modifier le point de terminaison. Les métriques opérationnelles et journaux disposent de fenêtres d'historique distinctes.

Remplacer un modèle#

Remplace le modèle derrière un endpoint prêt sans modifier son URL :

  1. Ouvre le déploiement dans la vue Cartes
  2. Clique sur Remplacer le modèle
  3. Sélectionne un autre modèle terminé dans le même espace de travail
  4. Modifie éventuellement le nom du déploiement
  5. Clique sur Remplacer le modèle

Le modèle actuel continue de traiter les requêtes pendant le démarrage du remplacement. Une fois le remplacement prêt, le trafic est transféré vers le nouveau modèle. L'ID du déploiement, l'URL, la région et la clé API restent inchangés ; son nom d'affichage ne change que si tu en saisis un nouveau. Si le remplacement échoue, le modèle et le nom précédents restent actifs.

Le remplacement nécessite toutes les conditions suivantes et est sinon refusé :

  • Le déploiement est Prêt et aucune autre opération de cycle de vie n'est en cours
  • Le modèle de remplacement possède des poids et appartient au même espace de travail que le déploiement
  • Le modèle de remplacement n'est pas celui qui est déjà déployé
Un modèle par endpoint

Le remplacement supprime l'ancien modèle du déploiement. Chaque endpoint sert un seul modèle ; crée un autre déploiement lorsque tu as besoin que les deux modèles soient disponibles simultanément.

États des déploiements#

StatutDescription
CréationLe déploiement est en cours de configuration
DéploiementLe conteneur démarre
PrêtL'endpoint est actif et accepte les requêtes
ArrêtL'endpoint est en cours d'arrêt
ArrêtéL'endpoint est en pause et indisponible
ÉchecÉchec du déploiement (voir le message d'erreur)

URL de l'endpoint#

Chaque endpoint possède une URL unique, par exemple :

https://predict-<deployment-id>-<hash>-<region>.a.run.app

Ultralytics Platform Deployment Card Endpoint Url With Copy Button

Clique sur le bouton de copie pour copier l'URL. Clique sur l'icône de documentation pour ouvrir la référence de l'API du point de terminaison. Le point de terminaison dessert ces chemins :

CheminMéthodeDescription
/predictPOSTExécuter l'inférence ; nécessite la clé API du déploiement
/healthGETVérification de disponibilité indiquant l'état du service et le nombre de modèles mis en cache
/GETRésumé de l'état du service déployé
/docsGETRéférence API interactive générée pour ce déploiement, ce modèle et cette région

Gestion du cycle de vie#

Contrôle l'état de ton endpoint :

graph LR
    R[Ready]:::out -->|Stop| S[Stopped]:::extern
    S -->|Start| R
    R -->|Delete| D[Deleted]:::error
    S -->|Delete| D

    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
ActionDescription
DémarrerReprendre un endpoint arrêté
ArrêterMettre l'endpoint en pause
DeleteSupprimer définitivement l'endpoint

Arrêter l'endpoint#

Arrête un endpoint lorsqu'il ne doit plus accepter de requêtes :

  1. Clique sur l'icône de pause de la carte du déploiement
  2. L'état de l'endpoint passe à « Stopping », puis à « Stopped »

Les endpoints arrêtés :

  • N'accepte pas les requêtes et ne rapporte aucune métrique en direct ni aucun état de santé
  • Arrête d'accumuler les frais de temps de fonctionnement
  • Perd les statistiques de surveillance temporaires et les images d'exemple lorsque l'instance de service s'arrête
  • conservent leur URL, leur région et leur clé API associée, et peuvent être redémarrés à tout moment
  • sont toujours comptabilisés dans le quota de déploiements de ton forfait — supprime un endpoint pour libérer sa place

Supprimer l'endpoint#

Supprime définitivement un endpoint :

  1. Clique sur l'icône de suppression (corbeille) de la carte du déploiement
  2. Confirme la suppression dans la boîte de dialogue
Action irréversible

La suppression est immédiate et irréversible — les déploiements ne sont pas déplacés dans la corbeille. La suppression de l'endpoint supprime son service et libère une place dans ton quota de déploiements. Tu peux toujours créer un nouvel endpoint, mais il reçoit une nouvelle URL.

Les déploiements sont également supprimés lorsque leur modèle ou leur projet est définitivement supprimé, ou lorsqu'un modèle ou un projet placé dans la corbeille arrive au terme de sa période de conservation.

Utiliser les endpoints#

Authentification#

Chaque déploiement est associé à une seule clé API de l'espace de travail qui possède le modèle. Inclus-la dans tes requêtes :

Authorization: Bearer YOUR_API_KEY

L'endpoint accepte uniquement la clé associée lors de sa création : aucune autre clé ne permet d'y accéder — pas même une autre clé active du même espace de travail. Pour contrôler la clé associée, effectue le déploiement via l'API authentifiée avec la clé du propriétaire de l'espace de travail : cette clé exacte est associée, et tu la détiens déjà. Les déploiements créés autrement (via l'interface utilisateur de la Platform ou un appel API authentifié en tant que membre de l'équipe) associent automatiquement l'une des clés actives de l'espace de travail propriétaire — identifie-la grâce au préfixe de clé affiché dans le pied de page de la carte du déploiement, puis demande sa valeur au propriétaire de l'espace de travail, car lui seul peut consulter les valeurs des clés (voir Clés API). Les membres de l'équipe qui ne possèdent pas la clé associée peuvent tout de même exécuter l'inférence via le proxy de prédiction de la Platform dans le navigateur.

La suppression de la clé associée ne verrouille pas l'endpoint

La suppression ou la désactivation de la clé API associée ne révoque pas l'accès direct à l'endpoint : toute personne qui détient la chaîne de la clé peut toujours appeler l'URL de l'endpoint. En revanche, le proxy de prédiction de la Platform ne fonctionne plus, car il vérifie la clé en temps réel et indique qu'elle n'est plus disponible. Pour révoquer complètement l'accès, arrête ou supprime le déploiement ; après la rotation des clés, recrée l'endpoint afin qu'il associe la nouvelle clé.

Requêtes directes vers l'endpoint#

Envoie les requêtes de production directement à l'URL affichée sur la carte du déploiement. Ces requêtes ne passent pas par le limiteur de débit de l'API de la Platform ; la limite de prédiction de 20 requêtes par minute ne s'applique donc pas. L'endpoint possède toujours sa propre limite de capacité :

  • Une seule instance sert chaque endpoint et traite un nombre limité de requêtes simultanément
  • Les requêtes qui ne peuvent pas être traitées rapidement renvoient 429 avec un en-tête Retry-After
  • Une seule requête peut s'exécuter pendant 1 heure au maximum, ce qui permet de terminer l'inférence vidéo
  • Les réponses de plus de 1 Ko sont compressées avec gzip et les requêtes de navigateur interorigines sont autorisées

Exemple de requête#

import requests

# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Send image for inference
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Paramètres de requête#

ParamètreTypeValeur par défautPlageDescription
filefile--Fichier image ou vidéo (requis sauf si source est défini)
conffloat0.250.01 – 1.0Seuil minimal de confiance
ioufloat0.70.0 – 0.95Seuil IoU de NMS
imgszint64032 – 1280Taille de l’image d’entrée en pixels
normalizeboolfalse-Renvoyer les coordonnées des boîtes englobantes entre 0 et 1
decimalsint50 – 10Précision décimale des valeurs de coordonnées
bitsint88, 12, 16Quantification de la carte de profondeur, uniquement pour les modèles de profondeur
sourcestring--URL de l’image ou chaîne base64 (alternative à file)

Consulte Réponses de profondeur pour savoir comment bits modifie la carte de profondeur renvoyée et comment la décoder.

Inférence vidéo

Les endpoints dédiés acceptent les images et les vidéos via le paramètre file.

  • Formats d'image (jusqu'à 100 Mo) : AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Formats vidéo (jusqu'à 100 Mo) : ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Chaque image vidéo est traitée individuellement et les résultats sont renvoyés pour chaque image. Tu peux également transmettre une URL publique d'image ou une image encodée en base64 via le paramètre source au lieu de file. Les téléversements trop volumineux sont rejetés avec 413.

Format de réponse#

Identique à l'inférence partagée, avec des champs propres à la tâche.

FAQ#

  • Les limites d'endpoints dépendent du forfait :

    • Free : jusqu'à 3 déploiements
    • Pro : jusqu'à 10 déploiements
    • Enterprise : déploiements illimités

    Chaque modèle peut toujours être déployé dans plusieurs régions, dans la limite du quota de ton forfait. Le quota est comptabilisé pour l'espace de travail qui possède le modèle ; les membres de l'équipe qui déploient un modèle partagé utilisent donc le quota du propriétaire. Lorsque la limite est atteinte, une erreur te demande de supprimer d'abord un déploiement existant.

  • Non, les régions sont fixes. Pour changer de région :

    1. Supprime l'endpoint existant
    2. Crée un nouvel endpoint dans la région souhaitée

    Le nouvel endpoint reçoit une nouvelle URL. Pour changer uniquement le modèle utilisé par un endpoint, utilise le remplacement de modèle, qui conserve l'URL.

  • Pour une couverture mondiale :

    1. Déploie dans plusieurs régions
    2. Utilise un répartiteur de charge ou un routage DNS
    3. Achemine les utilisateurs vers l'endpoint le plus proche
  • Le temps de démarrage à froid dépend du modèle et du fait que l'endpoint soit ou non descendu à zéro ; la Platform laisse à un endpoint inactif un délai supplémentaire pour démarrer avant de le déclarer non sain. L'exécution d'un contrôle de santé depuis la carte du déploiement avant un pic de trafic réchauffe l'instance.

  • Non. Chaque déploiement sert le trafic sur l'URL d'endpoint générée et affichée sur sa carte de déploiement. Cette URL reste stable pendant toute la durée de vie du déploiement, y compris lors des remplacements de modèle.

Commentaires