Déploiement#
Ultralytics Platform fournit des options de déploiement de modèles complètes pour mettre tes modèles YOLO en production. Teste les modèles avec l'inférence basée sur le navigateur, déploie-les sur des points de terminaison dédiés à travers 42 régions mondiales et surveille les performances en temps réel.
Watch: Get Started with Ultralytics Platform - Deploy
Présentation#
La section Déploiement t'aide à :
- Teste les modèles directement dans le navigateur avec l'onglet
Predict - Déploie sur des endpoints dédiés dans 42 régions mondiales
- Surveiller les métriques de requêtes, les journaux et les vérifications d'état
- Réduire à zéro en cas d'inactivité (les déploiements exécutent actuellement une instance active unique)

Options de déploiement#
Ultralytics Platform propose plusieurs chemins de déploiement :
| Option | Description | Idéal pour |
|---|---|---|
| Onglet Prédiction | Inférence basée sur navigateur avec image, webcam et exemples | Développement, validation |
| Inférence partagée | Service multi-locataire réparti sur 3 régions de données | Usage léger, tests |
| Points de terminaison dédiés | Services à locataire unique dans 42 régions | Production, faible latence |
| Export | Télécharge les poids dans 20 formats pour un runtime local ou en périphérie | Hors ligne, sur l'appareil |
Flux de travail#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Étape | Description |
|---|---|
| Test | Valide le modèle avec l'onglet Predict |
| Configurer | Sélectionne une région ; le nom du déploiement est généré à partir du modèle et de la ville |
| Déployer | Crée un point de terminaison dédié à partir de l'onglet Deploy |
| Surveiller | Suis les requêtes, la latence, les erreurs et les journaux dans Monitoring |
Architecture#
Inférence partagée#
Le service d'inférence partagé s'exécute dans 3 régions clés. Les requêtes adressées à un modèle sont acheminées vers le service de cette région de données pour que les résultats restent dans la région où le modèle est stocké :
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Région | Étiquette | Emplacement | Idéal pour |
|---|---|---|---|
| US | Amériques | Iowa, USA | Utilisateurs des Amériques, le plus rapide pour les Amériques |
| EU | Europe, Moyen-Orient et Afrique | Belgique, Europe | Utilisateurs européens, conformité RGPD |
| AP | Asie-Pacifique | Taïwan, Asie-Pacifique | Utilisateurs Asie-Pacifique, latence APAC la plus faible |
Terminaux dédiés#
Déploie dans 42 régions du monde entier sur Ultralytics Cloud :
- Amériques : 14 régions
- Europe : 13 régions
- Asie-Pacifique : 12 régions
- Moyen-Orient et Afrique : 3 régions
Chaque terminal est un service single-tenant avec :
- Dimensionnement géré par la plateforme (non configurable actuellement)
- Réduction à zéro en cas d'inactivité
- URL de point de terminaison unique avec sa propre référence API interactive sur
/docs - Sa propre liaison de clé API, de sorte que seule cette clé peut appeler le point de terminaison
- Surveillance, journaux et vérifications d'état indépendants
Page des déploiements#
Accède à la page des déploiements globaux depuis la barre latérale sous Deploy. Cette page affiche :
- Mappemonde avec des épingles de régions déployées ; clique sur une région pour ouvrir la boîte de dialogue
New Deployment - Cartes de présentation : Nombre total de requêtes (24h), déploiements actifs, taux d'erreur (24h), latence P95 (24h)
- Liste des déploiements avec trois modes d'affichage : cartes, compact et tableau
- Bouton Nouveau déploiement pour créer des terminaux à partir de n'importe quel modèle terminé
- Bouton Rafraîchir et horodatage
Updateddans l'en-tête de la page

La page se rafraîchit automatiquement, en interrogeant plus fréquemment tant que les déploiements sont dans un état transitoire (creating, deploying ou stopping). Consulte la section Surveillance pour plus de détails.
Fonctionnalités clés#
Couverture mondiale#
Déploie au plus proche de tes utilisateurs avec 42 régions couvrant :
- Amérique du Nord, Amérique du Sud
- Europe, Moyen-Orient, Afrique
- Asie-Pacifique, Océanie
Comportement de mise à l'échelle#
Les terminaux se comportent actuellement comme suit :
- Réduction à zéro : les points de terminaison inactifs descendent à zéro et effectuent un démarrage à froid lors de la requête suivante
- Instance active unique : chaque point de terminaison dessert actuellement une seule instance sur tous les abonnements
- Délestage : les requêtes reçoivent des réponses
429lorsque le point de terminaison est temporairement à pleine capacité — voir Requêtes directes de point de terminaison - Délai d'expiration de la requête : chaque requête peut s'exécuter jusqu'à 1 heure, ce qui suffit pour l'inférence vidéo
Déploiement régional#
Utilise la latence mesurée de la région pour placer un point de terminaison près de ses appelants. La latence d'inférence réelle dépend du modèle, de la taille d'entrée, de l'état du point de terminaison et du chemin réseau.
Vérifications d'état#
Chaque déploiement en cours inclut une vérification d'état automatique avec :
- Indicateur d'état en direct (sain/non sain)
- Affichage de la latence de réponse
- Réessai automatique en cas de dysfonctionnement, s'arrêtant dès que l'état redevient sain
- Bouton de rafraîchissement manuel
Démarrage rapide#
Crée un déploiement :
- Entraîne ou téléverse un modèle vers un projet
- Va dans l'onglet Deploy du modèle
- Sélectionne une région dans le tableau de latence
- Clique sur Deploy et attends que l'état du déploiement devienne Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyLe nom du déploiement est généré à partir du nom du modèle et de la ville de la région, aucune étape de nommage n'est donc requise. Une fois déployé, utilise l'URL du point de terminaison avec ta clé API pour envoyer des requêtes d'inférence depuis n'importe quelle application.
Liens rapides#
- Inférence : Teste les modèles dans le navigateur
- Points de terminaison : Déploie des points de terminaison dédiés
- Monitoring : Suivis les performances de déploiement
FAQ#
Fonctionnalité Partagée Dédiée Service Partagé entre les utilisateurs de Platform Dédié à un seul déploiement Échelle Géré par Platform Mise à l'échelle à zéro, une instance Régions 3 régions de données Choisis parmi 42 régions de déploiement URL API de modèle Platform URL du point de terminaison de déploiement générée Test Onglet Predictdu modèleOnglet Predictde la carte de déploiement ou APILimites de débit 20 requêtes/minute Aucune limite de débit de la plateforme sur les appels directs Authentification N'importe quelle clé API d'espace de travail Seule la clé API liée au déploiement Le déploiement reste dans un état de création ou de déploiement pendant que son service démarre. Il devient utilisable lorsque le statut passe à Prêt ; le délai varie selon le modèle et la région, et prend généralement quelques minutes.
Oui, chaque modèle peut avoir plusieurs points de terminaison dans différentes régions. Le nombre de déploiements est limité par abonnement : Gratuit
3, Pro10, Entrepriseunlimited. Le quota est facturé à l'espace de travail propriétaire du modèle, et un point de terminaison dessert exactement un modèle à la fois — utilise le remplacement de modèle pour le changer sans modifier l'URL.Avec la mise à l'échelle à zéro activée :
- Le point de terminaison réduit sa capacité après inactivité
- La première requête déclenche un démarrage à froid
- Les requêtes suivantes sont rapides
Les premières requêtes après une période d'inactivité déclenchent un démarrage à froid. L'ouverture de la carte de déploiement exécute une vérification de santé qui réchauffe le point de terminaison, de sorte qu'une prédiction test juste après répond rapidement.