Déploiement#
Ultralytics Platform t'offre des options de déploiement de modèles complètes pour mettre tes modèles YOLO en production. Teste tes modèles avec une inférence basée sur le navigateur, déploie-les vers des points de terminaison dédiés à travers 42 régions mondiales et surveille leurs performances en temps réel.
Watch: Get Started with Ultralytics Platform - Deploy
Présentation#
La section Déploiement t'aide à :
- Tester des modèles directement dans le navigateur avec l'onglet
Predict - Déploie sur des endpoints dédiés dans 42 régions mondiales
- Surveiller les métriques de requêtes, les journaux et les vérifications d'état
- Réduire à zéro en cas d'inactivité (les déploiements exécutent actuellement une instance active unique)

Options de déploiement#
Ultralytics Platform propose plusieurs chemins de déploiement :
| Option | Description | Idéal pour |
|---|---|---|
| Onglet Predict | Inférence basée sur navigateur avec image, webcam et exemples | Développement, validation |
| Inférence partagée | Service multi-tenant sur 3 régions | Usage léger, tests |
| Terminaux dédiés | Services à locataire unique dans 42 régions | Production, faible latence |
Flux de travail#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Étape | Description |
|---|---|
| Test | Valide ton modèle avec l'onglet Predict |
| Configurer | Sélectionne une région et examine le nom de déploiement modifiable généré automatiquement |
| Déployer | Crée un terminal dédié depuis l'onglet Deploy |
| Surveiller | Suis les requêtes, la latence, les erreurs et les journaux dans Monitoring |
Architecture#
Inférence partagée#
Le service d'inférence partagée s'exécute dans 3 régions clés, acheminant automatiquement les requêtes en fonction de la région de tes données :
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Région | Étiquette | Emplacement | Idéal pour |
|---|---|---|---|
| US | Amériques | Iowa, USA | Utilisateurs des Amériques, le plus rapide pour les Amériques |
| EU | Europe, Moyen-Orient et Afrique | Belgique, Europe | Utilisateurs européens, conformité RGPD |
| AP | Asie-Pacifique | Taïwan, Asie-Pacifique | Utilisateurs Asie-Pacifique, latence APAC la plus faible |
Terminaux dédiés#
Déploie dans 42 régions du monde entier sur Ultralytics Cloud :
- Amériques : 14 régions
- Europe : 13 régions
- Asie-Pacifique : 12 régions
- Moyen-Orient et Afrique : 3 régions
Chaque terminal est un service single-tenant avec :
- Ressources par défaut de
1 CPU,2 GiBde mémoire,minInstances=0,maxInstances=1 - Réduction à zéro en cas d'inactivité
- URL de terminal unique
- Surveillance, journaux et vérifications d'état indépendants
Page des déploiements#
Accède à la page des déploiements mondiaux depuis la barre latérale sous Deploy. Cette page affiche :
- Carte du monde avec des épingles des régions déployées (carte interactive)
- Cartes de présentation : Nombre total de requêtes (24h), déploiements actifs, taux d'erreur (24h), latence P95 (24h)
- Liste des déploiements avec trois modes d'affichage : cartes, compact et tableau
- Bouton Nouveau déploiement pour créer des terminaux à partir de n'importe quel modèle terminé

La page s'interroge normalement toutes les 15 secondes. Lorsque les déploiements sont dans un état transitoire (creating, deploying ou stopping), l'interrogation passe à toutes les 3 secondes pour un retour plus rapide.
Fonctionnalités clés#
Couverture mondiale#
Déploie au plus proche de tes utilisateurs avec 42 régions couvrant :
- Amérique du Nord, Amérique du Sud
- Europe, Moyen-Orient, Afrique
- Asie-Pacifique, Océanie
Comportement de mise à l'échelle#
Les terminaux se comportent actuellement comme suit :
- Mise à l'échelle à zéro :
minInstancesest défini par défaut sur0 - Instance active unique :
maxInstancesest actuellement plafonné à1sur tous les plans
Déploiement régional#
Utilise la latence mesurée de la région pour placer un point de terminaison près de ses appelants. La latence d'inférence réelle dépend du modèle, de la taille d'entrée, de l'état du point de terminaison et du chemin réseau.
Vérifications d'état#
Chaque déploiement en cours inclut une vérification d'état automatique avec :
- Indicateur d'état en direct (sain/non sain)
- Affichage de la latence de réponse
- Réessai automatique en cas d'état non sain (interrogation toutes les 20 secondes)
- Bouton de rafraîchissement manuel
Démarrage rapide#
Crée un déploiement :
- Entraîne ou téléverse un modèle vers un projet
- Va dans l'onglet Deploy du modèle
- Sélectionne une région dans le tableau de latence
- Clique sur Deploy et attends que l'état du déploiement devienne Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyUne fois déployé, utilise l'URL du terminal avec ta clé API pour envoyer des requêtes d'inférence depuis n'importe quelle application.
Liens rapides#
- Inférence : Teste les modèles dans le navigateur
- Terminaux : Déploie des terminaux dédiés
- Surveillance : Suis les performances de déploiement
FAQ#
Quelle est la différence entre l'inférence partagée et dédiée ?#
| Fonctionnalité | Partagée | Dédiée |
|---|---|---|
| Service | Partagé entre les utilisateurs de Platform | Dédié à un seul déploiement |
| Échelle | Géré par Platform | Mise à l'échelle à zéro, une instance |
| Régions | 3 régions de données | Choisis parmi 42 régions de déploiement |
| URL | API de modèle Platform | URL du point de terminaison de déploiement générée |
| Test | Onglet Predict du modèle | Onglet Predict de la carte de déploiement ou API |
Combien de temps prend le déploiement ?#
Le déploiement reste dans un état de création ou de déploiement pendant que son service démarre. Il devient utilisable lorsque l'état passe à Ready ; le délai varie selon le modèle et la région.
Puis-je déployer plusieurs modèles ?#
Oui, chaque modèle peut avoir plusieurs points de terminaison dans différentes régions. Les nombres de déploiements sont limités par forfait : Free 3, Pro 10, Enterprise unlimited.
Que se passe-t-il lorsqu'un point de terminaison est inactif ?#
Avec la mise à l'échelle à zéro activée :
- Le point de terminaison réduit sa capacité après inactivité
- La première requête déclenche un démarrage à froid
- Les requêtes suivantes sont rapides
Les premières requêtes après une période d'inactivité déclenchent un démarrage à froid.