Déploiement#
Ultralytics Platform fournit des options complètes de déploiement de modèles pour mettre tes modèles YOLO en production. Teste tes modèles avec l'inférence dans le navigateur, déploie-les sur des endpoints dédiés dans 42 régions du monde et surveille les performances en temps réel.
Watch: Get Started with Ultralytics Platform - Deploy
Présentation#
La section Déploiement t'aide à :
- Tester les modèles directement dans le navigateur avec l'onglet
Predict - Déployer sur des endpoints dédiés dans 42 régions du monde
- Surveille les métriques de requêtes, les journaux, les bilans de santé et les prédictions temporaires sur les points de terminaison payants
- Choisis les ressources : les points de terminaison par défaut se réduisent à zéro ; les tailles personnalisées maintiennent une instance active avec une facturation basée sur la durée de disponibilité

Options de déploiement#
Ultralytics Platform propose plusieurs méthodes de déploiement :
| Option | Description | Idéal pour |
|---|---|---|
| Onglet Predict | Inférence dans le navigateur avec des images, une webcam et des exemples | Développement, validation |
| Inférence partagée | Service mutualisé dans 3 régions de données | Utilisation légère, tests |
| Endpoints dédiés | Services à locataire unique dans 42 régions | Production, faible latence |
| Export | Télécharge les poids dans 20 formats pour un runtime local ou en périphérie | Hors ligne, sur l'appareil |
Flux de travail#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Étape | Description |
|---|---|
| Test | Valide le modèle avec l'onglet Predict |
| Configurer | Sélectionne un modèle, une région, un CPU et de la mémoire ; examine les tarifs et le nom du déploiement |
| Déployer | Crée un endpoint dédié depuis l'onglet Deploy |
| Surveiller | Inspecte les métriques du point de terminaison et les prédictions temporaires dans Monitoring |
Architecture#
Inférence partagée#
Le service d'inférence partagée s'exécute dans 3 régions clés. Les requêtes adressées à un modèle sont routées vers le service situé dans la région de données de ce modèle, afin que les résultats restent dans la région où le modèle est stocké :
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Région | Libellé | Emplacement | Idéal pour |
|---|---|---|---|
| US | Amériques | Iowa, États-Unis | Utilisateurs des Amériques, rapidité maximale pour les Amériques |
| EU | Europe, Moyen-Orient et Afrique | Belgique, Europe | Utilisateurs européens, conformité au RGPD |
| AP | Asie-Pacifique | Taïwan, Asie-Pacifique | Utilisateurs d'Asie-Pacifique, latence minimale en APAC |
Endpoints dédiés#
Déploie sur 42 régions du monde avec Ultralytics Cloud :
- Amériques : 14 régions
- Europe : 13 régions
- Asie-Pacifique : 12 régions
- Moyen-Orient et Afrique : 3 régions
Chaque endpoint est un service à locataire unique avec :
- CPU et mémoire configurables avec des tarifs affichés avant le déploiement
- Réduction à zéro pour les ressources par défaut ; une instance active et facturée à la durée de disponibilité pour les ressources personnalisées
- URL d'endpoint unique avec sa propre référence API interactive à l'adresse
/docs - Sa propre association de clé API, afin que seule cette clé puisse appeler l'endpoint
- Surveillance, journaux et vérifications d'état indépendants
Page des déploiements#
Accède à la page mondiale des déploiements depuis la barre latérale, sous Deploy. Cette page affiche :
- Carte du monde avec les repères des régions déployées ; clique sur une région pour ouvrir la boîte de dialogue
New Deployment - Cartes de vue d'ensemble : Requêtes HTTP (24h), Déploiements actifs, Taux d'erreur HTTP (24h), Latence P95 HTTP (24h)
- Liste des déploiements avec trois modes d'affichage : cartes, compact et tableau
- Bouton Nouveau déploiement pour créer des endpoints à partir de n'importe quel modèle terminé
- Bouton Actualiser et horodatage
Updateddans l'en-tête de la page

La page s'actualise automatiquement et interroge le service plus fréquemment lorsque les déploiements sont dans un état de transition (creating, deploying ou stopping). Consulte Monitoring pour plus de détails.
Les points de terminaison payants fournissent des graphiques et des images d'exemple conservées uniquement dans la mémoire de l'instance de service. Arrêter, redémarrer, redéployer, redimensionner ou remplacer le modèle peut effacer ces données. Enregistre les exemples dans un ensemble de données et attends la fin de l'ingestion pour les conserver. Voir Monitoring.
Fonctionnalités clés#
Couverture mondiale#
Déploie au plus près de tes utilisateurs avec 42 régions couvrant :
- Amérique du Nord, Amérique du Sud
- Europe, Moyen-Orient, Afrique
- Asie-Pacifique, Océanie
Comportement de la mise à l'échelle#
Les endpoints se comportent actuellement comme suit :
- Ressources par défaut : les points de terminaison inactifs se réduisent à zéro et effectuent un démarrage à froid lors de la requête suivante
- Ressources personnalisées : une instance reste active et accumule des frais de disponibilité jusqu'à ce qu'elle soit arrêtée
- Une seule instance active : chaque endpoint est actuellement servi par une seule instance sur toutes les offres
- Réduction de charge : les requêtes reçoivent des réponses
429lorsque l'endpoint est temporairement à pleine capacité — consulte Requêtes directes vers les endpoints - Délai d'attente des requêtes : les requêtes directes de point de terminaison ont une durée maximale de 1 heure ; consulte Inference pour connaître les entrées prises en charge
Déploiement régional#
Utilise la latence mesurée par région pour placer un endpoint près de ses appelants. La latence réelle de l'inférence dépend du modèle, de la taille de l'entrée, de l'état de l'endpoint et du chemin réseau.
Vérifications d'état#
Chaque déploiement en cours d'exécution inclut une vérification d'état automatique avec :
- Indicateur d'état en direct (sain/non sain)
- Affichage de la latence des réponses
- Nouvelle tentative automatique en cas d'état non sain, avec arrêt une fois l'état redevenu sain
- Bouton d'actualisation manuelle
Démarrage rapide#
Créer un déploiement :
- Entraîne ou téléverse un modèle dans un projet
- Accède à l'onglet Deploy du modèle
- Clique sur Déployer pour une région dans le tableau de latence
- Vérifie le CPU, la mémoire, les tarifs et le nom dans la boîte de dialogue de déploiement
- Clique sur Créer un déploiement et attends que l'état du déploiement devienne Prêt
Model → Deploy tab → Deploy in a region → Review configuration → Create DeploymentLe nom du déploiement est généré à partir du nom du modèle et de la ville de la région, et peut être modifié avant le déploiement. Une fois déployé, utilise l'URL du point de terminaison avec ta clé API pour envoyer des requêtes d'inférence depuis n'importe quelle application.
Liens rapides#
- Inference : teste les modèles dans le navigateur
- Endpoints : déploie des endpoints dédiés
- Surveillance : Suis les performances des déploiements
FAQ#
Fonctionnalité Partagée Dédiée Service Partagé entre les utilisateurs de la plateforme Dédié à un seul déploiement Mise à l'échelle Gérée par la plateforme Par défaut : se réduit à zéro ; personnalisé : reste actif Régions 3 régions de données Choix parmi 42 régions de déploiement URL API de modèle de la plateforme URL d'endpoint de déploiement générée Tests Onglet Predictdu modèleOnglet Predictde la carte du déploiement ou APILimites de débit 20 requêtes/minute Aucune limite de débit de la plateforme pour les appels directs Authentification N'importe quelle clé API de l'espace de travail Uniquement la clé API associée au déploiement Le déploiement reste à l’état de création ou de déploiement pendant le démarrage de son service. Il devient utilisable lorsque son statut passe à Ready0; le délai varie selon le modèle et la région et prend généralement quelques minutes.
Oui, chaque modèle peut disposer de plusieurs points de terminaison dans différentes régions. Le nombre de déploiements est limité selon le forfait0: Gratuit
3, Pro10, Enterpriseunlimited. Le quota est imputé à l’espace de travail qui possède le modèle, et un point de terminaison ne sert qu’un seul modèle à la fois — utilise le remplacement du modèle pour le remplacer sans modifier l’URL.Les points de terminaison à ressources par défaut se réduisent à zéro lorsqu'ils sont inactifs :
- Le point de terminaison est mis à l’échelle vers zéro après une période d’inactivité
- La première requête déclenche un démarrage à froid
- Les requêtes suivantes sont rapides
Les premières requêtes après une période d’inactivité déclenchent un démarrage à froid. L’ouverture de la carte du déploiement exécute un contrôle d’intégrité qui réchauffe le point de terminaison, de sorte qu’une prédiction de test effectuée juste après reçoit une réponse rapide.
Les points de terminaison à ressources personnalisées restent actifs et sont facturés pour leur durée de disponibilité, y compris le temps d'inactivité. Arrête un point de terminaison pour stopper ses frais de disponibilité.