Ultralytics YOLO27 :

Déploiement#

Ultralytics Platform fournit des options complètes de déploiement de modèles pour mettre tes modèles YOLO en production. Teste tes modèles avec l'inférence dans le navigateur, déploie-les sur des endpoints dédiés dans 42 régions du monde et surveille les performances en temps réel.



Watch: Get Started with Ultralytics Platform - Deploy

Présentation#

La section Déploiement t'aide à :

  • Tester les modèles directement dans le navigateur avec l'onglet Predict
  • Déployer sur des endpoints dédiés dans 42 régions du monde
  • Surveille les métriques de requêtes, les journaux, les bilans de santé et les prédictions temporaires sur les points de terminaison payants
  • Choisis les ressources : les points de terminaison par défaut se réduisent à zéro ; les tailles personnalisées maintiennent une instance active avec une facturation basée sur la durée de disponibilité

Page de déploiement d'Ultralytics Platform avec carte du monde et cartes récapitulatives

Options de déploiement#

Ultralytics Platform propose plusieurs méthodes de déploiement :

OptionDescriptionIdéal pour
Onglet PredictInférence dans le navigateur avec des images, une webcam et des exemplesDéveloppement, validation
Inférence partagéeService mutualisé dans 3 régions de donnéesUtilisation légère, tests
Endpoints dédiésServices à locataire unique dans 42 régionsProduction, faible latence
ExportTélécharge les poids dans 20 formats pour un runtime local ou en périphérieHors ligne, sur l'appareil

Flux de travail#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ÉtapeDescription
TestValide le modèle avec l'onglet Predict
ConfigurerSélectionne un modèle, une région, un CPU et de la mémoire ; examine les tarifs et le nom du déploiement
DéployerCrée un endpoint dédié depuis l'onglet Deploy
SurveillerInspecte les métriques du point de terminaison et les prédictions temporaires dans Monitoring

Architecture#

Inférence partagée#

Le service d'inférence partagée s'exécute dans 3 régions clés. Les requêtes adressées à un modèle sont routées vers le service situé dans la région de données de ce modèle, afin que les résultats restent dans la région où le modèle est stocké :

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RégionLibelléEmplacementIdéal pour
USAmériquesIowa, États-UnisUtilisateurs des Amériques, rapidité maximale pour les Amériques
EUEurope, Moyen-Orient et AfriqueBelgique, EuropeUtilisateurs européens, conformité au RGPD
APAsie-PacifiqueTaïwan, Asie-PacifiqueUtilisateurs d'Asie-Pacifique, latence minimale en APAC

Endpoints dédiés#

Déploie sur 42 régions du monde avec Ultralytics Cloud :

  • Amériques : 14 régions
  • Europe : 13 régions
  • Asie-Pacifique : 12 régions
  • Moyen-Orient et Afrique : 3 régions

Chaque endpoint est un service à locataire unique avec :

  • CPU et mémoire configurables avec des tarifs affichés avant le déploiement
  • Réduction à zéro pour les ressources par défaut ; une instance active et facturée à la durée de disponibilité pour les ressources personnalisées
  • URL d'endpoint unique avec sa propre référence API interactive à l'adresse /docs
  • Sa propre association de clé API, afin que seule cette clé puisse appeler l'endpoint
  • Surveillance, journaux et vérifications d'état indépendants

Page des déploiements#

Accède à la page mondiale des déploiements depuis la barre latérale, sous Deploy. Cette page affiche :

  • Carte du monde avec les repères des régions déployées ; clique sur une région pour ouvrir la boîte de dialogue New Deployment
  • Cartes de vue d'ensemble : Requêtes HTTP (24h), Déploiements actifs, Taux d'erreur HTTP (24h), Latence P95 HTTP (24h)
  • Liste des déploiements avec trois modes d'affichage : cartes, compact et tableau
  • Bouton Nouveau déploiement pour créer des endpoints à partir de n'importe quel modèle terminé
  • Bouton Actualiser et horodatage Updated dans l'en-tête de la page

Cartes récapitulatives et liste des déploiements de la page de déploiement d'Ultralytics Platform

Interrogation automatique

La page s'actualise automatiquement et interroge le service plus fréquemment lorsque les déploiements sont dans un état de transition (creating, deploying ou stopping). Consulte Monitoring pour plus de détails.

Surveillance légère et temporaire

Les points de terminaison payants fournissent des graphiques et des images d'exemple conservées uniquement dans la mémoire de l'instance de service. Arrêter, redémarrer, redéployer, redimensionner ou remplacer le modèle peut effacer ces données. Enregistre les exemples dans un ensemble de données et attends la fin de l'ingestion pour les conserver. Voir Monitoring.

Fonctionnalités clés#

Couverture mondiale#

Déploie au plus près de tes utilisateurs avec 42 régions couvrant :

  • Amérique du Nord, Amérique du Sud
  • Europe, Moyen-Orient, Afrique
  • Asie-Pacifique, Océanie

Comportement de la mise à l'échelle#

Les endpoints se comportent actuellement comme suit :

  • Ressources par défaut : les points de terminaison inactifs se réduisent à zéro et effectuent un démarrage à froid lors de la requête suivante
  • Ressources personnalisées : une instance reste active et accumule des frais de disponibilité jusqu'à ce qu'elle soit arrêtée
  • Une seule instance active : chaque endpoint est actuellement servi par une seule instance sur toutes les offres
  • Réduction de charge : les requêtes reçoivent des réponses 429 lorsque l'endpoint est temporairement à pleine capacité — consulte Requêtes directes vers les endpoints
  • Délai d'attente des requêtes : les requêtes directes de point de terminaison ont une durée maximale de 1 heure ; consulte Inference pour connaître les entrées prises en charge

Déploiement régional#

Utilise la latence mesurée par région pour placer un endpoint près de ses appelants. La latence réelle de l'inférence dépend du modèle, de la taille de l'entrée, de l'état de l'endpoint et du chemin réseau.

Vérifications d'état#

Chaque déploiement en cours d'exécution inclut une vérification d'état automatique avec :

  • Indicateur d'état en direct (sain/non sain)
  • Affichage de la latence des réponses
  • Nouvelle tentative automatique en cas d'état non sain, avec arrêt une fois l'état redevenu sain
  • Bouton d'actualisation manuelle

Démarrage rapide#

Créer un déploiement :

  1. Entraîne ou téléverse un modèle dans un projet
  2. Accède à l'onglet Deploy du modèle
  3. Clique sur Déployer pour une région dans le tableau de latence
  4. Vérifie le CPU, la mémoire, les tarifs et le nom dans la boîte de dialogue de déploiement
  5. Clique sur Créer un déploiement et attends que l'état du déploiement devienne Prêt
Déploiement rapide
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

Le nom du déploiement est généré à partir du nom du modèle et de la ville de la région, et peut être modifié avant le déploiement. Une fois déployé, utilise l'URL du point de terminaison avec ta clé API pour envoyer des requêtes d'inférence depuis n'importe quelle application.

Liens rapides#

  • Inference : teste les modèles dans le navigateur
  • Endpoints : déploie des endpoints dédiés
  • Surveillance : Suis les performances des déploiements

FAQ#

  • FonctionnalitéPartagéeDédiée
    ServicePartagé entre les utilisateurs de la plateformeDédié à un seul déploiement
    Mise à l'échelleGérée par la plateformePar défaut : se réduit à zéro ; personnalisé : reste actif
    Régions3 régions de donnéesChoix parmi 42 régions de déploiement
    URLAPI de modèle de la plateformeURL d'endpoint de déploiement générée
    TestsOnglet Predict du modèleOnglet Predict de la carte du déploiement ou API
    Limites de débit20 requêtes/minuteAucune limite de débit de la plateforme pour les appels directs
    AuthentificationN'importe quelle clé API de l'espace de travailUniquement la clé API associée au déploiement
  • Le déploiement reste à l’état de création ou de déploiement pendant le démarrage de son service. Il devient utilisable lorsque son statut passe à Ready0; le délai varie selon le modèle et la région et prend généralement quelques minutes.

  • Oui, chaque modèle peut disposer de plusieurs points de terminaison dans différentes régions. Le nombre de déploiements est limité selon le forfait0: Gratuit 3, Pro 10, Enterprise unlimited. Le quota est imputé à l’espace de travail qui possède le modèle, et un point de terminaison ne sert qu’un seul modèle à la fois — utilise le remplacement du modèle pour le remplacer sans modifier l’URL.

  • Les points de terminaison à ressources par défaut se réduisent à zéro lorsqu'ils sont inactifs :

    • Le point de terminaison est mis à l’échelle vers zéro après une période d’inactivité
    • La première requête déclenche un démarrage à froid
    • Les requêtes suivantes sont rapides

    Les premières requêtes après une période d’inactivité déclenchent un démarrage à froid. L’ouverture de la carte du déploiement exécute un contrôle d’intégrité qui réchauffe le point de terminaison, de sorte qu’une prédiction de test effectuée juste après reçoit une réponse rapide.

    Les points de terminaison à ressources personnalisées restent actifs et sont facturés pour leur durée de disponibilité, y compris le temps d'inactivité. Arrête un point de terminaison pour stopper ses frais de disponibilité.

Commentaires