YOLO Vision 2026 :

Déploiement#

Ultralytics Platform t'offre des options de déploiement de modèles complètes pour mettre tes modèles YOLO en production. Teste tes modèles avec une inférence basée sur le navigateur, déploie-les vers des points de terminaison dédiés à travers 42 régions mondiales et surveille leurs performances en temps réel.



Watch: Get Started with Ultralytics Platform - Deploy

Présentation#

La section Déploiement t'aide à :

  • Tester des modèles directement dans le navigateur avec l'onglet Predict
  • Déploie sur des endpoints dédiés dans 42 régions mondiales
  • Surveiller les métriques de requêtes, les journaux et les vérifications d'état
  • Réduire à zéro en cas d'inactivité (les déploiements exécutent actuellement une instance active unique)

Ultralytics Platform Deploy Page World Map With Overview Cards

Options de déploiement#

Ultralytics Platform propose plusieurs chemins de déploiement :

OptionDescriptionIdéal pour
Onglet PredictInférence basée sur navigateur avec image, webcam et exemplesDéveloppement, validation
Inférence partagéeService multi-tenant sur 3 régionsUsage léger, tests
Terminaux dédiésServices à locataire unique dans 42 régionsProduction, faible latence

Flux de travail#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ÉtapeDescription
TestValide ton modèle avec l'onglet Predict
ConfigurerSélectionne une région et examine le nom de déploiement modifiable généré automatiquement
DéployerCrée un terminal dédié depuis l'onglet Deploy
SurveillerSuis les requêtes, la latence, les erreurs et les journaux dans Monitoring

Architecture#

Inférence partagée#

Le service d'inférence partagée s'exécute dans 3 régions clés, acheminant automatiquement les requêtes en fonction de la région de tes données :

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Region Router}:::decide
    Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RégionÉtiquetteEmplacementIdéal pour
USAmériquesIowa, USAUtilisateurs des Amériques, le plus rapide pour les Amériques
EUEurope, Moyen-Orient et AfriqueBelgique, EuropeUtilisateurs européens, conformité RGPD
APAsie-PacifiqueTaïwan, Asie-PacifiqueUtilisateurs Asie-Pacifique, latence APAC la plus faible

Terminaux dédiés#

Déploie dans 42 régions du monde entier sur Ultralytics Cloud :

  • Amériques : 14 régions
  • Europe : 13 régions
  • Asie-Pacifique : 12 régions
  • Moyen-Orient et Afrique : 3 régions

Chaque terminal est un service single-tenant avec :

  • Ressources par défaut de 1 CPU, 2 GiB de mémoire, minInstances=0, maxInstances=1
  • Réduction à zéro en cas d'inactivité
  • URL de terminal unique
  • Surveillance, journaux et vérifications d'état indépendants

Page des déploiements#

Accède à la page des déploiements mondiaux depuis la barre latérale sous Deploy. Cette page affiche :

  • Carte du monde avec des épingles des régions déployées (carte interactive)
  • Cartes de présentation : Nombre total de requêtes (24h), déploiements actifs, taux d'erreur (24h), latence P95 (24h)
  • Liste des déploiements avec trois modes d'affichage : cartes, compact et tableau
  • Bouton Nouveau déploiement pour créer des terminaux à partir de n'importe quel modèle terminé

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Interrogation automatique

La page s'interroge normalement toutes les 15 secondes. Lorsque les déploiements sont dans un état transitoire (creating, deploying ou stopping), l'interrogation passe à toutes les 3 secondes pour un retour plus rapide.

Fonctionnalités clés#

Couverture mondiale#

Déploie au plus proche de tes utilisateurs avec 42 régions couvrant :

  • Amérique du Nord, Amérique du Sud
  • Europe, Moyen-Orient, Afrique
  • Asie-Pacifique, Océanie

Comportement de mise à l'échelle#

Les terminaux se comportent actuellement comme suit :

  • Mise à l'échelle à zéro : minInstances est défini par défaut sur 0
  • Instance active unique : maxInstances est actuellement plafonné à 1 sur tous les plans

Déploiement régional#

Utilise la latence mesurée de la région pour placer un point de terminaison près de ses appelants. La latence d'inférence réelle dépend du modèle, de la taille d'entrée, de l'état du point de terminaison et du chemin réseau.

Vérifications d'état#

Chaque déploiement en cours inclut une vérification d'état automatique avec :

  • Indicateur d'état en direct (sain/non sain)
  • Affichage de la latence de réponse
  • Réessai automatique en cas d'état non sain (interrogation toutes les 20 secondes)
  • Bouton de rafraîchissement manuel

Démarrage rapide#

Crée un déploiement :

  1. Entraîne ou téléverse un modèle vers un projet
  2. Va dans l'onglet Deploy du modèle
  3. Sélectionne une région dans le tableau de latence
  4. Clique sur Deploy et attends que l'état du déploiement devienne Ready
Déploiement rapide
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Une fois déployé, utilise l'URL du terminal avec ta clé API pour envoyer des requêtes d'inférence depuis n'importe quelle application.

Liens rapides#

FAQ#

Quelle est la différence entre l'inférence partagée et dédiée ?#

FonctionnalitéPartagéeDédiée
ServicePartagé entre les utilisateurs de PlatformDédié à un seul déploiement
ÉchelleGéré par PlatformMise à l'échelle à zéro, une instance
Régions3 régions de donnéesChoisis parmi 42 régions de déploiement
URLAPI de modèle PlatformURL du point de terminaison de déploiement générée
TestOnglet Predict du modèleOnglet Predict de la carte de déploiement ou API

Combien de temps prend le déploiement ?#

Le déploiement reste dans un état de création ou de déploiement pendant que son service démarre. Il devient utilisable lorsque l'état passe à Ready ; le délai varie selon le modèle et la région.

Puis-je déployer plusieurs modèles ?#

Oui, chaque modèle peut avoir plusieurs points de terminaison dans différentes régions. Les nombres de déploiements sont limités par forfait : Free 3, Pro 10, Enterprise unlimited.

Que se passe-t-il lorsqu'un point de terminaison est inactif ?#

Avec la mise à l'échelle à zéro activée :

  • Le point de terminaison réduit sa capacité après inactivité
  • La première requête déclenche un démarrage à froid
  • Les requêtes suivantes sont rapides

Les premières requêtes après une période d'inactivité déclenchent un démarrage à froid.

Commentaires