YOLO Vision 2026 :

Surveillance#

Ultralytics Platform fournit un suivi pour les points de terminaison déployés. Suis les métriques de requêtes, consulte les journaux et vérifie l'état de santé grâce à l'interrogation automatique.

Ultralytics Platform Deploy Page Overview Cards And World Map

Tableau de bord des déploiements#

La page Deploy dans la barre latérale sert de tableau de bord de suivi pour tous tes déploiements. Elle combine la carte du monde, les métriques d'aperçu et la gestion des déploiements en une seule vue. Consulte Dedicated Endpoints pour créer et gérer des déploiements.

graph TB
    subgraph Dashboard
        Map[World Map]:::proc --- Cards[Overview Cards]:::proc
        Cards --- List[Deployments List]:::decide
    end
    subgraph "Per Deployment"
        Metrics[Metrics Row]:::out
        Health[Health Check]:::out
        Logs[Logs Tab]:::out
        Code[Code Tab]:::out
        Predict[Predict Tab]:::out
    end
    List --> Metrics
    List --> Health
    List --> Logs
    List --> Code
    List --> Predict

    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff

Cartes de synthèse#

Quatre cartes de synthèse en haut de la page affichent :

Ultralytics Platform Deploy Page Four Overview Cards

MétriqueDescription
Nombre total de requêtes (24h)Requêtes sur tous les endpoints
Déploiements actifsEndpoints actuellement dans l'état Ready
Taux d'erreur (24h)Part des réponses avec un statut 4xx ou 5xx, pondérée par le volume de requêtes
Latence P95 (24h)Moyenne des latences horaires au 95e centile, pondérée par le volume

Le P95 plutôt que la latence médiane est rapporté car les vérifications d'état répondent en quelques millisecondes et domineraient autrement l'image de la vraie latence d'inférence.

Alerte de taux d'erreur

La carte du taux d'erreur s'illumine en rouge lorsque le taux dépasse 5 %. Vérifie l'onglet Logs sur les déploiements individuels pour diagnostiquer les erreurs.

Carte du monde#

La carte du monde interactive montre :

  • Épingles de région pour les 42 régions disponibles
  • Épingles vertes pour les régions disposant d'un déploiement prêt
  • Épingles bleues animées pour les régions avec des déploiements actifs en cours
  • La taille des épingles varie en fonction de l'état du déploiement et de la latence

Clique sur n'importe quelle région pour ouvrir la boîte de dialogue New Deployment. La carte est masquée sur les petits écrans.

Ultralytics Platform Deploy Page World Map With Deployed Regions

Liste des déploiements#

Sous les cartes de synthèse, la liste des déploiements montre tous les endpoints de tes projets. Utilise le sélecteur de mode de vue pour basculer entre :

VueDescription
CartesDes cartes de détail complètes avec des onglets pour les métriques, les journaux, le code et la prédiction
CompactUne grille de cartes plus petites (1-4 colonnes) avec des métriques clés
TableauUn DataTable avec des colonnes triables : Nom, Région, État, Requêtes, P95, Erreurs
Mises à jour en temps réel

Le tableau de bord se rafraîchit automatiquement, se mettant à jour plus rapidement lorsque les déploiements sont dans un état transitoire (creating, deploying ou stopping). Clique sur le bouton de rafraîchissement pour des mises à jour immédiates.

Métriques par déploiement#

Chaque carte de déploiement (en vue cartes) affiche des métriques en temps réel :

Ligne de métriques#

MétriqueDescription
RequêtesNombre de requêtes au cours des dernières 24 heures
Latence P95Moyenne des latences horaires au 95e centile (24h)
Taux d'erreurPart des réponses 4xx et 5xx, affichée uniquement lorsqu'elle est supérieure à 0

Les métriques se rafraîchissent automatiquement. Les endpoints n'ayant servi aucune requête affichent "No traffic yet", et les métriques sont collectées uniquement pour les déploiements à l'état Ready. Sur le tableau de bord des déploiements, les métriques sont récupérées pour les 20 déploiements les plus récents.

Vérification de santé#

Les déploiements en cours d'exécution affichent un indicateur de santé :

IndicateurSignification
Cœur vertSain — affiche la latence de réponse
Cœur rougeNon sain — affiche un message d'erreur
Icône tournanteVérification de santé en cours

Les vérifications d'état réessayent automatiquement en cas de dysfonctionnement et s'arrêtent dès que l'endpoint répond. Clique sur l'icône de rafraîchissement pour déclencher manuellement une vérification d'état, ce qui sert également à réchauffer un endpoint réduit à zéro avant d'envoyer du trafic.

Ultralytics Platform Deployment Card Health Check Healthy With Latency

Tolérance au démarrage à froid

Platform accorde un délai supplémentaire à la vérification d'état et réessaie en cas d'échecs de connexion transitoires, de sorte qu'un endpoint réduit à zéro a le temps de démarrer. Si la carte indique "Service starting up...", rafraîchis-la pour récupérer une instance qui a fini de démarrer entre-temps.

Journaux#

Chaque carte de déploiement inclut un onglet Logs pour consulter les entrées de journaux récentes :

Ultralytics Platform Deployment Card Logs Tab With Severity Filter

Entrées de journal#

Chaque entrée de journal montre :

ChampDescription
GravitéBarre codée par couleur (voir ci-dessous)
HorodatageHeure de la requête (format local)
MessageContenu du journal
Informations HTTPCode de statut et latence (si applicable)

Chaque entrée comporte une barre de sévérité de couleur :

NiveauCouleurDescription
DEBUGGrisMessages de débogage
INFOBleuRequêtes normales
WARNINGAmbreProblèmes non critiques
ERRORRougeRequêtes échouées
CRITICALRougeDéfaillances critiques

L'API accepte l'ensemble complet des sévérités de journaux sous forme de filtre séparé par des virgules : DEBUG, INFO, NOTICE, WARNING, ERROR, CRITICAL, ALERT et EMERGENCY.

L'interface utilisateur affiche les 20 entrées les plus récentes et masque les vides. L'API utilise par défaut 50 entrées par requête (max 200) et renvoie un nextPageToken pour paginer plus loin en arrière.

Flux de travail de débogage

Lors de l'investigation des erreurs : clique d'abord sur Errors pour filtrer vers les entrées ERROR et WARNING, puis examine les horodatages et les codes de statut HTTP. Copie les journaux dans le presse-papiers pour les partager avec ton équipe.

Exemples de code#

Chaque carte de déploiement comprend un onglet Code affichant du code API prêt à l'emploi avec l'URL de l'endpoint renseignée. Pour les propriétaires d'espace de travail, la clé API liée du déploiement est insérée, prête à être copiée et exécutée. Les non-propriétaires voient un espace réservé YOUR_API_KEY :

import requests

# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Send image for inference
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())
Identifiants pré-remplis

Lors de la consultation de l'onglet Code dans la plateforme, l'URL de l'endpoint et, pour les propriétaires d'espace de travail, la clé API liée du déploiement sont renseignées pour toi. Consulte API Keys pour générer une clé.

Inférence de déploiement#

L'onglet Predict sur chaque carte de déploiement fournit un panneau de prédiction intégré — la même interface que l'onglet Predict du modèle, mais exécutant l'inférence via le point de terminaison de déploiement au lieu du service partagé. C'est utile pour tester un point de terminaison déployé directement depuis le navigateur. Consulte Inference pour les détails des paramètres et les formats de réponse.

Points de terminaison API#

Chaque déploiement est désigné par son propriétaire et son nom de déploiement, et chaque route nécessite une clé API. Consulte la référence API pour les détails d'authentification.

Métriques de déploiement#

GET /api/deployments/{owner}/{deployment}/metrics?range=24h

Renvoie la charge utile complète des métriques pour un déploiement : un bloc summary avec le total des requêtes, le nombre et le taux d'erreurs, ainsi que les latences moyenne, P50, P95 et P99, plus des tableaux timeSeries pour les requêtes, les erreurs, les latences P50 et P95, l'utilisation du processeur et de la mémoire, et le nombre d'instances.

ParamètreTypeDescription
rangecha'ne de caract'resPlage de temps : 1h, 6h, 24h, 7d ou 30d (par défaut 24h)
sparklineboolRenvoyer le résumé compact du tableau de bord au lieu de la charge utile complète

Avec sparkline=true, la réponse prend la forme compacte utilisée par les cartes de déploiement — 24 décomptes de requêtes horaires plus le total des requêtes, le taux d'erreur et la latence moyenne. C'est l'appel qui se rafraîchit toutes les 60 secondes.

Journaux de déploiement#

GET /api/deployments/{owner}/{deployment}/logs?limit=50&severity=ERROR,WARNING

Renvoie les entrées de journal récentes avec un filtre de sévérité optionnel et une pagination.

ParamètreTypeDescription
limitentierNombre maximal d'entrées à renvoyer (par défaut : 50, max : 200)
severitycha'ne de caract'resFiltre de sévérité séparé par des virgules
pageTokencha'ne de caract'resJeton de pagination de la réponse précédente

Santé du déploiement#

GET /api/deployments/{owner}/{deployment}/health

Envoie un ping au déploiement et renvoie son état de santé avec la latence aller-retour mesurée :

{
    "healthy": true,
    "status": 200,
    "latencyMs": 142
}

Une réponse non saine omet status lorsque l'endpoint n'a pas pu être joint du tout, et ajoute un message error.

Aperçu du tableau de bord

Les chiffres agrégés sur la page Deploy ne sont pas disponibles sous forme de endpoint REST unique. Reproduis-les en appelant la route des métriques pour chaque déploiement renvoyé par GET /api/deployments/{owner}.

Optimisation des performances#

Utilise les données de surveillance pour optimiser tes déploiements :

Si la latence est trop élevée :

  1. Vérifie que la taille du modèle est appropriée
  2. Envisage une région plus proche
  3. Vérifie la taille de l'image envoyée avec chaque requête
Réduction de la latence

Essaie une valeur imgsz plus petite et compare la latence et la précision obtenues pour ton modèle. Déploie dans une région plus proche des appelants pour réduire la latence réseau.

FAQ#

  • L'API de métriques prend en charge des fenêtres sélectionnables de 1 heure à 30 jours, échantillonnées de manière plus grossière à mesure que la fenêtre grandit — des seaux de 1 minute sur 1 heure jusqu'à des seaux de 4 heures sur 30 jours. La carte de déploiement affiche les 20 entrées de journal les plus récentes ; l'API des journaux peut renvoyer jusqu'à 200 entrées par requête et prend en charge la pagination.

    Les métriques et les journaux ne sont conservés que tant que le déploiement existe, donc la suppression d'un déploiement met également fin à l'accès à son historique. Exporte tout ce que tu dois conserver avant de supprimer un endpoint.

  • Oui, la page de déploiements affiche tous les points de terminaison avec des cartes d'aperçu agrégées. Utilise la vue tableau pour comparer les performances entre les déploiements.

  • Non. Les métriques et les vérifications d'état sont collectées uniquement pour les déploiements à l'état Ready. Un endpoint arrêté conserve sa carte et sa fenêtre d'historique mais n'affiche aucun chiffre en direct tant que tu ne le redémarres pas.

Commentaires