Surveillance#
Ultralytics Platform propose la surveillance des points de terminaison déployés. Suis les requêtes, la latence, les erreurs et les journaux des points de terminaison. Les points de terminaison dédiés prêts à l’emploi sur un environnement d’exécution actuel fournissent aussi des statistiques de prédiction en direct et des exemples temporaires que tu peux examiner et enregistrer dans des jeux de données.

Onglet Déploiements#
L’onglet Déploiements de ton profil sert de tableau de bord de surveillance pour tous tes déploiements. Il regroupe la carte du monde, les métriques récapitulatives et la gestion des déploiements dans une même vue. Consulte Points de terminaison dédiés pour créer et gérer des déploiements.
graph TB
subgraph "Deployments Tab"
Map[World Map]:::proc --- Cards[Overview Cards]:::proc
Cards --- List[Deployments List]:::decide
end
subgraph "Deployment Page"
Metrics[Metrics Cards]:::out
Overview[Overview Tab: Endpoint and Health Check]:::out
Monitoring[Monitoring Tab]:::out
Predict[Predict Tab]:::out
Logs[Logs Tab]:::out
end
List --> Metrics
List --> Overview
List --> Monitoring
List --> Predict
List --> Logs
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fffCartes récapitulatives#
Quatre cartes récapitulatives en haut de la page affichent :

| Mesure | Description |
|---|---|
| Déploiements actifs | Points de terminaison actuellement à l’état Prêt |
| Requêtes HTTP (24 h) | Requêtes HTTP sur tous les points de terminaison, y compris les requêtes de prédiction, de surveillance et de contrôle d’état |
| Taux d’erreur HTTP (24 h) | Part des réponses ayant un statut 4xx ou 5xx, pondérée selon le volume de requêtes |
| Latence HTTP P95 (24 h) | Moyenne des latences horaires au 95e centile, pondérée selon le volume |
La latence P95 plutôt que la latence médiane est indiquée, car les contrôles d’état répondent en quelques millisecondes et domineraient autrement la représentation de la latence réelle d’inférence.
La carte du taux d’erreur devient rouge lorsque le taux dépasse 5 %. Consulte l’onglet Logs de chaque déploiement pour diagnostiquer les erreurs.
Carte du monde#
La carte du monde interactive affiche :
- Repères régionaux pour les 42 régions disponibles
- Repères verts pour les régions ayant un déploiement prêt
- Repères bleus animés pour les régions où des déploiements sont en cours
- La taille des repères varie selon l’état du déploiement et la latence
Clique sur une région pour ouvrir la boîte de dialogue New Deployment. La carte est masquée sur les petits écrans.

Liste des déploiements#
Sous les cartes récapitulatives, la liste des déploiements présente tous les points de terminaison de tes projets. Utilise le sélecteur de mode d’affichage pour choisir entre :
| Affichage | Description |
|---|---|
| Cartes | Cartes avec l’état, la taille, les métriques, la distance et la date de déploiement |
| Compact | Une grille de petites cartes (1 à 4 colonnes) avec les métriques clés |
| Tableau | Un tableau de données avec des colonnes triables, notamment CPU, mémoire, métriques HTTP et distance |
L’onglet s’actualise automatiquement, et plus rapidement lorsqu’un déploiement change d’état (creating, deploying ou stopping). Chaque carte et chaque ligne renvoient à la page du déploiement.
Métriques par déploiement#
Chaque page de déploiement affiche des métriques en temps réel au-dessus de ses onglets Overview, Monitoring, Predict et Logs :
Cartes de métriques#
| Mesure | Description |
|---|---|
| Requêtes HTTP (24 h) | Nombre de requêtes, y compris les requêtes de prédiction, de surveillance et de contrôle d’état |
| Taux d’erreur HTTP (24 h) | Part des réponses 4xx et 5xx |
| Latence HTTP P95 (24 h) | 95e centile des latences P95 sur 15 minutes |
Chaque carte affiche une courbe sparkline et s’actualise toutes les minutes, à côté d’une carte renvoyant au modèle déployé. Les métriques sont collectées uniquement pour les déploiements à l’état Prêt. Dans l’onglet Déploiements, les métriques sont récupérées pour les 20 déploiements les plus récents.
Vérification de l’état#
La carte Point de terminaison de l’onglet Overview d’un déploiement en cours d’exécution affiche un indicateur de contrôle d’état :
| Indicateur | Signification |
|---|---|
| Cœur vert | En bon état — affiche la latence de réponse |
| Cœur rouge | En mauvais état — affiche un message d’erreur |
| Icône animée | Contrôle d’état en cours |
Les contrôles d’état sont relancés automatiquement tant que le point de terminaison est en mauvais état et s’arrêtent dès qu’il répond. L’ouverture de la page du déploiement lance un contrôle d’état, et le bouton de nouvelle vérification en déclenche un autre, ce qui permet aussi de réchauffer un point de terminaison ramené à zéro avant de lui envoyer du trafic.

Platform accorde plus de temps au contrôle d’état et réessaie en cas d’échec temporaire de connexion, afin de laisser le temps à un point de terminaison ramené à zéro de démarrer. Tant que le premier contrôle d’état n’a pas reçu de réponse, le badge indique Démarrage en cours et les onglets Predict et Monitoring affichent Le point de terminaison démarre, puis se mettent à jour automatiquement dès qu’il répond. Si le contrôle échoue, le badge indique Aucune réponse et ces onglets proposent Réessayer.
Onglet Surveillance#
Ouvre la page de déploiement d’un point de terminaison dédié à l’état Prêt, puis sélectionne l’onglet Surveillance. Envoie une image via son onglet Prédire ou l’API du point de terminaison, ou laisse une caméra en arrière-plan fonctionner pour alimenter Exemples temporaires et Statistiques de prédiction. Avant le traitement de la première image, l’onglet affiche Aucune image traitée.
La surveillance est disponible sur tous les points de terminaison dédiés à l’état Prêt, y compris ceux de taille par défaut avec le forfait Free. Les points de terminaison existants ne sont pas automatiquement mis à jour à chaque nouvelle version de l’environnement d’exécution : un point de terminaison plus ancien peut donc afficher Surveillance indisponible jusqu’à la mise à jour de son environnement d’exécution.

La surveillance est légère et temporaire : les graphiques, les statistiques de prédiction et les images d’exemple sont stockés uniquement dans la mémoire de l’instance de service. Ils peuvent être perdus lorsque le point de terminaison s’éteint, s’arrête, redémarre, est redéployé, change de ressources ou remplace son modèle. L’historique n’est pas restauré au redémarrage du point de terminaison. Enregistre les exemples utiles dans un jeu de données et attends la fin de leur ingestion avant de modifier le point de terminaison.
Exemples temporaires#
La galerie contient des images traitées récemment, avec des superpositions de prédiction. Ouvre une image pour examiner ses prédictions dans le lecteur plein écran et utilise les commandes de visibilité pour ajuster les superpositions. La galerie affiche jusqu’à 12 exemples au départ ; Tout afficher permet de la développer.
- Capture : Les images traitées récemment apparaissent comme exemples temporaires, à raison d’une image par seconde au maximum. La capture est effectuée au mieux ; l’inférence n’attend pas l’encodage des exemples.
- Capacité : Au maximum 100 images dans une limite de mémoire partagée de 100 MiB pour les images compressées, les métadonnées de prédiction et les ressources associées. L’interface indique cette limite sous la forme 100 MB.
- Remplacement : Les exemples les plus anciens sont remplacés lorsque l’une ou l’autre des limites est atteinte. Un exemple peut devenir indisponible pendant que tu le consultes.
- Stockage : Les exemples temporaires restent dans la mémoire du point de terminaison. Leur enregistrement dans un jeu de données utilise les limites habituelles de stockage et de traitement de l’espace de travail.

Enregistrer les exemples dans un jeu de données#
Les membres de l’espace de travail disposant d’un droit de modification du contenu peuvent enregistrer des exemples dans un jeu de données de l’espace de travail du point de terminaison :
- Sélectionne des exemples individuellement à l’aide de leurs cases à cocher, ou clique sur Tout sélectionner.
- Clique sur Enregistrer dans le jeu de données.
- Choisis un jeu de données existant ayant la même tâche que le modèle déployé. Les jeux de données reliés à une source sont exclus ; si aucun jeu de données n’est disponible, crée d’abord un jeu de données compatible.
- Clique sur le bouton Enregistrer, qui indique le nombre d’images sélectionnées, puis ouvre le jeu de données pour suivre le traitement.
Les images et les prédictions sélectionnées sont copiées à l’aide du processus standard de téléversement et d’ingestion des jeux de données. Les quotas, le mappage des classes et la gestion des doublons habituels s’appliquent. L’enregistrement laisse les exemples temporaires dans la galerie ; les images correctement ingérées dans le jeu de données survivent aux redémarrages et à la suppression du point de terminaison. Vérifie les étiquettes prédites avant de les utiliser pour l’entraînement. Chaque image enregistrée consigne deploymentId, deploymentName, deploymentRegion et deploymentRegionName dans ses métadonnées personnalisées, sur lesquelles la recherche dans le jeu de données peut s’appuyer ; les noms sont enregistrés tels qu’ils étaient au moment de l’enregistrement, et une image ignorée parce qu’elle est en double conserve ses métadonnées existantes.

Pour supprimer des exemples temporaires, utilise la commande de suppression qui apparaît au survol d’une image, ou sélectionne des exemples et clique sur le bouton de suppression groupée, puis confirme en cliquant sur Supprimer. La suppression d’exemples ne modifie ni les statistiques de prédiction agrégées ni les images déjà enregistrées dans des jeux de données.
Statistiques de prédiction#
Les statistiques regroupent les images traitées indépendamment de la galerie. La suppression ou le remplacement d’un exemple ne soustrait pas sa contribution. Le récapitulatif affiche le nombre d’images, de prédictions et d’images sans prédiction pour la période sélectionnée ; les modèles de profondeur affichent le nombre d’images.
Le sélecteur de dates est réglé par défaut sur les 30 derniers jours et accepte des plages allant jusqu’à 365 jours. Les dates sélectionnées utilisent les limites UTC ; les horodatages des graphiques s’affichent à l’heure locale. Pour les plages récentes allant jusqu’à trois jours, l’historique horaire est utilisé si toute la plage se situe dans les dernières 72 heures ; les autres plages utilisent l’historique quotidien. La plage de dates filtre les statistiques, tandis que la galerie continue d’afficher les exemples temporaires actuels.
L’historique est limité à 72 périodes horaires et 365 périodes journalières, et n’est disponible que depuis le démarrage de l’instance actuelle. Si aucune image n’a été traitée pendant la période sélectionnée, le message Aucune image traitée pendant cette période s’affiche.
Les graphiques disponibles dépendent de la tâche et des prédictions collectées :
| Graphique | Ce qu’il affiche |
|---|---|
| Prédictions au fil du temps | Totaux des images traitées et des prédictions ; les modèles de profondeur affichent Images au fil du temps |
| Temps d’inférence | Temps moyen d’inférence du modèle en millisecondes, sans le réseau ni la surcharge des requêtes |
| Principales classes | Nombre de prédictions par classe |
| Prédictions par image | Répartition incluant les images sans prédiction et une dernière tranche 100+ ; masqué pour la classification et la profondeur |
| Confiance des prédictions | Répartition et moyenne des scores de confiance, lorsqu’ils sont disponibles |
| Confiance au fil du temps | Confiance moyenne des prédictions pour chaque période |
| Dimensions des prédictions | Largeur et hauteur des prédictions par rapport à l’image d’entrée, lorsque les dimensions des cadres sont disponibles |
| Emplacements des prédictions | Carte thermique spatiale des prédictions, lorsque les données d’emplacement sont disponibles |


La confiance mesure le degré de certitude du modèle, pas son exactitude. Pour évaluer la précision, examine des exemples et compare-les aux annotations vérifiées. Inference Time mesure le temps d’exécution du modèle ; la P95 Latency du déploiement inclut le traitement des requêtes et peut aussi refléter du trafic sans inférence, comme les vérifications d’état.
La surveillance s’actualise automatiquement tant que son panneau est ouvert et visible, et se met en pause lorsque le panneau est hors écran ou que l’onglet du navigateur est masqué. Une inférence réussie via l’onglet Predict du déploiement déclenche également l’actualisation des statistiques.
Journaux#
Chaque page de déploiement comprend un onglet Logs permettant de consulter les entrées récentes du journal :

Entrées du journal#
Chaque entrée du journal affiche :
| Champ | Description |
|---|---|
| Gravité | Barre codée par couleur (voir ci-dessous) |
| Horodatage | Heure de la requête (format local) |
| Message | Contenu du journal |
| Informations HTTP | Code d’état et latence (le cas échéant) |
Chaque entrée comporte une barre de gravité codée par couleur :
| Niveau | Couleur | Description |
|---|---|---|
| DEBUG | Gris | Messages de débogage |
| INFO | Bleu | Requêtes normales |
| WARNING | Ambre | Problèmes non critiques |
| ERROR | Rouge | Requêtes ayant échoué |
| CRITICAL | Rouge | Défaillances critiques |
L’API accepte l’ensemble des niveaux de gravité des journaux sous forme de filtre séparé par des virgules : DEBUG, INFO, NOTICE, WARNING, ERROR, CRITICAL, ALERT et EMERGENCY.
L’interface affiche les 20 entrées les plus récentes et masque celles qui sont vides. Par défaut, l’API renvoie 50 entrées par requête (200 au maximum) et renvoie un nextPageToken pour parcourir les pages précédentes.
Pour examiner des erreurs : clique d’abord sur Errors pour filtrer les entrées ERROR et WARNING, puis consulte les horodatages et les codes d’état HTTP. Copie les journaux dans le presse-papiers pour les partager avec ton équipe.
Exemples de code#
L’onglet de résultats Docs de l’onglet Predict de chaque déploiement affiche du code API prêt à l’emploi, avec l’URL du point de terminaison et, pour les propriétaires de l’espace de travail, la clé API associée au déploiement déjà renseignée. Le code est prêt à être copié et exécuté. Les personnes qui ne sont pas propriétaires voient un espace réservé YOUR_API_KEY :
import requests
# Point de terminaison de déploiement
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# En-têtes contenant ta clé API de déploiement
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Paramètres d'inférence
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Envoyer une image pour l'inférence
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Dans les exemples Docs de l’onglet Predict du déploiement, l’URL du point de terminaison et, pour les propriétaires de l’espace de travail, la clé API associée au déploiement sont renseignées pour toi. Consulte Clés API pour générer une clé.
Prédiction du déploiement#
L’onglet Predict de chaque page de déploiement fournit un panneau de prédiction intégré — la même interface que l’onglet Predict du modèle, mais qui exécute l’inférence via le point de terminaison du déploiement plutôt que via le service partagé. C’est utile pour tester directement un point de terminaison déployé depuis le navigateur. Consulte Inférence pour en savoir plus sur les paramètres et les formats de réponse.
Points de terminaison de l’API#
Chaque déploiement est désigné par son propriétaire et son nom, et chaque route nécessite une clé API. Consulte la référence de l’API pour en savoir plus sur l’authentification.
Métriques du déploiement#
GET /api/deployments/{owner}/{deployment}/metrics?range=24hSDK Python : client.deployments.metrics(owner, deployment, range="24h")
Renvoie la charge utile complète des métriques d’un déploiement : un bloc summary contenant le nombre total de requêtes, le nombre et le taux d’erreurs, ainsi que les latences moyenne, P50, P95 et P99 ; il inclut également des tableaux timeSeries pour les requêtes, les erreurs, les latences P50 et P95, l’utilisation du CPU et de la mémoire, ainsi que le nombre d’instances.
| Paramètre | Type | Description |
|---|---|---|
range | chaîne | Plage temporelle : 1h, 6h, 24h, 7d ou 30d (par défaut : 24h) |
sparkline | bool | Renvoie le résumé compact du tableau de bord au lieu de la charge utile complète |
view | chaîne | overview renvoie uniquement les métriques des requêtes, des erreurs et de la latence P95 |
Avec sparkline=true, la réponse est un résumé compact : le nombre de requêtes par heure au cours des dernières 24 heures (les heures sans requête sont omises), ainsi que le nombre total de requêtes, le taux d’erreurs et avgLatencyMs, qui correspond à la moyenne des latences P95 horaires. Avec view=overview, summary contient totalRequests, errorRate et p95LatencyMs, tandis que timeSeries contient requests, errors et latencyP95 ; les cartes de statistiques de la page de déploiement utilisent cette vue et s’actualisent automatiquement.
Journaux du déploiement#
GET /api/deployments/{owner}/{deployment}/logs?limit=50&severity=ERROR,WARNINGSDK Python : client.deployments.logs(owner, deployment, limit=50, severity="ERROR,WARNING")
Renvoie les entrées récentes du journal, avec un filtre de gravité et une pagination facultatifs.
| Paramètre | Type | Description |
|---|---|---|
limit | int | Nombre maximal d’entrées à renvoyer (par défaut : 50, maximum : 200) |
severity | chaîne | Filtre de gravité séparé par des virgules |
pageToken | chaîne | Jeton de pagination de la réponse précédente |
État du déploiement#
GET /api/deployments/{owner}/{deployment}/healthSDK Python : client.deployments.health(owner, deployment)
Envoie une requête ping au déploiement et renvoie son état avec la latence aller-retour mesurée :
{
"healthy": true,
"status": 200,
"latencyMs": 142
}Une réponse indiquant un état dégradé omet status si le point de terminaison est totalement inaccessible, et ajoute un message error.
Les chiffres agrégés de l’onglet Deployments ne sont pas disponibles via un seul point de terminaison REST. Pour les obtenir, appelle la route des métriques pour chaque déploiement renvoyé par GET /api/deployments/{owner} (client.deployments.list(owner)).
Optimisation des performances#
Utilise les données de surveillance pour optimiser tes déploiements :
Si la latence est trop élevée :
- Vérifie que la taille du modèle est adaptée
- Envisage une région plus proche
- Vérifie la taille de l’image envoyée avec chaque requête
Essaie une valeur imgsz plus petite et compare la latence et la précision obtenues pour ton modèle. Déploie le modèle dans une région plus proche des utilisateurs pour réduire la latence réseau.
FAQ#
Les statistiques de prédiction et les exemples temporaires ne sont conservés que pendant la durée de vie de l’instance de service, dans les limites de taille du compartiment et de la galerie décrites ci-dessus. L’arrêt, le redémarrage, le redéploiement, le redimensionnement ou le remplacement du modèle peut les effacer. Seuls les exemples enregistrés avec succès dans un jeu de données sont conservés indépendamment du point de terminaison.
Les métriques opérationnelles et les journaux ont des périodes d’historique distinctes. L’API des métriques permet de choisir une période allant de 1 heure à 30 jours ; les données sont échantillonnées de façon moins précise à mesure que la période augmente — par tranches d’une minute sur 1 heure, jusqu’à des tranches de 4 heures sur 30 jours. L’onglet
Logsdu déploiement affiche les 20 entrées les plus récentes du journal ; l’API des journaux peut renvoyer jusqu’à 200 entrées par requête et prend en charge la pagination.Les métriques et les journaux ne sont conservés que tant que le déploiement existe ; supprimer un déploiement met donc également fin à l’accès à son historique. Exporte les données que tu souhaites conserver avant de supprimer un point de terminaison.
Oui, l’onglet Deployments de ton profil affiche tous les points de terminaison avec des cartes de synthèse agrégées. Utilise la vue en tableau pour comparer les performances des différents déploiements.
Non. Les métriques et les vérifications d’état sont recueillies uniquement pour les déploiements à l’état Ready. Un point de terminaison arrêté conserve sa page de déploiement et sa période d’historique, mais n’affiche aucun chiffre en temps réel tant que tu ne le redémarres pas.