Monitoraggio#
Ultralytics Platform offre il monitoraggio degli endpoint distribuiti. Tieni traccia delle richieste agli endpoint, della latenza, degli errori e dei log. Gli endpoint dedicati pronti su un runtime aggiornato forniscono anche statistiche di predizione in tempo reale ed esempi temporanei che puoi esaminare e salvare nei dataset.

Scheda Deployments#
La scheda Distribuzioni del tuo profilo funge da dashboard di monitoraggio per tutte le tue distribuzioni. Riunisce in un'unica vista la mappa del mondo, le metriche di riepilogo e la gestione delle distribuzioni. Consulta Endpoint dedicati per creare e gestire le distribuzioni.
graph TB
subgraph "Deployments Tab"
Map[World Map]:::proc --- Cards[Overview Cards]:::proc
Cards --- List[Deployments List]:::decide
end
subgraph "Deployment Page"
Metrics[Metrics Cards]:::out
Overview[Overview Tab: Endpoint and Health Check]:::out
Monitoring[Monitoring Tab]:::out
Predict[Predict Tab]:::out
Logs[Logs Tab]:::out
end
List --> Metrics
List --> Overview
List --> Monitoring
List --> Predict
List --> Logs
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fffSchede di riepilogo#
Quattro schede di riepilogo nella parte superiore della pagina mostrano:

| Metrica | Descrizione |
|---|---|
| Distribuzioni attive | Endpoint attualmente nello stato Pronto |
| Richieste HTTP (24 ore) | Richieste HTTP su tutti gli endpoint, incluse le richieste di predizione, monitoraggio e integrità |
| Tasso di errori HTTP (24 ore) | Percentuale di risposte con stato 4xx o 5xx, ponderata in base al volume delle richieste |
| Latenza HTTP P95 (24 ore) | Media delle latenze orarie al 95° percentile, ponderata in base al volume |
Viene riportata la latenza P95 anziché quella mediana perché i controlli di integrità si completano in un paio di millisecondi e altrimenti prevarrebbero nel quadro della latenza di inferenza effettiva.
La scheda del tasso di errori si evidenzia in rosso quando il tasso supera il 5%. Controlla la scheda Logs delle singole distribuzioni per diagnosticare gli errori.
Mappa del mondo#
La mappa interattiva del mondo mostra:
- Indicatori di area per tutte le 42 regioni disponibili
- Indicatori verdi per le regioni con una distribuzione pronta
- Indicatori blu animati per le regioni con distribuzioni attive in corso
- Le dimensioni degli indicatori variano in base allo stato della distribuzione e alla latenza
Fai clic su una regione per aprire la finestra di dialogo New Deployment. La mappa è nascosta sugli schermi piccoli.

Elenco delle distribuzioni#
Sotto le schede di riepilogo, l'elenco delle distribuzioni mostra tutti gli endpoint dei tuoi progetti. Usa il selettore della modalità di visualizzazione per alternare tra:
| Visualizzazione | Descrizione |
|---|---|
| Schede | Schede con stato, dimensione, metriche, distanza e data di deployment |
| Compatta | Griglia di schede più piccole (1-4 colonne) con le metriche principali |
| Tabella | Tabella dati con colonne ordinabili, tra cui CPU, memoria, metriche HTTP e distanza |
La scheda si aggiorna automaticamente, più spesso quando una distribuzione cambia stato (creating, deploying o stopping). Ogni scheda e riga rimanda alla pagina della distribuzione.
Metriche per distribuzione#
Ogni pagina di distribuzione mostra metriche in tempo reale sopra le schede Overview, Monitoring, Predict e Logs:
Schede delle metriche#
| Metrica | Descrizione |
|---|---|
| Richieste HTTP (24 ore) | Numero di richieste, incluse le richieste di predizione, monitoraggio e integrità |
| Tasso di errori HTTP (24 ore) | Percentuale di risposte 4xx e 5xx |
| Latenza HTTP P95 (24 ore) | 95° percentile delle latenze P95 su 15 minuti |
Ogni scheda mostra un grafico sparkline e si aggiorna ogni minuto, accanto a una scheda che rimanda al modello distribuito. Le metriche vengono raccolte solo per le distribuzioni nello stato Pronto. Nella scheda Distribuzioni, le metriche vengono recuperate per le 20 distribuzioni più recenti.
Controllo dello stato#
La scheda Endpoint nella scheda Overview di una distribuzione in esecuzione mostra un indicatore del controllo di integrità:
| Indicatore | Significato |
|---|---|
| Cuore verde | Integro — mostra la latenza della risposta |
| Cuore rosso | Non integro — mostra il messaggio di errore |
| Icona rotante | Controllo di integrità in corso |
I controlli di integrità vengono ritentati automaticamente quando l'endpoint non è integro e si interrompono quando l'endpoint risponde. Aprire la pagina della distribuzione avvia un controllo di integrità; il pulsante per ripetere il ping ne avvia un altro e può anche essere usato per riscaldare un endpoint scalato a zero prima di inviargli traffico.

La piattaforma concede più tempo al controllo di integrità e riprova in caso di errori di connessione transitori, così un endpoint scalato a zero ha il tempo di avviarsi. Fino alla prima risposta del controllo di integrità, il badge mostra In avvio e le schede Predict e Monitoring mostrano Endpoint in avvio; si aggiornano automaticamente quando l'endpoint risponde. Se il controllo non riesce, il badge mostra Nessuna risposta e le schede offrono l'opzione Riprova.
Scheda Monitoraggio#
Apri la pagina della distribuzione di un endpoint dedicato con stato Pronto e seleziona la scheda Monitoraggio. Invia un'immagine tramite la scheda Predici o l'API dell'endpoint oppure mantieni attiva una telecamera in background per popolare Esempi temporanei e Statistiche delle predizioni. Prima che venga elaborata la prima immagine, la scheda mostra Nessuna immagine elaborata.
Il monitoraggio è disponibile su ogni endpoint dedicato Pronto, inclusi gli endpoint di dimensioni predefinite del piano Free. Gli endpoint esistenti non vengono aggiornati automaticamente a ogni rilascio del runtime, quindi un endpoint meno recente potrebbe mostrare Monitoraggio non disponibile finché il runtime non viene aggiornato.

Il monitoraggio è leggero e temporaneo: i grafici, le statistiche delle predizioni e le immagini di esempio risiedono solo nella memoria dell'istanza di servizio. Possono andare persi quando l'endpoint si spegne, si arresta, si riavvia, viene distribuito di nuovo, cambia risorse o sostituisce il modello. La cronologia non viene ripristinata al successivo avvio dell'endpoint. Salva gli esempi utili in un dataset e attendi il completamento dell'acquisizione prima di modificare l'endpoint.
Esempi temporanei#
La galleria contiene immagini elaborate di recente con sovrapposizioni delle predizioni. Apri un'immagine per esaminarne le predizioni nel visualizzatore a schermo intero e usa i controlli di visibilità per regolare le sovrapposizioni. Inizialmente, la galleria mostra fino a 12 esempi; Mostra tutto la espande.
- Acquisizione: le immagini elaborate di recente appaiono come esempi temporanei, al massimo una al secondo. L'acquisizione è effettuata al meglio; l'inferenza non attende la codifica degli esempi.
- Capacità: al massimo 100 immagini entro un budget condiviso di memoria di 100 MiB per immagini compresse, metadati delle predizioni e risorse associate. L'interfaccia indica questo budget come 100 MB.
- Sostituzione: gli esempi meno recenti vengono sostituiti quando viene raggiunto uno dei due limiti. Un esempio potrebbe non essere più disponibile mentre lo visualizzi.
- Archiviazione: gli esempi temporanei rimangono nella memoria dell'endpoint. Salvarli in un dataset comporta l'uso dei normali limiti di archiviazione e di elaborazione dell'area di lavoro.

Salvare gli esempi in un dataset#
I membri dell'area di lavoro con autorizzazione a modificare i contenuti possono salvare gli esempi in un dataset nell'area di lavoro dell'endpoint:
- Seleziona singoli esempi usando le relative caselle di controllo oppure fai clic su Seleziona tutto.
- Fai clic su Salva nel dataset.
- Scegli un dataset esistente con la stessa attività del modello distribuito. I dataset connessi a una fonte sono esclusi; se non è disponibile nessun dataset compatibile, creane prima uno.
- Fai clic sul pulsante Salva, che mostra il numero di immagini selezionate, quindi apri il dataset per seguire l'elaborazione.
Le immagini selezionate e le relative predizioni vengono copiate tramite il normale flusso di caricamento e acquisizione del dataset. Si applicano i normali limiti di quota, la mappatura delle classi e la gestione dei duplicati. Il salvataggio lascia gli esempi temporanei nella galleria; le immagini del dataset acquisite correttamente restano disponibili anche dopo il riavvio o l'eliminazione dell'endpoint. Esamina le etichette predette prima di usarle per l'addestramento. Ogni immagine salvata registra deploymentId, deploymentName, deploymentRegion e deploymentRegionName nei metadati personalizzati, utilizzati dalla ricerca nel dataset; i nomi vengono registrati come erano al momento del salvataggio e un'immagine ignorata perché duplicata conserva i metadati esistenti.

Per rimuovere gli esempi temporanei, usa il controllo del cestino che appare al passaggio del cursore sull'immagine oppure seleziona gli esempi e fai clic sul pulsante del cestino per l'eliminazione in blocco, quindi conferma Elimina. L'eliminazione degli esempi non modifica le statistiche aggregate delle predizioni né le immagini già salvate nei dataset.
Statistiche delle predizioni#
Le statistiche aggregano le immagini elaborate indipendentemente dalla galleria. L'eliminazione o la sostituzione di un esempio non sottrae il relativo contributo. Il riepilogo mostra immagini, predizioni e immagini senza predizioni per il periodo selezionato; i modelli di profondità mostrano il conteggio delle immagini.
Il selettore delle date usa per impostazione predefinita gli ultimi 30 giorni e accetta intervalli fino a 365 giorni. Le date selezionate seguono i confini temporali UTC; gli orari dei grafici sono visualizzati nell'ora locale. Gli intervalli recenti fino a tre giorni usano la cronologia oraria quando l'intero intervallo rientra nelle ultime 72 ore; gli altri intervalli usano la cronologia giornaliera. L'intervallo di date filtra le statistiche, mentre la galleria continua a mostrare gli esempi temporanei attuali.
La cronologia è limitata a 72 intervalli orari e 365 intervalli giornalieri ed è disponibile solo a partire dall'avvio dell'istanza corrente. Se nel periodo selezionato non sono state elaborate immagini, viene mostrato Nessuna immagine elaborata in questo periodo.
I grafici disponibili dipendono dall'attività e dalle predizioni raccolte:
| Grafico | Cosa mostra |
|---|---|
| Predizioni nel tempo | Totali di immagini elaborate e predizioni; i modelli di profondità mostrano Immagini nel tempo |
| Tempo di inferenza | Tempo medio di inferenza del modello in millisecondi, esclusi la rete e il sovraccarico delle richieste |
| Classi principali | Conteggio delle predizioni per classe |
| Predizioni per immagine | Distribuzione che include le immagini senza predizioni e una fascia finale 100+; nascosta per classificazione e profondità |
| Confidenza delle predizioni | Distribuzione e media della confidenza, se i punteggi di confidenza sono disponibili |
| Confidenza nel tempo | Confidenza media delle predizioni per ciascun intervallo temporale |
| Dimensioni delle predizioni | Larghezza e altezza della predizione rispetto all'immagine di input, se sono disponibili le dimensioni del riquadro |
| Posizioni delle predizioni | Mappa di calore spaziale delle predizioni, se sono disponibili i dati sulla posizione |


La confidence misura il grado di certezza del modello, non la correttezza. Quando valuti l'accuratezza, esamina gli esempi e confrontali con le etichette verificate. Inference Time misura l'esecuzione del modello; la P95 Latency del deployment include la gestione delle richieste e può risentire anche del traffico non legato all'inferenza, ad esempio quello dei controlli di integrità.
Il monitoraggio si aggiorna automaticamente mentre il pannello è aperto e visibile e si interrompe quando il pannello è fuori schermo o la scheda del browser è nascosta. Anche un'inferenza riuscita tramite la scheda Predict del deployment attiva un aggiornamento delle statistiche.
Log#
Ogni pagina di deployment include una scheda Logs per visualizzare le voci di log recenti:

Voci di log#
Ogni voce di log mostra:
| Campo | Descrizione |
|---|---|
| Gravità | Barra colorata (vedi sotto) |
| Timestamp | Ora della richiesta (formato locale) |
| Messaggio | Contenuto del log |
| Informazioni HTTP | Codice di stato e latenza (se applicabile) |
Ogni voce è contrassegnata da una barra colorata che indica la gravità:
| Livello | Colore | Descrizione |
|---|---|---|
| DEBUG | Grigio | Messaggi di debug |
| INFO | Blu | Richieste normali |
| WARNING | Ambra | Problemi non critici |
| ERROR | Rosso | Richieste non riuscite |
| CRITICAL | Rosso | Errori critici |
L'API accetta l'intero insieme dei livelli di gravità dei log come filtro separato da virgole: DEBUG, INFO, NOTICE, WARNING, ERROR, CRITICAL, ALERT e EMERGENCY.
L'interfaccia mostra le 20 voci più recenti e nasconde quelle vuote. Per impostazione predefinita, l'API restituisce 50 voci per richiesta (massimo 200) e restituisce un nextPageToken per scorrere le pagine precedenti.
Quando analizzi gli errori: fai clic prima su Errors per filtrare le voci ERROR e WARNING, poi controlla i timestamp e i codici di stato HTTP. Copia i log negli appunti per condividerli con il tuo team.
Esempi di codice#
La scheda dei risultati Predict Docs di ogni deployment mostra codice API pronto all'uso con l'URL dell'endpoint e, per i proprietari dello spazio di lavoro, la chiave API associata al deployment già compilata, pronta da copiare ed eseguire. Chi non è proprietario visualizza un segnaposto YOUR_API_KEY:
import requests
# Endpoint della distribuzione
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# Intestazioni con la chiave API della distribuzione
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Parametri di inferenza
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Invia un'immagine per l'inferenza
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Negli esempi Docs della scheda Predict del deployment, l'URL dell'endpoint e, per i proprietari dello spazio di lavoro, la chiave API associata al deployment sono già compilati. Consulta Chiavi API per generare una chiave.
Inferenza di deployment#
La scheda Predict di ogni pagina di deployment fornisce un pannello di inferenza integrato: la stessa interfaccia della scheda Predict del modello, ma con l'inferenza eseguita tramite l'endpoint di deployment anziché il servizio condiviso. È utile per testare un endpoint distribuito direttamente dal browser. Consulta Inferenza per i dettagli sui parametri e i formati delle risposte.
Endpoint API#
Ogni deployment è identificato dal nome del proprietario e dal nome del deployment, e ogni route richiede una chiave API. Consulta il riferimento API per i dettagli sull'autenticazione.
Metriche del deployment#
GET /api/deployments/{owner}/{deployment}/metrics?range=24hPython SDK: client.deployments.metrics(owner, deployment, range="24h")
Restituisce l'intero payload delle metriche di un deployment: un blocco summary con il numero totale di richieste, il numero e il tasso di errori, e la latenza media, P50, P95 e P99; inoltre, include array timeSeries per richieste, errori, latenza P50 e P95, utilizzo di CPU e memoria e numero di istanze.
| Parametro | Tipo | Descrizione |
|---|---|---|
range | stringa | Intervallo di tempo: 1h, 6h, 24h, 7d o 30d (predefinito 24h) |
sparkline | bool | Restituisce il riepilogo compatto del dashboard invece del payload completo |
view | stringa | overview restituisce solo le metriche di richieste, errori e latenza P95 |
Con sparkline=true, la risposta è un riepilogo compatto: il numero orario di richieste delle ultime 24 ore (le ore senza richieste vengono omesse), oltre alle richieste totali, al tasso di errori e a avgLatencyMs, la media delle latenze P95 orarie. Con view=overview, summary contiene totalRequests, errorRate e p95LatencyMs, mentre timeSeries contiene requests, errors e latencyP95; le schede delle statistiche nella pagina del deployment usano questa visualizzazione e si aggiornano automaticamente.
Log del deployment#
GET /api/deployments/{owner}/{deployment}/logs?limit=50&severity=ERROR,WARNINGPython SDK: client.deployments.logs(owner, deployment, limit=50, severity="ERROR,WARNING")
Restituisce le voci di log recenti con filtro di gravità e paginazione facoltativi.
| Parametro | Tipo | Descrizione |
|---|---|---|
limit | int | Numero massimo di voci da restituire (predefinito: 50, massimo: 200) |
severity | stringa | Filtro di gravità separato da virgole |
pageToken | stringa | Token di paginazione della risposta precedente |
Integrità del deployment#
GET /api/deployments/{owner}/{deployment}/healthPython SDK: client.deployments.health(owner, deployment)
Invia un ping al deployment e ne restituisce lo stato di integrità insieme alla latenza di andata e ritorno misurata:
{
"healthy": true,
"status": 200,
"latencyMs": 142
}Una risposta di stato non integro omette status se non è stato possibile raggiungere l'endpoint e aggiunge un messaggio error.
I valori aggregati nella scheda Deployments non sono disponibili tramite un singolo endpoint REST. Puoi ricrearli chiamando la route delle metriche per ogni deployment restituito da GET /api/deployments/{owner} (client.deployments.list(owner)).
Ottimizzazione delle prestazioni#
Usa i dati di monitoraggio per ottimizzare i tuoi deployment:
Se la latenza è troppo elevata:
- Verifica che le dimensioni del modello siano adeguate
- Valuta una regione più vicina
- Controlla le dimensioni dell'immagine inviata con ogni richiesta
Prova un valore imgsz più basso e confronta la latenza e l'accuratezza risultanti per il tuo modello. Esegui il deployment in una regione più vicina ai chiamanti per ridurre la latenza di rete.
Domande frequenti#
Le statistiche delle predizioni e gli esempi temporanei sono conservati solo per la durata dell'istanza di servizio, entro i limiti del bucket e della galleria descritti sopra. L'arresto, il riavvio, un nuovo deployment, il ridimensionamento o la sostituzione del modello possono cancellarli. Solo gli esempi salvati correttamente in un dataset persistono indipendentemente dall'endpoint.
Le metriche operative e i log hanno periodi di cronologia distinti. L'API delle metriche supporta intervalli selezionabili da 1 ora a 30 giorni, con campionamenti più distanziati all'aumentare dell'intervallo: bucket di 1 minuto per 1 ora, fino a bucket di 4 ore per 30 giorni. La scheda
Logsdel deployment mostra le 20 voci di log più recenti; l'API dei log può restituire fino a 200 voci per richiesta e supporta la paginazione.Le metriche e i log vengono conservati solo finché esiste il deployment, quindi l'eliminazione di un deployment interrompe anche l'accesso alla relativa cronologia. Esporta i dati che vuoi conservare prima di eliminare un endpoint.
Sì, la scheda Deployments del tuo profilo mostra tutti gli endpoint con schede riepilogative aggregate. Usa la visualizzazione tabellare per confrontare le prestazioni dei deployment.
No. Le metriche e i controlli di integrità vengono raccolti solo per i deployment nello stato Ready. Un endpoint arrestato mantiene la propria pagina di deployment e il relativo intervallo di cronologia, ma non mostra dati in tempo reale finché non lo riavvii.