YOLO Vision 2026:

Überwachung#

Ultralytics Platform bietet Überwachung für bereitgestellte Endpunkte. Verfolge Anfragemetriken, zeige Protokolle an und prüfe den Integritätsstatus mit automatischem Polling.

Ultralytics Platform Deploy Page Overview Cards And World Map

Bereitstellungs-Dashboard#

Die Seite Deploy in der Seitenleiste dient als Überwachungs-Dashboard für all deine Deployments. Sie kombiniert die Weltkarte, Übersichtskennzahlen und die Deployment-Verwaltung in einer Ansicht. Siehe Dedicated Endpoints zum Erstellen und Verwalten von Deployments.

graph TB
    subgraph Dashboard
        Map[World Map]:::proc --- Cards[Overview Cards]:::proc
        Cards --- List[Deployments List]:::decide
    end
    subgraph "Per Deployment"
        Metrics[Metrics Row]:::out
        Health[Health Check]:::out
        Logs[Logs Tab]:::out
        Code[Code Tab]:::out
        Predict[Predict Tab]:::out
    end
    List --> Metrics
    List --> Health
    List --> Logs
    List --> Code
    List --> Predict

    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff

Übersichtskarten#

Vier Zusammenfassungskarten oben auf der Seite zeigen:

Ultralytics Platform Deploy Page Four Overview Cards

MetrikBeschreibung
Gesamtanfragen (24h)Anfragen über alle Endpunkte hinweg
Aktive BereitstellungenEndpunkte, die sich aktuell im Zustand Ready befinden
Fehlerrate (24h)Anteil der Antworten mit einem 4xx- oder 5xx-Status, gewichtet nach Anfragevolumen
P95 Latenz (24h)Durchschnitt der stündlichen 95.-Perzentil-Latenzen, gewichtet nach Volumen

Es wird das P95 anstelle der medianen Latenz berichtet, da Integritätsprüfungen in wenigen Millisekunden antworten und das Bild der echten Inferenzlatenz sonst dominieren würden.

Fehlerraten-Warnung

Die Fehlerra-Karte leuchtet rot auf, wenn die Rate 5% übersteigt. Überprüfe die Registerkarte Logs bei einzelnen Deployments, um Fehler zu diagnostizieren.

Weltkarte#

Die interaktive Weltkarte zeigt:

  • Regions-Pins für alle 42 verfügbaren Regionen
  • Grüne Pins für Regionen mit einer bereiten Bereitstellung
  • Animierte blaue Pins für Regionen mit laufenden Bereitstellungen
  • Pin-Größe variiert je nach Bereitstellungsstatus und Latenz

Klicke auf eine beliebige Region, um den Dialog New Deployment zu öffnen. Die Karte ist auf kleinen Bildschirmen ausgeblendet.

Ultralytics Platform Deploy Page World Map With Deployed Regions

Bereitstellungsliste#

Unter den Übersichtskarten zeigt die Bereitstellungsliste alle Endpunkte deiner Projekte. Nutze den Ansichtsmodus-Umschalter, um zwischen folgenden Optionen zu wechseln:

AnsichtBeschreibung
KartenVollständige Detailkarten mit Metriken, Logs, Code- und Predict-Tabs
KompaktRaster aus kleineren Karten (1-4 Spalten) mit Schlüsselmetriken
TabelleDatentabelle mit sortierbaren Spalten: Name, Region, Status, Anfragen, P95, Fehler
Echtzeit-Updates

Das Dashboard wird automatisch aktualisiert und aktualisiert sich schneller, während sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping). Klicke auf die Schaltfläche zum Aktualisieren für sofortige Aktualisierungen.

Metriken pro Bereitstellung#

Jede Bereitstellungskarte (in der Kartenansicht) zeigt Echtzeitmetriken:

Metrik-Zeile#

MetrikBeschreibung
AnfragenAnfrageanzahl der letzten 24 Stunden
P95 LatenzDurchschnitt der stündlichen 95.-Perzentil-Latenzen (24h)
FehlerrateAnteil von 4xx- und 5xx-Antworten, wird nur angezeigt, wenn er über 0 liegt

Metriken werden automatisch aktualisiert. Endpunkte, die noch keine Anfrage beantwortet haben, zeigen „No traffic yet“ an, und Metriken werden nur für Bereitstellungen im Zustand Ready erfasst. Auf dem Bereitstellungs-Dashboard werden Metriken für die 20 neuesten Bereitstellungen abgerufen.

Gesundheitsprüfung#

Laufende Bereitstellungen zeigen einen Gesundheitscheck-Indikator:

IndikatorBedeutung
Grünes HerzGesund — zeigt Antwortlatenz
Rotes HerzUngesund — zeigt Fehlermeldung
Drehendes IconGesundheitscheck läuft

Integritätsprüfungen versuchen automatisch erneut, wenn sie fehlerhaft sind, und stoppen, sobald der Endpunkt antwortet. Klicke auf das Aktualisierungssymbol, um manuell eine Integritätsprüfung auszulösen, was gleichzeitig eine Möglichkeit ist, einen auf Null skalierten Endpunkt vor dem Senden von Datenverkehr aufzuwärmen.

Ultralytics Platform Deployment Card Health Check Healthy With Latency

Kaltstart-Toleranz

Die Plattform gibt der Integritätsprüfung zusätzliche Zeit und versucht vorübergehende Verbindungsausfälle erneut, sodass ein auf Null skalierter Endpunkt Zeit zum Starten hat. Wenn die Karte „Service starting up...“ meldet, aktualisiere sie, um eine Instanz aufzurufen, die in der Zwischenzeit das Hochfahren beendet hat.

Logs#

Jede Deployment-Karte enthält eine Registerkarte Logs zum Anzeigen neuerer Protokolleinträge:

Ultralytics Platform Deployment Card Logs Tab With Severity Filter

Log-Einträge#

Jeder Log-Eintrag zeigt:

FeldBeschreibung
SchweregradFarbcodierter Balken (siehe unten)
ZeitstempelAnfragezeit (lokales Format)
NachrichtLog-Inhalt
HTTP-InfoStatuscode und Latenz (falls zutreffend)

Jeder Eintrag enthält einen farbcodierten Schweregradbalken:

EbeneFarbeBeschreibung
DEBUGGrauDebug-Nachrichten
INFOBlauNormale Anfragen
WARNINGBernsteinNicht-kritische Probleme
ERRORRotFehlgeschlagene Anfragen
CRITICALRotKritische Fehler

Die API akzeptiert den vollständigen Satz von Protokollschweregraden als durch Kommas getrennten Filter: DEBUG, INFO, NOTICE, WARNING, ERROR, CRITICAL, ALERT und EMERGENCY.

Die Benutzeroberfläche zeigt die 20 neuesten Einträge an und blendet leere aus. Die API verwendet standardmäßig 50 Einträge pro Anfrage (max. 200) und gibt ein nextPageToken für weiteres Blättern zurück.

Debugging-Workflow

Bei der Untersuchung von Fehlern: Klicke zuerst auf Errors, um nach ERROR- und WARNING-Einträgen zu filtern, und prüfe dann die Zeitstempel sowie HTTP-Statuscodes. Kopiere die Logs in die Zwischenablage, um sie mit deinem Team zu teilen.

Code-Beispiele#

Jede Bereitstellungskarte enthält einen Code-Tab, der einsatzbereiten API-Code mit eingetragener Endpunkt-URL anzeigt. Für Workspace-Inhaber ist der an die Bereitstellung gebundene API-Schlüssel eingefügt, bereit zum Kopieren und Ausführen. Andere Benutzer sehen einen YOUR_API_KEY-Platzhalter:

import requests

# Deployment endpoint
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Send image for inference
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())
Automatisch ausgefüllte Anmeldedaten

Wenn du den Code-Tab in der Plattform anzeigst, werden die Endpunkt-URL und für Workspace-Inhaber der gebundene API-Schlüssel automatisch für dich ausgefüllt. Siehe API Keys, um einen Schlüssel zu generieren.

Deployment-Predict#

Die Registerkarte Predict auf jeder Deployment-Karte bietet ein integriertes Vorhersage-Panel — dieselbe Benutzeroberfläche wie die Registerkarte Predict des Modells, führt die Inferenz jedoch über den Deployment-Endpunkt anstelle des gemeinsamen Dienstes aus. Dies ist nützlich, um einen bereitgestellten Endpunkt direkt aus dem Browser zu testen. Siehe Inference für Parameterdetails und Antwortformate.

API-Endpunkte#

Jede Bereitstellung wird über ihren Inhaber und den Bereitstellungsnamen angesprochen, und jede Route erfordert einen API-Schlüssel. Siehe die API reference für Authentifizierungsdetails.

Deployment-Metriken#

GET /api/deployments/{owner}/{deployment}/metrics?range=24h

Gibt die vollständige Metriknutzlast für eine Bereitstellung zurück: einen summary-Block mit Gesamtanfragen, Fehleranzahl und -rate sowie durchschnittlicher, P50-, P95- und P99-Latenz plus timeSeries-Arrays für Anfragen, Fehler, P50- und P95-Latenz, CPU- und Speicherauslastung sowie Instanzanzahl.

ParameterTypBeschreibung
rangestringZeitbereich: 1h, 6h, 24h, 7d oder 30d (Standard 24h)
sparklineboolGibt die kompakte Dashboard-Zusammenfassung anstelle der vollständigen Nutzlast zurück

Mit sparkline=true ist die Antwort die kompakte Form, die von den Bereitstellungskarten verwendet wird – 24 stündliche Anfrageanzahlen plus Gesamtanfragen, Fehlerrate und durchschnittliche Latenz. Dies ist der Aufruf, der alle 60 Sekunden aktualisiert wird.

Deployment-Logs#

GET /api/deployments/{owner}/{deployment}/logs?limit=50&severity=ERROR,WARNING

Gibt aktuelle Log-Einträge mit optionalem Schweregradfilter und Paginierung zurück.

ParameterTypBeschreibung
limitintMaximale Anzahl zurückzugebender Einträge (Standard: 50, Maximum: 200)
severitystringKommagetrennter Schweregradfilter
pageTokenstringPagination-Token von der vorherigen Antwort

Deployment-Status#

GET /api/deployments/{owner}/{deployment}/health

Pingt die Bereitstellung an und gibt ihren Integritätsstatus mit der gemessenen Roundtrip-Latenz zurück:

{
    "healthy": true,
    "status": 200,
    "latencyMs": 142
}

Eine fehlerhafte Antwort lässt status weg, wenn der Endpunkt überhaupt nicht erreichbar war, und fügt eine error-Nachricht hinzu.

Dashboard-Übersicht

Die aggregierten Zahlen auf der Deploy-Seite sind nicht als einzelner REST-Endpunkt verfügbar. Du kannst sie reproduzieren, indem du die Metrik-Route für jede Bereitstellung aufrufst, die von GET /api/deployments/{owner} zurückgegeben wird.

Leistungsoptimierung#

Verwende Überwachungsdaten, um deine Deployments zu optimieren:

Wenn die Latenz zu hoch ist:

  1. Überprüfe, ob die Modellgröße angemessen ist
  2. Erwäge eine nähere Region
  3. Überprüfe die mit jeder Anfrage gesendete Bildgröße
Latenz reduzieren

Probiere einen kleineren Wert für imgsz aus und vergleiche die resultierende Latenz und Genauigkeit für dein Modell. Deploye in eine Region näher an den Aufrufern, um die Netzwerk Latenz zu verringern.

FAQ#

  • Die Metriken-API unterstützt wählbare Zeitfenster von 1 Stunde bis zu 30 Tagen, die mit wachsendem Zeitfenster gröber abgetastet werden – 1-Minuten-Buckets über 1 Stunde bis zu 4-Stunden-Buckets über 30 Tage. Die Bereitstellungskarte zeigt die 20 neuesten Protokolleinträge; die Protokolle-API kann bis zu 200 Einträge pro Anfrage zurückgeben und unterstützt Paginierung.

    Metriken und Protokolle werden nur aufbewahrt, solange die Bereitstellung existiert, sodass das Löschen einer Bereitstellung auch den Zugriff auf ihren Verlauf beendet. Exportiere alles, was du behalten musst, bevor du einen Endpunkt löschst.

  • Ja, die Deployments-Seite zeigt alle Endpunkte mit aggregierten Übersichtskarten. Verwende die Tabellenansicht, um die Leistung über verschiedene Deployments hinweg zu vergleichen.

  • Nein. Metriken und Integritätsprüfungen werden nur für Bereitstellungen im Zustand Ready erfasst. Ein gestoppter Endpunkt behält seine Karte und sein Verlaufssfenster, zeigt jedoch keine Live-Zahlen an, bis du ihn wieder startest.

Kommentare