Überwachung#
Die Ultralytics Platform bietet Überwachung für bereitgestellte Endpunkte. Verfolge Anfragen, Latenz, Fehler und Protokolle der Endpunkte. Bereite dedizierte Endpunkte mit einer aktuellen Laufzeitumgebung vor, um außerdem Live-Statistiken zu Vorhersagen und temporäre Beispiele zu erhalten, die du prüfen und in Datensätzen speichern kannst.

Tab „Bereitstellungen“#
Der Tab Bereitstellungen in deinem Profil dient als Überwachungsdashboard für alle deine Bereitstellungen. Er vereint die Weltkarte, Übersichtsmetriken und die Verwaltung der Bereitstellungen in einer Ansicht. Unter Dedizierte Endpunkte erfährst du, wie du Bereitstellungen erstellst und verwaltest.
graph TB
subgraph "Deployments Tab"
Map[World Map]:::proc --- Cards[Overview Cards]:::proc
Cards --- List[Deployments List]:::decide
end
subgraph "Deployment Page"
Metrics[Metrics Cards]:::out
Overview[Overview Tab: Endpoint and Health Check]:::out
Monitoring[Monitoring Tab]:::out
Predict[Predict Tab]:::out
Logs[Logs Tab]:::out
end
List --> Metrics
List --> Overview
List --> Monitoring
List --> Predict
List --> Logs
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fffÜbersichtskarten#
Vier Übersichtskarten oben auf der Seite zeigen:

| Kennzahl | Beschreibung |
|---|---|
| Aktive Bereitstellungen | Endpunkte, die sich derzeit im Status Bereit befinden |
| HTTP-Anfragen (24 h) | HTTP-Anfragen an allen Endpunkten, einschließlich Vorhersage-, Überwachungs- und Zustandsprüfungsanfragen |
| HTTP-Fehlerrate (24 h) | Anteil der Antworten mit Status 4xx oder 5xx, gewichtet nach Anfragevolumen |
| HTTP-P95-Latenz (24 h) | Durchschnitt der stündlichen Latenzen des 95. Perzentils, gewichtet nach Volumen |
Es wird die P95-Latenz statt der medianen Latenz angezeigt, da Zustandsprüfungen innerhalb weniger Millisekunden abgeschlossen sind und sonst das Bild der tatsächlichen Inferenzlatenz verzerren würden.
Die Karte zur Fehlerrate wird rot hervorgehoben, wenn die Rate 5 % überschreitet. Öffne den Tab Logs bei einzelnen Bereitstellungen, um Fehler zu untersuchen.
Weltkarte#
Die interaktive Weltkarte zeigt:
- Regionsmarkierungen für alle 42 verfügbaren Regionen
- Grüne Markierungen für Regionen mit einer bereitstehenden Bereitstellung
- Animierte blaue Markierungen für Regionen mit laufenden aktiven Bereitstellungen
- Größe der Markierungen variiert je nach Bereitstellungsstatus und Latenz
Klicke auf eine beliebige Region, um den Dialog New Deployment zu öffnen. Auf kleinen Bildschirmen wird die Karte ausgeblendet.

Bereitstellungsliste#
Unter den Übersichtskarten zeigt die Bereitstellungsliste alle Endpunkte deiner Projekte. Mit dem Ansichtsmodus kannst du wechseln zwischen:
| Ansicht | Beschreibung |
|---|---|
| Karten | Karten mit Status, Größe, Messwerten, Entfernung und Bereitstellungsdatum |
| Kompakt | einem Raster aus kleineren Karten (1–4 Spalten) mit wichtigen Kennzahlen |
| Tabelle | einer Datentabelle mit sortierbaren Spalten, darunter CPU, Arbeitsspeicher, HTTP-Metriken und Entfernung |
Der Tab wird automatisch aktualisiert, bei Statusänderungen einer Bereitstellung auch schneller (creating, deploying oder stopping). Jede Karte und Zeile verlinkt auf die Seite der jeweiligen Bereitstellung.
Metriken einzelner Bereitstellungen#
Auf der Seite jeder Bereitstellung werden oberhalb der Tabs Overview, Monitoring, Predict und Logs Echtzeitmetriken angezeigt:
Metrikkarten#
| Kennzahl | Beschreibung |
|---|---|
| HTTP-Anfragen (24 h) | Anzahl der Anfragen, einschließlich Vorhersage-, Überwachungs- und Zustandsprüfungsanfragen |
| HTTP-Fehlerrate (24 h) | Anteil der Antworten mit Status 4xx und 5xx |
| HTTP-P95-Latenz (24 h) | 95. Perzentil der 15-Minuten-P95-Latenzen |
Jede Karte zeigt einen Sparkline-Verlauf und wird jede Minute aktualisiert. Daneben befindet sich eine Karte mit einem Link zum bereitgestellten Modell. Metriken werden nur für Bereitstellungen im Status Bereit erfasst. Im Tab „Bereitstellungen“ werden Metriken für die 20 zuletzt erstellten Bereitstellungen abgerufen.
Zustandsprüfung#
Die Karte Endpunkt im Tab Overview einer laufenden Bereitstellung zeigt eine Zustandsprüfungsanzeige:
| Anzeige | Bedeutung |
|---|---|
| Grünes Herz | Funktionsfähig – zeigt die Antwortlatenz an |
| Rotes Herz | Nicht funktionsfähig – zeigt eine Fehlermeldung an |
| Drehsymbol | Zustandsprüfung läuft |
Bei einem nicht funktionsfähigen Endpunkt werden Zustandsprüfungen automatisch wiederholt und beendet, sobald der Endpunkt antwortet. Beim Öffnen der Bereitstellungsseite wird eine Zustandsprüfung ausgeführt. Über die Schaltfläche zum erneuten Anpingen wird eine weitere Prüfung ausgelöst. Damit kannst du auch einen auf null skalierten Endpunkt aufwärmen, bevor du Datenverkehr sendest.

Die Platform gewährt der Zustandsprüfung zusätzliche Zeit und wiederholt sie bei vorübergehenden Verbindungsfehlern, damit ein auf null skalierter Endpunkt starten kann. Bis die erste Zustandsprüfung erfolgreich antwortet, lautet die Kennzeichnung Wird gestartet. In den Tabs Predict und Monitoring wird Endpunkt wird gestartet angezeigt. Die Anzeige wird automatisch aktualisiert, sobald der Endpunkt antwortet. Schlägt die Prüfung fehl, lautet die Kennzeichnung Keine Antwort und in diesen Tabs wird Erneut versuchen angeboten.
Tab „Überwachung“#
Öffne die Bereitstellungsseite eines dedizierten Endpunkts mit dem Status Bereit und wähle den Tab Überwachung aus. Sende über den Tab Vorhersage oder die API des Endpunkts ein Bild oder lasse eine Hintergrundkamera laufen, um Temporäre Beispiele und Vorhersagestatistiken zu füllen. Bevor das erste Bild verarbeitet wurde, wird auf dem Tab Keine Bilder verarbeitet angezeigt.
Die Überwachung ist für alle bereiten dedizierten Endpunkte verfügbar, auch für Endpunkte mit Standardgröße im Free-Tarif. Vorhandene Endpunkte werden nicht automatisch mit jeder neuen Laufzeitversion aktualisiert. Bei älteren Endpunkten wird daher möglicherweise Überwachung nicht verfügbar angezeigt, bis ihre Laufzeitumgebung aktualisiert wurde.

Die Überwachung ist ressourcenschonend und temporär: Diagramme, Vorhersagestatistiken und Beispielbilder werden nur im Arbeitsspeicher der Instanz gespeichert, die den Dienst bereitstellt. Sie können verloren gehen, wenn der Endpunkt heruntergefahren, angehalten, neu gestartet oder erneut bereitgestellt wird, wenn sich seine Ressourcen ändern oder sein Modell ersetzt wird. Beim nächsten Start des Endpunkts wird der Verlauf nicht wiederhergestellt. Speichere nützliche Beispiele in einem Datensatz und warte, bis die Verarbeitung abgeschlossen ist, bevor du den Endpunkt änderst.
Temporäre Beispiele#
Die Galerie enthält kürzlich verarbeitete Bilder mit eingeblendeten Vorhersagen. Öffne ein Bild, um die Vorhersagen in der Vollbildansicht zu prüfen, und passe die Einblendungen über die Sichtbarkeitseinstellungen an. In der Galerie werden zunächst bis zu 12 Beispiele angezeigt. Mit Alle anzeigen kannst du sie erweitern.
- Erfassung: Kürzlich verarbeitete Bilder erscheinen als temporäre Beispiele, höchstens eines pro Sekunde. Die Erfassung erfolgt nach Möglichkeit; die Inferenz wartet nicht auf die Kodierung der Beispiele.
- Kapazität: Höchstens 100 Bilder innerhalb eines gemeinsamen Arbeitsspeicherbudgets von 100 MiB für komprimierte Bilder, Vorhersagemetadaten und zugehörige Ressourcen. Die Benutzeroberfläche gibt dieses Budget als 100 MB an.
- Ersetzung: Ältere Beispiele werden ersetzt, sobald eine der beiden Grenzen erreicht ist. Ein Beispiel kann während der Ansicht nicht mehr verfügbar sein.
- Speicherung: Temporäre Beispiele bleiben im Arbeitsspeicher des Endpunkts. Beim Speichern in einem Datensatz gelten die üblichen Speicher- und Verarbeitungsgrenzen des Arbeitsbereichs.

Beispiele in einem Datensatz speichern#
Mitglieder des Arbeitsbereichs, die Inhalte bearbeiten dürfen, können Beispiele in einem Datensatz des Arbeitsbereichs speichern, zu dem der Endpunkt gehört:
- Wähle einzelne Beispiele über ihre Kontrollkästchen aus oder klicke auf Alle auswählen.
- Klicke auf In Datensatz speichern.
- Wähle einen vorhandenen Datensatz aus, dessen Aufgabe mit der des bereitgestellten Modells übereinstimmt. Datensätze mit verbundenen Quellen sind ausgeschlossen. Wenn kein geeigneter Datensatz verfügbar ist, erstelle zuerst einen passenden Datensatz.
- Klicke auf Speichern. Die Schaltfläche zeigt die Anzahl der ausgewählten Bilder an. Öffne anschließend den Datensatz, um die Verarbeitung nachzuverfolgen.
Die ausgewählten Bilder und Vorhersagen werden über den üblichen Workflow zum Hochladen und Einlesen von Datensätzen kopiert. Es gelten die üblichen Kontingente sowie die Regeln für die Klassenzuordnung und den Umgang mit Duplikaten. Beim Speichern bleiben die temporären Beispiele in der Galerie. Erfolgreich eingelesene Datensatzbilder bleiben auch nach einem Neustart oder Löschen des Endpunkts erhalten. Überprüfe vorhergesagte Bezeichnungen, bevor du sie zum Trainieren verwendest. Für jedes gespeicherte Bild werden deploymentId, deploymentName, deploymentRegion und deploymentRegionName in den benutzerdefinierten Metadaten erfasst, nach denen die Datensatzsuche sucht. Die Namen werden so gespeichert, wie sie zum Speicherzeitpunkt lauten. Wird ein Bild als Duplikat übersprungen, bleiben seine vorhandenen Metadaten erhalten.

Um temporäre Beispiele zu entfernen, bewege den Mauszeiger über ein Bild und verwende die Papierkorb-Schaltfläche. Alternativ kannst du mehrere Beispiele auswählen, auf die Schaltfläche zum Löschen mehrerer Elemente klicken und anschließend Löschen bestätigen. Das Löschen von Beispielen ändert weder die aggregierten Vorhersagestatistiken noch Bilder, die bereits in Datensätzen gespeichert wurden.
Vorhersagestatistiken#
Die Statistiken fassen verarbeitete Bilder unabhängig von der Galerie zusammen. Wenn ein Beispiel gelöscht oder ersetzt wird, wird sein Beitrag nicht abgezogen. Die Übersicht zeigt für den ausgewählten Zeitraum die Anzahl der Bilder, Vorhersagen und Bilder ohne Vorhersagen. Tiefenmodelle zeigen die Anzahl der Bilder an.
Standardmäßig ist im Datumsauswahlfeld der Zeitraum der letzten 30 Tage eingestellt. Es sind Zeiträume von bis zu 365 Tagen möglich. Für die ausgewählten Datumsgrenzen gilt UTC; die Zeitstempel in Diagrammen werden in der lokalen Zeit angezeigt. Bei kürzeren Zeiträumen von bis zu drei Tagen wird der Stundenverlauf verwendet, wenn der gesamte Zeitraum innerhalb der letzten 72 Stunden liegt. Für andere Zeiträume wird der Tagesverlauf verwendet. Der Datumsbereich filtert die Statistiken; in der Galerie werden weiterhin die aktuellen temporären Beispiele angezeigt.
Der Verlauf ist auf 72 Stundenintervalle und 365 Tagesintervalle begrenzt und ist nur seit dem Start der aktuellen Instanz verfügbar. Wenn im ausgewählten Zeitraum keine Bilder verarbeitet wurden, wird In diesem Zeitraum wurden keine Bilder verarbeitet angezeigt.
Die verfügbaren Diagramme hängen von der Aufgabe und den erfassten Vorhersagen ab:
| Diagramm | Anzeige |
|---|---|
| Vorhersagen im Zeitverlauf | Gesamtzahl der verarbeiteten Bilder und Vorhersagen; bei Tiefenmodellen wird Bilder im Zeitverlauf angezeigt |
| Inferenzzeit | Mittlere Inferenzzeit des Modells in Millisekunden, ohne Netzwerk- und Anfrageaufwand |
| Häufigste Klassen | Anzahl der Vorhersagen nach Klasse |
| Vorhersagen pro Bild | Verteilung einschließlich Bildern ohne Vorhersagen und einem abschließenden Intervall 100+; bei Klassifizierung und Tiefenmodellen ausgeblendet |
| Vorhersagekonfidenz | Verteilung und Mittelwert der Konfidenzwerte, sofern Konfidenzwerte verfügbar sind |
| Konfidenz im Zeitverlauf | Mittlere Vorhersagekonfidenz für jedes Zeitintervall |
| Vorhersageabmessungen | Breite und Höhe der Vorhersagen relativ zum Eingabebild, sofern Boxabmessungen verfügbar sind |
| Vorhersagepositionen | Räumliche Heatmap der Vorhersagen, sofern Positionsdaten verfügbar sind |


Die Konfidenz gibt an, wie sicher sich das Modell ist, nicht, ob es richtig liegt. Prüfe Beispiele und vergleiche sie mit geprüften Labels, wenn du die Genauigkeit bewertest. Inference Time misst die Ausführungszeit des Modells; die P95-Latenz der Bereitstellung umfasst die Anfrageverarbeitung und kann auch von anderem Datenverkehr als Inferenz beeinflusst werden, etwa von Zustandsprüfungen.
Die Überwachung wird automatisch aktualisiert, solange das zugehörige Bedienfeld geöffnet und sichtbar ist. Sie wird angehalten, wenn das Bedienfeld außerhalb des sichtbaren Bereichs liegt oder der Browser-Tab ausgeblendet ist. Erfolgreiche Inferenz über den Tab Predict der Bereitstellung löst ebenfalls eine Aktualisierung der Statistiken aus.
Protokolle#
Auf jeder Bereitstellungsseite gibt es einen Tab Logs, in dem du die neuesten Protokolleinträge ansehen kannst:

Protokolleinträge#
Jeder Protokolleintrag enthält:
| Feld | Beschreibung |
|---|---|
| Schweregrad | Farbcodierter Balken (siehe unten) |
| Zeitstempel | Anfragezeit (Ortszeitformat) |
| Meldung | Protokollinhalt |
| HTTP-Informationen | Statuscode und Latenz (falls zutreffend) |
Jeder Eintrag hat einen farbcodierten Balken für den Schweregrad:
| Stufe | Farbe | Beschreibung |
|---|---|---|
| DEBUG | Grau | Debugmeldungen |
| INFO | Blau | Normale Anfragen |
| WARNING | Bernsteinfarben | Nicht kritische Probleme |
| ERROR | Rot | Fehlgeschlagene Anfragen |
| CRITICAL | Rot | Kritische Fehler |
Die API akzeptiert alle Schweregrade als durch Kommas getrennten Filter: DEBUG, INFO, NOTICE, WARNING, ERROR, CRITICAL, ALERT und EMERGENCY.
Die Benutzeroberfläche zeigt die 20 neuesten Einträge an und blendet leere Einträge aus. Die API gibt standardmäßig 50 Einträge pro Anfrage zurück (max. 200) und liefert ein nextPageToken, um weiter zurückzublättern.
Wenn du Fehler untersuchst: Klicke zuerst auf Errors, um nach ERROR- und WARNING-Einträgen zu filtern, und prüfe dann die Zeitstempel und HTTP-Statuscodes. Kopiere die Protokolle in die Zwischenablage, um sie mit deinem Team zu teilen.
Codebeispiele#
Der Ergebnis-Tab Docs im Tab Predict jeder Bereitstellung zeigt sofort verwendbaren API-Code mit der Endpunkt-URL und – für Workspace-Eigentümer – dem zugehörigen API-Schlüssel der Bereitstellung. Du kannst den Code direkt kopieren und ausführen. Nicht-Eigentümer sehen einen Platzhalter YOUR_API_KEY:
import requests
# Endpunkt der Bereitstellung
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# Header mit dem API-Schlüssel deiner Bereitstellung
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Inferenzparameter
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Bild zur Inferenz senden
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())In den Beispielen unter Docs im Tab Predict der Bereitstellung werden die Endpunkt-URL und – für Workspace-Eigentümer – der zugehörige API-Schlüssel der Bereitstellung automatisch eingetragen. Unter API-Schlüssel erfährst du, wie du einen Schlüssel erstellst.
Vorhersage für Bereitstellungen#
Der Tab Predict auf jeder Bereitstellungsseite bietet ein integriertes Vorhersagefeld – dieselbe Oberfläche wie im Tab Predict des Modells, aber mit Inferenz über den Bereitstellungsendpunkt statt über den gemeinsam genutzten Dienst. Damit kannst du einen bereitgestellten Endpunkt direkt im Browser testen. Unter Inferenz findest du Details zu Parametern und Antwortformaten.
API-Endpunkte#
Jede Bereitstellung wird über den Namen des Eigentümers und den Namen der Bereitstellung adressiert. Für jede Route ist ein API-Schlüssel erforderlich. Details zur Authentifizierung findest du in der API-Referenz.
Bereitstellungsmetriken#
GET /api/deployments/{owner}/{deployment}/metrics?range=24hPython SDK: client.deployments.metrics(owner, deployment, range="24h")
Gibt die vollständige Nutzlast der Metriken einer Bereitstellung zurück: einen summary-Block mit der Gesamtzahl der Anfragen, der Anzahl und Rate von Fehlern sowie der durchschnittlichen Latenz und der P50-, P95- und P99-Latenz. Dazu kommen timeSeries-Arrays für Anfragen, Fehler, P50- und P95-Latenz, CPU- und Arbeitsspeicherauslastung sowie die Anzahl der Instanzen.
| Parameter | Typ | Beschreibung |
|---|---|---|
range | Zeichenkette | Zeitraum: 1h, 6h, 24h, 7d oder 30d (Standard: 24h) |
sparkline | bool | Gibt statt der vollständigen Nutzlast die kompakte Dashboard-Übersicht zurück |
view | Zeichenkette | overview gibt nur Metriken zu Anfragen, Fehlern und P95-Latenz zurück |
Mit sparkline=true ist die Antwort eine kompakte Übersicht: stündliche Anfragezahlen der letzten 24 Stunden (Stunden ohne Anfragen werden ausgelassen) sowie die Gesamtzahl der Anfragen, die Fehlerrate und avgLatencyMs, der Durchschnitt der stündlichen P95-Latenzen. Mit view=overview enthält summary die Werte totalRequests, errorRate und p95LatencyMs, während timeSeries die Werte requests, errors und latencyP95 enthält. Die Statistikfelder auf der Bereitstellungsseite verwenden diese Ansicht und werden automatisch aktualisiert.
Bereitstellungsprotokolle#
GET /api/deployments/{owner}/{deployment}/logs?limit=50&severity=ERROR,WARNINGPython SDK: client.deployments.logs(owner, deployment, limit=50, severity="ERROR,WARNING")
Gibt aktuelle Protokolleinträge mit optionalem Filter nach Schweregrad und Paginierung zurück.
| Parameter | Typ | Beschreibung |
|---|---|---|
limit | int | Maximale Anzahl zurückzugebender Einträge (Standard: 50, max.: 200) |
severity | Zeichenkette | Durch Kommas getrennter Filter für Schweregrade |
pageToken | Zeichenkette | Paginierungstoken aus der vorherigen Antwort |
Status der Bereitstellung#
GET /api/deployments/{owner}/{deployment}/healthPython SDK: client.deployments.health(owner, deployment)
Sendet eine Ping-Anfrage an die Bereitstellung und gibt ihren Status sowie die gemessene Round-Trip-Latenz zurück:
{
"healthy": true,
"status": 200,
"latencyMs": 142
}Bei einer fehlerhaften Antwort wird status ausgelassen, wenn der Endpunkt überhaupt nicht erreichbar war, und eine Meldung error hinzugefügt.
Die aggregierten Zahlen im Tab Deployments sind nicht über einen einzelnen REST-Endpunkt verfügbar. Ermittle sie, indem du die Metrikroute für jede Bereitstellung aufrufst, die von GET /api/deployments/{owner} (client.deployments.list(owner)) zurückgegeben wird.
Leistungsoptimierung#
Nutze Überwachungsdaten, um deine Bereitstellungen zu optimieren:
Wenn die Latenz zu hoch ist:
- Prüfe, ob die Modellgröße angemessen ist
- Ziehe eine näher gelegene Region in Betracht
- Prüfe die Bildgröße, die mit jeder Anfrage gesendet wird
Probiere einen kleineren Wert für imgsz aus und vergleiche die resultierende Latenz und Genauigkeit deines Modells. Stelle die Bereitstellung in einer Region näher bei den Aufrufenden bereit, um die Netzwerklatenz zu verringern.
Häufig gestellte Fragen#
Vorhersagestatistiken und temporäre Beispiele bleiben nur so lange erhalten wie die Bereitstellungsinstanz und unterliegen den oben beschriebenen Grenzen für Speicher und Galerie. Beim Anhalten, Neustarten, erneuten Bereitstellen, Ändern der Größe oder Austauschen des Modells können sie gelöscht werden. Nur Beispiele, die erfolgreich in einem Dataset gespeichert wurden, bleiben unabhängig vom Endpunkt erhalten.
Betriebsmetriken und Protokolle haben getrennte Aufbewahrungszeiträume. Für die Metrik-API lassen sich Zeiträume von 1 Stunde bis 30 Tagen auswählen; mit zunehmendem Zeitraum werden die Daten gröber erfasst – von 1-Minuten-Intervallen für 1 Stunde bis zu 4-Stunden-Intervallen für 30 Tage. Der Tab
Logsder Bereitstellung zeigt die 20 neuesten Protokolleinträge. Die Protokoll-API kann bis zu 200 Einträge pro Anfrage zurückgeben und unterstützt Paginierung.Metriken und Protokolle werden nur so lange aufbewahrt, wie die Bereitstellung besteht. Wenn du eine Bereitstellung löschst, ist auch ihr Verlauf nicht mehr zugänglich. Exportiere alle Daten, die du behalten möchtest, bevor du einen Endpunkt löschst.
Ja, der Tab Deployments in deinem Profil zeigt alle Endpunkte mit aggregierten Übersichtskarten. Verwende die Tabellenansicht, um die Leistung der Bereitstellungen miteinander zu vergleichen.
Nein. Metriken und Zustandsprüfungen werden nur für Bereitstellungen im Status Ready erfasst. Bei einem angehaltenen Endpunkt bleiben die Bereitstellungsseite und der Verlaufszeitraum erhalten, aber es werden keine aktuellen Werte angezeigt, bis du den Endpunkt wieder startest.