YOLO Vision 2026:

Dedicated Endpoints#

Ultralytics Platform ermöglicht das Deployment von YOLO-Modellen auf dedizierten Endpunkten in 42 globalen Regionen. Jeder Endpunkt ist ein Single-Tenant-Service mit Scale-to-Zero-Verhalten, einer eindeutigen Endpunkt-URL und unabhängigem Monitoring.

Ultralytics Platform Model Deploy Tab With Region Map And Table

Endpunkt erstellen#

Über den Reiter „Deploy“#

Stelle ein Modell über dessen Deploy-Reiter bereit:

  1. Navigiere zu deinem Modell
  2. Klicke auf den Reiter Deploy
  3. Sieh dir die Weltkarte und die Regionentabelle an, die nach der gemessenen Latenz von deinem Standort aus sortiert ist
  4. Klicke in der Zeile der gewünschten Region auf Deploy

Der Name der Bereitstellung wird automatisch aus dem Modellnamen und der Stadt der Region generiert (z. B. yolo26n-iowa).

Über die Seite „Deployments“#

Erstelle eine Bereitstellung über die globale Deploy-Seite in der Seitenleiste:

  1. Klicke auf New Deployment
  2. Wähle ein Modell aus dem Modellauswahlmenü
  3. Wähle eine Region auf der Karte oder in der Tabelle aus
  4. Überprüfe den bearbeitbaren, automatisch generierten Namen des Deployments und die festen Ressourcen-Standardwerte
  5. Klicke auf Deploy Model

Ultralytics Platform New Deployment Dialog With Model Selector And Region Map

Deployment-Lebenszyklus#

stateDiagram-v2
    [*] --> Creating: Deploy
    Creating --> Deploying: Container starting
    Deploying --> Ready: Health check passed
    Ready --> Stopping: Stop
    Stopping --> Stopped: Stopped
    Stopped --> Ready: Start
    Ready --> [*]: Delete
    Stopped --> [*]: Delete
    Creating --> Failed: Error
    Deploying --> Failed: Error
    Failed --> [*]: Delete

    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
    class Creating,Deploying,Stopping proc
    class Ready out
    class Failed error
    class Stopped extern

Verbinde Slack alerts, um eine Nachricht zu erhalten, wenn eine Bereitstellung bereit ist oder nicht gestartet werden kann.

Regionsauswahl#

Wähle aus 42 Regionen weltweit. Die interaktive Regionskarte und die Tabelle zeigen:

  • Regions-Pins: Farblich kodiert nach Latenz auf einem Grün-Rot-Verlauf (schnellere Regionen sind grüner, langsamere Regionen rötlicher)
  • Bereitgestellte Regionen: Hervorgehoben mit einer „Deployed“-Plakette
  • Bereitstellung läuft: Animierte Pulsanzeige
  • Bidirektionale Hervorhebung: Das Bewegen des Mauszeigers über die Karte hebt die Tabellenzeile hervor und umgekehrt

Ultralytics Platform Deploy Tab Region Latency Table Sorted By Latency Die Regionentabelle im Reiter Deploy des Modells enthält:

SpalteBeschreibung
StandortStadt und Land mit Flaggensymbol
ZoneRegionskennung
LatenzGemessene Ping-Zeit (Median aus 3 Pings)
EntfernungEntfernung von deinem Standort in km
AktionenDeploy-Schaltfläche oder „Deployed“-Statusplakette
Dialog „New Deployment“

Der New Deployment-Dialog (von der globalen Deploy-Seite aus) zeigt eine einfachere Regionstabelle mit nur den Spalten Standort, Latenz und Auswählen.

Wähle weise

Wähle die für deine Nutzer am nächsten gelegene Region für die geringste Latenz. Verwende die Rescan-Schaltfläche, um die Latenz von deinem aktuellen Standort aus neu zu messen.

Verfügbare Regionen#

ZoneStandort
us-central1Iowa, USA
us-east1South Carolina, USA
us-east4Northern Virginia, USA
us-east5Columbus, USA
us-south1Dallas, USA
us-west1Oregon, USA
us-west2Los Angeles, USA
us-west3Salt Lake City, USA
us-west4Las Vegas, USA
northamerica-northeast1Montreal, Canada
northamerica-northeast2Toronto, Canada
northamerica-south1Queretaro, Mexico
southamerica-east1Sao Paulo, Brazil
southamerica-west1Santiago, Chile

Endpunkt-Konfiguration#

Dialog „New Deployment“#

Der Dialog New Deployment bietet:

EinstellungBeschreibungStandard
ModellAus fertigen Modellen auswählen-
RegionDeployment-Region-
BereitstellungsnameAutomatisch generiert, bearbeitbar-
CPU-KerneFester Standardwert1
Arbeitsspeicher (GB)Fester Standardwert2

Ultralytics Platform New Deployment Dialog Fixed Resource Defaults Das deaktivierte Resources-Feld ist als Coming Soon markiert und kann derzeit nicht erweitert oder angepasst werden. Deployments verwenden 1 CPU, 2 GiB Arbeitsspeicher, minInstances = 0 und maxInstances = 1.

Automatisch generierte Namen

Der Bereitstellungsname wird automatisch aus dem Modellnamen und der Stadt der Region generiert (z. B. yolo26n-iowa). Wenn du dasselbe Modell erneut in derselben Region bereitstellst, wird ein numerisches Suffix hinzugefügt (z. B. yolo26n-iowa-2).

Bereitstellungs-Tab (Quick Deploy)#

Bei der Bereitstellung über den Deploy-Tab des Modells werden Endpunkte mit Standardressourcen (1 CPU, 2 GB Arbeitsspeicher) und aktivierter Scale-to-Zero-Funktion erstellt. Der Bereitstellungsname wird automatisch generiert.

Endpunkte verwalten#

Ansichtsmodi#

Die Liste der Bereitstellungen unterstützt drei Ansichtsmodi:

ModusBeschreibung
KartenDetaillierte Karten mit Logs, Code-Beispielen und Vorhersage-Panel
KompaktRaster aus kleineren Karten mit wichtigen Metriken
TabelleDatentabelle mit sortierbaren Spalten und Suchfunktion

Ultralytics Platform Deploy Tab Active Deployments Cards View

Bereitstellungskarte (Kartenansicht)#

Jede Bereitstellungskarte in der Kartenansicht zeigt:

  • Kopfzeile: Name, Regionenflagge, Status-Badge, Schaltflächen für Start/Stopp/Löschen
  • Endpunkt-URL: Kopierbare URL mit Link zur API-Dokumentation
  • Metriken: Anzahl der Anfragen (24h), P95-Latenz, Fehlerrate
  • Health-Check: Live-Statusanzeige mit Latenz und manueller Aktualisierung
  • Tabs: Logs, Code und Predict

Der Logs-Tab zeigt aktuelle Protokolleinträge mit Schweregradfilter (Alle / Fehler). Der Code-Tab zeigt gebrauchsfertige Code-Beispiele in Python, JavaScript und cURL mit deiner tatsächlichen Endpunkt-URL und deinem API-Key. Der Predict-Tab bietet ein Inline-Vorhersage-Panel zum direkten Testen auf der Bereitstellung.

Bereitstellungsstatus#

StatusBeschreibung
CreatingBereitstellung wird eingerichtet
DeployingContainer wird gestartet
ReadyEndpunkt ist aktiv und akzeptiert Anfragen
StoppingEndpunkt wird heruntergefahren
StoppedDer Endpunkt ist pausiert und nicht verfügbar
FehlgeschlagenBereitstellung fehlgeschlagen (siehe Fehlermeldung)

Endpunkt-URL#

Jeder Endpunkt hat eine eindeutige URL, zum Beispiel:

https://predict-abc123.run.app

Ultralytics Platform Deployment Card Endpoint Url With Copy Button Klicke auf die Kopieren-Schaltfläche, um die URL zu kopieren. Klicke auf das Dokumentationssymbol, um die automatisch generierte API-Dokumentation für den Endpunkt anzuzeigen.

Lebenszyklus-Management#

Steuere den Status deines Endpunkts:

graph LR
    R[Ready]:::out -->|Stop| S[Stopped]:::extern
    S -->|Start| R
    R -->|Delete| D[Deleted]:::error
    S -->|Delete| D

    classDef out fill:#9C27B0,color:#fff
    classDef error fill:#F44336,color:#fff
    classDef extern fill:#607D8B,color:#fff
AktionBeschreibung
StartEinen gestoppten Endpunkt fortsetzen
StopPause den Endpunkt
DeleteEndpunkt dauerhaft entfernen

Endpunkt stoppen#

Stoppe einen Endpunkt, wenn er keine Anfragen mehr annehmen soll:

  1. Klicke auf das Pausen-Symbol auf der Bereitstellungskarte
  2. Der Endpunktstatus ändert sich zu "Stopping" und dann zu "Stopped"

Gestoppte Endpunkte:

  • Akzeptieren keine Anfragen
  • Können jederzeit neu gestartet werden

Endpunkt löschen#

Einen Endpunkt dauerhaft entfernen:

  1. Klicke auf das Löschen-Symbol (Papierkorb) auf der Bereitstellungskarte
  2. Bestätige das Löschen im Dialog
Dauerhafte Aktion

Das Löschen erfolgt sofort und dauerhaft. Du kannst jederzeit einen neuen Endpunkt erstellen.

Endpunkte verwenden#

Authentifizierung#

Jede Bereitstellung wird mit einem API-Key aus deinem Konto erstellt. Füge ihn in Anfragen hinzu:

Authorization: Bearer YOUR_API_KEY

Das Präfix des API-Keys wird zur Identifizierung in der Fußzeile der Bereitstellungskarte angezeigt. Generiere Keys unter API Keys.

Direkte Endpunkt-Anfragen#

Sende Produktionsanfragen direkt an die auf der Deployment-Karte angezeigte URL. Diese Anfragen laufen nicht durch den Ratenbegrenzer der Platform-API. Der Endpunkt führt derzeit eine Instanz mit den oben beschriebenen festen Ressourcen aus.

Anfragebeispiel#

import requests

# Deployment endpoint
url = "https://predict-abc123.run.app/predict"

# Headers with your deployment API key
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inference parameters
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Send image for inference
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Anfrage-Parameter#

ParameterTypStandardBereichBeschreibung
fileDatei--Bild- oder Videodatei (erforderlich, sofern source nicht gesetzt)
conffloat0.250.01 – 1.0Minimaler Konfidenz-Schwellenwert
ioufloat0,70.0 – 0.95NMS IoU-Schwellenwert
imgszint64032 – 1280Eingabebildgröße in Pixeln
normalizeboolfalse-BBox-Koordinaten als 0 – 1 zurückgeben
decimalsint50 – 10Dezimalpräzision für Koordinatenwerte
sourcestring--Bild-URL oder base64-String (Alternative zu file)
Videoinferenz

Dedizierte Endpunkte akzeptieren sowohl Bilder als auch Videos über den file-Parameter.

  • Bildformate (bis zu 100 MB): AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Videoformate (bis zu 100 MB): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Jeder Videofram wird einzeln verarbeitet und die Ergebnisse werden pro Frame zurückgegeben. Du kannst alternativ eine öffentliche Bild-URL oder ein base64-kodiertes Bild über den source-Parameter anstelle von file übergeben.

Antwortformat#

Gleich wie bei der geteilten Inferenz mit aufgabenspezifischen Feldern.

FAQ#

Wie viele Endpunkte kann ich erstellen?#

Die Endpunkt-Limits hängen von deinem Plan ab:

  • Free: Bis zu 3 Deployments
  • Pro: Bis zu 10 Deployments
  • Enterprise: Unbegrenzte Deployments

Jedes Modell kann weiterhin in mehreren Regionen innerhalb deines Planzugriffs bereitgestellt werden.

Kann ich die Region nach dem Deployment ändern?#

Nein, Regionen sind festgelegt. Um die Region zu ändern:

  1. Lösche den bestehenden Endpunkt
  2. Erstelle einen neuen Endpunkt in der gewünschten Region

Wie gehe ich mit einem Multi-Region-Deployment um?#

Für eine globale Abdeckung:

  1. Stelle in mehreren Regionen bereit
  2. Nutze einen Load Balancer oder DNS-Routing
  3. Route Benutzer zum nächstgelegenen Endpunkt

Wie lange ist die Kaltstartzeit?#

Die Kaltstartzeit hängt vom Modell und davon ab, ob der Endpunkt auf null skaliert wurde. Die Health-Check-Anfrage der Plattform erlaubt bis zu 55 Sekunden, damit ein im Leerlauf befindlicher Endpunkt Zeit zum Starten hat.

Jedes Deployment verwendet derzeit die auf seiner Deployment-Karte angezeigte generierte Endpunkt-URL.

Kommentare