YOLO Vision 2026:

Deployment#

Ultralytics Platform bietet umfassende Modellbereitstellungsoptionen, um deine YOLO-Modelle in die Produktion zu überführen. Teste Modelle mit browserbasierter Inferenz, stelle sie auf dedizierten Endpunkten in 42 globalen Regionen bereit und überwache die Leistung in Echtzeit.



Watch: Get Started with Ultralytics Platform - Deploy

Übersicht#

Der Bereich Deployment hilft dir:

  • Teste Modelle direkt im Browser mit dem Tab Predict
  • Bereitstellung auf dedizierten Endpunkten in 42 globalen Regionen
  • Anfragemetriken, Logs und Gesundheitschecks zu überwachen
  • Bei Leerlauf auf null zu skalieren (Bereitstellungen führen derzeit eine einzelne aktive Instanz aus)

Ultralytics Platform Deploy Page World Map With Overview Cards

Bereitstellungsoptionen#

Die Ultralytics Platform bietet mehrere Bereitstellungswege:

OptionBeschreibungAm besten für
Predict-TabBrowserbasierte Inferenz mit Bild, Webcam und BeispielenEntwicklung, Validierung
Shared InferenceMandantenfähiger Dienst in 3 DatenregionenGeringe Nutzung, Tests
Dedizierte EndpunkteSingle-Tenant-Dienste in 42 RegionenProduktion, niedrige Latenz
ExportGewichte in 20 Formaten für lokale oder Edge-Laufzeiten herunterladenOffline, auf dem Gerät

Workflow#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
PhaseBeschreibung
TestenValidiere das Modell mit dem Tab Predict
KonfigurierenWähle eine Region aus; der Bereitstellungsname wird aus Modell und Stadt generiert
BereitstellenErstelle einen dedizierten Endpunkt über den Tab Deploy
ÜberwachenVerfolge Anfragen, Latenz, Fehler und Protokolle in Monitoring

Architektur#

Shared Inference#

Der gemeinsam genutzte Inferenzdienst läuft in 3 Schlüsselregionen. Anfragen an ein Modell werden an den Dienst in dieser Datenregion geleitet, sodass die Ergebnisse in der Region verbleiben, in der das Modell gespeichert ist:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegionBezeichnungStandortAm besten für
USAmerikaIowa, USANutzer aus Amerika, am schnellsten für Amerika
EUEuropa, Naher Osten & AfrikaBelgien, EuropaEuropäische Nutzer, DSGVO-konform
APAsien-PazifikTaiwan, Asien-PazifikNutzer im asiatisch-pazifischen Raum, geringste APAC-Latenz

Dedicated Endpoints#

Bereitstellung in 42 Regionen weltweit über Ultralytics Cloud:

  • Amerika: 14 Regionen
  • Europa: 13 Regionen
  • Asien-Pazifik: 12 Regionen
  • Naher Osten & Afrika: 3 Regionen

Jeder Endpunkt ist ein Single-Tenant-Service mit:

  • Plattformverwaltete Skalierung (aktuell nicht konfigurierbar)
  • Skalierung auf null bei Leerlauf
  • Eindeutige Endpunkt-URL mit eigener interaktiver API-Referenz unter /docs
  • Eigene API-Schlüssel-Bindung, sodass nur dieser Schlüssel den Endpunkt aufrufen kann
  • Unabhängiges Monitoring, Logs und Gesundheitschecks

Seite Bereitstellungen#

Greife über die Seitenleiste unter Deploy auf die Seite für globale Bereitstellungen zu. Diese Seite zeigt:

  • Weltkarte mit Markierungen für bereitgestellte Regionen; klicke auf eine Region, um den Dialog New Deployment zu öffnen
  • Übersichtskarten: Gesamtanfragen (24h), aktive Bereitstellungen, Fehlerrate (24h), P95-Latenz (24h)
  • Bereitstellungsliste mit drei Ansichtsmodi: Karten, kompakt und Tabelle
  • Neue Bereitstellung Schaltfläche, um Endpunkte aus jedem abgeschlossenen Modell zu erstellen
  • Aktualisieren-Schaltfläche und ein Updated-Zeitstempel im Seitenkopf

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Automatisches Polling

Die Seite wird automatisch aktualisiert und pollt schneller, während sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping). Siehe Überwachung für Details.

Hauptfunktionen#

Globale Abdeckung#

Stelle deine Modelle in der Nähe deiner Nutzer in 42 Regionen bereit, die Folgendes abdecken:

  • Nordamerika, Südamerika
  • Europa, Naher Osten, Afrika
  • Asien-Pazifik, Ozeanien

Skalierungsverhalten#

Endpunkte verhalten sich derzeit wie folgt:

  • Auf Null skalieren: Inaktive Endpunkte skalieren auf Null herunter und führen beim nächsten Aufruf einen Kaltstart durch
  • Einzelne aktive Instanz: Jeder Endpunkt wird derzeit bei allen Tarifen von einer Instanz bereitgestellt
  • Lastabwurf: Anfragen erhalten 429-Antworten, wenn der Endpunkt vorübergehend ausgelastet ist — siehe Direkte Endpunkt-Anfragen
  • Anfrage-Timeout: Jede Anfrage kann bis zu 1 Stunde laufen, was für Video-Inferenz ausreicht

Regionale Bereitstellung#

Nutze die gemessene Latenz der Region, um einen Endpunkt in der Nähe seiner Aufrufer zu platzieren. Die tatsächliche Inferenzlatenz hängt vom Modell, der Eingabegröße, dem Endpunktstatus und dem Netzwerkpfad ab.

Gesundheitschecks#

Jede laufende Bereitstellung enthält einen automatischen Gesundheitscheck mit:

  • Live-Statusanzeige (gesund/ungesund)
  • Anzeige der Antwortlatenz
  • Automatischer erneuter Versuch bei Fehler, der stoppt, sobald der Dienst wieder fehlerfrei ist
  • Schaltfläche für manuelle Aktualisierung

Kurzanleitung#

Erstelle eine Bereitstellung:

  1. Trainiere ein Modell oder lade es in ein Projekt hoch
  2. Gehe zum Deploy Tab des Modells
  3. Wähle eine Region aus der Latenztabelle aus
  4. Klicke auf Deploy und warte, bis der Bereitstellungsstatus Ready anzeigt
Schnellbereitstellung
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Der Bereitstellungsname wird aus dem Modellnamen und der Regionsstadt generiert, sodass kein Namensgebungsschritt erforderlich ist. Verwende nach der Bereitstellung die Endpunkt-URL mit deinem API-Schlüssel, um Inferenzanfragen von jeder Anwendung aus zu senden.

Schnellzugriff#

FAQ#

  • FunktionSharedDedicated
    DienstWird von Platform-Benutzern gemeinsam genutztDediziert für eine Bereitstellung
    SkalierungVerwaltet von PlatformSkalierung auf Null, eine Instanz
    Regionen3 DatenregionenWähle aus 42 Bereitstellungsregionen
    URLPlatform-Modell-APIGenerierte Bereitstellungs-Endpunkt-URL
    TestenModell-Tab PredictBereitstellungskarten-Tab Predict oder API
    Ratenlimits20 Anfragen/MinuteKein Plattform-Ratenlimit bei direkten Aufrufen
    AuthentifizierungBeliebiger Workspace-API-SchlüsselNur der an die Bereitstellung gebundene API-Schlüssel
  • Die Bereitstellung verbleibt in einem Erstellungs- oder Bereitstellungsstatus, während ihr Dienst startet. Sie wird nutzbar, wenn der Status zu Bereit wechselt; die Dauer variiert je nach Modell und Region und beträgt typischerweise einige Minuten.

  • Ja, jedes Modell kann mehrere Endpunkte in verschiedenen Regionen haben. Die Anzahl der Bereitstellungen ist je nach Tarif begrenzt: Free 3, Pro 10, Enterprise unlimited. Das Kontingent wird dem Workspace belastet, dem das Modell gehört, und ein Endpunkt bedient exakt ein Modell zur Zeit — verwende den Modelltausch, um es zu wechseln, ohne die URL zu ändern.

  • Bei aktiviertem Scale-to-Zero:

    • Der Endpunkt wird nach Inaktivität heruntergefahren
    • Die erste Anfrage löst einen Kaltstart aus
    • Nachfolgende Anfragen erfolgen schnell

    Erste Anfragen nach einer Inaktivitätsphase lösen einen Kaltstart aus. Das Öffnen der Bereitstellungskarte führt eine Integritätsprüfung durch, die den Endpunkt aufwärmt, sodass eine Testvorhersage direkt danach schnell antwortet.

Kommentare