Deployment#
Ultralytics Platform bietet umfassende Modellbereitstellungsoptionen, um deine YOLO-Modelle in die Produktion zu überführen. Teste Modelle mit browserbasierter Inferenz, stelle sie auf dedizierten Endpunkten in 42 globalen Regionen bereit und überwache die Leistung in Echtzeit.
Watch: Get Started with Ultralytics Platform - Deploy
Übersicht#
Der Bereich Deployment hilft dir:
- Teste Modelle direkt im Browser mit dem Tab
Predict - Bereitstellung auf dedizierten Endpunkten in 42 globalen Regionen
- Anfragemetriken, Logs und Gesundheitschecks zu überwachen
- Bei Leerlauf auf null zu skalieren (Bereitstellungen führen derzeit eine einzelne aktive Instanz aus)

Bereitstellungsoptionen#
Die Ultralytics Platform bietet mehrere Bereitstellungswege:
| Option | Beschreibung | Am besten für |
|---|---|---|
| Predict-Tab | Browserbasierte Inferenz mit Bild, Webcam und Beispielen | Entwicklung, Validierung |
| Shared Inference | Mandantenfähiger Dienst in 3 Datenregionen | Geringe Nutzung, Tests |
| Dedizierte Endpunkte | Single-Tenant-Dienste in 42 Regionen | Produktion, niedrige Latenz |
| Export | Gewichte in 20 Formaten für lokale oder Edge-Laufzeiten herunterladen | Offline, auf dem Gerät |
Workflow#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Phase | Beschreibung |
|---|---|
| Testen | Validiere das Modell mit dem Tab Predict |
| Konfigurieren | Wähle eine Region aus; der Bereitstellungsname wird aus Modell und Stadt generiert |
| Bereitstellen | Erstelle einen dedizierten Endpunkt über den Tab Deploy |
| Überwachen | Verfolge Anfragen, Latenz, Fehler und Protokolle in Monitoring |
Architektur#
Shared Inference#
Der gemeinsam genutzte Inferenzdienst läuft in 3 Schlüsselregionen. Anfragen an ein Modell werden an den Dienst in dieser Datenregion geleitet, sodass die Ergebnisse in der Region verbleiben, in der das Modell gespeichert ist:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Region | Bezeichnung | Standort | Am besten für |
|---|---|---|---|
| US | Amerika | Iowa, USA | Nutzer aus Amerika, am schnellsten für Amerika |
| EU | Europa, Naher Osten & Afrika | Belgien, Europa | Europäische Nutzer, DSGVO-konform |
| AP | Asien-Pazifik | Taiwan, Asien-Pazifik | Nutzer im asiatisch-pazifischen Raum, geringste APAC-Latenz |
Dedicated Endpoints#
Bereitstellung in 42 Regionen weltweit über Ultralytics Cloud:
- Amerika: 14 Regionen
- Europa: 13 Regionen
- Asien-Pazifik: 12 Regionen
- Naher Osten & Afrika: 3 Regionen
Jeder Endpunkt ist ein Single-Tenant-Service mit:
- Plattformverwaltete Skalierung (aktuell nicht konfigurierbar)
- Skalierung auf null bei Leerlauf
- Eindeutige Endpunkt-URL mit eigener interaktiver API-Referenz unter
/docs - Eigene API-Schlüssel-Bindung, sodass nur dieser Schlüssel den Endpunkt aufrufen kann
- Unabhängiges Monitoring, Logs und Gesundheitschecks
Seite Bereitstellungen#
Greife über die Seitenleiste unter Deploy auf die Seite für globale Bereitstellungen zu. Diese Seite zeigt:
- Weltkarte mit Markierungen für bereitgestellte Regionen; klicke auf eine Region, um den Dialog
New Deploymentzu öffnen - Übersichtskarten: Gesamtanfragen (24h), aktive Bereitstellungen, Fehlerrate (24h), P95-Latenz (24h)
- Bereitstellungsliste mit drei Ansichtsmodi: Karten, kompakt und Tabelle
- Neue Bereitstellung Schaltfläche, um Endpunkte aus jedem abgeschlossenen Modell zu erstellen
- Aktualisieren-Schaltfläche und ein
Updated-Zeitstempel im Seitenkopf

Die Seite wird automatisch aktualisiert und pollt schneller, während sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping). Siehe Überwachung für Details.
Hauptfunktionen#
Globale Abdeckung#
Stelle deine Modelle in der Nähe deiner Nutzer in 42 Regionen bereit, die Folgendes abdecken:
- Nordamerika, Südamerika
- Europa, Naher Osten, Afrika
- Asien-Pazifik, Ozeanien
Skalierungsverhalten#
Endpunkte verhalten sich derzeit wie folgt:
- Auf Null skalieren: Inaktive Endpunkte skalieren auf Null herunter und führen beim nächsten Aufruf einen Kaltstart durch
- Einzelne aktive Instanz: Jeder Endpunkt wird derzeit bei allen Tarifen von einer Instanz bereitgestellt
- Lastabwurf: Anfragen erhalten
429-Antworten, wenn der Endpunkt vorübergehend ausgelastet ist — siehe Direkte Endpunkt-Anfragen - Anfrage-Timeout: Jede Anfrage kann bis zu 1 Stunde laufen, was für Video-Inferenz ausreicht
Regionale Bereitstellung#
Nutze die gemessene Latenz der Region, um einen Endpunkt in der Nähe seiner Aufrufer zu platzieren. Die tatsächliche Inferenzlatenz hängt vom Modell, der Eingabegröße, dem Endpunktstatus und dem Netzwerkpfad ab.
Gesundheitschecks#
Jede laufende Bereitstellung enthält einen automatischen Gesundheitscheck mit:
- Live-Statusanzeige (gesund/ungesund)
- Anzeige der Antwortlatenz
- Automatischer erneuter Versuch bei Fehler, der stoppt, sobald der Dienst wieder fehlerfrei ist
- Schaltfläche für manuelle Aktualisierung
Kurzanleitung#
Erstelle eine Bereitstellung:
- Trainiere ein Modell oder lade es in ein Projekt hoch
- Gehe zum Deploy Tab des Modells
- Wähle eine Region aus der Latenztabelle aus
- Klicke auf Deploy und warte, bis der Bereitstellungsstatus Ready anzeigt
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyDer Bereitstellungsname wird aus dem Modellnamen und der Regionsstadt generiert, sodass kein Namensgebungsschritt erforderlich ist. Verwende nach der Bereitstellung die Endpunkt-URL mit deinem API-Schlüssel, um Inferenzanfragen von jeder Anwendung aus zu senden.
Schnellzugriff#
- Inferenz: Modelle im Browser testen
- Endpunkte: Dedizierte Endpunkte bereitstellen
- Monitoring: Verfolge die Deployment-Performance
FAQ#
Die Bereitstellung verbleibt in einem Erstellungs- oder Bereitstellungsstatus, während ihr Dienst startet. Sie wird nutzbar, wenn der Status zu Bereit wechselt; die Dauer variiert je nach Modell und Region und beträgt typischerweise einige Minuten.
Ja, jedes Modell kann mehrere Endpunkte in verschiedenen Regionen haben. Die Anzahl der Bereitstellungen ist je nach Tarif begrenzt: Free
3, Pro10, Enterpriseunlimited. Das Kontingent wird dem Workspace belastet, dem das Modell gehört, und ein Endpunkt bedient exakt ein Modell zur Zeit — verwende den Modelltausch, um es zu wechseln, ohne die URL zu ändern.Bei aktiviertem Scale-to-Zero:
- Der Endpunkt wird nach Inaktivität heruntergefahren
- Die erste Anfrage löst einen Kaltstart aus
- Nachfolgende Anfragen erfolgen schnell
Erste Anfragen nach einer Inaktivitätsphase lösen einen Kaltstart aus. Das Öffnen der Bereitstellungskarte führt eine Integritätsprüfung durch, die den Endpunkt aufwärmt, sodass eine Testvorhersage direkt danach schnell antwortet.