Deployment#
Die Ultralytics Platform bietet umfassende Modell-Deployment-Optionen, um deine YOLO-Modelle in die Produktion zu bringen. Teste Modelle mit browserbasierter Inferenz, deploye sie auf dedizierten Endpunkten in 42 globalen Regionen und überwache die Leistung in Echtzeit.
Watch: Get Started with Ultralytics Platform - Deploy
Übersicht#
Der Bereich Deployment hilft dir:
- Modelle direkt im Browser über den
PredictTab zu testen - Bereitstellung auf dedizierten Endpunkten in 42 globalen Regionen
- Anfragemetriken, Logs und Gesundheitschecks zu überwachen
- Bei Leerlauf auf null zu skalieren (Bereitstellungen führen derzeit eine einzelne aktive Instanz aus)

Bereitstellungsoptionen#
Die Ultralytics Platform bietet mehrere Bereitstellungswege:
| Option | Beschreibung | Am besten für |
|---|---|---|
| Predict Tab | Browserbasierte Inferenz mit Bild, Webcam und Beispielen | Entwicklung, Validierung |
| Shared Inference | Multi-Tenant-Service in 3 Regionen | Geringe Nutzung, Tests |
| Dedicated Endpoints | Single-Tenant-Dienste in 42 Regionen | Produktion, niedrige Latenz |
Workflow#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Phase | Beschreibung |
|---|---|
| Testen | Modell validieren mit dem Predict tab |
| Konfigurieren | Wähle eine Region aus und überprüfe den bearbeitbaren, automatisch generierten Bereitstellungsnamen |
| Bereitstellen | Dedizierten Endpunkt über den Deploy tab erstellen |
| Überwachen | Anfragen, Latenz, Fehler und Logs in Monitoring nachverfolgen |
Architektur#
Shared Inference#
Der Shared Inference Service läuft in 3 Hauptregionen und leitet Anfragen automatisch basierend auf deiner Datenregion weiter:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Region | Bezeichnung | Standort | Am besten für |
|---|---|---|---|
| US | Amerika | Iowa, USA | Nutzer aus Amerika, am schnellsten für Amerika |
| EU | Europa, Naher Osten & Afrika | Belgien, Europa | Europäische Nutzer, DSGVO-konform |
| AP | Asien-Pazifik | Taiwan, Asien-Pazifik | Nutzer im asiatisch-pazifischen Raum, geringste APAC-Latenz |
Dedicated Endpoints#
Bereitstellung in 42 Regionen weltweit über Ultralytics Cloud:
- Amerika: 14 Regionen
- Europa: 13 Regionen
- Asien-Pazifik: 12 Regionen
- Naher Osten & Afrika: 3 Regionen
Jeder Endpunkt ist ein Single-Tenant-Service mit:
- Standardressourcen von
1 CPU,2 GiBArbeitsspeicher,minInstances=0,maxInstances=1 - Skalierung auf null bei Leerlauf
- Eindeutiger Endpunkt-URL
- Unabhängiges Monitoring, Logs und Gesundheitschecks
Seite Bereitstellungen#
Rufe die globale Bereitstellungsseite über die Seitenleiste unter Deploy auf. Diese Seite zeigt:
- Weltkarte mit Pins der bereitgestellten Regionen (interaktive Karte)
- Übersichtskarten: Gesamtanfragen (24h), aktive Bereitstellungen, Fehlerrate (24h), P95-Latenz (24h)
- Bereitstellungsliste mit drei Ansichtsmodi: Karten, kompakt und Tabelle
- Neue Bereitstellung Schaltfläche, um Endpunkte aus jedem abgeschlossenen Modell zu erstellen

Die Seite fragt normalerweise alle 15 Sekunden ab. Wenn sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping), erhöht sich das Polling für schnelleres Feedback auf alle 3 Sekunden.
Hauptfunktionen#
Globale Abdeckung#
Stelle deine Modelle in der Nähe deiner Nutzer in 42 Regionen bereit, die Folgendes abdecken:
- Nordamerika, Südamerika
- Europa, Naher Osten, Afrika
- Asien-Pazifik, Ozeanien
Skalierungsverhalten#
Endpunkte verhalten sich derzeit wie folgt:
- Auf Null skalieren:
minInstancesist standardmäßig auf0gesetzt - Einzelne aktive Instanz:
maxInstancesist derzeit in allen Plänen auf1begrenzt
Regionale Bereitstellung#
Nutze die gemessene Latenz der Region, um einen Endpunkt in der Nähe seiner Aufrufer zu platzieren. Die tatsächliche Inferenzlatenz hängt vom Modell, der Eingabegröße, dem Endpunktstatus und dem Netzwerkpfad ab.
Gesundheitschecks#
Jede laufende Bereitstellung enthält einen automatischen Gesundheitscheck mit:
- Live-Statusanzeige (gesund/ungesund)
- Anzeige der Antwortlatenz
- Automatischer erneuter Versuch bei Ungesundheit (Abfrage alle 20 Sekunden)
- Schaltfläche für manuelle Aktualisierung
Kurzanleitung#
Erstelle eine Bereitstellung:
- Trainiere ein Modell oder lade es in ein Projekt hoch
- Gehe zum Deploy Tab des Modells
- Wähle eine Region aus der Latenztabelle aus
- Klicke auf Deploy und warte, bis der Bereitstellungsstatus Ready anzeigt
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readySobald die Bereitstellung abgeschlossen ist, verwende die Endpunkt-URL mit deinem API-Schlüssel, um Inferenzanfragen von jeder Anwendung aus zu senden.
Schnellzugriff#
- Inference: Modelle im Browser testen
- Endpoints: Dedizierte Endpunkte bereitstellen
- Monitoring: Bereitstellungsleistung verfolgen
FAQ#
Was ist der Unterschied zwischen Shared und Dedicated Inference?#
| Funktion | Shared | Dedicated |
|---|---|---|
| Dienst | Wird von Platform-Benutzern gemeinsam genutzt | Dediziert für eine Bereitstellung |
| Skalierung | Verwaltet von Platform | Skalierung auf Null, eine Instanz |
| Regionen | 3 Datenregionen | Wähle aus 42 Bereitstellungsregionen |
| URL | Platform-Modell-API | Generierte Bereitstellungs-Endpunkt-URL |
| Testen | Modell-Registerkarte Predict | Registerkarte Predict der Bereitstellungskarte oder API |
Wie lange dauert die Bereitstellung?#
Die Bereitstellung bleibt im Status „Erstellung“ oder „Bereitstellung“, während ihr Dienst startet. Sie wird verwendbar, wenn sich der Status in Ready ändert; die Dauer variiert je nach Modell und Region.
Kann ich mehrere Modelle bereitstellen?#
Ja, jedes Modell kann über mehrere Endpunkte in verschiedenen Regionen verfügen. Die Anzahl der Deployments ist je nach Plan begrenzt: Free 3, Pro 10, Enterprise unlimited.
Was passiert, wenn ein Endpunkt im Leerlauf ist?#
Bei aktiviertem Scale-to-Zero:
- Der Endpunkt wird nach Inaktivität heruntergefahren
- Die erste Anfrage löst einen Kaltstart aus
- Nachfolgende Anfragen erfolgen schnell
Erste Anfragen nach einer Leerlaufzeit lösen einen Kaltstart aus.