Bereitstellung#
Ultralytics Platform bietet umfassende Optionen für die Modellbereitstellung, um deine YOLO-Modelle produktiv einzusetzen. Teste Modelle mit browserbasierter Inferenz, stelle sie in dedizierten Endpunkten in 42 Regionen weltweit bereit und überwache die Leistung in Echtzeit.
Watch: Get Started with Ultralytics Platform - Deploy
Übersicht#
Der Bereich „Bereitstellung“ unterstützt dich bei Folgendem:
- Modelle testen direkt im Browser über den Tab
Predict - Bereitstellung in dedizierten Endpunkten in 42 Regionen weltweit
- Überwache Anfragemetriken, Protokolle, Gesundheitsprüfungen und temporäre Vorhersagen auf kostenpflichtigen Endpunkten
- Ressourcen auswählen: Standardendpunkte skalieren auf Null; benutzerdefinierte Größen halten eine warme Instanz mit Betriebszeitabrechnung vor

Optionen für die Modellbereitstellung#
Ultralytics Platform bietet mehrere Wege für die Modellbereitstellung:
| Option | Beschreibung | Am besten geeignet für |
|---|---|---|
| Vorhersage-Tab | Browserbasierte Inferenz mit Bildern, Webcam und Beispielen | Entwicklung, Validierung |
| Gemeinsam genutzte Inferenz | Mandantenfähiger Dienst über 3 Datenregionen hinweg | Geringe Nutzung, Tests |
| Dedizierte Endpunkte | Dienste für einzelne Mandanten in 42 Regionen | Produktion, geringe Latenz |
| Export | Gewichte in 20 Formaten für lokale oder Edge-Laufzeitumgebungen herunterladen | Offline, auf dem Gerät |
Workflow#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Stufe | Beschreibung |
|---|---|
| Test | Validiere das Modell über den Tab Predict |
| Konfigurieren | Wähle ein Modell, eine Region, CPU und Arbeitsspeicher aus; überprüfe die Preisgestaltung und den Namen der Bereitstellung |
| Bereitstellen | Erstelle über den Tab Deploy einen dedizierten Endpunkt |
| Überwachen | Überprüfe Endpunktmetriken und temporäre Vorhersagen unter Monitoring |
Architektur#
Gemeinsam genutzte Inferenz#
Der Dienst für gemeinsam genutzte Inferenz läuft in 3 wichtigen Regionen. Anfragen an ein Modell werden an den Dienst in der Datenregion dieses Modells weitergeleitet, sodass die Ergebnisse innerhalb der Region bleiben, in der das Modell gespeichert ist:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Region | Bezeichnung | Standort | Am besten geeignet für |
|---|---|---|---|
| US | Amerika | Iowa, USA | Nutzer in Amerika, am schnellsten für Amerika |
| EU | Europa, Naher Osten und Afrika | Belgien, Europa | Europäische Nutzer, DSGVO-Konformität |
| AP | Asien-Pazifik | Taiwan, Asien-Pazifik | Nutzer im Asien-Pazifik-Raum, geringste Latenz im asiatisch-pazifischen Raum |
Dedizierte Endpunkte#
Stelle Modelle in Ultralytics Cloud weltweit in 42 Regionen bereit:
- Amerika: 14 Regionen
- Europa: 13 Regionen
- Asien-Pazifik: 12 Regionen
- Nahost und Afrika: 3 Regionen
Jeder Endpunkt ist ein Dienst für einen einzelnen Mandanten mit:
- Konfigurierbare CPU und Arbeitsspeicher mit Preisen, die vor der Bereitstellung angezeigt werden
- Skalierung auf Null für Standardressourcen; eine warme, nach Betriebszeit abgerechnete Instanz für benutzerdefinierte Ressourcen
- Eindeutiger Endpunkt-URL mit eigener interaktiver API-Referenz unter
/docs - Eigener API-Schlüsselzuordnung, sodass nur dieser Schlüssel den Endpunkt aufrufen kann
- Unabhängiger Überwachung, Protokollen und Zustandsprüfungen
Seite „Bereitstellungen“#
Öffne die globale Bereitstellungsseite über die Seitenleiste unter Deploy. Diese Seite zeigt:
- Weltkarte mit Markierungen der bereitgestellten Regionen; klicke auf eine Region, um den Dialog
New Deploymentzu öffnen - Übersichtskarten: HTTP-Anfragen (24h), Aktive Bereitstellungen, HTTP-Fehlerrate (24h), HTTP-P95-Latenz (24h)
- Liste der Bereitstellungen mit drei Ansichtsmodi: Karten, kompakt und Tabelle
- Schaltfläche Neue Bereitstellung, um aus jedem abgeschlossenen Modell Endpunkte zu erstellen
- Schaltfläche Aktualisieren und ein Zeitstempel
Updatedin der Kopfzeile der Seite

Die Seite wird automatisch aktualisiert und fragt schneller ab, während sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping). Weitere Informationen findest du unter Überwachung.
Kostenpflichtige Endpunkte stellen Diagramme und Beispielbilder bereit, die nur im Arbeitsspeicher der bereitstellenden Instanz gehalten werden. Das Stoppen, Neustarten, erneute Bereitstellen, Ändern der Größe oder Ersetzen des Modells kann diese Daten löschen. Speichere Beispiele in einem Dataset und warte, bis das Laden abgeschlossen ist, um sie zu behalten. Siehe Monitoring.
Wichtige Funktionen#
Globale Abdeckung#
Stelle Modelle mit 42 Regionen in der Nähe deiner Nutzer bereit, die folgende Gebiete abdecken:
- Nordamerika, Südamerika
- Europa, Nahost, Afrika
- Asien-Pazifik, Ozeanien
Skalierungsverhalten#
Endpunkte verhalten sich derzeit wie folgt:
- Standardressourcen: Inaktive Endpunkte skalieren auf Null herunter und führen beim nächsten Request einen Kaltstart durch
- Benutzerdefinierte Ressourcen: Eine Instanz bleibt warm und verursacht Betriebszeltkosten, bis sie gestoppt wird
- Eine aktive Instanz: Jeder Endpunkt stellt derzeit bei allen Tarifen über eine Instanz bereit
- Lastabweisung: Anfragen erhalten
429-Antworten, wenn der Endpunkt vorübergehend ausgelastet ist – siehe Direkte Endpunktanfragen - Anfrage-Timeout: Direkte Endpunktanfragen haben eine maximale Dauer von 1 Stunde; siehe Inference für unterstützte Eingaben
Regionale Bereitstellung#
Nutze die gemessene Latenz der Regionen, um einen Endpunkt in der Nähe seiner Aufrufer zu platzieren. Die tatsächliche Inferenzlatenz hängt vom Modell, der Eingabegröße, dem Zustand des Endpunkts und dem Netzwerkpfad ab.
Zustandsprüfungen#
Jede laufende Bereitstellung umfasst eine automatische Zustandsprüfung mit:
- Anzeige des Live-Status (funktionsfähig/nicht funktionsfähig)
- Anzeige der Antwortlatenz
- Automatischer Wiederholungsversuch bei nicht funktionsfähigem Zustand, der beendet wird, sobald der Zustand wieder funktionsfähig ist
- Schaltfläche zum manuellen Aktualisieren
Schnellstart#
Erstelle eine Bereitstellung:
- Trainiere ein Modell für ein Projekt oder lade eines hoch
- Öffne den Tab Bereitstellen des Modells
- Klicke auf Deploy für eine Region in der Latenztabelle
- Überprüfe CPU, Arbeitsspeicher, Preise und Name im Bereitstellungsdialog
- Klicke auf Create Deployment und warte, bis der Bereitstellungsstatus Ready lautet
Model → Deploy tab → Deploy in a region → Review configuration → Create DeploymentDer Name der Bereitstellung wird aus dem Modellnamen und der Regionsstadt generiert und kann vor der Bereitstellung bearbeitet werden. Verwende nach der Bereitstellung die Endpunkt-URL mit deinem API-Schlüssel, um Inferenzanfragen von jeder Anwendung aus zu senden.
Schnellzugriffe#
- Inferenz: Modelle im Browser testen
- Endpunkte: Dedizierte Endpunkte bereitstellen
- Überwachung: Verfolge die Leistung deiner Bereitstellungen
FAQ#
Merkmal Gemeinsam genutzt Dediziert Dienst Gemeinsam von Platform-Nutzern genutzt Einer Bereitstellung zugewiesen Skalierung Von Platform verwaltet Standard: skaliert auf Null; benutzerdefiniert: bleibt warm Regionen 3 Datenregionen Aus 42 Bereitstellungsregionen auswählen URL Platform-Modell-API Generierte Endpunkt-URL der Bereitstellung Tests Tab Predictdes ModellsTab Predictder Bereitstellungskarte oder APIRatenbegrenzungen 20 Anfragen/Minute Keine Ratenbegrenzung von Platform bei direkten Aufrufen Authentifizierung Beliebiger API-Schlüssel des Arbeitsbereichs Nur der an die Bereitstellung gebundene API-Schlüssel Die Bereitstellung bleibt im Status „wird erstellt“ oder „wird bereitgestellt“, während der Dienst gestartet wird. Sie kann verwendet werden, sobald sich der Status in Bereit ändert; die Dauer variiert je nach Modell und Region und beträgt typischerweise einige Minuten.
Ja, für jedes Modell können mehrere Endpunkte in verschiedenen Regionen eingerichtet werden. Die Anzahl der Bereitstellungen ist durch den Tarif begrenzt: Free
3, Pro10, Enterpriseunlimited. Das Kontingent wird dem Arbeitsbereich berechnet, dem das Modell gehört, und ein Endpunkt stellt jeweils genau ein Modell bereit – mit einem Modellaustausch kannst du es ersetzen, ohne die URL zu ändern.Endpunkte mit Standardressourcen skalieren bei Inaktivität auf Null herunter:
- Der Endpunkt wird nach einer Inaktivitätsphase heruntergefahren
- Die erste Anfrage löst einen Kaltstart aus
- Nachfolgende Anfragen sind schnell
Die ersten Anfragen nach einer Inaktivitätsphase lösen einen Kaltstart aus. Beim Öffnen der Bereitstellungskarte wird eine Gesundheitsprüfung durchgeführt, die den Endpunkt aufwärmt, sodass eine direkt danach gesendete Testvorhersage schnell beantwortet wird.
Endpunkte mit benutzerdefinierten Ressourcen bleiben warm und werden für die Betriebszeit einschließlich der Leerlaufzeit berechnet. Stoppe einen Endpunkt, um die Berechnung seiner Betriebszeit zu beenden.