Ultralytics YOLO27:

Bereitstellung#

Ultralytics Platform bietet umfassende Optionen für die Modellbereitstellung, um deine YOLO-Modelle produktiv einzusetzen. Teste Modelle mit browserbasierter Inferenz, stelle sie in dedizierten Endpunkten in 42 Regionen weltweit bereit und überwache die Leistung in Echtzeit.



Watch: Get Started with Ultralytics Platform - Deploy

Übersicht#

Der Bereich „Bereitstellung“ unterstützt dich bei Folgendem:

  • Modelle testen direkt im Browser über den Tab Predict
  • Bereitstellung in dedizierten Endpunkten in 42 Regionen weltweit
  • Überwache Anfragemetriken, Protokolle, Gesundheitsprüfungen und temporäre Vorhersagen auf kostenpflichtigen Endpunkten
  • Ressourcen auswählen: Standardendpunkte skalieren auf Null; benutzerdefinierte Größen halten eine warme Instanz mit Betriebszeitabrechnung vor

Weltkarte der Bereitstellungsseite von Ultralytics Platform mit Übersichtskarten

Optionen für die Modellbereitstellung#

Ultralytics Platform bietet mehrere Wege für die Modellbereitstellung:

OptionBeschreibungAm besten geeignet für
Vorhersage-TabBrowserbasierte Inferenz mit Bildern, Webcam und BeispielenEntwicklung, Validierung
Gemeinsam genutzte InferenzMandantenfähiger Dienst über 3 Datenregionen hinwegGeringe Nutzung, Tests
Dedizierte EndpunkteDienste für einzelne Mandanten in 42 RegionenProduktion, geringe Latenz
ExportGewichte in 20 Formaten für lokale oder Edge-Laufzeitumgebungen herunterladenOffline, auf dem Gerät

Workflow#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
StufeBeschreibung
TestValidiere das Modell über den Tab Predict
KonfigurierenWähle ein Modell, eine Region, CPU und Arbeitsspeicher aus; überprüfe die Preisgestaltung und den Namen der Bereitstellung
BereitstellenErstelle über den Tab Deploy einen dedizierten Endpunkt
ÜberwachenÜberprüfe Endpunktmetriken und temporäre Vorhersagen unter Monitoring

Architektur#

Gemeinsam genutzte Inferenz#

Der Dienst für gemeinsam genutzte Inferenz läuft in 3 wichtigen Regionen. Anfragen an ein Modell werden an den Dienst in der Datenregion dieses Modells weitergeleitet, sodass die Ergebnisse innerhalb der Region bleiben, in der das Modell gespeichert ist:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegionBezeichnungStandortAm besten geeignet für
USAmerikaIowa, USANutzer in Amerika, am schnellsten für Amerika
EUEuropa, Naher Osten und AfrikaBelgien, EuropaEuropäische Nutzer, DSGVO-Konformität
APAsien-PazifikTaiwan, Asien-PazifikNutzer im Asien-Pazifik-Raum, geringste Latenz im asiatisch-pazifischen Raum

Dedizierte Endpunkte#

Stelle Modelle in Ultralytics Cloud weltweit in 42 Regionen bereit:

  • Amerika: 14 Regionen
  • Europa: 13 Regionen
  • Asien-Pazifik: 12 Regionen
  • Nahost und Afrika: 3 Regionen

Jeder Endpunkt ist ein Dienst für einen einzelnen Mandanten mit:

  • Konfigurierbare CPU und Arbeitsspeicher mit Preisen, die vor der Bereitstellung angezeigt werden
  • Skalierung auf Null für Standardressourcen; eine warme, nach Betriebszeit abgerechnete Instanz für benutzerdefinierte Ressourcen
  • Eindeutiger Endpunkt-URL mit eigener interaktiver API-Referenz unter /docs
  • Eigener API-Schlüsselzuordnung, sodass nur dieser Schlüssel den Endpunkt aufrufen kann
  • Unabhängiger Überwachung, Protokollen und Zustandsprüfungen

Seite „Bereitstellungen“#

Öffne die globale Bereitstellungsseite über die Seitenleiste unter Deploy. Diese Seite zeigt:

  • Weltkarte mit Markierungen der bereitgestellten Regionen; klicke auf eine Region, um den Dialog New Deployment zu öffnen
  • Übersichtskarten: HTTP-Anfragen (24h), Aktive Bereitstellungen, HTTP-Fehlerrate (24h), HTTP-P95-Latenz (24h)
  • Liste der Bereitstellungen mit drei Ansichtsmodi: Karten, kompakt und Tabelle
  • Schaltfläche Neue Bereitstellung, um aus jedem abgeschlossenen Modell Endpunkte zu erstellen
  • Schaltfläche Aktualisieren und ein Zeitstempel Updated in der Kopfzeile der Seite

Übersichtskarten und Bereitstellungsliste der Bereitstellungsseite von Ultralytics Platform

Automatische Abfragen

Die Seite wird automatisch aktualisiert und fragt schneller ab, während sich Bereitstellungen in einem Übergangszustand befinden (creating, deploying oder stopping). Weitere Informationen findest du unter Überwachung.

Leichtgewichtige, temporäre Überwachung

Kostenpflichtige Endpunkte stellen Diagramme und Beispielbilder bereit, die nur im Arbeitsspeicher der bereitstellenden Instanz gehalten werden. Das Stoppen, Neustarten, erneute Bereitstellen, Ändern der Größe oder Ersetzen des Modells kann diese Daten löschen. Speichere Beispiele in einem Dataset und warte, bis das Laden abgeschlossen ist, um sie zu behalten. Siehe Monitoring.

Wichtige Funktionen#

Globale Abdeckung#

Stelle Modelle mit 42 Regionen in der Nähe deiner Nutzer bereit, die folgende Gebiete abdecken:

  • Nordamerika, Südamerika
  • Europa, Nahost, Afrika
  • Asien-Pazifik, Ozeanien

Skalierungsverhalten#

Endpunkte verhalten sich derzeit wie folgt:

  • Standardressourcen: Inaktive Endpunkte skalieren auf Null herunter und führen beim nächsten Request einen Kaltstart durch
  • Benutzerdefinierte Ressourcen: Eine Instanz bleibt warm und verursacht Betriebszeltkosten, bis sie gestoppt wird
  • Eine aktive Instanz: Jeder Endpunkt stellt derzeit bei allen Tarifen über eine Instanz bereit
  • Lastabweisung: Anfragen erhalten 429-Antworten, wenn der Endpunkt vorübergehend ausgelastet ist – siehe Direkte Endpunktanfragen
  • Anfrage-Timeout: Direkte Endpunktanfragen haben eine maximale Dauer von 1 Stunde; siehe Inference für unterstützte Eingaben

Regionale Bereitstellung#

Nutze die gemessene Latenz der Regionen, um einen Endpunkt in der Nähe seiner Aufrufer zu platzieren. Die tatsächliche Inferenzlatenz hängt vom Modell, der Eingabegröße, dem Zustand des Endpunkts und dem Netzwerkpfad ab.

Zustandsprüfungen#

Jede laufende Bereitstellung umfasst eine automatische Zustandsprüfung mit:

  • Anzeige des Live-Status (funktionsfähig/nicht funktionsfähig)
  • Anzeige der Antwortlatenz
  • Automatischer Wiederholungsversuch bei nicht funktionsfähigem Zustand, der beendet wird, sobald der Zustand wieder funktionsfähig ist
  • Schaltfläche zum manuellen Aktualisieren

Schnellstart#

Erstelle eine Bereitstellung:

  1. Trainiere ein Modell für ein Projekt oder lade eines hoch
  2. Öffne den Tab Bereitstellen des Modells
  3. Klicke auf Deploy für eine Region in der Latenztabelle
  4. Überprüfe CPU, Arbeitsspeicher, Preise und Name im Bereitstellungsdialog
  5. Klicke auf Create Deployment und warte, bis der Bereitstellungsstatus Ready lautet
Schnelle Bereitstellung
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

Der Name der Bereitstellung wird aus dem Modellnamen und der Regionsstadt generiert und kann vor der Bereitstellung bearbeitet werden. Verwende nach der Bereitstellung die Endpunkt-URL mit deinem API-Schlüssel, um Inferenzanfragen von jeder Anwendung aus zu senden.

Schnellzugriffe#

FAQ#

  • MerkmalGemeinsam genutztDediziert
    DienstGemeinsam von Platform-Nutzern genutztEiner Bereitstellung zugewiesen
    SkalierungVon Platform verwaltetStandard: skaliert auf Null; benutzerdefiniert: bleibt warm
    Regionen3 DatenregionenAus 42 Bereitstellungsregionen auswählen
    URLPlatform-Modell-APIGenerierte Endpunkt-URL der Bereitstellung
    TestsTab Predict des ModellsTab Predict der Bereitstellungskarte oder API
    Ratenbegrenzungen20 Anfragen/MinuteKeine Ratenbegrenzung von Platform bei direkten Aufrufen
    AuthentifizierungBeliebiger API-Schlüssel des ArbeitsbereichsNur der an die Bereitstellung gebundene API-Schlüssel
  • Die Bereitstellung bleibt im Status „wird erstellt“ oder „wird bereitgestellt“, während der Dienst gestartet wird. Sie kann verwendet werden, sobald sich der Status in Bereit ändert; die Dauer variiert je nach Modell und Region und beträgt typischerweise einige Minuten.

  • Ja, für jedes Modell können mehrere Endpunkte in verschiedenen Regionen eingerichtet werden. Die Anzahl der Bereitstellungen ist durch den Tarif begrenzt: Free 3, Pro 10, Enterprise unlimited. Das Kontingent wird dem Arbeitsbereich berechnet, dem das Modell gehört, und ein Endpunkt stellt jeweils genau ein Modell bereit – mit einem Modellaustausch kannst du es ersetzen, ohne die URL zu ändern.

  • Endpunkte mit Standardressourcen skalieren bei Inaktivität auf Null herunter:

    • Der Endpunkt wird nach einer Inaktivitätsphase heruntergefahren
    • Die erste Anfrage löst einen Kaltstart aus
    • Nachfolgende Anfragen sind schnell

    Die ersten Anfragen nach einer Inaktivitätsphase lösen einen Kaltstart aus. Beim Öffnen der Bereitstellungskarte wird eine Gesundheitsprüfung durchgeführt, die den Endpunkt aufwärmt, sodass eine direkt danach gesendete Testvorhersage schnell beantwortet wird.

    Endpunkte mit benutzerdefinierten Ressourcen bleiben warm und werden für die Betriebszeit einschließlich der Leerlaufzeit berechnet. Stoppe einen Endpunkt, um die Berechnung seiner Betriebszeit zu beenden.

Kommentare