Ultralytics YOLO27:
Get Started

Dedizierte Endpunkte#

Die Ultralytics Platform ermöglicht die Bereitstellung von YOLO-Modellen auf dedizierten Endpunkten in 42 Regionen weltweit. Jeder Endpunkt ist ein Dienst für einen einzelnen Mandanten mit einer eigenen Endpunkt-URL und unabhängiger Überwachung. Die Standardgröße der Ressourcen wird bei Inaktivität auf null herunterskaliert; benutzerdefinierte Größen halten eine Instanz bereit und werden nach Betriebszeit abgerechnet.

Bereitstellungs-Tab der Ultralytics Platform mit Regionskarte und Tabelle

Endpunkt erstellen#

Im Bereitstellungs-Tab#

Stelle ein Modell über seinen Tab Deploy bereit:

  1. Rufe dein Modell auf
  2. Klicke auf den Tab Deploy
  3. Sieh dir die Weltkarte und die Regionentabelle an, die nach der gemessenen Latenz von deinem Standort aus sortiert ist
  4. Klicke in der Zeile der gewünschten Region auf Deploy
  5. Prüfe im Dialogfeld CPU, Arbeitsspeicher, Preis und Bereitstellungsnamen und klicke dann auf Create Deployment

Der vorgeschlagene Name setzt sich aus dem Modellnamen und der Stadt der Region zusammen (zum Beispiel yolo26n-iowa) und kann vor der Bereitstellung bearbeitet werden. Das Modell muss Gewichte enthalten. Andernfalls wird im Tab statt der Regionentabelle ein leerer Zustand angezeigt.

Im Tab „Deployments“#

Erstelle eine Bereitstellung über den Tab Deployments in deinem Profil oder über die Seitenleiste:

  1. Klicke im Tab „Deployments“ auf New Deployment oder in der Seitenleiste neben Deployments auf +
  2. Wähle im Modellauswahlmenü ein Modell aus. Dort werden deine abgeschlossenen Modelle aufgeführt.
  3. Wähle eine Region auf der Minikarte oder in der Latenztabelle aus
  4. Wähle CPU und Arbeitsspeicher aus, prüfe den Preis und bearbeite bei Bedarf den vorgeschlagenen Bereitstellungsnamen
  5. Klicke auf Create Deployment

Dialogfeld „New Deployment“ der Ultralytics Platform mit Modellauswahl und Regionskarte

Lebenszyklus der Bereitstellung#

Verbinde Slack-Benachrichtigungen, um eine Nachricht zu erhalten, wenn eine Bereitstellung bereit ist oder nicht gestartet werden kann.

Region auswählen#

Wähle aus 42 Regionen weltweit. Die interaktive Regionskarte und Tabelle zeigen Folgendes:

  • Regionsmarkierungen: Nach Latenz auf einem Farbverlauf von Grün bis Rot eingefärbt (schnellere Regionen sind grüner, langsamere röter)
  • Bereitgestellte Regionen: In der Tabelle mit dem Kennzeichen „Deployed“ hervorgehoben
  • Regionen in Bereitstellung: Animierte pulsierende Markierung auf der Karte und in der Tabellenzeile
  • Wechselseitige Hervorhebung: Beim Überfahren der Karte wird die Tabellenzeile hervorgehoben und umgekehrt

Latenztabelle der Regionen im Bereitstellungs-Tab der Ultralytics Platform, nach Latenz sortiert

Die Regionentabelle im Tab Deploy des Modells enthält Folgendes:

SpalteBeschreibung
StandortStadt und Land mit Flaggensymbol
ZoneRegionskennung
LatenzGemessene Ping-Zeit von deinem Browser
EntfernungEntfernung von deinem ungefähren Standort in km
AktionenSchaltfläche „Deploy“ oder Statuskennzeichen „Deployed“

Die Tabelle kann nach Stadt, Land und Zone durchsucht werden und ist standardmäßig nach Latenz sortiert.

Dialogfeld „New Deployment“

Das Dialogfeld New Deployment (über den Tab „Deployments“ oder die Seitenleiste) zeigt eine vereinfachte Regionentabelle mit den Spalten Standort, Latenz und Auswählen. Es führt die 20 schnellsten Regionen auf und weist auf die übrigen Regionen hin. Verwende die Minikarte, um eine andere Region auszuwählen.

So wird die Latenz gemessen

Dein Browser misst die Latenz zu jeder der 42 Regionen. Die Ergebnisse werden 30 Minuten lang zwischengespeichert und zwischen dem Tab Deploy und dem Dialogfeld New Deployment geteilt. Verwende die Schaltfläche Rescan im Modell-Tab Deploy, um die Messung über dein aktuelles Netzwerk zu wiederholen. Die Entfernung wird anhand des ungefähren Standorts deiner Anfrage berechnet und ist daher nur ein grober Richtwert.

Verfügbare Regionen#

ZoneStandort
us-central1Iowa, USA
us-east1South Carolina, USA
us-east4Northern Virginia, USA
us-east5Columbus, USA
us-south1Dallas, USA
us-west1Oregon, USA
us-west2Los Angeles, USA
us-west3Salt Lake City, USA
us-west4Las Vegas, USA
northamerica-northeast1Montreal, Kanada
northamerica-northeast2Toronto, Kanada
northamerica-south1Querétaro, Mexiko
southamerica-east1São Paulo, Brasilien
southamerica-west1Santiago, Chile

Endpunktkonfiguration#

Dialogfeld für neue Bereitstellung#

Im Dialogfeld New Deployment kannst du ein Modell, eine Region, Ressourcen und einen Namen für die Bereitstellung auswählen:

FeldBeschreibung
ModellJedes abgeschlossene Modell im Arbeitsbereich, ausgewählt über das Auswahlfeld
RegionBereitstellungsregion, ausgewählt auf der Minikarte oder in der Latenztabelle
CPU und ArbeitsspeicherWähle die Ressourcengröße aus und prüfe die angezeigten Preise
Name der BereitstellungWird automatisch erstellt, sobald Modell und Region festgelegt sind, und kann bearbeitet werden

Dialogfeld für neue Bereitstellung auf der Ultralytics Platform mit festen Ressourcenstandardeinstellungen

Wähle in den Ressourceneinstellungen die CPU- und Arbeitsspeichergröße aus und prüfe vor dem Erstellen der Bereitstellung die angezeigten Preise. Für die CPU stehen 1, 2, 4, 6 oder 8 vCPU zur Auswahl, für den Arbeitsspeicher 2 bis 32 GiB. Für größere Arbeitsspeichergrößen ist mehr vCPU erforderlich (16 GiB benötigen beispielsweise mindestens 4 vCPU), und das Dialogfeld erläutert ungültige Kombinationen. Die Standardgröße (1 vCPU, 2 GiB) ist kostenlos und wird bei Nichtnutzung auf null herunterskaliert. Bei benutzerdefinierten Größen bleibt eine Instanz aktiv; ab dem Zeitpunkt der Betriebsbereitschaft wird bis zum Anhalten des Endpunkts der angezeigte regionale Stundensatz berechnet, auch bei Nichtnutzung. Zum Erstellen, Starten oder Ändern auf eine benutzerdefinierte Größe müssen ausreichend Guthaben verfügbar sein. Endpunkte mit benutzerdefinierter Größe werden automatisch angehalten, wenn dem Arbeitsbereich das Guthaben ausgeht. Agents verwendet dasselbe Dialogfeld, wenn du Neue Bereitstellung… auswählst.

Dialogfeld für neue Bereitstellung auf der Ultralytics Platform mit benutzerdefinierten Preisen für CPU und Arbeitsspeicher

Automatisch generierte Namen

Der Name der Bereitstellung setzt sich aus dem Modellnamen und der Stadt der Region zusammen, zum Beispiel yolo26n-iowa. Namen müssen innerhalb eines Arbeitsbereichs eindeutig sein: Wenn der Name bereits vergeben ist, zeigt das Dialogfeld einen Inline-Fehler an und deaktiviert Bereitstellung erstellen, bis du einen anderen Namen auswählst.

Bereitstellungs-Tab (schnelle Bereitstellung)#

Wenn du die Bereitstellung über den Tab Deploy des Modells startest, wird dasselbe Dialogfeld geöffnet, in dem Modell und Region bereits ausgewählt sind. Prüfe vor dem Erstellen des Endpunkts die Ressourcengröße, die Preise und den automatisch generierten Namen. Während der Erstellung wird die Bereitstellung unterhalb der Regionstabelle in der Liste der Bereitstellungen für das Modell angezeigt.

Endpunkte verwalten#

Ansichtsmodi#

Die Liste der Bereitstellungen bietet drei Ansichtsmodi:

ModusBeschreibung
KartenKarten mit Status, Größe, Messwerten, Entfernung und Bereitstellungsdatum
KompaktRaster mit kleineren Karten und wichtigen Messwerten
TabelleDatentabelle mit sortierbaren Spalten

Tab „Bereitstellung“ der Ultralytics Platform mit aktiven Bereitstellungen in Kartenansicht

Kompakt- und Tabellenansicht

Kompakte Karten zeigen die Flagge, den Namen, die Stadt, den Status und die drei Messwerte. Die Tabellenansicht lässt sich nach Name, Region, Status, CPU, Arbeitsspeicher, HTTP-Anfragen, HTTP-Fehlerrate, HTTP-P95-Latenz, Entfernung und Bereitstellungsdatum sortieren. Jede Karte und jede Zeile führt zur Seite der Bereitstellung. Aktionen für den Lebenszyklus findest du auf dieser Seite; über das Papierkorbsymbol neben einer Bereitstellung in der Seitenleiste kannst du sie löschen.

Seite der Bereitstellung#

Jede Bereitstellung hat eine eigene Seite unter /{username}/deploy/{deployment}, auf der Folgendes angezeigt wird:

  • Kopfzeile: Regionsflagge, Anzeigename (klicke darauf, um ihn umzubenennen; die Seiten-URL und der API-Pfad ändern sich entsprechend einem aus dem neuen Namen gebildeten Slug, die Endpunkt-URL jedoch nicht), Statussymbol, Standort sowie CPU- und Arbeitsspeichergröße
  • Aktionen: Konfiguration aktualisieren, Modell ersetzen und Bereitstellung anhalten, wenn der Status Bereit ist; Bereitstellung starten, wenn der Status Angehalten ist; außerdem ein Menü Weitere Aktionen (…) mit Informationen, Aktualisieren und Bereitstellung löschen
  • Messwerte: HTTP-Anfragen, HTTP-Fehlerrate und HTTP-P95-Latenz über einen Zeitraum von 24 Stunden mit Sparkline-Diagrammen sowie eine Karte mit einem Link zum bereitgestellten Modell
  • Tabs: Overview, Monitoring, Predict und Logs
  • Statusmeldung: Fehlerursache, wenn eine Bereitstellung fehlgeschlagen ist

Im Tab Overview werden die Standortkarte, die Karte Endpunkt mit der kopierbaren Endpunkt-URL, ein Link zur API-Dokumentation und eine Zustandsprüfung sowie eine Karte mit Bereitstellungsinformationen zu Preisen, Region, CPU und Arbeitsspeicher angezeigt. Im Tab Logs findest du aktuelle Protokolleinträge mit Filter nach Schweregrad (Alle / Fehler). Der Tab Predict bietet ein integriertes Vorhersagefeld zum direkten Testen der Bereitstellung. Der Ergebnistab Dokumentation enthält sofort verwendbare Codebeispiele in Python, JavaScript und cURL, in die die Endpunkt-URL und – für Eigentümer des Arbeitsbereichs – der verknüpfte API-Schlüssel eingetragen sind (siehe Überwachung). Im Dialogfeld Informationen werden die Eigenschaften der Bereitstellung aufgeführt und benutzerdefinierte Metadaten können bearbeitet werden.

CPU und Arbeitsspeicher aktualisieren#

  1. Öffne die Seite eines bereiten Endpunkts.
  2. Klicke auf Konfiguration aktualisieren.
  3. Wähle CPU und Arbeitsspeicher aus und prüfe die angezeigten Kosten pro Stunde.
  4. Klicke auf Konfiguration aktualisieren. Die aktuelle Konfiguration bleibt in Betrieb, bis die neue bereit ist.

CPU- und Arbeitsspeicherkonfiguration einer Bereitstellung auf der Ultralytics Platform aktualisieren

Benutzerdefinierte Ressourcen werden nach Laufzeit abgerechnet und halten eine Instanz aktiv. Dadurch kann auch eine IP-Kamera ohne zusätzliche Kosten weiterlaufen (siehe Hintergrundkamera). Wenn du zu den Standardressourcen zurückkehrst, wird das Herunterskalieren auf null wieder aktiviert und die Hintergrundkamera entfernt.

Vorübergehende Überwachungsdaten

Überwachungsdiagramme und Beispielbilder sind kompakte Daten, die im Arbeitsspeicher gehalten werden. Beim Anhalten, Neustarten, erneuten Bereitstellen, Ändern der Größe oder Ersetzen eines Modells können diese Daten gelöscht werden. Beim erneuten Starten des Endpunkts wird der Verlauf nicht wiederhergestellt. Speichere nützliche Beispiele in einem Datensatz und warte, bis die Aufnahme abgeschlossen ist, bevor du den Endpunkt änderst. Für Betriebsmetriken und Protokolle gelten separate Aufbewahrungszeiträume.

Modell ersetzen#

Ersetze das Modell eines bereiten Endpunkts, ohne seine URL zu ändern:

  1. Öffne die Seite der Bereitstellung
  2. Klicke auf Modell ersetzen
  3. Wähle ein anderes abgeschlossenes Modell aus demselben Arbeitsbereich aus
  4. Bearbeite bei Bedarf den Namen der Bereitstellung
  5. Klicke auf Modell ersetzen

Das aktuelle Modell wird weiter ausgeführt, während das Ersatzmodell startet. Sobald das Ersatzmodell bereit ist, wird der Datenverkehr auf das neue Modell umgeleitet. Bereitstellungs-ID, URL, Region und API-Schlüssel bleiben unverändert; der Anzeigename ändert sich nur, wenn du einen neuen Namen eingibst. Schlägt der Austausch fehl, bleiben das bisherige Modell und der bisherige Name aktiv.

Für den Austausch müssen alle folgenden Bedingungen erfüllt sein; andernfalls wird er abgelehnt:

  • Die Bereitstellung hat den Status Ready und es läuft keine andere Lebenszyklusoperation.
  • Das Ersatzmodell hat Gewichte und gehört zum selben Workspace wie die Bereitstellung.
  • Das Ersatzmodell ist nicht das bereits bereitgestellte Modell.
Ein Modell pro Endpunkt

Beim Ersetzen wird das vorherige Modell aus der Bereitstellung entfernt. Jeder Endpunkt stellt ein Modell bereit. Erstelle eine weitere Bereitstellung, wenn beide Modelle gleichzeitig verfügbar sein sollen.

Bereitstellungsstatus#

StatusBeschreibung
Wird erstelltDie Bereitstellung wird eingerichtet.
Wird bereitgestelltDer Container wird gestartet.
ReadyDer Endpunkt ist aktiv und nimmt Anfragen entgegen.
Wird angehaltenDer Endpunkt wird heruntergefahren.
AngehaltenDer Endpunkt ist pausiert und nicht verfügbar.
FehlgeschlagenDie Bereitstellung ist fehlgeschlagen (siehe Fehlermeldung).

Bei einer Bereitstellung mit dem Status Ready zeigt das Abzeichen auf der Seite Starting an, bis der Endpunkt seine erste Zustandsprüfung beantwortet, und Not responding, wenn die Prüfung fehlschlägt.

Endpunkt-URL#

Jeder Endpunkt hat eine eindeutige URL, zum Beispiel:

https://predict-<deployment-id>-<hash>-<region>.a.run.app

Endpunkt-URL auf der Bereitstellungskarte der Ultralytics Platform mit Schaltfläche zum Kopieren

Klicke auf die Schaltfläche zum Kopieren, um die URL zu kopieren. Klicke auf API-Dokumentation, um die API-Referenz des Endpunkts zu öffnen. Der Endpunkt stellt diese Pfade bereit:

PfadMethodeBeschreibung
/predictPOSTInferenz ausführen; der API-Schlüssel der Bereitstellung ist erforderlich
/healthGETErreichbarkeitsprüfung mit Dienststatus und Anzahl der zwischengespeicherten Modelle
/GETStatusübersicht für den bereitgestellten Dienst
/docsGETInteraktive API-Referenz für diese Bereitstellung, dieses Modell und diese Region

Lebenszyklusverwaltung#

Steuere den Status deines Endpunkts:

AktionBeschreibung
StartenEinen angehaltenen Endpunkt fortsetzen
AnhaltenDen Endpunkt pausieren
LöschenEndpunkt dauerhaft entfernen

Endpunkt anhalten#

Halte einen Endpunkt an, wenn er keine Anfragen entgegennehmen soll:

  1. Klicke auf der Bereitstellungsseite auf Bereitstellung anhalten.
  2. Der Endpunktstatus wechselt zu „Wird angehalten“ und anschließend zu „Angehalten“.

Angehaltene Endpunkte:

  • Nehmen keine Anfragen entgegen und melden weder aktuelle Messwerte noch einen Zustandsstatus.
  • Verursachen keine weiteren Betriebszeitgebühren.
  • Verlieren temporäre Überwachungsstatistiken und Beispielbilder, wenn die Bereitstellungsinstanz heruntergefahren wird.
  • Behalten ihre URL, Region und den zugewiesenen API-Schlüssel und können jederzeit neu gestartet werden.
  • Werden weiterhin auf dein Bereitstellungskontingent angerechnet — lösche einen Endpunkt, um seinen Platz freizugeben.

Endpunkt löschen#

Einen Endpunkt dauerhaft entfernen:

  1. Öffne Weitere Aktionen (…) auf der Bereitstellungsseite und klicke auf Bereitstellung löschen, oder klicke in der Seitenleiste neben der Bereitstellung auf das Papierkorbsymbol.
  2. Bestätige mit Löschen.
Dauerhafte Aktion

Das Löschen erfolgt sofort und ist dauerhaft — Bereitstellungen landen nicht im Papierkorb. Wenn du den Endpunkt löschst, wird sein Dienst entfernt und ein Platz in deinem Bereitstellungskontingent frei. Du kannst jederzeit einen neuen Endpunkt erstellen, erhältst dafür aber eine neue URL.

Bereitstellungen werden auch entfernt, wenn ihr Modell oder Projekt dauerhaft gelöscht wird oder wenn ein Modell oder Projekt im Papierkorb das Ende seiner Aufbewahrungsfrist erreicht.

Endpunkte verwenden#

Authentifizierung#

Jede Bereitstellung ist an einen einzelnen API-Schlüssel aus dem Workspace gebunden, dem das Modell gehört. Füge ihn den Anfragen hinzu:

Authorization: Bearer YOUR_API_KEY

Der Endpunkt akzeptiert nur den bei der Erstellung zugewiesenen Schlüssel. Kein anderer Schlüssel kann ihn öffnen — auch kein anderer aktiver Schlüssel im selben Workspace. Wenn du steuern möchtest, welcher Schlüssel zugewiesen wird, stelle die Bereitstellung über die API bereit und authentifiziere dich mit dem Schlüssel des Workspace-Eigentümers: Genau dieser Schlüssel wird zugewiesen und du hast ihn bereits. Bei Bereitstellungen auf anderem Weg (über die Platform-Benutzeroberfläche oder einen API-Aufruf, der mit den Zugangsdaten eines Teammitglieds authentifiziert wurde) wird automatisch einer der aktiven Schlüssel des besitzenden Workspace zugewiesen. Bitte den Workspace-Eigentümer um den Schlüsselwert, da nur der Eigentümer Schlüsselwerte einsehen kann (siehe API-Schlüssel). Teammitglieder ohne den zugewiesenen Schlüssel können weiterhin über den Predict-Proxy der Platform im Browser Inferenz ausführen.

Das Löschen des zugewiesenen Schlüssels sperrt den Endpunkt nicht

Wenn du den zugewiesenen API-Schlüssel löschst oder deaktivierst, wird der direkte Zugriff auf den Endpunkt nicht widerrufen — jeder, der den Schlüsseltext besitzt, kann die Endpunkt-URL weiterhin aufrufen. Nicht mehr funktioniert dann der Predict-Proxy der Platform, der den Schlüssel live überprüft und meldet, dass er nicht mehr verfügbar ist. Um den Zugriff vollständig zu widerrufen, halte die Bereitstellung an oder lösche sie. Erstelle nach dem Wechsel der Schlüssel den Endpunkt erneut, damit der neue Schlüssel zugewiesen wird.

Direkte Endpunktanfragen#

Sende Produktionsanfragen direkt an die URL auf der Bereitstellungsseite. Diese Anfragen laufen nicht durch die Ratenbegrenzung der Platform API, daher gilt das Limit von 20 Predict-Anfragen pro Minute nicht. Für den Endpunkt gilt weiterhin eine eigene Kapazitätsgrenze:

  • Für jeden Endpunkt stellt eine einzelne Instanz den Dienst bereit und verarbeitet jeweils nur eine begrenzte Anzahl von Anfragen.
  • Anfragen, die nicht zeitnah bearbeitet werden können, geben 429 mit einem Retry-After-Header zurück.
  • Eine einzelne Anfrage kann bis zu 1 Stunde dauern, sodass die Inferenz von Videos abgeschlossen werden kann.
  • Anfrageinhalte sind auf 32 MB begrenzt; größere Uploads werden mit 413 abgewiesen.
  • Antworten über 1 KB werden mit gzip komprimiert, und browserbasierte ursprungsübergreifende Anfragen sind zulässig.

Anfragebeispiel#

import requests

# Endpunkt der Bereitstellung
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"

# Header mit dem API-Schlüssel deiner Bereitstellung
headers = {"Authorization": "Bearer YOUR_API_KEY"}

# Inferenzparameter
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}

# Bild zur Inferenz senden
with open("image.jpg", "rb") as f:
    response = requests.post(url, headers=headers, data=data, files={"file": f})

print(response.json())

Anfrageparameter#

ParameterTypStandardBereichBeschreibung
fileDatei--Bild- oder Videodatei (erforderlich, sofern source nicht gesetzt ist)
conffloat0.250.01 – 1.0Mindest-Konfidenzschwelle
ioufloat0.70.0 – 0.95NMS-IoU-Schwellenwert
imgszint-32 – 1280Größe des Eingabebilds in Pixeln; standardmäßig die Trainingsgröße des Modells (640, falls nicht verfügbar)
normalizeboolfalse-Gibt BBox-Koordinaten als Werte von 0 bis 1 zurück
decimalsint50 – 10Dezimalstellen für Koordinatenwerte
vid_strideint1≥ 1Jeden N-ten Videoframe vorhersagen; bei Bildern wird dieser Parameter ignoriert
bitsint88, 12, 16Quantisierung der Tiefenkarte, nur für Tiefenmodelle
sourceZeichenkette--Bild-URL oder Base64-Zeichenkette (Alternative zu file); über die Platform API auf 4.096 Zeichen begrenzt

Ein Endpunkt behält die Inferenzlaufzeit seiner letzten Aktualisierung bei. Neuere Verhaltensweisen, etwa die Trainingsgröße imgsz als Standardwert oder vid_stride oben, erreichen ihn daher erst mit einer neuen Revision, zum Beispiel nachdem du das Modell ersetzt oder CPU oder Arbeitsspeicher änderst. Gib imgsz explizit an, wenn die Eingabegröße unverändert bleiben soll.

Unter Tiefenantworten erfährst du, wie bits die zurückgegebene Tiefenkarte verändert und wie du sie dekodierst.

Videoinferenz

Dedizierte Endpunkte akzeptieren über den Parameter file sowohl Bilder als auch Videos.

  • Bildformate (bis zu 32 MB pro Anfrage): AVIF, BMP, DNG, HEIC, HEIF, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
  • Videoformate (bis zu 32 MB pro Anfrage): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV

Die Ergebnisse werden für jedes verarbeitete Videobild zurückgegeben; Tiefenmodelle akzeptieren nur Bilder. Du kannst statt file über den Parameter source auch eine öffentliche Bild-URL oder ein Base64-kodiertes Bild übergeben. Zu große Uploads werden mit 413 abgewiesen.

Antwortformat#

Wie bei gemeinsam genutzter Inferenz, mit aufgabenspezifischen Feldern.

Häufig gestellte Fragen#

  • Die Endpunktlimits hängen vom Tarif ab:

    • Free: Bis zu 3 Bereitstellungen
    • Pro: Bis zu 10 Bereitstellungen
    • Enterprise: Unbegrenzte Bereitstellungen

    Jedes Modell kann weiterhin in mehreren Regionen bereitgestellt werden, sofern dein Tarifkontingent dies zulässt. Das Kontingent wird dem Workspace angerechnet, dem das Modell gehört. Teammitglieder, die ein gemeinsam genutztes Modell bereitstellen, verbrauchen daher das Kontingent des Eigentümers. Bei Erreichen des Limits erscheint eine Fehlermeldung, die dich auffordert, zuerst eine vorhandene Bereitstellung zu löschen.

  • Nein, Regionen können nicht geändert werden. So wechselst du die Region:

    1. Lösche den vorhandenen Endpunkt.
    2. Erstelle einen neuen Endpunkt in der gewünschten Region.

    Der neue Endpunkt erhält eine neue URL. Wenn du nur das Modell hinter einem Endpunkt ändern möchtest, verwende den Modellaustausch. Dabei bleibt die URL erhalten.

  • Für eine globale Abdeckung:

    1. Stelle den Dienst in mehreren Regionen bereit.
    2. Verwende einen Load Balancer oder DNS-Routing.
    3. Leite Nutzer zum nächstgelegenen Endpunkt.
  • Die Kaltstartdauer hängt vom Modell ab und davon, ob der Endpunkt auf null skaliert wurde. Der Start aus dem Leerlauf kann etwa eine Minute dauern, und Platform räumt einem untätigen Endpunkt zusätzliche Startzeit ein, bevor der Status „nicht verfügbar“ gemeldet wird. Wenn du die Bereitstellungsseite öffnest oder die Zustandsprüfung erneut ausführst, wird ein untätiger Endpunkt aufgewärmt. Tu eines von beidem, bevor ein hoher Anfrageanstieg einsetzt.

  • Nein. Jede Bereitstellung verarbeitet Anfragen über die generierte Endpunkt-URL auf der Bereitstellungsseite. Diese bleibt während der gesamten Lebensdauer der Bereitstellung stabil — auch beim Austausch von Modellen.

Kommentare