Endpoint dedicati#
Ultralytics Platform consente di distribuire modelli YOLO su endpoint dedicati in 42 regioni del mondo. Ogni endpoint è un servizio a tenant singolo, con un URL univoco e monitoraggio indipendente. Per impostazione predefinita, le risorse vengono ridotte a zero quando il servizio è inattivo; le dimensioni personalizzate mantengono un'istanza attiva e vengono fatturate per il tempo di attività.

Crea endpoint#
Dalla scheda Deploy#
Distribuisci un modello dalla relativa scheda Deploy:
- Vai al tuo modello
- Fai clic sulla scheda Deploy
- Esamina la mappa del mondo e la tabella delle regioni, ordinata in base alla latenza misurata dalla tua posizione
- Fai clic su Deploy nella riga della regione che vuoi usare
- Nella finestra di dialogo, controlla CPU, memoria, prezzi e nome della distribuzione, quindi fai clic su Create Deployment
Il nome suggerito combina il nome del modello e la città della regione (ad esempio yolo26n-iowa) e può essere modificato prima della distribuzione. Il modello deve avere dei pesi; in caso contrario, la scheda mostra uno stato vuoto anziché la tabella delle regioni.
Dalla scheda Deployments#
Crea una distribuzione dalla scheda Deployments del tuo profilo o dalla barra laterale:
- Fai clic su New Deployment nella scheda Deployments oppure su
+accanto a Deployments nella barra laterale - Seleziona un modello dal selettore, che elenca i modelli completati
- Seleziona una regione dalla mini mappa o dalla tabella della latenza
- Scegli CPU e memoria, controlla i prezzi e, se necessario, modifica il nome di distribuzione suggerito
- Fai clic su Create Deployment

Ciclo di vita della distribuzione#
Collega gli avvisi Slack per ricevere un messaggio quando una distribuzione è pronta o non riesce ad avviarsi.
Selezione della regione#
Scegli tra 42 regioni in tutto il mondo. La mappa interattiva e la tabella delle regioni mostrano:
- Indicatori delle regioni: codificati per colore in base alla latenza, con una sfumatura dal verde al rosso (le regioni più veloci sono più verdi, quelle più lente più rosse)
- Regioni con distribuzioni: evidenziate nella tabella con un badge "Deployed"
- Regioni in fase di distribuzione: indicatore animato sull'area e sulla riga della tabella
- Evidenziazione bidirezionale: passando il puntatore sulla mappa si evidenzia la riga corrispondente nella tabella, e viceversa

La tabella delle regioni nella scheda Deploy del modello include:
| Colonna | Descrizione |
|---|---|
| Posizione | Città e paese con icona della bandiera |
| Zona | Identificatore della regione |
| Latenza | Tempo di ping misurato dal browser |
| Distanza | Distanza approssimativa dalla tua posizione, in km |
| Azioni | Pulsante Deploy o badge di stato "Deployed" |
La tabella è consultabile per città, paese e zona ed è ordinata per impostazione predefinita in base alla latenza.
La finestra di dialogo New Deployment (dalla scheda Deployments o dalla barra laterale) mostra una tabella delle regioni più semplice, con solo le colonne Posizione, Latenza e Seleziona, e include le 20 regioni più veloci con una nota sulle restanti. Usa la mini mappa per scegliere qualsiasi altra regione.
Il browser misura la latenza verso ciascuna delle 42 regioni. I risultati vengono memorizzati nella cache per 30 minuti e condivisi tra la scheda Deploy e la finestra di dialogo New Deployment. Usa il pulsante Rescan nella scheda Deploy del modello per ripetere la misurazione dalla rete che stai usando. La distanza viene calcolata a partire dalla posizione approssimativa della tua richiesta, quindi è un'indicazione orientativa, non un valore preciso.
Regioni disponibili#
| Zona | Posizione |
|---|---|
| us-central1 | Iowa, USA |
| us-east1 | Carolina del Sud, USA |
| us-east4 | Virginia settentrionale, USA |
| us-east5 | Columbus, USA |
| us-south1 | Dallas, USA |
| us-west1 | Oregon, USA |
| us-west2 | Los Angeles, USA |
| us-west3 | Salt Lake City, USA |
| us-west4 | Las Vegas, USA |
| northamerica-northeast1 | Montreal, Canada |
| northamerica-northeast2 | Toronto, Canada |
| northamerica-south1 | Querétaro, Messico |
| southamerica-east1 | San Paolo, Brasile |
| southamerica-west1 | Santiago, Cile |
Configurazione dell'endpoint#
Finestra di dialogo per un nuovo deployment#
La finestra di dialogo New Deployment ti consente di selezionare un modello, una regione, le risorse e un nome per il deployment:
| Campo | Descrizione |
|---|---|
| Modello | Qualsiasi modello completato nell'area di lavoro, selezionato tramite il selettore |
| Regione | Regione del deployment, selezionata sulla mini mappa o nella tabella della latenza |
| CPU e memoria | Seleziona la dimensione delle risorse e controlla il prezzo visualizzato |
| Nome del deployment | Generato automaticamente una volta impostati il modello e la regione, e modificabile |

Scegli la dimensione di CPU e memoria nei controlli delle risorse e controlla il prezzo visualizzato prima di creare il deployment. Le opzioni CPU sono 1, 2, 4, 6 o 8 vCPU e le opzioni di memoria vanno da 2 a 32 GiB; le dimensioni di memoria maggiori richiedono più vCPU (ad esempio, 16 GiB richiedono almeno 4 vCPU) e la finestra di dialogo spiega le combinazioni non valide. La dimensione predefinita (1 vCPU, 2 GiB) è gratuita e si riduce a zero quando è inattiva. Le dimensioni personalizzate mantengono un'istanza attiva e vengono addebitate alla tariffa oraria regionale visualizzata dal momento in cui l'endpoint è pronto fino a quando non lo arresti, compreso il tempo di inattività. Per creare, avviare o ridimensionare un deployment a una dimensione personalizzata servono crediti disponibili; gli endpoint con dimensioni personalizzate vengono arrestati automaticamente quando l'area di lavoro esaurisce i crediti. Agents riutilizza questa finestra di dialogo quando selezioni Nuovo deployment….

Il nome del deployment combina il nome del modello con la città della regione, ad esempio yolo26n-iowa. I nomi devono essere univoci all'interno di un'area di lavoro: se il nome è già in uso, la finestra di dialogo mostra un errore in linea e disabilita Crea deployment finché non scegli un altro nome.
Scheda Deploy (deployment rapido)#
Se esegui il deployment dalla scheda Deploy del modello, si apre la stessa finestra di dialogo con il modello e la regione preselezionati. Controlla la dimensione delle risorse, il prezzo e il nome generato automaticamente prima di creare l'endpoint. Durante la creazione, il deployment compare nell'elenco dei deployment del modello sotto la tabella delle regioni.
Gestione degli endpoint#
Modalità di visualizzazione#
L'elenco dei deployment supporta tre modalità di visualizzazione:
| Modalità | Descrizione |
|---|---|
| Schede | Schede con stato, dimensione, metriche, distanza e data di deployment |
| Compatta | Griglia di schede più piccole con le metriche principali |
| Tabella | Tabella dati con colonne ordinabili |

Le schede compatte mostrano la bandiera, il nome, la città, lo stato e le tre metriche. La tabella è ordinabile per Nome, Regione, Stato, CPU, Memoria, Richieste HTTP, Tasso di errori HTTP, Latenza P95 HTTP, Distanza e Data di deployment. Ogni scheda e riga rimanda alla pagina del deployment; le azioni del ciclo di vita si trovano in quella pagina, mentre l'icona del cestino accanto a un deployment nella barra laterale lo elimina.
Pagina del deployment#
Ogni deployment ha una propria pagina all'indirizzo /{username}/deploy/{deployment}, che mostra:
- Intestazione: bandiera della regione, nome visualizzato (fai clic per rinominarlo; l'URL della pagina e il percorso API cambiano e diventano uno slug del nuovo nome, mentre l'URL dell'endpoint non cambia), badge dello stato, località e dimensioni di CPU e memoria
- Azioni: Aggiorna configurazione, Sostituisci modello e Arresta deployment quando è Pronto; Avvia deployment quando è Arrestato; e un menu Altre azioni (…) con Informazioni, Aggiorna ed Elimina deployment
- Metriche: Richieste HTTP, Tasso di errori HTTP e Latenza P95 HTTP nell'arco di 24 ore, con grafici sparkline, oltre a una scheda che rimanda al modello distribuito
- Schede:
Overview,Monitoring,PredicteLogs - Messaggio di stato: motivo dell'errore, se un deployment non è riuscito
La scheda Overview mostra la mappa della località, la scheda Endpoint con l'URL dell'endpoint copiabile, un link alla documentazione API e un controllo dello stato, oltre a una scheda Informazioni sul deployment con prezzi, regione, CPU e memoria. La scheda Logs mostra le voci di log recenti con filtro per livello di gravità (Tutti / Errori). La scheda Predict offre un pannello di previsione in linea per eseguire test direttamente sul deployment; la scheda dei risultati Docs contiene esempi di codice pronti all'uso in Python, JavaScript e cURL, compilati con l'URL dell'endpoint e, per i proprietari dell'area di lavoro, con la chiave API associata (vedi Monitoraggio). La finestra di dialogo Informazioni elenca le proprietà del deployment e ti consente di modificare i metadati personalizzati.
Aggiornare CPU e memoria#
- Apri la pagina di un endpoint Pronto.
- Fai clic su Aggiorna configurazione.
- Scegli CPU e Memoria e controlla il costo orario visualizzato.
- Fai clic su Aggiorna configurazione. La configurazione attuale continua a fornire il servizio finché la nuova non è pronta.

Le risorse personalizzate vengono fatturate in base al tempo di attività e mantengono attiva un'istanza; ciò può anche mantenere in funzione una telecamera IP senza costi aggiuntivi (vedi Telecamera in background). Tornando alle risorse predefinite si ripristina il comportamento di scale-to-zero e si rimuove la telecamera in background.
I grafici di monitoraggio e le immagini di esempio sono dati leggeri conservati in memoria. Arrestare, riavviare, ridistribuire, ridimensionare o sostituire un modello può cancellarli. Riavviando l'endpoint, la cronologia non viene ripristinata. Salva gli esempi utili in un dataset e attendi il completamento dell'acquisizione prima di modificare l'endpoint. Le metriche operative e i log hanno finestre di cronologia separate.
Sostituire un modello#
Sostituisci il modello associato a un endpoint pronto senza modificarne l'URL:
- Apri la pagina del deployment
- Fai clic su Sostituisci modello
- Seleziona un altro modello completato dalla stessa area di lavoro
- Se vuoi, modifica il nome del deployment
- Fai clic su Sostituisci modello
Il modello attuale continua a fornire il servizio mentre quello sostitutivo si avvia. Quando il modello sostitutivo è pronto, il traffico passa al nuovo modello. L'ID del deployment, l'URL, la regione e la chiave API rimangono invariati; il nome visualizzato cambia solo se ne inserisci uno nuovo. Se la sostituzione non riesce, il modello e il nome precedenti rimangono attivi.
La sostituzione richiede tutte le condizioni seguenti; in caso contrario, viene rifiutata:
- La distribuzione è Pronta e non ci sono altre operazioni del ciclo di vita in corso
- Il modello sostitutivo ha i pesi e appartiene allo stesso workspace della distribuzione
- Il modello sostitutivo non è quello già distribuito
La sostituzione rimuove il modello precedente dalla distribuzione. Ogni endpoint gestisce un solo modello; crea un'altra distribuzione se vuoi rendere disponibili entrambi i modelli contemporaneamente.
Stati della distribuzione#
| Stato | Descrizione |
|---|---|
| In creazione | La distribuzione è in fase di configurazione |
| In distribuzione | Il container è in fase di avvio |
| Pronto | L'endpoint è attivo e accetta richieste |
| In arresto | L'endpoint è in fase di arresto |
| Arrestato | L'endpoint è in pausa e non è disponibile |
| Non riuscito | Distribuzione non riuscita (consulta il messaggio di errore) |
Per una distribuzione Pronta, il badge della pagina mostra In avvio finché l'endpoint non risponde al primo controllo di integrità, e Nessuna risposta se il controllo non riesce.
URL dell'endpoint#
Ogni endpoint ha un URL univoco, ad esempio:
https://predict-<deployment-id>-<hash>-<region>.a.run.app
Fai clic sul pulsante di copia per copiare l'URL. Fai clic su Documentazione API per aprire la documentazione API specifica dell'endpoint. L'endpoint gestisce questi percorsi:
| Percorso | Metodo | Descrizione |
|---|---|---|
/predict | POST | Esegue l'inferenza; richiede la chiave API della distribuzione |
/health | GET | Controllo di attività che riporta lo stato del servizio e il numero di modelli memorizzati nella cache |
/ | GET | Riepilogo dello stato del servizio distribuito |
/docs | GET | Documentazione API interattiva generata per questa distribuzione, questo modello e questa regione |
Gestione del ciclo di vita#
Controlla lo stato del tuo endpoint:
| Azione | Descrizione |
|---|---|
| Avvia | Riattiva un endpoint arrestato |
| Arresta | Metti in pausa l'endpoint |
| Elimina | Rimuovi definitivamente l'endpoint |
Arresta l'endpoint#
Arresta un endpoint quando non vuoi che accetti richieste:
- Fai clic su Arresta distribuzione nella pagina della distribuzione
- Lo stato dell'endpoint diventa "In arresto" e poi "Arrestato"
Gli endpoint arrestati:
- Non accettano richieste e non riportano metriche in tempo reale né lo stato di integrità
- Interrompono l'accumulo degli addebiti per il tempo di attività
- Perdono le statistiche di monitoraggio temporanee e le immagini di esempio quando l'istanza che gestisce le richieste si arresta
- Mantengono l'URL, la regione e la chiave API associata e possono essere riavviati in qualsiasi momento
- Continuano a occupare una quota di distribuzione del tuo piano: elimina un endpoint per liberare il relativo slot
Elimina endpoint#
Rimuovi definitivamente un endpoint:
- Apri Altre azioni (…) nella pagina della distribuzione e fai clic su Elimina distribuzione, oppure fai clic sull'icona del cestino accanto alla distribuzione nella barra laterale
- Conferma con Elimina
L'eliminazione è immediata e permanente: le distribuzioni non vengono spostate nel Cestino. Eliminando l'endpoint, il relativo servizio viene rimosso e si libera uno slot nella quota di distribuzioni. Puoi sempre creare un nuovo endpoint, ma riceverà un nuovo URL.
Le distribuzioni vengono rimosse anche quando il relativo modello o progetto viene eliminato definitivamente, oppure quando un modello o progetto nel cestino raggiunge la fine del periodo di conservazione.
Uso degli endpoint#
Autenticazione#
Ogni distribuzione è associata a una singola chiave API del workspace proprietario del modello. Includila nelle richieste:
Authorization: Bearer YOUR_API_KEYL'endpoint accetta solo la chiave associata al momento della creazione, quindi nessun'altra chiave può accedervi: neanche un'altra chiave attiva dello stesso workspace. Per controllare quale chiave viene associata, distribuisci tramite l'API autenticata con la chiave del proprietario del workspace: verrà associata proprio quella chiave e tu ne sarai già in possesso. Le distribuzioni create in qualsiasi altro modo (tramite l'interfaccia di Platform o una chiamata API autenticata come membro del team) associano automaticamente una delle chiavi attive del workspace proprietario: chiedi al proprietario del workspace il valore della chiave, poiché solo il proprietario può visualizzare i valori delle chiavi (vedi Chiavi API). I membri del team sprovvisti della chiave associata possono comunque eseguire inferenze tramite il proxy di predizione di Platform nel browser.
L'eliminazione o la disattivazione della chiave API associata non revoca l'accesso diretto all'endpoint: chiunque possieda la stringa della chiave può ancora chiamare l'URL dell'endpoint. A non funzionare più è il proxy di predizione di Platform, che verifica la chiave in tempo reale e la segnala come non più disponibile. Per revocare completamente l'accesso, arresta o elimina la distribuzione; dopo aver ruotato le chiavi, crea di nuovo l'endpoint affinché associ la nuova chiave.
Richieste dirette all'endpoint#
Invia le richieste di produzione direttamente all'URL mostrato nella pagina della distribuzione. Queste richieste non passano dal limitatore di frequenza dell'API di Platform, quindi non si applica il limite di 20 richieste al minuto per la predizione. L'endpoint ha comunque un proprio limite di capacità:
- Ogni endpoint è gestito da una singola istanza, che elabora un numero limitato di richieste alla volta
- Le richieste che non possono essere gestite tempestivamente restituiscono
429con un'intestazioneRetry-After - Una singola richiesta può durare fino a 1 ora, consentendo il completamento dell'inferenza video
- I corpi delle richieste sono limitati a 32 MB; i caricamenti più grandi vengono rifiutati con
413 - Le risposte superiori a 1 KB vengono compresse con gzip e sono consentite le richieste del browser tra origini diverse
Esempio di richiesta#
import requests
# Endpoint della distribuzione
url = "https://YOUR_DEPLOYMENT_URL.run.app/predict"
# Intestazioni con la chiave API della distribuzione
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# Parametri di inferenza
data = {"conf": 0.25, "iou": 0.7, "imgsz": 640}
# Invia un'immagine per l'inferenza
with open("image.jpg", "rb") as f:
response = requests.post(url, headers=headers, data=data, files={"file": f})
print(response.json())Parametri della richiesta#
| Parametro | Tipo | Predefinito | Intervallo | Descrizione |
|---|---|---|---|---|
file | file | - | - | File immagine o video (obbligatorio se non è impostato source) |
conf | float | 0.25 | 0.01 – 1.0 | Soglia minima di confidenza |
iou | float | 0.7 | 0.0 – 0.95 | Soglia IoU di NMS |
imgsz | int | - | 32 – 1280 | Dimensione dell'immagine di input in pixel; per impostazione predefinita usa la dimensione di addestramento del modello (640 se non disponibile) |
normalize | bool | false | - | Restituisce le coordinate del riquadro di delimitazione nell'intervallo da 0 a 1 |
decimals | int | 5 | 0 – 10 | Precisione decimale dei valori delle coordinate |
vid_stride | int | 1 | ≥ 1 | Esegue la previsione su un frame video ogni N; viene ignorato per le immagini |
bits | int | 8 | 8, 12, 16 | Quantizzazione della mappa di profondità, solo per i modelli di profondità |
source | stringa | - | - | URL dell'immagine o stringa base64 (in alternativa a file); massimo 4.096 caratteri tramite l'API Platform |
Un endpoint mantiene il runtime di inferenza dell'ultimo rollout, quindi le funzionalità più recenti, come il valore predefinito della dimensione di addestramento imgsz o vid_stride qui sopra, vengono applicate quando viene rilasciata una nuova revisione, ad esempio dopo aver sostituito il modello o modificato la CPU o la memoria. Specifica esplicitamente imgsz per usare una dimensione di input fissa.
Consulta Risposte di profondità per sapere come bits modifica la mappa di profondità restituita e come decodificarla.
Gli endpoint dedicati accettano immagini e video tramite il parametro file.
- Formati immagine (fino a 32 MB per richiesta): AVIF, BMP, DNG, HEIC, HEIF, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WEBP
- Formati video (fino a 32 MB per richiesta): ASF, AVI, GIF, M4V, MKV, MOV, MP4, MPEG, MPG, TS, WEBM, WMV
I risultati vengono restituiti per ogni fotogramma video elaborato; i modelli di profondità accettano solo immagini. Puoi anche passare un URL pubblico di un'immagine o un'immagine codificata in base64 tramite il parametro source invece di file. I caricamenti troppo grandi vengono rifiutati con 413.
Formato della risposta#
Come l'inferenza condivisa, con campi specifici per l'attività.
Domande frequenti#
I limiti degli endpoint dipendono dal piano:
- Free: fino a 3 distribuzioni
- Pro: fino a 10 distribuzioni
- Enterprise: distribuzioni illimitate
Ogni modello può comunque essere distribuito in più regioni entro i limiti della quota del tuo piano. La quota viene conteggiata per il workspace proprietario del modello, quindi i membri del team che distribuiscono un modello condiviso consumano la quota del proprietario. Se raggiungi il limite, viene restituito un errore che ti chiede di eliminare prima una distribuzione esistente.
No, le regioni sono fisse. Per cambiarle:
- Elimina l'endpoint esistente
- Crea un nuovo endpoint nella regione desiderata
Il nuovo endpoint riceve un nuovo URL. Per cambiare solo il modello associato a un endpoint, usa la sostituzione del modello, che mantiene invariato l'URL.
Per una copertura globale:
- Distribuisci in più regioni
- Usa un bilanciatore del carico o un instradamento DNS
- Instrada gli utenti verso l'endpoint più vicino
La durata dell'avvio a freddo dipende dal modello e dal fatto che l'endpoint sia stato ridimensionato a zero; l'avvio da inattività può richiedere fino a circa un minuto e Platform concede a un endpoint inattivo ulteriore tempo per avviarsi prima di segnalarlo come non integro. Aprire la pagina della distribuzione o eseguire di nuovo il controllo di integrità riattiva un endpoint inattivo: fai una delle due cose prima che arrivi un picco di traffico.
No. Ogni distribuzione gestisce il traffico sull'URL dell'endpoint generato, mostrato nella pagina della distribuzione, che rimane stabile per tutta la durata della distribuzione, anche quando sostituisci il modello.