Distribuzione#
Ultralytics Platform offre opzioni di distribuzione dei modelli complete per mettere in produzione i tuoi modelli YOLO. Testa i modelli con l'inferenza basata su browser, distribuisci su endpoint dedicati in 42 regioni globali e monitora le prestazioni in tempo reale.
Watch: Get Started with Ultralytics Platform - Deploy
Panoramica#
La sezione Distribuzione ti aiuta a:
- Testa i modelli direttamente nel browser con la scheda
Predict - Distribuisci su endpoint dedicati in 42 regioni globali
- Monitorare metriche delle richieste, log e controlli di integrità
- Ridurre a zero quando inattivo (le distribuzioni attualmente eseguono una singola istanza attiva)

Opzioni di distribuzione#
Ultralytics Platform offre molteplici percorsi di distribuzione:
| Opzione | Descrizione | Ideale per |
|---|---|---|
| Scheda Predict | Inferenza basata su browser con immagini, webcam ed esempi | Sviluppo, validazione |
| Inferenza condivisa | Servizio multi-tenant in 3 aree geografiche di dati | Uso leggero, test |
| Endpoint dedicati | Servizi single-tenant in 42 regioni | Produzione, bassa latenza |
| Export | Scarica i pesi in 20 formati per runtime locali o edge | Offline, su dispositivo |
Workflow#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Fase | Descrizione |
|---|---|
| Test | Valida il modello con la scheda Predict |
| Configura | Seleziona una regione; il nome del deployment viene generato dal modello e dalla città |
| Deploy | Crea un endpoint dedicato dalla scheda Deploy |
| Monitora | Traccia richieste, latenza, errori e log in Monitoraggio |
Architettura#
Inferenza condivisa#
Il servizio di inferenza condiviso viene eseguito in 3 regioni chiave. Le richieste a un modello vengono instradate al servizio in quella data region del modello, in modo che i risultati rimangano all'interno della regione in cui il modello è memorizzato:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Regione | Etichetta | Posizione | Ideale per |
|---|---|---|---|
| US | Americhe | Iowa, USA | Utenti nelle Americhe, la più veloce per le Americhe |
| EU | Europa, Medio Oriente e Africa | Belgio, Europa | Utenti europei, conformità GDPR |
| AP | Asia Pacifico | Taiwan, Asia-Pacifico | Utenti nell'Asia-Pacifico, latenza APAC più bassa |
Endpoint dedicati#
Distribuisci in 42 regioni in tutto il mondo su Ultralytics Cloud:
- Americhe: 14 regioni
- Europa: 13 regioni
- Asia-Pacifico: 12 regioni
- Medio Oriente e Africa: 3 regioni
Ogni endpoint è un servizio single-tenant con:
- Dimensionamento gestito dalla piattaforma (non configurabile al momento)
- Riduzione a zero quando inattivo
- URL di endpoint univoco con il proprio riferimento API interattivo su
/docs - Associazione di una chiave API dedicata, in modo che solo quella chiave possa chiamare l'endpoint
- Monitoraggio, log e controlli di integrità indipendenti
Pagina Distribuzioni#
Accedi alla pagina delle distribuzioni globali dalla barra laterale sotto Deploy. Questa pagina mostra:
- World map con i pin delle regioni distribuite; fai clic su una regione per aprire la finestra di dialogo
New Deployment - Schede di panoramica: Richieste totali (24h), Distribuzioni attive, Tasso di errore (24h), Latenza P95 (24h)
- Elenco distribuzioni con tre modalità di visualizzazione: schede, compatta e tabella
- Pulsante Nuova distribuzione per creare endpoint da qualsiasi modello completato
- Pulsante Refresh e un timestamp
Updatednell'intestazione della pagina

La pagina si aggiorna automaticamente, eseguendo il polling più frequentemente mentre i deployment si trovano in uno stato transitorio (creating, deploying o stopping). Vedi Monitoring per i dettagli.
Caratteristiche principali#
Copertura globale#
Distribuisci vicino ai tuoi utenti con 42 regioni che coprono:
- Nord America, Sud America
- Europa, Medio Oriente, Africa
- Asia Pacifico, Oceania
Comportamento di scalabilità#
Gli endpoint attualmente si comportano come segue:
- Scale to zero: gli endpoint inattivi si riducono a zero e subiscono un cold-start alla richiesta successiva
- Single active instance: ciascun endpoint attualmente risponde da una singola istanza su tutti i piani
- Load shedding: le richieste ricevono risposte
429quando l'endpoint è temporaneamente a piena capacità — vedi Direct Endpoint Requests - Request timeout: ogni richiesta può durare fino a 1 ora, il che è sufficiente per l'inferenza video
Deployment Regionale#
Usa la latenza misurata della regione per posizionare un endpoint vicino ai suoi chiamanti. La latenza effettiva dell'inferenza dipende dal modello, dalla dimensione dell'input, dallo stato dell'endpoint e dal percorso di rete.
Controlli di integrità#
Ogni distribuzione in esecuzione include un controllo di integrità automatico con:
- Indicatore di stato in tempo reale (sano/non sano)
- Visualizzazione della latenza di risposta
- Nuovo tentativo automatico in caso di malfunzionamento, che si interrompe non appena torna attivo
- Pulsante di aggiornamento manuale
Avvio rapido#
Crea un deployment:
- Addestra o carica un modello in un progetto
- Vai alla scheda Deploy del modello
- Seleziona una regione dalla tabella della latenza
- Fai clic su Deploy e attendi che lo stato del deployment diventi Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyIl nome del deployment viene generato dal nome del modello e dalla città della regione, quindi non è richiesta alcuna fase di denominazione. Una volta effettuato il deployment, usa l'URL dell'endpoint con la tua chiave API per inviare richieste di inferenza da qualsiasi applicazione.
Link rapidi#
- Inferenza: Testa i modelli nel browser
- Endpoint: Distribuisci endpoint dedicati
- Monitoring: Traccia le prestazioni del deployment
FAQ#
Funzionalità Condivisa Dedicata Servizio Condiviso tra gli utenti della Platform Dedicato a un singolo deployment Scala Gestito da Platform Ridimensionamento a zero, un'istanza Regioni 3 regioni di dati Scegli tra 42 regioni di deployment URL API del modello Platform URL dell'endpoint di deployment generato Test Scheda del modello PredictScheda Predictdella scheda di distribuzione o APIRate limits 20 richieste/minuto Nessun limite di frequenza della piattaforma sulle chiamate dirette Auth Qualsiasi chiave API del workspace Solo la chiave API associata al deployment Il deployment rimane nello stato di creazione o distribuzione mentre il servizio si avvia. Diventa utilizzabile quando lo stato passa a Ready; i tempi variano a seconda del modello e della regione e in genere richiedono pochi minuti.
Sì, ogni modello può avere più endpoint in diverse regioni. Il numero di deployment è limitato in base al piano: Free
3, Pro10, Enterpriseunlimited. La quota viene addebitata al workspace proprietario del modello e un endpoint serve esattamente un modello alla volta — usa la sostituzione del modello per sostituirlo senza modificare l'URL.Con lo scale-to-zero abilitato:
- L'endpoint si riduce dopo l'inattività
- La prima richiesta attiva un cold start
- Le richieste successive sono rapide
Le prime richieste dopo un periodo di inattività attivano un cold start. L'apertura della scheda del deployment esegue un controllo dello stato che riscalda l'endpoint, in modo che un test di previsione subito dopo risponda rapidamente.