Distribuzione#
Ultralytics Platform offre complete opzioni di deployment dei modelli per mettere in produzione i tuoi modelli YOLO. Testa i modelli con l'inferenza basata su browser, effettua il deployment su endpoint dedicati in 42 regioni globali e monitora le prestazioni in tempo reale.
Watch: Get Started with Ultralytics Platform - Deploy
Panoramica#
La sezione Distribuzione ti aiuta a:
- Testare i modelli direttamente nel browser con la scheda
Predict - Distribuisci su endpoint dedicati in 42 regioni globali
- Monitorare metriche delle richieste, log e controlli di integrità
- Ridurre a zero quando inattivo (le distribuzioni attualmente eseguono una singola istanza attiva)

Opzioni di distribuzione#
Ultralytics Platform offre molteplici percorsi di distribuzione:
| Opzione | Descrizione | Ideale per |
|---|---|---|
| Scheda Predict | Inferenza basata su browser con immagini, webcam ed esempi | Sviluppo, validazione |
| Inferenza condivisa | Servizio multi-tenant in 3 regioni | Uso leggero, test |
| Endpoint dedicati | Servizi single-tenant in 42 regioni | Produzione, bassa latenza |
Workflow#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Fase | Descrizione |
|---|---|
| Test | Valida il modello con la scheda Predict |
| Configura | Seleziona una regione e verifica il nome del deployment modificabile e generato automaticamente |
| Deploy | Crea un endpoint dedicato dalla scheda Deploy |
| Monitora | Tieni traccia di richieste, latenza, errori e log in Monitoraggio |
Architettura#
Inferenza condivisa#
Il servizio di inferenza condivisa è attivo in 3 regioni chiave, instradando automaticamente le richieste in base alla regione dei tuoi dati:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Regione | Etichetta | Posizione | Ideale per |
|---|---|---|---|
| US | Americhe | Iowa, USA | Utenti nelle Americhe, la più veloce per le Americhe |
| EU | Europa, Medio Oriente e Africa | Belgio, Europa | Utenti europei, conformità GDPR |
| AP | Asia Pacifico | Taiwan, Asia-Pacifico | Utenti nell'Asia-Pacifico, latenza APAC più bassa |
Endpoint dedicati#
Distribuisci in 42 regioni in tutto il mondo su Ultralytics Cloud:
- Americhe: 14 regioni
- Europa: 13 regioni
- Asia-Pacifico: 12 regioni
- Medio Oriente e Africa: 3 regioni
Ogni endpoint è un servizio single-tenant con:
- Risorse predefinite di
1 CPU,2 GiBdi memoria,minInstances=0,maxInstances=1 - Riduzione a zero quando inattivo
- URL endpoint univoco
- Monitoraggio, log e controlli di integrità indipendenti
Pagina Distribuzioni#
Accedi alla pagina delle distribuzioni globali dalla barra laterale sotto Deploy. Questa pagina mostra:
- Mappa del mondo con pin delle regioni distribuite (mappa interattiva)
- Schede di panoramica: Richieste totali (24h), Distribuzioni attive, Tasso di errore (24h), Latenza P95 (24h)
- Elenco distribuzioni con tre modalità di visualizzazione: schede, compatta e tabella
- Pulsante Nuova distribuzione per creare endpoint da qualsiasi modello completato

La pagina esegue il polling ogni 15 secondi normalmente. Quando le distribuzioni sono in uno stato di transizione (creating, deploying o stopping), il polling aumenta a ogni 3 secondi per un feedback più rapido.
Caratteristiche principali#
Copertura globale#
Distribuisci vicino ai tuoi utenti con 42 regioni che coprono:
- Nord America, Sud America
- Europa, Medio Oriente, Africa
- Asia Pacifico, Oceania
Comportamento di scalabilità#
Gli endpoint attualmente si comportano come segue:
- Ridimensionamento a zero:
minInstancesè impostato su0per impostazione predefinita - Singola istanza attiva:
maxInstancesè attualmente limitato a1su tutti i piani
Deployment Regionale#
Usa la latenza misurata della regione per posizionare un endpoint vicino ai suoi chiamanti. La latenza effettiva dell'inferenza dipende dal modello, dalla dimensione dell'input, dallo stato dell'endpoint e dal percorso di rete.
Controlli di integrità#
Ogni distribuzione in esecuzione include un controllo di integrità automatico con:
- Indicatore di stato in tempo reale (sano/non sano)
- Visualizzazione della latenza di risposta
- Riprova automatica quando non è sano (esegue il polling ogni 20 secondi)
- Pulsante di aggiornamento manuale
Avvio rapido#
Crea un deployment:
- Addestra o carica un modello in un progetto
- Vai alla scheda Deploy del modello
- Seleziona una regione dalla tabella della latenza
- Fai clic su Deploy e attendi che lo stato del deployment diventi Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyUna volta distribuito, usa l'URL dell'endpoint con la tua chiave API per inviare richieste di inferenza da qualsiasi applicazione.
Link rapidi#
- Inferenza: Testa i modelli nel browser
- Endpoint: Distribuisci endpoint dedicati
- Monitoraggio: Tieni traccia delle prestazioni di distribuzione
FAQ#
Qual è la differenza tra inferenza condivisa e dedicata?#
| Funzionalità | Condivisa | Dedicata |
|---|---|---|
| Servizio | Condiviso tra gli utenti della Platform | Dedicato a un singolo deployment |
| Scala | Gestito da Platform | Ridimensionamento a zero, un'istanza |
| Regioni | 3 regioni di dati | Scegli tra 42 regioni di deployment |
| URL | API del modello Platform | URL dell'endpoint di deployment generato |
| Test | Scheda Predict del modello | Scheda Predict della scheda di deployment o API |
Quanto tempo richiede il deployment?#
Il deployment rimane in uno stato di creazione o distribuzione mentre il servizio si avvia. Diventa utilizzabile quando lo stato cambia in Ready; i tempi variano a seconda del modello e della regione.
Posso distribuire più modelli?#
Sì, ogni modello può avere più endpoint in diverse regioni. I limiti di deployment variano in base al piano: Free 3, Pro 10, Enterprise unlimited.
Cosa succede quando un endpoint è inattivo?#
Con lo scale-to-zero abilitato:
- L'endpoint si riduce dopo l'inattività
- La prima richiesta attiva un cold start
- Le richieste successive sono rapide
Le prime richieste dopo un periodo di inattività attivano un cold start.