Distribuzione#
Ultralytics Platform offre opzioni complete per il deployment dei modelli per portare i tuoi modelli YOLO in produzione. Testa i modelli con l'inferenza basata su browser, esegui il deployment su endpoint dedicati in 42 regioni globali e monitora le prestazioni in tempo reale.
Watch: Get Started with Ultralytics Platform - Deploy
Panoramica#
La sezione Deployment ti permette di:
- Testare i modelli direttamente nel browser con la scheda
Predict - Eseguire il deployment su endpoint dedicati in 42 regioni globali
- Monitorare le metriche delle richieste, i log e i controlli di integrità
- Ridurre a zero quando inattivi (i deployment attualmente eseguono una singola istanza attiva)

Opzioni di deployment#
Ultralytics Platform offre diversi percorsi di deployment:
| Opzione | Descrizione | Ideale per |
|---|---|---|
| Scheda Predict | Inferenza basata su browser con immagini, webcam ed esempi | Sviluppo, validazione |
| Inferenza condivisa | Servizio multi-tenant distribuito in 3 regioni di dati | Utilizzo leggero, test |
| Endpoint dedicati | Servizi single-tenant in 42 regioni | Produzione, bassa latenza |
| Esportazione | Scarica i pesi in 20 formati per il runtime locale o edge | Offline, sul dispositivo |
Flusso di lavoro#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Fase | Descrizione |
|---|---|
| Test | Valida il modello con la scheda Predict |
| Configura | Seleziona una regione; il nome del deployment viene generato dal modello e dalla città |
| Distribuisci | Crea un endpoint dedicato dalla scheda Deploy |
| Monitora | Tieni traccia di richieste, latenza, errori e log in Monitoring |
Architettura#
Inferenza condivisa#
Il servizio di inferenza condivisa viene eseguito in 3 regioni chiave. Le richieste a un modello vengono instradate al servizio nella regione di dati di quel modello, così i risultati restano all'interno della regione in cui è archiviato il modello:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Regione | Etichetta | Posizione | Ideale per |
|---|---|---|---|
| US | Americhe | Iowa, USA | Utenti delle Americhe, velocità massima per le Americhe |
| EU | Europa, Medio Oriente e Africa | Belgio, Europa | Utenti europei, conformità al GDPR |
| AP | Asia-Pacifico | Taiwan, Asia-Pacifico | Utenti dell'Asia-Pacifico, latenza minima nell'APAC |
Endpoint dedicati#
Esegui il deployment in 42 regioni nel mondo su Ultralytics Cloud:
- Americhe: 14 regioni
- Europa: 13 regioni
- Asia-Pacifico: 12 regioni
- Medio Oriente e Africa: 3 regioni
Ogni endpoint è un servizio single-tenant con:
- Dimensionamento gestito dalla piattaforma (attualmente non configurabile)
- Riduzione a zero quando inattivo
- URL endpoint univoco con un proprio riferimento API interattivo a
/docs - La propria associazione con una chiave API, in modo che solo quella chiave possa chiamare l'endpoint
- Monitoraggio, log e controlli di integrità indipendenti
Pagina dei deployment#
Accedi alla pagina globale dei deployment dalla barra laterale, alla voce Deploy. Questa pagina mostra:
- Mappa del mondo con i pin delle regioni in cui è stato eseguito il deployment; fai clic su una regione per aprire la finestra di dialogo
New Deployment - Schede di panoramica: richieste totali (24 h), deployment attivi, tasso di errore (24 h), latenza P95 (24 h)
- Elenco dei deployment con tre modalità di visualizzazione: schede, compatta e tabella
- Pulsante Nuovo deployment per creare endpoint da qualsiasi modello completato
- Pulsante Aggiorna e un timestamp
Updatednell'intestazione della pagina

La pagina si aggiorna automaticamente, eseguendo il polling più frequentemente mentre i deployment si trovano in uno stato di transizione (creating, deploying o stopping). Per i dettagli, consulta Monitoring.
Funzionalità principali#
Copertura globale#
Esegui il deployment vicino ai tuoi utenti con 42 regioni che coprono:
- Nord America, Sud America
- Europa, Medio Oriente, Africa
- Asia-Pacifico, Oceania
Comportamento del ridimensionamento#
Gli endpoint attualmente si comportano come segue:
- Riduzione a zero: gli endpoint inattivi vengono ridotti a zero e si riavviano a freddo alla richiesta successiva
- Una singola istanza attiva: ogni endpoint attualmente elabora le richieste da una sola istanza su tutti i piani
- Eliminazione del carico: le richieste ricevono risposte
429quando l'endpoint è temporaneamente al limite della capacità — consulta Richieste dirette agli endpoint - Timeout della richiesta: ogni richiesta può essere eseguita per un massimo di 1 ora, un tempo sufficiente per l'inferenza video
Deployment regionale#
Usa la latenza misurata della regione per posizionare un endpoint vicino ai suoi chiamanti. La latenza effettiva dell'inferenza dipende dal modello, dalla dimensione dell'input, dallo stato dell'endpoint e dal percorso di rete.
Controlli di integrità#
Ogni deployment in esecuzione include un controllo automatico di integrità con:
- Indicatore dello stato corrente (integro/non integro)
- Visualizzazione della latenza di risposta
- Nuovo tentativo automatico quando non integro, con arresto una volta ripristinata l'integrità
- Pulsante di aggiornamento manuale
Avvio rapido#
Crea un deployment:
- Addestra o carica un modello in un progetto
- Vai alla scheda Deploy del modello
- Seleziona una regione dalla tabella della latenza
- Fai clic su Deploy e attendi che lo stato del deployment diventi Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyIl nome del deployment viene generato dal nome del modello e dalla città della regione, quindi non è necessario assegnare un nome. Dopo il deployment, usa l'URL dell'endpoint con la tua chiave API per inviare richieste di inferenza da qualsiasi applicazione.
Link rapidi#
- Inferenza: testa i modelli nel browser
- Endpoint: esegui il deployment di endpoint dedicati
- Monitoraggio: monitora le prestazioni della distribuzione
FAQ#
Caratteristica Condivisa Dedicata Servizio Condiviso tra gli utenti della piattaforma Dedicato a un deployment Ridimensionamento Gestito dalla piattaforma Riduzione a zero, una singola istanza Regioni 3 regioni di dati Scegli tra 42 regioni di deployment URL API del modello della piattaforma URL dell'endpoint di deployment generato Test Scheda Predictdel modelloScheda Predictnella scheda del deployment o APILimiti di frequenza 20 richieste/minuto Nessun limite di frequenza della piattaforma sulle chiamate dirette Autenticazione Qualsiasi chiave API dell'area di lavoro Solo la chiave API associata al deployment Il deployment rimane nello stato di creazione o di deployment mentre il servizio si avvia. Diventa utilizzabile quando lo stato passa a Ready; i tempi variano in base al modello e alla regione e in genere richiedono alcuni minuti.
Sì, ogni modello può avere più endpoint in regioni diverse. Il numero di deployment è limitato dal piano: Free
3, Pro10, Enterpriseunlimited. La quota viene addebitata al workspace che possiede il modello e un endpoint serve esattamente un modello alla volta: usa la sostituzione del modello per sostituirlo senza modificare l'URL.Con la funzionalità scale-to-zero abilitata:
- L'endpoint si riduce dopo un periodo di inattività
- La prima richiesta attiva un cold start
- Le richieste successive sono rapide
Le prime richieste dopo un periodo di inattività attivano un cold start. L'apertura della scheda del deployment esegue un controllo dello stato che riscalda l'endpoint, quindi una previsione di test subito dopo risponde rapidamente.