YOLO Vision 2026:

Distribuzione#

Ultralytics Platform offre opzioni complete per il deployment dei modelli per portare i tuoi modelli YOLO in produzione. Testa i modelli con l'inferenza basata su browser, esegui il deployment su endpoint dedicati in 42 regioni globali e monitora le prestazioni in tempo reale.



Watch: Get Started with Ultralytics Platform - Deploy

Panoramica#

La sezione Deployment ti permette di:

  • Testare i modelli direttamente nel browser con la scheda Predict
  • Eseguire il deployment su endpoint dedicati in 42 regioni globali
  • Monitorare le metriche delle richieste, i log e i controlli di integrità
  • Ridurre a zero quando inattivi (i deployment attualmente eseguono una singola istanza attiva)

Pagina Deploy di Ultralytics Platform con mappa del mondo e schede di panoramica

Opzioni di deployment#

Ultralytics Platform offre diversi percorsi di deployment:

OpzioneDescrizioneIdeale per
Scheda PredictInferenza basata su browser con immagini, webcam ed esempiSviluppo, validazione
Inferenza condivisaServizio multi-tenant distribuito in 3 regioni di datiUtilizzo leggero, test
Endpoint dedicatiServizi single-tenant in 42 regioniProduzione, bassa latenza
EsportazioneScarica i pesi in 20 formati per il runtime locale o edgeOffline, sul dispositivo

Flusso di lavoro#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
FaseDescrizione
TestValida il modello con la scheda Predict
ConfiguraSeleziona una regione; il nome del deployment viene generato dal modello e dalla città
DistribuisciCrea un endpoint dedicato dalla scheda Deploy
MonitoraTieni traccia di richieste, latenza, errori e log in Monitoring

Architettura#

Inferenza condivisa#

Il servizio di inferenza condivisa viene eseguito in 3 regioni chiave. Le richieste a un modello vengono instradate al servizio nella regione di dati di quel modello, così i risultati restano all'interno della regione in cui è archiviato il modello:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegioneEtichettaPosizioneIdeale per
USAmericheIowa, USAUtenti delle Americhe, velocità massima per le Americhe
EUEuropa, Medio Oriente e AfricaBelgio, EuropaUtenti europei, conformità al GDPR
APAsia-PacificoTaiwan, Asia-PacificoUtenti dell'Asia-Pacifico, latenza minima nell'APAC

Endpoint dedicati#

Esegui il deployment in 42 regioni nel mondo su Ultralytics Cloud:

  • Americhe: 14 regioni
  • Europa: 13 regioni
  • Asia-Pacifico: 12 regioni
  • Medio Oriente e Africa: 3 regioni

Ogni endpoint è un servizio single-tenant con:

  • Dimensionamento gestito dalla piattaforma (attualmente non configurabile)
  • Riduzione a zero quando inattivo
  • URL endpoint univoco con un proprio riferimento API interattivo a /docs
  • La propria associazione con una chiave API, in modo che solo quella chiave possa chiamare l'endpoint
  • Monitoraggio, log e controlli di integrità indipendenti

Pagina dei deployment#

Accedi alla pagina globale dei deployment dalla barra laterale, alla voce Deploy. Questa pagina mostra:

  • Mappa del mondo con i pin delle regioni in cui è stato eseguito il deployment; fai clic su una regione per aprire la finestra di dialogo New Deployment
  • Schede di panoramica: richieste totali (24 h), deployment attivi, tasso di errore (24 h), latenza P95 (24 h)
  • Elenco dei deployment con tre modalità di visualizzazione: schede, compatta e tabella
  • Pulsante Nuovo deployment per creare endpoint da qualsiasi modello completato
  • Pulsante Aggiorna e un timestamp Updated nell'intestazione della pagina

Schede di panoramica e lista dei deployment nella pagina Deploy di Ultralytics Platform

Polling automatico

La pagina si aggiorna automaticamente, eseguendo il polling più frequentemente mentre i deployment si trovano in uno stato di transizione (creating, deploying o stopping). Per i dettagli, consulta Monitoring.

Funzionalità principali#

Copertura globale#

Esegui il deployment vicino ai tuoi utenti con 42 regioni che coprono:

  • Nord America, Sud America
  • Europa, Medio Oriente, Africa
  • Asia-Pacifico, Oceania

Comportamento del ridimensionamento#

Gli endpoint attualmente si comportano come segue:

  • Riduzione a zero: gli endpoint inattivi vengono ridotti a zero e si riavviano a freddo alla richiesta successiva
  • Una singola istanza attiva: ogni endpoint attualmente elabora le richieste da una sola istanza su tutti i piani
  • Eliminazione del carico: le richieste ricevono risposte 429 quando l'endpoint è temporaneamente al limite della capacità — consulta Richieste dirette agli endpoint
  • Timeout della richiesta: ogni richiesta può essere eseguita per un massimo di 1 ora, un tempo sufficiente per l'inferenza video

Deployment regionale#

Usa la latenza misurata della regione per posizionare un endpoint vicino ai suoi chiamanti. La latenza effettiva dell'inferenza dipende dal modello, dalla dimensione dell'input, dallo stato dell'endpoint e dal percorso di rete.

Controlli di integrità#

Ogni deployment in esecuzione include un controllo automatico di integrità con:

  • Indicatore dello stato corrente (integro/non integro)
  • Visualizzazione della latenza di risposta
  • Nuovo tentativo automatico quando non integro, con arresto una volta ripristinata l'integrità
  • Pulsante di aggiornamento manuale

Avvio rapido#

Crea un deployment:

  1. Addestra o carica un modello in un progetto
  2. Vai alla scheda Deploy del modello
  3. Seleziona una regione dalla tabella della latenza
  4. Fai clic su Deploy e attendi che lo stato del deployment diventi Ready
Deployment rapido
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Il nome del deployment viene generato dal nome del modello e dalla città della regione, quindi non è necessario assegnare un nome. Dopo il deployment, usa l'URL dell'endpoint con la tua chiave API per inviare richieste di inferenza da qualsiasi applicazione.

  • Inferenza: testa i modelli nel browser
  • Endpoint: esegui il deployment di endpoint dedicati
  • Monitoraggio: monitora le prestazioni della distribuzione

FAQ#

  • CaratteristicaCondivisaDedicata
    ServizioCondiviso tra gli utenti della piattaformaDedicato a un deployment
    RidimensionamentoGestito dalla piattaformaRiduzione a zero, una singola istanza
    Regioni3 regioni di datiScegli tra 42 regioni di deployment
    URLAPI del modello della piattaformaURL dell'endpoint di deployment generato
    TestScheda Predict del modelloScheda Predict nella scheda del deployment o API
    Limiti di frequenza20 richieste/minutoNessun limite di frequenza della piattaforma sulle chiamate dirette
    AutenticazioneQualsiasi chiave API dell'area di lavoroSolo la chiave API associata al deployment
  • Il deployment rimane nello stato di creazione o di deployment mentre il servizio si avvia. Diventa utilizzabile quando lo stato passa a Ready; i tempi variano in base al modello e alla regione e in genere richiedono alcuni minuti.

  • Sì, ogni modello può avere più endpoint in regioni diverse. Il numero di deployment è limitato dal piano: Free 3, Pro 10, Enterprise unlimited. La quota viene addebitata al workspace che possiede il modello e un endpoint serve esattamente un modello alla volta: usa la sostituzione del modello per sostituirlo senza modificare l'URL.

  • Con la funzionalità scale-to-zero abilitata:

    • L'endpoint si riduce dopo un periodo di inattività
    • La prima richiesta attiva un cold start
    • Le richieste successive sono rapide

    Le prime richieste dopo un periodo di inattività attivano un cold start. L'apertura della scheda del deployment esegue un controllo dello stato che riscalda l'endpoint, quindi una previsione di test subito dopo risponde rapidamente.

Commenti