Sicurezza pronta per le aziende: Conforme a ISO 27001 + SOC 2 Type I.

Distribuzione#

Ultralytics Platform offre complete opzioni di deployment dei modelli per mettere in produzione i tuoi modelli YOLO. Testa i modelli con l'inferenza basata su browser, effettua il deployment su endpoint dedicati in 42 regioni globali e monitora le prestazioni in tempo reale.



Watch: Get Started with Ultralytics Platform - Deploy

Panoramica#

La sezione Distribuzione ti aiuta a:

  • Testare i modelli direttamente nel browser con la scheda Predict
  • Distribuisci su endpoint dedicati in 42 regioni globali
  • Monitorare metriche delle richieste, log e controlli di integrità
  • Ridurre a zero quando inattivo (le distribuzioni attualmente eseguono una singola istanza attiva)

Ultralytics Platform Deploy Page World Map With Overview Cards

Opzioni di distribuzione#

Ultralytics Platform offre molteplici percorsi di distribuzione:

OpzioneDescrizioneIdeale per
Scheda PredictInferenza basata su browser con immagini, webcam ed esempiSviluppo, validazione
Inferenza condivisaServizio multi-tenant in 3 regioniUso leggero, test
Endpoint dedicatiServizi single-tenant in 42 regioniProduzione, bassa latenza

Workflow#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
FaseDescrizione
TestValida il modello con la scheda Predict
ConfiguraSeleziona una regione e verifica il nome del deployment modificabile e generato automaticamente
DeployCrea un endpoint dedicato dalla scheda Deploy
MonitoraTieni traccia di richieste, latenza, errori e log in Monitoraggio

Architettura#

Inferenza condivisa#

Il servizio di inferenza condivisa è attivo in 3 regioni chiave, instradando automaticamente le richieste in base alla regione dei tuoi dati:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Region Router}:::decide
    Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegioneEtichettaPosizioneIdeale per
USAmericheIowa, USAUtenti nelle Americhe, la più veloce per le Americhe
EUEuropa, Medio Oriente e AfricaBelgio, EuropaUtenti europei, conformità GDPR
APAsia PacificoTaiwan, Asia-PacificoUtenti nell'Asia-Pacifico, latenza APAC più bassa

Endpoint dedicati#

Distribuisci in 42 regioni in tutto il mondo su Ultralytics Cloud:

  • Americhe: 14 regioni
  • Europa: 13 regioni
  • Asia-Pacifico: 12 regioni
  • Medio Oriente e Africa: 3 regioni

Ogni endpoint è un servizio single-tenant con:

  • Risorse predefinite di 1 CPU, 2 GiB di memoria, minInstances=0, maxInstances=1
  • Riduzione a zero quando inattivo
  • URL endpoint univoco
  • Monitoraggio, log e controlli di integrità indipendenti

Pagina Distribuzioni#

Accedi alla pagina delle distribuzioni globali dalla barra laterale sotto Deploy. Questa pagina mostra:

  • Mappa del mondo con pin delle regioni distribuite (mappa interattiva)
  • Schede di panoramica: Richieste totali (24h), Distribuzioni attive, Tasso di errore (24h), Latenza P95 (24h)
  • Elenco distribuzioni con tre modalità di visualizzazione: schede, compatta e tabella
  • Pulsante Nuova distribuzione per creare endpoint da qualsiasi modello completato

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Polling automatico

La pagina esegue il polling ogni 15 secondi normalmente. Quando le distribuzioni sono in uno stato di transizione (creating, deploying o stopping), il polling aumenta a ogni 3 secondi per un feedback più rapido.

Caratteristiche principali#

Copertura globale#

Distribuisci vicino ai tuoi utenti con 42 regioni che coprono:

  • Nord America, Sud America
  • Europa, Medio Oriente, Africa
  • Asia Pacifico, Oceania

Comportamento di scalabilità#

Gli endpoint attualmente si comportano come segue:

  • Ridimensionamento a zero: minInstances è impostato su 0 per impostazione predefinita
  • Singola istanza attiva: maxInstances è attualmente limitato a 1 su tutti i piani

Deployment Regionale#

Usa la latenza misurata della regione per posizionare un endpoint vicino ai suoi chiamanti. La latenza effettiva dell'inferenza dipende dal modello, dalla dimensione dell'input, dallo stato dell'endpoint e dal percorso di rete.

Controlli di integrità#

Ogni distribuzione in esecuzione include un controllo di integrità automatico con:

  • Indicatore di stato in tempo reale (sano/non sano)
  • Visualizzazione della latenza di risposta
  • Riprova automatica quando non è sano (esegue il polling ogni 20 secondi)
  • Pulsante di aggiornamento manuale

Avvio rapido#

Crea un deployment:

  1. Addestra o carica un modello in un progetto
  2. Vai alla scheda Deploy del modello
  3. Seleziona una regione dalla tabella della latenza
  4. Fai clic su Deploy e attendi che lo stato del deployment diventi Ready
Distribuzione rapida
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Una volta distribuito, usa l'URL dell'endpoint con la tua chiave API per inviare richieste di inferenza da qualsiasi applicazione.

FAQ#

Qual è la differenza tra inferenza condivisa e dedicata?#

FunzionalitàCondivisaDedicata
ServizioCondiviso tra gli utenti della PlatformDedicato a un singolo deployment
ScalaGestito da PlatformRidimensionamento a zero, un'istanza
Regioni3 regioni di datiScegli tra 42 regioni di deployment
URLAPI del modello PlatformURL dell'endpoint di deployment generato
TestScheda Predict del modelloScheda Predict della scheda di deployment o API

Quanto tempo richiede il deployment?#

Il deployment rimane in uno stato di creazione o distribuzione mentre il servizio si avvia. Diventa utilizzabile quando lo stato cambia in Ready; i tempi variano a seconda del modello e della regione.

Posso distribuire più modelli?#

Sì, ogni modello può avere più endpoint in diverse regioni. I limiti di deployment variano in base al piano: Free 3, Pro 10, Enterprise unlimited.

Cosa succede quando un endpoint è inattivo?#

Con lo scale-to-zero abilitato:

  • L'endpoint si riduce dopo l'inattività
  • La prima richiesta attiva un cold start
  • Le richieste successive sono rapide

Le prime richieste dopo un periodo di inattività attivano un cold start.

Commenti