Ultralytics YOLO27:

Analisi comparativa delle opzioni di deployment di YOLO26#

YOLO26 supporta più di 20 opzioni di deployment, ciascuna ottimizzata per un runtime, un target hardware o una piattaforma diversa — da PyTorch e ONNX a TensorRT, OpenVINO, CoreML e formati dedicati per edge NPU. La scelta giusta richiede un equilibrio tra velocità di inferenza, vincoli hardware e facilità di integrazione. Questa guida confronta ogni opzione, così puoi scegliere quella più adatta alla tua applicazione e poi passare alle best practice per il deployment dei modelli per eseguire il deployment in modo affidabile.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Il deployment è la fase del workflow di un progetto di computer vision in cui un modello addestrato inizia a svolgere il lavoro reale, quindi il formato in cui lo esporti influisce direttamente su velocità, costi e portabilità.

Come selezionare l'opzione di deployment giusta per il tuo modello YOLO26#

Quando è il momento di eseguire il deployment del tuo modello YOLO26, selezionare un formato di esportazione adatto è molto importante. Come illustrato nella documentazione sull'esportazione di Ultralytics YOLO26, la funzione model.export() converte il modello addestrato in diversi formati, pensati per ambienti e requisiti di prestazioni differenti.

Il formato ideale dipende dal contesto operativo previsto per il modello e dall'hardware.

Salta l'esportazione manuale

Per un deployment gestito senza esportazione manuale, Ultralytics Platform offre endpoint di inferenza pronti all'uso con auto-scaling in 42 regioni globali.

Opzioni di deployment di YOLO26#

Ecco una breve descrizione di ogni formato e dei casi in cui utilizzarlo. Per la procedura completa di esportazione, consulta la documentazione sull'esportazione; per i criteri di confronto affiancati, vai alla tabella comparativa.

  • PyTorch (.pt): il formato nativo per l'addestramento e l'inferenza, che offre la massima flessibilità e l'accelerazione GPU tramite NVIDIA CUDA o AMD ROCm — ideale per ricerca e prototipazione, senza bisogno di un passaggio di esportazione.
  • TorchScript (torchscript): serializza il modello per un runtime C++ senza Python, adatto ai sistemi di produzione in cui Python non è disponibile.
  • ONNX (onnx): un formato di interscambio indipendente dal framework, con ampio supporto multipiattaforma e hardware tramite ONNX Runtime.
  • OpenVINO (openvino): il toolkit di Intel per l'inferenza ottimizzata su CPU Intel, GPU integrate e NPU, comune nell'IoT e nell'edge computing.
  • TensorRT (engine): il runtime ad alte prestazioni di NVIDIA, che offre un'inferenza GPU di livello superiore con ottimizzazione FP16 e INT8.
  • CoreML (coreml): il formato on-device di Apple per iOS, macOS, watchOS e tvOS, che utilizza l'Apple Neural Engine.
  • TF SavedModel (saved_model): il formato standard di TensorFlow per il serving scalabile lato server con TensorFlow Serving.
  • TF GraphDef (pb): un formato TensorFlow a grafo statico congelato per gli ambienti che richiedono un grafo computazionale fisso.
  • TF Edge TPU (edgetpu): compila i modelli .tflite per gli acceleratori Google Coral Edge TPU.
  • LiteRT (litert): il runtime on-device di Google (in precedenza TensorFlow Lite) per l'inferenza su dispositivi mobili, sistemi embedded e browser a partire da un singolo modello .tflite, con supporto per FP32 e INT8 ed esecuzione nel browser tramite LiteRT.js.
  • PaddlePaddle (paddle): il framework di deep learning di Baidu, diffuso in Cina, con ampio supporto hardware.
  • MNN (mnn): un motore di inferenza leggero e ad alte prestazioni, ottimizzato per sistemi ARM e x86-64 mobili ed embedded.
  • NCNN (ncnn): un framework di inferenza leggero e ad alte prestazioni, ottimizzato per dispositivi mobili ARM.
  • Sony IMX500 (imx): esporta i modelli per il sensore di visione intelligente Sony IMX500 con elaborazione on-chip, come la Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): è destinato alle NPU Rockchip su schede embedded, con quantizzazione FP16 e INT8.
  • ExecuTorch (executorch): il runtime on-device nativo di PyTorch per dispositivi mobili (iOS e Android) e sistemi embedded tramite XNNPACK.
  • Axelera AI (axelera): compila per l'AIPU Metis di Axelera (fino a 856 TOPS) tramite PCIe o M.2, per un'inferenza edge ad alto throughput.
  • DEEPX (deepx): è destinato all'hardware NPU DEEPX, con quantizzazione INT8 per l'inferenza edge embedded.
  • Qualcomm QNN (qnn): inferenza on-device su NPU Hexagon, GPU Adreno e CPU Snapdragon tramite lo stack Qualcomm AI.
  • Core AI (coreai): il nuovo formato .aimodel di Apple per iOS 27 e macOS 27, pianificato su CPU, GPU e Apple Neural Engine; l'esportazione richiede macOS 26 o versioni successive su Apple silicon.

L'integrazione Hailo esporta direttamente i modelli YOLO per rilevamento, segmentazione, segmentazione semantica, stima della profondità, classificazione, posa e OBB in Hailo HEF; consulta la relativa tabella di compatibilità per i modelli e i target convalidati. L'integrazione Ambarella segue un workflow ONNX-first e compila le esportazioni ONNX nel formato AmbaPB con la toolchain CVflow di Ambarella per SoC CVflow® come CV72, utilizzando facoltativamente l'addestramento consapevole della compressione SpongeTorch. L'integrazione Huawei Ascend compila le esportazioni ONNX nel formato offline .om con il compilatore CANN ATC per l'inferenza FP16 sui processori AI Ascend.

Confronto tra le opzioni di deployment#

La tabella seguente riassume le opzioni di deployment per i modelli YOLO26 secondo i criteri che generalmente guidano la scelta. Per un'analisi approfondita di ogni formato, consulta la documentazione sui formati di esportazione.

Opzione di deploymentBenchmark delle prestazioniCompatibilità e integrazioneSupporto della community ed ecosistemaCasi di studioManutenzione e aggiornamentiConsiderazioni sulla sicurezzaAccelerazione hardware
PyTorchBuona flessibilità; può sacrificare le prestazioni grezzeEccellente con le librerie PythonAmpie risorse e communityRicerca e prototipiSviluppo regolare e attivoDipende dall'ambiente di deploymentSupporto CUDA per l'accelerazione GPU
TorchScriptPiù adatto alla produzione rispetto a PyTorchTransizione fluida da PyTorch a C++Specializzato, ma più limitato rispetto a PyTorchSettori in cui Python rappresenta un collo di bottigliaAggiornamenti coerenti con PyTorchSicurezza migliorata senza Python completoEredita il supporto CUDA da PyTorch
ONNXVariabile a seconda del runtimeElevata tra framework diversiAmpio ecosistema, supportato da numerose organizzazioniFlessibilità tra framework di MLAggiornamenti regolari per le nuove operazioniAssicurati di adottare pratiche sicure di conversione e deploymentDiverse ottimizzazioni hardware
OpenVINOOttimizzato per l'hardware IntelIdeale nell'ecosistema IntelSolido nel settore della computer visionIoT ed edge con hardware IntelAggiornamenti regolari per l'hardware IntelFunzionalità robuste per applicazioni sensibiliOttimizzato per l'hardware Intel
TensorRTDi livello superiore sulle GPU NVIDIAIdeale per l'hardware NVIDIARete solida attraverso NVIDIAInferenza video e immagini in tempo realeAggiornamenti frequenti per le nuove GPUParticolare attenzione alla sicurezzaProgettato per le GPU NVIDIA
CoreMLOttimizzato per l'hardware Apple on-deviceEsclusivo dell'ecosistema AppleSolido supporto da parte di Apple e degli sviluppatoriML on-device sui prodotti AppleAggiornamenti regolari di AppleFocus su privacy e sicurezzaApple Neural Engine e GPU
TF SavedModelScalabile negli ambienti serverAmpia compatibilità nell'ecosistema TensorFlowAmpio supporto grazie alla popolarità di TensorFlowServing dei modelli su larga scalaAggiornamenti regolari da Google e dalla communityFunzionalità robuste per le aziendeDiverse forme di accelerazione hardware
TF GraphDefStabile per i grafi computazionali staticiSi integra bene con l'infrastruttura TensorFlowRisorse per ottimizzare i grafi staticiScenari che richiedono grafi staticiAggiornamenti insieme al core di TensorFlowPratiche di sicurezza TensorFlow consolidateOpzioni di accelerazione TensorFlow
TF Edge TPUOttimizzato per l'hardware Edge TPU di GoogleEsclusivo per i dispositivi Edge TPUIn crescita grazie alle risorse di Google e di terze partiDispositivi IoT che richiedono elaborazione in tempo realeMiglioramenti per il nuovo hardware Edge TPUSolida sicurezza IoT di GoogleProgettato su misura per Google Coral
LiteRTVelocità ed efficienza su dispositivi mobili, sistemi embedded e webSupporto per dispositivi mobili, sistemi embedded, edge e browserComunità solida, supportata da GoogleApp sul dispositivo per Android, iOS e webFunzionalità più recenti del runtime sul dispositivoInferenza sicura sul dispositivo e nel browserAccelerazione tramite GPU, DSP e WebGPU
PaddlePaddleCompetitivo, facile da usare e scalabileEcosistema Baidu, ampio supporto per le applicazioniIn rapida crescita, soprattutto in CinaMercato cinese ed elaborazione del linguaggioFocus sulle applicazioni di AI cinesiDà priorità alla privacy e alla sicurezza dei datiInclude i chip Kunlun di Baidu
MNNElevate prestazioni sui dispositivi mobiliSistemi ARM mobili ed embedded e CPU X86-64Comunità ML mobile/embeddedEfficienza dei sistemi mobiliManutenzione delle elevate prestazioni sui dispositivi mobiliVantaggi della sicurezza sul dispositivoOttimizzazioni per CPU e GPU ARM
NCNNOttimizzato per i dispositivi mobili basati su ARMSistemi ARM mobili ed embeddedComunità ML mobile/embedded di nicchia ma attivaEfficienza su sistemi Android e ARMManutenzione delle elevate prestazioni su ARMVantaggi della sicurezza sul dispositivoOttimizzazioni per CPU e GPU ARM
Sony IMX500Inferenza sul sensore con consumi energetici molto bassiSensore Sony IMX500, Raspberry Pi AI CameraEcosistema Sony AITRIOSAI edge direttamente sulla fotocameraAggiornamenti dell'SDK Sony e della toolchain MCTI dati restano sul sensoreAcceleratore integrato nel chip Sony IMX500
Rockchip RKNNOttimizzato per le NPU RockchipSchede SoC Rockchip (ad es. RK3588)Comunità di sviluppatori RockchipDispositivi SBC embedded ed edgeAggiornamenti di Rockchip RKNN-ToolkitInferenza locale sul dispositivoNPU Rockchip
ExecuTorchRuntime PyTorch efficiente sul dispositivoiOS, Android e sistemi embedded tramite XNNPACKSupportato dal progetto PyTorchApp mobili ed embeddedMantenuto insieme a PyTorchL'inferenza sul dispositivo mantiene i dati in localeBackend XNNPACK e CPU/GPU mobili
Axelera AIThroughput molto elevato (fino a 856 TOPS)Metis AIPU tramite PCIe o M.2SDK Axelera VoyagerInferenza edge ad alto throughputAggiornamenti dell'SDK AxeleraInferenza edge on-premiseAxelera Metis AIPU
DEEPXInferenza NPU ottimizzata per INT8Hardware NPU DEEPXStrumenti per sviluppatori DEEPX (dx_com, dx_engine)Inferenza edge embeddedAggiornamenti dell'SDK e del runtime DEEPXInferenza locale sul dispositivoNPU DEEPX
Qualcomm QNNInferenza rapida sul dispositivo con SnapdragonNPU Snapdragon Hexagon, GPU Adreno, CPUEcosistema Qualcomm AI HubDispositivi Snapdragon mobili ed edgeAggiornamenti dello stack AI Qualcomm (QAIRT)L'inferenza sul dispositivo mantiene i dati in localeNPU Snapdragon Hexagon
HailoInferenza INT8 HEF su NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler e HailoRTTelecamere, robot, sistemi edge industrialiRilasci di Hailo DFC e HailoRTInferenza locale sul dispositivoNPU Hailo
Huawei AscendMaggiore throughput su Ascend AI CoreSchede Atlas e OrangePi AIProEcosistema Huawei CANNInferenza edge su NPU AscendRilasci di CANN e ATCInferenza locale sul dispositivoAscend AI Core
Core AIOttimizzato per Apple siliconiOS 27 e macOS 27; l'esportazione richiede macOS 26+Framework Apple; non ancora disponibile negli SDK iOS/FlutterML su dispositivo su piattaforme Apple di prossima generazioneLegato alle versioni dei sistemi operativi Apple; attualmente in versione betaL'inferenza sul dispositivo mantiene i dati in localeApple Neural Engine, GPU e CPU

Questo confronto offre una panoramica generale. Per la distribuzione, valuta i requisiti e i vincoli specifici del tuo progetto rispetto a ciascuna opzione e consulta la guida all'integrazione collegata per il formato che scegli.

Conclusioni#

L'ampia gamma di formati di esportazione di YOLO26 ti consente di adattare un modello a quasi qualsiasi ambiente, da un server cloud con GPU a una fotocamera edge con inferenza sul sensore. Dopo aver scelto un formato, segui le best practice per la distribuzione dei modelli per ottimizzazione, risoluzione dei problemi e sicurezza, e affidati alla comunità Ultralytics quando incontri difficoltà.

FAQ#

  • Ultralytics YOLO26 supporta diversi formati di distribuzione, ciascuno progettato per ambienti e piattaforme hardware specifici. I formati principali includono:

    • PyTorch per ricerca e prototipazione, con un'eccellente integrazione con Python.
    • TorchScript per gli ambienti di produzione in cui Python non è disponibile.
    • ONNX per la compatibilità multipiattaforma e l'accelerazione hardware.
    • OpenVINO per prestazioni ottimizzate sull'hardware Intel.
    • TensorRT per l'inferenza ad alta velocità sulle GPU NVIDIA.

    Ogni formato offre vantaggi unici. Per una guida dettagliata, consulta la nostra documentazione sul processo di esportazione.

  • Per aumentare la velocità di inferenza sulle CPU Intel, puoi distribuire il tuo modello YOLO26 utilizzando il toolkit OpenVINO di Intel. OpenVINO offre notevoli miglioramenti delle prestazioni ottimizzando i modelli per sfruttare in modo efficiente l'hardware Intel.

    1. Converti il tuo modello YOLO26 nel formato OpenVINO utilizzando la funzione model.export().
    2. Segui la guida dettagliata alla configurazione nella documentazione sull'esportazione Intel OpenVINO.

    Per ulteriori informazioni, consulta il nostro articolo sul blog.

  • Sì, i modelli YOLO26 possono essere distribuiti su dispositivi mobili utilizzando LiteRT (precedentemente TensorFlow Lite) e NCNN per Android, nonché CoreML o LiteRT per iOS. LiteRT è il runtime on-device di Google per dispositivi mobili ed embedded e consente di eseguire lo stesso modello su Android, iOS e browser, fornendo un'inferenza on-device efficiente.

    Esempio
    # Export command for NCNN format
    model.export(format="ncnn")

    Per ulteriori dettagli sulla distribuzione dei modelli su dispositivi mobili, consulta la nostra guida all'integrazione di LiteRT.

  • Quando scegli un formato di distribuzione per YOLO26, considera i seguenti fattori:

    • Prestazioni: alcuni formati, come TensorRT, offrono velocità eccezionali sulle GPU NVIDIA, mentre OpenVINO è ottimizzato per l'hardware Intel.
    • Compatibilità: ONNX offre un'ampia compatibilità tra piattaforme diverse.
    • Facilità di integrazione: formati come CoreML o LiteRT sono progettati per ecosistemi specifici, come rispettivamente iOS e Android.
    • Supporto della community: formati come PyTorch e TensorFlow dispongono di numerose risorse e di un ampio supporto della community.

    Per un'analisi comparativa, consulta la nostra documentazione sui formati di esportazione.

  • Per distribuire i modelli YOLO26 in un'applicazione web, puoi utilizzare LiteRT.js, il runtime web di LiteRT, che consente di eseguire modelli di apprendimento automatico direttamente nel browser e in Node.js. Questo approccio elimina la necessità di un'infrastruttura backend e offre prestazioni in tempo reale.

    1. Esporta il modello YOLO26 nel formato LiteRT.
    2. Integra il modello esportato nella tua applicazione web utilizzando LiteRT.js.

    Per istruzioni dettagliate passo dopo passo, consulta la nostra guida all'integrazione di LiteRT.

Commenti