Analisi comparativa delle opzioni di deployment di YOLO26#
YOLO26 supporta più di 20 opzioni di deployment, ciascuna ottimizzata per un runtime, un target hardware o una piattaforma diversa — da PyTorch e ONNX a TensorRT, OpenVINO, CoreML e formati dedicati per edge NPU. La scelta giusta richiede un equilibrio tra velocità di inferenza, vincoli hardware e facilità di integrazione. Questa guida confronta ogni opzione, così puoi scegliere quella più adatta alla tua applicazione e poi passare alle best practice per il deployment dei modelli per eseguire il deployment in modo affidabile.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
Il deployment è la fase del workflow di un progetto di computer vision in cui un modello addestrato inizia a svolgere il lavoro reale, quindi il formato in cui lo esporti influisce direttamente su velocità, costi e portabilità.
Come selezionare l'opzione di deployment giusta per il tuo modello YOLO26#
Quando è il momento di eseguire il deployment del tuo modello YOLO26, selezionare un formato di esportazione adatto è molto importante. Come illustrato nella documentazione sull'esportazione di Ultralytics YOLO26, la funzione model.export() converte il modello addestrato in diversi formati, pensati per ambienti e requisiti di prestazioni differenti.
Il formato ideale dipende dal contesto operativo previsto per il modello e dall'hardware.
Per un deployment gestito senza esportazione manuale, Ultralytics Platform offre endpoint di inferenza pronti all'uso con auto-scaling in 42 regioni globali.
Opzioni di deployment di YOLO26#
Ecco una breve descrizione di ogni formato e dei casi in cui utilizzarlo. Per la procedura completa di esportazione, consulta la documentazione sull'esportazione; per i criteri di confronto affiancati, vai alla tabella comparativa.
- PyTorch (
.pt): il formato nativo per l'addestramento e l'inferenza, che offre la massima flessibilità e l'accelerazione GPU tramite NVIDIA CUDA o AMD ROCm — ideale per ricerca e prototipazione, senza bisogno di un passaggio di esportazione. - TorchScript (
torchscript): serializza il modello per un runtime C++ senza Python, adatto ai sistemi di produzione in cui Python non è disponibile. - ONNX (
onnx): un formato di interscambio indipendente dal framework, con ampio supporto multipiattaforma e hardware tramite ONNX Runtime. - OpenVINO (
openvino): il toolkit di Intel per l'inferenza ottimizzata su CPU Intel, GPU integrate e NPU, comune nell'IoT e nell'edge computing. - TensorRT (
engine): il runtime ad alte prestazioni di NVIDIA, che offre un'inferenza GPU di livello superiore con ottimizzazione FP16 e INT8. - CoreML (
coreml): il formato on-device di Apple per iOS, macOS, watchOS e tvOS, che utilizza l'Apple Neural Engine. - TF SavedModel (
saved_model): il formato standard di TensorFlow per il serving scalabile lato server con TensorFlow Serving. - TF GraphDef (
pb): un formato TensorFlow a grafo statico congelato per gli ambienti che richiedono un grafo computazionale fisso. - TF Edge TPU (
edgetpu): compila i modelli.tfliteper gli acceleratori Google Coral Edge TPU. - LiteRT (
litert): il runtime on-device di Google (in precedenza TensorFlow Lite) per l'inferenza su dispositivi mobili, sistemi embedded e browser a partire da un singolo modello.tflite, con supporto per FP32 e INT8 ed esecuzione nel browser tramite LiteRT.js. - PaddlePaddle (
paddle): il framework di deep learning di Baidu, diffuso in Cina, con ampio supporto hardware. - MNN (
mnn): un motore di inferenza leggero e ad alte prestazioni, ottimizzato per sistemi ARM e x86-64 mobili ed embedded. - NCNN (
ncnn): un framework di inferenza leggero e ad alte prestazioni, ottimizzato per dispositivi mobili ARM. - Sony IMX500 (
imx): esporta i modelli per il sensore di visione intelligente Sony IMX500 con elaborazione on-chip, come la Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): è destinato alle NPU Rockchip su schede embedded, con quantizzazione FP16 e INT8. - ExecuTorch (
executorch): il runtime on-device nativo di PyTorch per dispositivi mobili (iOS e Android) e sistemi embedded tramite XNNPACK. - Axelera AI (
axelera): compila per l'AIPU Metis di Axelera (fino a 856 TOPS) tramite PCIe o M.2, per un'inferenza edge ad alto throughput. - DEEPX (
deepx): è destinato all'hardware NPU DEEPX, con quantizzazione INT8 per l'inferenza edge embedded. - Qualcomm QNN (
qnn): inferenza on-device su NPU Hexagon, GPU Adreno e CPU Snapdragon tramite lo stack Qualcomm AI. - Core AI (
coreai): il nuovo formato.aimodeldi Apple per iOS 27 e macOS 27, pianificato su CPU, GPU e Apple Neural Engine; l'esportazione richiede macOS 26 o versioni successive su Apple silicon.
L'integrazione Hailo esporta direttamente i modelli YOLO per rilevamento, segmentazione, segmentazione semantica, stima della profondità, classificazione, posa e OBB in Hailo HEF; consulta la relativa tabella di compatibilità per i modelli e i target convalidati. L'integrazione Ambarella segue un workflow ONNX-first e compila le esportazioni ONNX nel formato AmbaPB con la toolchain CVflow di Ambarella per SoC CVflow® come CV72, utilizzando facoltativamente l'addestramento consapevole della compressione SpongeTorch. L'integrazione Huawei Ascend compila le esportazioni ONNX nel formato offline .om con il compilatore CANN ATC per l'inferenza FP16 sui processori AI Ascend.
Confronto tra le opzioni di deployment#
La tabella seguente riassume le opzioni di deployment per i modelli YOLO26 secondo i criteri che generalmente guidano la scelta. Per un'analisi approfondita di ogni formato, consulta la documentazione sui formati di esportazione.
| Opzione di deployment | Benchmark delle prestazioni | Compatibilità e integrazione | Supporto della community ed ecosistema | Casi di studio | Manutenzione e aggiornamenti | Considerazioni sulla sicurezza | Accelerazione hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Buona flessibilità; può sacrificare le prestazioni grezze | Eccellente con le librerie Python | Ampie risorse e community | Ricerca e prototipi | Sviluppo regolare e attivo | Dipende dall'ambiente di deployment | Supporto CUDA per l'accelerazione GPU |
| TorchScript | Più adatto alla produzione rispetto a PyTorch | Transizione fluida da PyTorch a C++ | Specializzato, ma più limitato rispetto a PyTorch | Settori in cui Python rappresenta un collo di bottiglia | Aggiornamenti coerenti con PyTorch | Sicurezza migliorata senza Python completo | Eredita il supporto CUDA da PyTorch |
| ONNX | Variabile a seconda del runtime | Elevata tra framework diversi | Ampio ecosistema, supportato da numerose organizzazioni | Flessibilità tra framework di ML | Aggiornamenti regolari per le nuove operazioni | Assicurati di adottare pratiche sicure di conversione e deployment | Diverse ottimizzazioni hardware |
| OpenVINO | Ottimizzato per l'hardware Intel | Ideale nell'ecosistema Intel | Solido nel settore della computer vision | IoT ed edge con hardware Intel | Aggiornamenti regolari per l'hardware Intel | Funzionalità robuste per applicazioni sensibili | Ottimizzato per l'hardware Intel |
| TensorRT | Di livello superiore sulle GPU NVIDIA | Ideale per l'hardware NVIDIA | Rete solida attraverso NVIDIA | Inferenza video e immagini in tempo reale | Aggiornamenti frequenti per le nuove GPU | Particolare attenzione alla sicurezza | Progettato per le GPU NVIDIA |
| CoreML | Ottimizzato per l'hardware Apple on-device | Esclusivo dell'ecosistema Apple | Solido supporto da parte di Apple e degli sviluppatori | ML on-device sui prodotti Apple | Aggiornamenti regolari di Apple | Focus su privacy e sicurezza | Apple Neural Engine e GPU |
| TF SavedModel | Scalabile negli ambienti server | Ampia compatibilità nell'ecosistema TensorFlow | Ampio supporto grazie alla popolarità di TensorFlow | Serving dei modelli su larga scala | Aggiornamenti regolari da Google e dalla community | Funzionalità robuste per le aziende | Diverse forme di accelerazione hardware |
| TF GraphDef | Stabile per i grafi computazionali statici | Si integra bene con l'infrastruttura TensorFlow | Risorse per ottimizzare i grafi statici | Scenari che richiedono grafi statici | Aggiornamenti insieme al core di TensorFlow | Pratiche di sicurezza TensorFlow consolidate | Opzioni di accelerazione TensorFlow |
| TF Edge TPU | Ottimizzato per l'hardware Edge TPU di Google | Esclusivo per i dispositivi Edge TPU | In crescita grazie alle risorse di Google e di terze parti | Dispositivi IoT che richiedono elaborazione in tempo reale | Miglioramenti per il nuovo hardware Edge TPU | Solida sicurezza IoT di Google | Progettato su misura per Google Coral |
| LiteRT | Velocità ed efficienza su dispositivi mobili, sistemi embedded e web | Supporto per dispositivi mobili, sistemi embedded, edge e browser | Comunità solida, supportata da Google | App sul dispositivo per Android, iOS e web | Funzionalità più recenti del runtime sul dispositivo | Inferenza sicura sul dispositivo e nel browser | Accelerazione tramite GPU, DSP e WebGPU |
| PaddlePaddle | Competitivo, facile da usare e scalabile | Ecosistema Baidu, ampio supporto per le applicazioni | In rapida crescita, soprattutto in Cina | Mercato cinese ed elaborazione del linguaggio | Focus sulle applicazioni di AI cinesi | Dà priorità alla privacy e alla sicurezza dei dati | Include i chip Kunlun di Baidu |
| MNN | Elevate prestazioni sui dispositivi mobili | Sistemi ARM mobili ed embedded e CPU X86-64 | Comunità ML mobile/embedded | Efficienza dei sistemi mobili | Manutenzione delle elevate prestazioni sui dispositivi mobili | Vantaggi della sicurezza sul dispositivo | Ottimizzazioni per CPU e GPU ARM |
| NCNN | Ottimizzato per i dispositivi mobili basati su ARM | Sistemi ARM mobili ed embedded | Comunità ML mobile/embedded di nicchia ma attiva | Efficienza su sistemi Android e ARM | Manutenzione delle elevate prestazioni su ARM | Vantaggi della sicurezza sul dispositivo | Ottimizzazioni per CPU e GPU ARM |
| Sony IMX500 | Inferenza sul sensore con consumi energetici molto bassi | Sensore Sony IMX500, Raspberry Pi AI Camera | Ecosistema Sony AITRIOS | AI edge direttamente sulla fotocamera | Aggiornamenti dell'SDK Sony e della toolchain MCT | I dati restano sul sensore | Acceleratore integrato nel chip Sony IMX500 |
| Rockchip RKNN | Ottimizzato per le NPU Rockchip | Schede SoC Rockchip (ad es. RK3588) | Comunità di sviluppatori Rockchip | Dispositivi SBC embedded ed edge | Aggiornamenti di Rockchip RKNN-Toolkit | Inferenza locale sul dispositivo | NPU Rockchip |
| ExecuTorch | Runtime PyTorch efficiente sul dispositivo | iOS, Android e sistemi embedded tramite XNNPACK | Supportato dal progetto PyTorch | App mobili ed embedded | Mantenuto insieme a PyTorch | L'inferenza sul dispositivo mantiene i dati in locale | Backend XNNPACK e CPU/GPU mobili |
| Axelera AI | Throughput molto elevato (fino a 856 TOPS) | Metis AIPU tramite PCIe o M.2 | SDK Axelera Voyager | Inferenza edge ad alto throughput | Aggiornamenti dell'SDK Axelera | Inferenza edge on-premise | Axelera Metis AIPU |
| DEEPX | Inferenza NPU ottimizzata per INT8 | Hardware NPU DEEPX | Strumenti per sviluppatori DEEPX (dx_com, dx_engine) | Inferenza edge embedded | Aggiornamenti dell'SDK e del runtime DEEPX | Inferenza locale sul dispositivo | NPU DEEPX |
| Qualcomm QNN | Inferenza rapida sul dispositivo con Snapdragon | NPU Snapdragon Hexagon, GPU Adreno, CPU | Ecosistema Qualcomm AI Hub | Dispositivi Snapdragon mobili ed edge | Aggiornamenti dello stack AI Qualcomm (QAIRT) | L'inferenza sul dispositivo mantiene i dati in locale | NPU Snapdragon Hexagon |
| Hailo | Inferenza INT8 HEF su NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler e HailoRT | Telecamere, robot, sistemi edge industriali | Rilasci di Hailo DFC e HailoRT | Inferenza locale sul dispositivo | NPU Hailo |
| Huawei Ascend | Maggiore throughput su Ascend AI Core | Schede Atlas e OrangePi AIPro | Ecosistema Huawei CANN | Inferenza edge su NPU Ascend | Rilasci di CANN e ATC | Inferenza locale sul dispositivo | Ascend AI Core |
| Core AI | Ottimizzato per Apple silicon | iOS 27 e macOS 27; l'esportazione richiede macOS 26+ | Framework Apple; non ancora disponibile negli SDK iOS/Flutter | ML su dispositivo su piattaforme Apple di prossima generazione | Legato alle versioni dei sistemi operativi Apple; attualmente in versione beta | L'inferenza sul dispositivo mantiene i dati in locale | Apple Neural Engine, GPU e CPU |
Questo confronto offre una panoramica generale. Per la distribuzione, valuta i requisiti e i vincoli specifici del tuo progetto rispetto a ciascuna opzione e consulta la guida all'integrazione collegata per il formato che scegli.
Conclusioni#
L'ampia gamma di formati di esportazione di YOLO26 ti consente di adattare un modello a quasi qualsiasi ambiente, da un server cloud con GPU a una fotocamera edge con inferenza sul sensore. Dopo aver scelto un formato, segui le best practice per la distribuzione dei modelli per ottimizzazione, risoluzione dei problemi e sicurezza, e affidati alla comunità Ultralytics quando incontri difficoltà.
FAQ#
Ultralytics YOLO26 supporta diversi formati di distribuzione, ciascuno progettato per ambienti e piattaforme hardware specifici. I formati principali includono:
- PyTorch per ricerca e prototipazione, con un'eccellente integrazione con Python.
- TorchScript per gli ambienti di produzione in cui Python non è disponibile.
- ONNX per la compatibilità multipiattaforma e l'accelerazione hardware.
- OpenVINO per prestazioni ottimizzate sull'hardware Intel.
- TensorRT per l'inferenza ad alta velocità sulle GPU NVIDIA.
Ogni formato offre vantaggi unici. Per una guida dettagliata, consulta la nostra documentazione sul processo di esportazione.
Per aumentare la velocità di inferenza sulle CPU Intel, puoi distribuire il tuo modello YOLO26 utilizzando il toolkit OpenVINO di Intel. OpenVINO offre notevoli miglioramenti delle prestazioni ottimizzando i modelli per sfruttare in modo efficiente l'hardware Intel.
- Converti il tuo modello YOLO26 nel formato OpenVINO utilizzando la funzione
model.export(). - Segui la guida dettagliata alla configurazione nella documentazione sull'esportazione Intel OpenVINO.
Per ulteriori informazioni, consulta il nostro articolo sul blog.
- Converti il tuo modello YOLO26 nel formato OpenVINO utilizzando la funzione
Sì, i modelli YOLO26 possono essere distribuiti su dispositivi mobili utilizzando LiteRT (precedentemente TensorFlow Lite) e NCNN per Android, nonché CoreML o LiteRT per iOS. LiteRT è il runtime on-device di Google per dispositivi mobili ed embedded e consente di eseguire lo stesso modello su Android, iOS e browser, fornendo un'inferenza on-device efficiente.
Esempio# Export command for NCNN format model.export(format="ncnn")Per ulteriori dettagli sulla distribuzione dei modelli su dispositivi mobili, consulta la nostra guida all'integrazione di LiteRT.
Quando scegli un formato di distribuzione per YOLO26, considera i seguenti fattori:
- Prestazioni: alcuni formati, come TensorRT, offrono velocità eccezionali sulle GPU NVIDIA, mentre OpenVINO è ottimizzato per l'hardware Intel.
- Compatibilità: ONNX offre un'ampia compatibilità tra piattaforme diverse.
- Facilità di integrazione: formati come CoreML o LiteRT sono progettati per ecosistemi specifici, come rispettivamente iOS e Android.
- Supporto della community: formati come PyTorch e TensorFlow dispongono di numerose risorse e di un ampio supporto della community.
Per un'analisi comparativa, consulta la nostra documentazione sui formati di esportazione.
Per distribuire i modelli YOLO26 in un'applicazione web, puoi utilizzare LiteRT.js, il runtime web di LiteRT, che consente di eseguire modelli di apprendimento automatico direttamente nel browser e in Node.js. Questo approccio elimina la necessità di un'infrastruttura backend e offre prestazioni in tempo reale.
- Esporta il modello YOLO26 nel formato LiteRT.
- Integra il modello esportato nella tua applicazione web utilizzando LiteRT.js.
Per istruzioni dettagliate passo dopo passo, consulta la nostra guida all'integrazione di LiteRT.