Analisi comparativa delle opzioni di distribuzione di YOLO26#
YOLO26 supporta oltre 20 opzioni di distribuzione, ciascuna ottimizzata per un diverso runtime, target hardware o piattaforma: da PyTorch e ONNX a TensorRT, OpenVINO, CoreML e formati dedicati alle NPU edge. La scelta giusta richiede di bilanciare la velocità di inferenza, i vincoli hardware e la facilità di integrazione. Questa guida confronta tutte le opzioni per aiutarti a scegliere quella più adatta alla tua applicazione, poi puoi passare alle best practice per la distribuzione dei modelli per distribuirla in modo affidabile.
Guarda: Come scegliere il miglior formato di distribuzione di Ultralytics YOLO26 per il tuo progetto | TensorRT | OpenVINO 🚀
La distribuzione è la fase del flusso di lavoro di un progetto di visione artificiale in cui un modello addestrato inizia a svolgere attività concrete, quindi il formato in cui lo esporti influisce direttamente su velocità, costi e portabilità.
Come scegliere l'opzione di distribuzione giusta per il tuo modello YOLO26#
Quando è il momento di distribuire il tuo modello YOLO26, è molto importante scegliere un formato di esportazione adatto. Come descritto nella documentazione sull'esportazione di Ultralytics YOLO26, la funzione model.export() converte il modello addestrato in vari formati pensati per ambienti e requisiti di prestazioni diversi.
Il formato ideale dipende dal contesto operativo previsto per il tuo modello e dall'hardware.
Per una distribuzione gestita senza esportazione manuale, Ultralytics Platform offre endpoint di inferenza pronti all'uso, con scalabilità automatica in 42 regioni globali.
Opzioni di distribuzione di YOLO26#
Ecco una breve descrizione di ciascun formato e dei casi in cui sceglierlo. Per la procedura completa di esportazione, consulta la documentazione sull'esportazione; per i criteri di confronto affiancati, passa alla tabella comparativa.
- PyTorch (
.pt): il formato nativo per l'addestramento e l'inferenza, che offre la massima flessibilità e l'accelerazione GPU tramite NVIDIA CUDA o AMD ROCm — ideale per ricerca e prototipazione, senza bisogno di esportazione. - TorchScript (
torchscript): serializza il modello per un runtime C++ che non richiede Python, adatto ai sistemi di produzione in cui Python non è disponibile. - ONNX (
onnx): formato di interscambio indipendente dai framework, con un ampio supporto multipiattaforma e hardware tramite ONNX Runtime, incluse le GPU NVIDIA tramite CUDA e le GPU AMD tramite MIGraphX. - OpenVINO (
openvino): toolkit di Intel per un'inferenza ottimizzata su CPU, GPU integrate e NPU Intel, diffuso nell'IoT e nell'edge computing. - TensorRT (
engine): runtime ad alte prestazioni di NVIDIA, che offre inferenza GPU di livello superiore con ottimizzazione FP16 e INT8. - CoreML (
coreml): formato on-device di Apple per iOS, macOS, watchOS e tvOS, che utilizza l'Apple Neural Engine. - Core AI (
coreai): il nuovo formato.aimodeldi Apple per iOS 27 e macOS 27, con esecuzione distribuita tra CPU, GPU e Apple Neural Engine; per l'esportazione è necessario macOS 26 o versione successiva su Apple silicon, oppure x86_64 Linux con glibc 2.34 o versione successiva, e Python da 3.11 a 3.14. - TF SavedModel (
saved_model): formato standard di TensorFlow per la distribuzione scalabile lato server con TensorFlow Serving. - TF GraphDef (
pb): formato TensorFlow a grafo statico congelato, destinato agli ambienti che richiedono un grafo computazionale fisso. - TF Edge TPU (
edgetpu): compila i modelli.tfliteper gli acceleratori Google Coral Edge TPU. - LiteRT (
litert): runtime on-device di Google (in precedenza TensorFlow Lite) per l'inferenza su dispositivi mobili, sistemi embedded e browser, a partire da un singolo modello.tflite, con supporto FP32 e INT8 ed esecuzione nel browser tramite LiteRT.js. - PaddlePaddle (
paddle): framework di deep learning di Baidu, popolare in Cina e compatibile con un'ampia gamma di hardware. - MNN (
mnn): motore di inferenza leggero e ad alte prestazioni, ottimizzato per sistemi mobili ed embedded ARM e x86-64. - NCNN (
ncnn): framework di inferenza leggero e ad alte prestazioni, ottimizzato per dispositivi mobili ARM. - Sony IMX500 (
imx): esporta i modelli per il sensore di visione intelligente Sony IMX500 con elaborazione on-chip, come la Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): destinato alle NPU Rockchip su schede embedded, con quantizzazione FP16 e INT8. - ExecuTorch (
executorch): runtime nativo on-device di PyTorch per dispositivi mobili (iOS e Android) e sistemi embedded tramite XNNPACK. - Axelera AI (
axelera): compila i modelli per l'AIPU Metis di Axelera (fino a 856 TOPS) tramite PCIe o M.2, per un'inferenza edge ad alto throughput. - DEEPX (
deepx): destinato all'hardware NPU DEEPX, con quantizzazione INT8 per l'inferenza edge embedded. - Qualcomm QNN (
qnn): inferenza on-device su NPU Snapdragon Hexagon, GPU Adreno e CPU tramite lo stack AI di Qualcomm.
L'integrazione Hailo esporta direttamente in Hailo HEF i modelli YOLO per rilevamento, segmentazione, segmentazione semantica, stima della profondità, classificazione, posa e OBB; consulta la tabella di compatibilità per i modelli e le destinazioni convalidati. L'integrazione Ambarella segue un flusso di lavoro basato innanzitutto su ONNX e compila le esportazioni ONNX nel formato AmbaPB con la toolchain CVflow di Ambarella per SoC CVflow® come il CV72, utilizzando facoltativamente l'addestramento consapevole della compressione SpongeTorch. L'integrazione Huawei Ascend compila le esportazioni ONNX nel formato offline .om con il compilatore CANN ATC per l'inferenza FP16 sui processori AI Ascend. L'integrazione AMD Xilinx quantizza le esportazioni ONNX con AMD Quark per le NPU Versal AI Edge Series Gen 2, che il Vitis AI Execution Provider compila in un modello .rai.
Confronto tra le opzioni di distribuzione#
La tabella seguente riassume le opzioni di distribuzione per i modelli YOLO26 in base ai criteri che in genere guidano la scelta. Per un'analisi approfondita di ciascun formato, consulta la documentazione sui formati di esportazione.
| Opzione di distribuzione | Benchmark delle prestazioni | Compatibilità e integrazione | Supporto della community ed ecosistema | Casi di studio | Manutenzione e aggiornamenti | Considerazioni sulla sicurezza | Accelerazione hardware |
|---|---|---|---|---|---|---|---|
| PyTorch | Buona flessibilità; possibili compromessi sulle prestazioni pure | Eccellente con le librerie Python | Ampie risorse e community | Ricerca e prototipi | Sviluppo attivo e regolare | Dipende dall'ambiente di distribuzione | Supporto CUDA per l'accelerazione GPU |
| TorchScript | Più adatto alla produzione rispetto a PyTorch | Transizione fluida da PyTorch a C++ | Specializzato, ma meno ampio di PyTorch | Settori in cui Python è un collo di bottiglia | Aggiornamenti regolari insieme a PyTorch | Sicurezza migliorata senza ricorrere a Python completo | Eredita il supporto CUDA da PyTorch |
| ONNX | Variabile in base al runtime | Elevata tra i diversi framework | Ecosistema ampio, supportato da molte organizzazioni | Flessibilità tra i framework di ML | Aggiornamenti regolari per le nuove operazioni | Garantire pratiche sicure di conversione e distribuzione | Varie ottimizzazioni hardware |
| OpenVINO | Ottimizzato per l'hardware Intel | Ottimale nell'ecosistema Intel | Solido nel settore della visione artificiale | IoT ed edge con hardware Intel | Aggiornamenti regolari per hardware Intel | Funzionalità avanzate per applicazioni sensibili | Su misura per hardware Intel |
| TensorRT | Prestazioni di alto livello sulle GPU NVIDIA | Ideale per hardware NVIDIA | Una solida rete di supporto tramite NVIDIA | Inferenza in tempo reale su video e immagini | Aggiornamenti frequenti per le nuove GPU | Particolare attenzione alla sicurezza | Progettato per le GPU NVIDIA |
| CoreML | Ottimizzato per l'hardware Apple sul dispositivo | Esclusivo dell'ecosistema Apple | Solido supporto da parte di Apple e degli sviluppatori | ML sul dispositivo nei prodotti Apple | Aggiornamenti regolari di Apple | Attenzione alla privacy e alla sicurezza | Neural Engine e GPU Apple |
| Core AI | Ottimizzato per Apple silicon | iOS 27 e macOS 27; esportazione su macOS con Apple silicon 26+ o Linux x86_64 (glibc 2.34+), Python 3.11-3.14 | Framework Apple; attivazione facoltativa negli SDK iOS/Flutter | ML sul dispositivo sulle piattaforme Apple di nuova generazione | Legato alle versioni del sistema operativo Apple; attualmente in beta | L'inferenza sul dispositivo mantiene i dati in locale | Apple Neural Engine, GPU e CPU |
| TF SavedModel | Scalabile in ambienti server | Ampia compatibilità nell'ecosistema TensorFlow | Ampio supporto grazie alla popolarità di TensorFlow | Distribuzione di modelli su larga scala | Aggiornamenti regolari da Google e dalla community | Funzionalità avanzate per le aziende | Diverse opzioni di accelerazione hardware |
| TF GraphDef | Stabile per i grafi computazionali statici | Si integra bene con l'infrastruttura TensorFlow | Risorse per ottimizzare i grafi statici | Scenari che richiedono grafi statici | Aggiornamenti in linea con il core di TensorFlow | Pratiche di sicurezza consolidate di TensorFlow | Opzioni di accelerazione TensorFlow |
| TF Edge TPU | Ottimizzato per l'hardware Edge TPU di Google | Esclusivo dei dispositivi Edge TPU | In crescita grazie alle risorse di Google e di terze parti | Dispositivi IoT che richiedono elaborazione in tempo reale | Miglioramenti per il nuovo hardware Edge TPU | Solida sicurezza IoT di Google | Progettato appositamente per Google Coral |
| LiteRT | Velocità ed efficienza su dispositivi mobili, sistemi embedded e web | Supporto per dispositivi mobili, sistemi embedded, edge e browser | Solida community, con il supporto di Google | App sul dispositivo per Android, iOS e web | Funzionalità più recenti per il runtime sul dispositivo | Inferenza sicura sul dispositivo e nel browser | Accelerazione GPU, DSP e WebGPU |
| PaddlePaddle | Competitivo, facile da usare e scalabile | Ecosistema Baidu e ampio supporto per le applicazioni | In rapida crescita, soprattutto in Cina | Mercato cinese ed elaborazione del linguaggio | Attenzione alle applicazioni di IA cinesi | Attenzione alla privacy e alla sicurezza dei dati | Include i chip Kunlun di Baidu |
| MNN | Prestazioni elevate sui dispositivi mobili | Sistemi ARM mobili ed embedded e CPU X86-64 | Community ML per dispositivi mobili ed embedded | Efficienza dei sistemi mobili | Manutenzione ad alte prestazioni sui dispositivi mobili | Vantaggi della sicurezza sul dispositivo | Ottimizzazioni per CPU e GPU ARM |
| NCNN | Ottimizzato per dispositivi mobili basati su ARM | Sistemi ARM mobili ed embedded | Community ML di nicchia ma attiva per dispositivi mobili ed embedded | Efficienza sui sistemi Android e ARM | Manutenzione ad alte prestazioni su ARM | Vantaggi della sicurezza sul dispositivo | Ottimizzazioni per CPU e GPU ARM |
| Sony IMX500 | Inferenza sul sensore a bassissimo consumo | Sensore Sony IMX500, Raspberry Pi AI Camera | Ecosistema Sony AITRIOS | IA edge direttamente sulla videocamera | Aggiornamenti dell'SDK Sony e della toolchain MCT | I dati restano sul sensore | Acceleratore integrato nel chip Sony IMX500 |
| Rockchip RKNN | Ottimizzato per le NPU Rockchip | Schede SoC Rockchip (ad es. RK3588) | Community di sviluppatori Rockchip | Dispositivi SBC embedded ed edge | Aggiornamenti di Rockchip RKNN-Toolkit | Inferenza locale sul dispositivo | NPU Rockchip |
| ExecuTorch | Runtime PyTorch efficiente sul dispositivo | iOS, Android e sistemi embedded tramite XNNPACK | Supportato dal progetto PyTorch | App per dispositivi mobili ed embedded | Mantenuto in parallelo a PyTorch | L'inferenza sul dispositivo mantiene i dati in locale | XNNPACK e backend CPU/GPU per dispositivi mobili |
| Axelera AI | Throughput molto elevato (fino a 856 TOPS) | Metis AIPU tramite PCIe o M.2 | SDK Axelera Voyager | Inferenza edge ad alto throughput | Aggiornamenti dell'SDK Axelera | Inferenza edge on-premise | AIPU Metis di Axelera |
| DEEPX | Inferenza NPU ottimizzata per INT8 | Hardware NPU DEEPX | Strumenti per sviluppatori DEEPX (dx_com, dx_engine) | Inferenza edge embedded | Aggiornamenti di SDK e runtime DEEPX | Inferenza locale sul dispositivo | NPU DEEPX |
| Qualcomm QNN | Inferenza rapida su dispositivo con Snapdragon | NPU Hexagon Snapdragon, GPU Adreno, CPU | Ecosistema Qualcomm AI Hub | Dispositivi Snapdragon mobili ed edge | Aggiornamenti dello stack Qualcomm AI (QAIRT) | L'inferenza sul dispositivo mantiene i dati in locale | NPU Hexagon Snapdragon |
| Hailo | Inferenza HEF INT8 sulle NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler e HailoRT | Telecamere, robot, sistemi edge industriali | Release di Hailo DFC e HailoRT | Inferenza locale sul dispositivo | NPU Hailo |
| Huawei Ascend | Throughput maggiore sull'Ascend AI Core | Schede Atlas e OrangePi AIPro | Ecosistema Huawei CANN | Inferenza edge sulle NPU Ascend | Release di CANN e ATC | Inferenza locale sul dispositivo | Ascend AI Core |
| AMD Xilinx | Inferenza INT8 sulle NPU Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI e Quark | Visione embedded su SoC adattivi | Versioni di Vitis AI e Quark | Inferenza locale sul dispositivo | NPU del motore AI Versal |
Questo confronto offre una panoramica generale. Per la distribuzione, valuta i requisiti e i vincoli specifici del tuo progetto rispetto a ciascuna opzione e consulta la guida all'integrazione collegata per il formato che scegli.
Conclusione#
L'ampia gamma di formati di esportazione di YOLO26 ti permette di adattare un modello a quasi qualsiasi ambiente, da un server cloud con GPU a una telecamera edge con sensore integrato. Dopo aver scelto un formato, segui le best practice per la distribuzione dei modelli per l'ottimizzazione, la risoluzione dei problemi e la sicurezza, e affidati alla community Ultralytics quando incontri un ostacolo.
Domande frequenti#
Ultralytics YOLO26 supporta diversi formati di distribuzione, ciascuno progettato per ambienti e piattaforme hardware specifici. I formati principali includono:
- PyTorch per la ricerca e la prototipazione, con un'eccellente integrazione con Python.
- TorchScript per gli ambienti di produzione in cui Python non è disponibile.
- ONNX per la compatibilità multipiattaforma e l'accelerazione hardware.
- OpenVINO per prestazioni ottimizzate sull'hardware Intel.
- TensorRT per un'inferenza ad alta velocità sulle GPU NVIDIA.
Ogni formato offre vantaggi specifici. Per una guida dettagliata, consulta la documentazione sul processo di esportazione.
Per aumentare la velocità di inferenza sulle CPU Intel, puoi distribuire il tuo modello YOLO26 usando il toolkit OpenVINO di Intel. OpenVINO offre notevoli incrementi delle prestazioni ottimizzando i modelli per sfruttare al meglio l'hardware Intel.
- Converti il tuo modello YOLO26 nel formato OpenVINO usando la funzione
model.export(). - Segui la guida dettagliata alla configurazione nella documentazione sull'esportazione Intel OpenVINO.
Per saperne di più, consulta il nostro articolo del blog.
- Converti il tuo modello YOLO26 nel formato OpenVINO usando la funzione
Sì, puoi distribuire i modelli YOLO26 sui dispositivi mobili usando LiteRT (in precedenza TensorFlow Lite) e NCNN per Android, e CoreML o LiteRT per iOS. LiteRT è il runtime on-device di Google per dispositivi mobili ed embedded e consente di eseguire lo stesso modello su Android, iOS e browser, offrendo un'inferenza on-device efficiente.
Esempiofrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Comando di esportazione per il formato NCNN model.export(format="ncnn")Per maggiori dettagli sulla distribuzione di modelli su dispositivi mobili, consulta la nostra guida all'integrazione di LiteRT.
Quando scegli un formato di distribuzione per YOLO26, considera i seguenti fattori:
- Prestazioni: alcuni formati, come TensorRT, offrono velocità eccezionali sulle GPU NVIDIA, mentre OpenVINO è ottimizzato per l'hardware Intel.
- Compatibilità: ONNX offre un'ampia compatibilità tra piattaforme diverse.
- Facilità di integrazione: formati come CoreML o LiteRT sono pensati rispettivamente per ecosistemi specifici come iOS e Android.
- Supporto della community: formati come PyTorch e TensorFlow dispongono di numerose risorse e di un ampio supporto da parte della community.
Per un'analisi comparativa, consulta la nostra documentazione sui formati di esportazione.
Per distribuire i modelli YOLO26 in un'applicazione web, puoi usare LiteRT.js, il runtime web di LiteRT, che consente di eseguire modelli di machine learning direttamente nel browser e in Node.js. Questo approccio elimina la necessità di un'infrastruttura backend e offre prestazioni in tempo reale.
- Esporta il modello YOLO26 nel formato LiteRT.
- Integra il modello esportato nella tua applicazione web usando LiteRT.js.
Per istruzioni dettagliate, consulta la nostra guida all'integrazione di LiteRT.