Ultralytics YOLO27:
Get Started

Analisi comparativa delle opzioni di distribuzione di YOLO26#

YOLO26 supporta oltre 20 opzioni di distribuzione, ciascuna ottimizzata per un diverso runtime, target hardware o piattaforma: da PyTorch e ONNX a TensorRT, OpenVINO, CoreML e formati dedicati alle NPU edge. La scelta giusta richiede di bilanciare la velocità di inferenza, i vincoli hardware e la facilità di integrazione. Questa guida confronta tutte le opzioni per aiutarti a scegliere quella più adatta alla tua applicazione, poi puoi passare alle best practice per la distribuzione dei modelli per distribuirla in modo affidabile.



Guarda: Come scegliere il miglior formato di distribuzione di Ultralytics YOLO26 per il tuo progetto | TensorRT | OpenVINO 🚀

La distribuzione è la fase del flusso di lavoro di un progetto di visione artificiale in cui un modello addestrato inizia a svolgere attività concrete, quindi il formato in cui lo esporti influisce direttamente su velocità, costi e portabilità.

Come scegliere l'opzione di distribuzione giusta per il tuo modello YOLO26#

Quando è il momento di distribuire il tuo modello YOLO26, è molto importante scegliere un formato di esportazione adatto. Come descritto nella documentazione sull'esportazione di Ultralytics YOLO26, la funzione model.export() converte il modello addestrato in vari formati pensati per ambienti e requisiti di prestazioni diversi.

Il formato ideale dipende dal contesto operativo previsto per il tuo modello e dall'hardware.

Salta l'esportazione manuale

Per una distribuzione gestita senza esportazione manuale, Ultralytics Platform offre endpoint di inferenza pronti all'uso, con scalabilità automatica in 42 regioni globali.

Opzioni di distribuzione di YOLO26#

Ecco una breve descrizione di ciascun formato e dei casi in cui sceglierlo. Per la procedura completa di esportazione, consulta la documentazione sull'esportazione; per i criteri di confronto affiancati, passa alla tabella comparativa.

  • PyTorch (.pt): il formato nativo per l'addestramento e l'inferenza, che offre la massima flessibilità e l'accelerazione GPU tramite NVIDIA CUDA o AMD ROCm — ideale per ricerca e prototipazione, senza bisogno di esportazione.
  • TorchScript (torchscript): serializza il modello per un runtime C++ che non richiede Python, adatto ai sistemi di produzione in cui Python non è disponibile.
  • ONNX (onnx): formato di interscambio indipendente dai framework, con un ampio supporto multipiattaforma e hardware tramite ONNX Runtime, incluse le GPU NVIDIA tramite CUDA e le GPU AMD tramite MIGraphX.
  • OpenVINO (openvino): toolkit di Intel per un'inferenza ottimizzata su CPU, GPU integrate e NPU Intel, diffuso nell'IoT e nell'edge computing.
  • TensorRT (engine): runtime ad alte prestazioni di NVIDIA, che offre inferenza GPU di livello superiore con ottimizzazione FP16 e INT8.
  • CoreML (coreml): formato on-device di Apple per iOS, macOS, watchOS e tvOS, che utilizza l'Apple Neural Engine.
  • Core AI (coreai): il nuovo formato .aimodel di Apple per iOS 27 e macOS 27, con esecuzione distribuita tra CPU, GPU e Apple Neural Engine; per l'esportazione è necessario macOS 26 o versione successiva su Apple silicon, oppure x86_64 Linux con glibc 2.34 o versione successiva, e Python da 3.11 a 3.14.
  • TF SavedModel (saved_model): formato standard di TensorFlow per la distribuzione scalabile lato server con TensorFlow Serving.
  • TF GraphDef (pb): formato TensorFlow a grafo statico congelato, destinato agli ambienti che richiedono un grafo computazionale fisso.
  • TF Edge TPU (edgetpu): compila i modelli .tflite per gli acceleratori Google Coral Edge TPU.
  • LiteRT (litert): runtime on-device di Google (in precedenza TensorFlow Lite) per l'inferenza su dispositivi mobili, sistemi embedded e browser, a partire da un singolo modello .tflite, con supporto FP32 e INT8 ed esecuzione nel browser tramite LiteRT.js.
  • PaddlePaddle (paddle): framework di deep learning di Baidu, popolare in Cina e compatibile con un'ampia gamma di hardware.
  • MNN (mnn): motore di inferenza leggero e ad alte prestazioni, ottimizzato per sistemi mobili ed embedded ARM e x86-64.
  • NCNN (ncnn): framework di inferenza leggero e ad alte prestazioni, ottimizzato per dispositivi mobili ARM.
  • Sony IMX500 (imx): esporta i modelli per il sensore di visione intelligente Sony IMX500 con elaborazione on-chip, come la Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): destinato alle NPU Rockchip su schede embedded, con quantizzazione FP16 e INT8.
  • ExecuTorch (executorch): runtime nativo on-device di PyTorch per dispositivi mobili (iOS e Android) e sistemi embedded tramite XNNPACK.
  • Axelera AI (axelera): compila i modelli per l'AIPU Metis di Axelera (fino a 856 TOPS) tramite PCIe o M.2, per un'inferenza edge ad alto throughput.
  • DEEPX (deepx): destinato all'hardware NPU DEEPX, con quantizzazione INT8 per l'inferenza edge embedded.
  • Qualcomm QNN (qnn): inferenza on-device su NPU Snapdragon Hexagon, GPU Adreno e CPU tramite lo stack AI di Qualcomm.

L'integrazione Hailo esporta direttamente in Hailo HEF i modelli YOLO per rilevamento, segmentazione, segmentazione semantica, stima della profondità, classificazione, posa e OBB; consulta la tabella di compatibilità per i modelli e le destinazioni convalidati. L'integrazione Ambarella segue un flusso di lavoro basato innanzitutto su ONNX e compila le esportazioni ONNX nel formato AmbaPB con la toolchain CVflow di Ambarella per SoC CVflow® come il CV72, utilizzando facoltativamente l'addestramento consapevole della compressione SpongeTorch. L'integrazione Huawei Ascend compila le esportazioni ONNX nel formato offline .om con il compilatore CANN ATC per l'inferenza FP16 sui processori AI Ascend. L'integrazione AMD Xilinx quantizza le esportazioni ONNX con AMD Quark per le NPU Versal AI Edge Series Gen 2, che il Vitis AI Execution Provider compila in un modello .rai.

Confronto tra le opzioni di distribuzione#

La tabella seguente riassume le opzioni di distribuzione per i modelli YOLO26 in base ai criteri che in genere guidano la scelta. Per un'analisi approfondita di ciascun formato, consulta la documentazione sui formati di esportazione.

Opzione di distribuzioneBenchmark delle prestazioniCompatibilità e integrazioneSupporto della community ed ecosistemaCasi di studioManutenzione e aggiornamentiConsiderazioni sulla sicurezzaAccelerazione hardware
PyTorchBuona flessibilità; possibili compromessi sulle prestazioni pureEccellente con le librerie PythonAmpie risorse e communityRicerca e prototipiSviluppo attivo e regolareDipende dall'ambiente di distribuzioneSupporto CUDA per l'accelerazione GPU
TorchScriptPiù adatto alla produzione rispetto a PyTorchTransizione fluida da PyTorch a C++Specializzato, ma meno ampio di PyTorchSettori in cui Python è un collo di bottigliaAggiornamenti regolari insieme a PyTorchSicurezza migliorata senza ricorrere a Python completoEredita il supporto CUDA da PyTorch
ONNXVariabile in base al runtimeElevata tra i diversi frameworkEcosistema ampio, supportato da molte organizzazioniFlessibilità tra i framework di MLAggiornamenti regolari per le nuove operazioniGarantire pratiche sicure di conversione e distribuzioneVarie ottimizzazioni hardware
OpenVINOOttimizzato per l'hardware IntelOttimale nell'ecosistema IntelSolido nel settore della visione artificialeIoT ed edge con hardware IntelAggiornamenti regolari per hardware IntelFunzionalità avanzate per applicazioni sensibiliSu misura per hardware Intel
TensorRTPrestazioni di alto livello sulle GPU NVIDIAIdeale per hardware NVIDIAUna solida rete di supporto tramite NVIDIAInferenza in tempo reale su video e immaginiAggiornamenti frequenti per le nuove GPUParticolare attenzione alla sicurezzaProgettato per le GPU NVIDIA
CoreMLOttimizzato per l'hardware Apple sul dispositivoEsclusivo dell'ecosistema AppleSolido supporto da parte di Apple e degli sviluppatoriML sul dispositivo nei prodotti AppleAggiornamenti regolari di AppleAttenzione alla privacy e alla sicurezzaNeural Engine e GPU Apple
Core AIOttimizzato per Apple siliconiOS 27 e macOS 27; esportazione su macOS con Apple silicon 26+ o Linux x86_64 (glibc 2.34+), Python 3.11-3.14Framework Apple; attivazione facoltativa negli SDK iOS/FlutterML sul dispositivo sulle piattaforme Apple di nuova generazioneLegato alle versioni del sistema operativo Apple; attualmente in betaL'inferenza sul dispositivo mantiene i dati in localeApple Neural Engine, GPU e CPU
TF SavedModelScalabile in ambienti serverAmpia compatibilità nell'ecosistema TensorFlowAmpio supporto grazie alla popolarità di TensorFlowDistribuzione di modelli su larga scalaAggiornamenti regolari da Google e dalla communityFunzionalità avanzate per le aziendeDiverse opzioni di accelerazione hardware
TF GraphDefStabile per i grafi computazionali staticiSi integra bene con l'infrastruttura TensorFlowRisorse per ottimizzare i grafi staticiScenari che richiedono grafi staticiAggiornamenti in linea con il core di TensorFlowPratiche di sicurezza consolidate di TensorFlowOpzioni di accelerazione TensorFlow
TF Edge TPUOttimizzato per l'hardware Edge TPU di GoogleEsclusivo dei dispositivi Edge TPUIn crescita grazie alle risorse di Google e di terze partiDispositivi IoT che richiedono elaborazione in tempo realeMiglioramenti per il nuovo hardware Edge TPUSolida sicurezza IoT di GoogleProgettato appositamente per Google Coral
LiteRTVelocità ed efficienza su dispositivi mobili, sistemi embedded e webSupporto per dispositivi mobili, sistemi embedded, edge e browserSolida community, con il supporto di GoogleApp sul dispositivo per Android, iOS e webFunzionalità più recenti per il runtime sul dispositivoInferenza sicura sul dispositivo e nel browserAccelerazione GPU, DSP e WebGPU
PaddlePaddleCompetitivo, facile da usare e scalabileEcosistema Baidu e ampio supporto per le applicazioniIn rapida crescita, soprattutto in CinaMercato cinese ed elaborazione del linguaggioAttenzione alle applicazioni di IA cinesiAttenzione alla privacy e alla sicurezza dei datiInclude i chip Kunlun di Baidu
MNNPrestazioni elevate sui dispositivi mobiliSistemi ARM mobili ed embedded e CPU X86-64Community ML per dispositivi mobili ed embeddedEfficienza dei sistemi mobiliManutenzione ad alte prestazioni sui dispositivi mobiliVantaggi della sicurezza sul dispositivoOttimizzazioni per CPU e GPU ARM
NCNNOttimizzato per dispositivi mobili basati su ARMSistemi ARM mobili ed embeddedCommunity ML di nicchia ma attiva per dispositivi mobili ed embeddedEfficienza sui sistemi Android e ARMManutenzione ad alte prestazioni su ARMVantaggi della sicurezza sul dispositivoOttimizzazioni per CPU e GPU ARM
Sony IMX500Inferenza sul sensore a bassissimo consumoSensore Sony IMX500, Raspberry Pi AI CameraEcosistema Sony AITRIOSIA edge direttamente sulla videocameraAggiornamenti dell'SDK Sony e della toolchain MCTI dati restano sul sensoreAcceleratore integrato nel chip Sony IMX500
Rockchip RKNNOttimizzato per le NPU RockchipSchede SoC Rockchip (ad es. RK3588)Community di sviluppatori RockchipDispositivi SBC embedded ed edgeAggiornamenti di Rockchip RKNN-ToolkitInferenza locale sul dispositivoNPU Rockchip
ExecuTorchRuntime PyTorch efficiente sul dispositivoiOS, Android e sistemi embedded tramite XNNPACKSupportato dal progetto PyTorchApp per dispositivi mobili ed embeddedMantenuto in parallelo a PyTorchL'inferenza sul dispositivo mantiene i dati in localeXNNPACK e backend CPU/GPU per dispositivi mobili
Axelera AIThroughput molto elevato (fino a 856 TOPS)Metis AIPU tramite PCIe o M.2SDK Axelera VoyagerInferenza edge ad alto throughputAggiornamenti dell'SDK AxeleraInferenza edge on-premiseAIPU Metis di Axelera
DEEPXInferenza NPU ottimizzata per INT8Hardware NPU DEEPXStrumenti per sviluppatori DEEPX (dx_com, dx_engine)Inferenza edge embeddedAggiornamenti di SDK e runtime DEEPXInferenza locale sul dispositivoNPU DEEPX
Qualcomm QNNInferenza rapida su dispositivo con SnapdragonNPU Hexagon Snapdragon, GPU Adreno, CPUEcosistema Qualcomm AI HubDispositivi Snapdragon mobili ed edgeAggiornamenti dello stack Qualcomm AI (QAIRT)L'inferenza sul dispositivo mantiene i dati in localeNPU Hexagon Snapdragon
HailoInferenza HEF INT8 sulle NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler e HailoRTTelecamere, robot, sistemi edge industrialiRelease di Hailo DFC e HailoRTInferenza locale sul dispositivoNPU Hailo
Huawei AscendThroughput maggiore sull'Ascend AI CoreSchede Atlas e OrangePi AIProEcosistema Huawei CANNInferenza edge sulle NPU AscendRelease di CANN e ATCInferenza locale sul dispositivoAscend AI Core
AMD XilinxInferenza INT8 sulle NPU Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI e QuarkVisione embedded su SoC adattiviVersioni di Vitis AI e QuarkInferenza locale sul dispositivoNPU del motore AI Versal

Questo confronto offre una panoramica generale. Per la distribuzione, valuta i requisiti e i vincoli specifici del tuo progetto rispetto a ciascuna opzione e consulta la guida all'integrazione collegata per il formato che scegli.

Conclusione#

L'ampia gamma di formati di esportazione di YOLO26 ti permette di adattare un modello a quasi qualsiasi ambiente, da un server cloud con GPU a una telecamera edge con sensore integrato. Dopo aver scelto un formato, segui le best practice per la distribuzione dei modelli per l'ottimizzazione, la risoluzione dei problemi e la sicurezza, e affidati alla community Ultralytics quando incontri un ostacolo.

Domande frequenti#

  • Ultralytics YOLO26 supporta diversi formati di distribuzione, ciascuno progettato per ambienti e piattaforme hardware specifici. I formati principali includono:

    • PyTorch per la ricerca e la prototipazione, con un'eccellente integrazione con Python.
    • TorchScript per gli ambienti di produzione in cui Python non è disponibile.
    • ONNX per la compatibilità multipiattaforma e l'accelerazione hardware.
    • OpenVINO per prestazioni ottimizzate sull'hardware Intel.
    • TensorRT per un'inferenza ad alta velocità sulle GPU NVIDIA.

    Ogni formato offre vantaggi specifici. Per una guida dettagliata, consulta la documentazione sul processo di esportazione.

  • Per aumentare la velocità di inferenza sulle CPU Intel, puoi distribuire il tuo modello YOLO26 usando il toolkit OpenVINO di Intel. OpenVINO offre notevoli incrementi delle prestazioni ottimizzando i modelli per sfruttare al meglio l'hardware Intel.

    1. Converti il tuo modello YOLO26 nel formato OpenVINO usando la funzione model.export().
    2. Segui la guida dettagliata alla configurazione nella documentazione sull'esportazione Intel OpenVINO.

    Per saperne di più, consulta il nostro articolo del blog.

  • Sì, puoi distribuire i modelli YOLO26 sui dispositivi mobili usando LiteRT (in precedenza TensorFlow Lite) e NCNN per Android, e CoreML o LiteRT per iOS. LiteRT è il runtime on-device di Google per dispositivi mobili ed embedded e consente di eseguire lo stesso modello su Android, iOS e browser, offrendo un'inferenza on-device efficiente.

    Esempio
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Comando di esportazione per il formato NCNN
    model.export(format="ncnn")

    Per maggiori dettagli sulla distribuzione di modelli su dispositivi mobili, consulta la nostra guida all'integrazione di LiteRT.

  • Quando scegli un formato di distribuzione per YOLO26, considera i seguenti fattori:

    • Prestazioni: alcuni formati, come TensorRT, offrono velocità eccezionali sulle GPU NVIDIA, mentre OpenVINO è ottimizzato per l'hardware Intel.
    • Compatibilità: ONNX offre un'ampia compatibilità tra piattaforme diverse.
    • Facilità di integrazione: formati come CoreML o LiteRT sono pensati rispettivamente per ecosistemi specifici come iOS e Android.
    • Supporto della community: formati come PyTorch e TensorFlow dispongono di numerose risorse e di un ampio supporto da parte della community.

    Per un'analisi comparativa, consulta la nostra documentazione sui formati di esportazione.

  • Per distribuire i modelli YOLO26 in un'applicazione web, puoi usare LiteRT.js, il runtime web di LiteRT, che consente di eseguire modelli di machine learning direttamente nel browser e in Node.js. Questo approccio elimina la necessità di un'infrastruttura backend e offre prestazioni in tempo reale.

    1. Esporta il modello YOLO26 nel formato LiteRT.
    2. Integra il modello esportato nella tua applicazione web usando LiteRT.js.

    Per istruzioni dettagliate, consulta la nostra guida all'integrazione di LiteRT.

Commenti