YOLO Vision 2026 :

Analyse comparative des options de déploiement de YOLO26#

YOLO26 prend en charge plus de 20 options de déploiement, chacune optimisée pour un runtime, une cible matérielle ou une plateforme différente — de PyTorch et ONNX à TensorRT, OpenVINO, CoreML et des formats dédiés aux NPU de périphérie. Choisir la bonne option permet de trouver un équilibre entre vitesse d'inférence, contraintes matérielles et facilité d'intégration. Ce guide compare toutes les options pour t'aider à choisir la mieux adaptée à ton application, puis à consulter les bonnes pratiques de déploiement de modèles pour un déploiement fiable.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Le déploiement est l'étape du flux de travail des projets de vision par ordinateur où un modèle entraîné commence à accomplir de vraies tâches ; le format vers lequel tu l'exportes a donc un impact direct sur la vitesse, le coût et la portabilité.

Comment choisir la bonne option de déploiement pour ton modèle YOLO26#

Quand le moment est venu de déployer ton modèle YOLO26, le choix d'un format d'exportation adapté est primordial. Comme indiqué dans la documentation d'exportation Ultralytics YOLO26, la fonction model.export() convertit ton modèle entraîné en une variété de formats adaptés à des environnements et des exigences de performance divers.

Le format idéal dépend du contexte opérationnel et du matériel prévus pour ton modèle.

Ignore l'exportation manuelle

Pour un déploiement géré sans exportation manuelle, Ultralytics Platform fournit des points de terminaison d'inférence prêts à l'emploi avec mise à l'échelle automatique dans 42 régions mondiales.

Options de déploiement de YOLO26#

Voici une brève description de chaque format et des cas où les utiliser. Pour consulter la procédure d'exportation complète, reporte-toi à la documentation sur l'exportation ; pour les critères comparatifs, passe directement au tableau comparatif.

  • PyTorch (.pt): Le format natif d'entraînement et d'inférence, offrant une flexibilité maximale et une accélération GPU via NVIDIA CUDA ou AMD ROCm — idéal pour la recherche et le prototypage sans étape d'exportation requise.
  • TorchScript (torchscript): Sérialise le modèle pour un runtime C++ sans Python, adapté aux systèmes de production où Python n'est pas disponible.
  • ONNX (onnx): Un format d'échange agnostique vis-à-vis des frameworks, bénéficiant d'un large support multiplateforme et matériel via ONNX Runtime.
  • OpenVINO (openvino): La boîte à outils d'Intel pour une inférence optimisée sur les CPU Intel, les GPU intégrés et les NPU, courante dans l'IdO et l'informatique en périphérie.
  • TensorRT (engine): Le runtime haute performance de NVIDIA offrant une inférence GPU de premier ordre avec une optimisation FP16 et INT8.
  • CoreML (coreml): Le format sur appareil d'Apple pour iOS, macOS, watchOS et tvOS, utilisant l'Apple Neural Engine.
  • TF SavedModel (saved_model): Le format standard de TensorFlow pour un service côté serveur évolutif avec TensorFlow Serving.
  • TF GraphDef (pb): Un format TensorFlow à graphe statique figé pour les environnements nécessitant un graphe de calcul fixe.
  • TF Edge TPU (edgetpu): Compile les modèles .tflite pour les accélérateurs Google Coral Edge TPU.
  • LiteRT (litert): Le runtime sur appareil de Google (anciennement TensorFlow Lite) pour l'inférence mobile, embarquée et sur navigateur à partir d'un seul modèle .tflite, avec prise en charge FP32 et INT8 et exécution dans le navigateur via LiteRT.js.
  • PaddlePaddle (paddle): Le framework de deep learning de Baidu, populaire en Chine, avec un large support matériel.
  • MNN (mnn): Un moteur d'inférence léger et haute performance optimisé pour les systèmes mobiles et embarqués ARM et x86-64.
  • NCNN (ncnn): Un framework d'inférence léger et haute performance conçu pour les appareils mobiles ARM.
  • Sony IMX500 (imx): Exporte pour le capteur de vision intelligent IMX500 de Sony avec traitement sur puce, tel que la caméra Raspberry Pi AI.
  • Rockchip RKNN (rknn): Cible les NPU Rockchip sur les cartes embarquées avec une quantification FP16 et INT8.
  • ExecuTorch (executorch): Le runtime sur appareil natif de PyTorch pour mobile (iOS et Android) et les systèmes embarqués via XNNPACK.
  • Axelera AI (axelera): Compile pour l'AIPU Metis d'Axelera (jusqu'à 856 TOPS) via PCIe ou M.2 pour une inférence en périphérie à haut débit.
  • DEEPX (deepx): Cible le matériel NPU DEEPX avec une quantification INT8 pour l'inférence en périphérie embarquée.
  • Qualcomm QNN (qnn): Inférence sur appareil sur le NPU Snapdragon Hexagon, le GPU Adreno et le CPU via la pile IA de Qualcomm.

L'intégration Hailo exporte les modèles de détection, de segmentation, de segmentation sémantique, d'estimation de profondeur, de classification, de pose et OBB de YOLO directement vers Hailo HEF ; consulte son tableau de compatibilité pour connaître les modèles et cibles validés. L'intégration Ambarella suit un flux de travail axé sur ONNX et compile les exportations ONNX au format AmbaPB avec la chaîne d'outils CVflow d'Ambarella pour les SoC CVflow® tels que le CV72, en utilisant éventuellement l'entraînement conscient de la compression SpongeTorch. L'intégration Huawei Ascend compile les exportations ONNX au format hors ligne .om avec le compilateur CANN ATC pour l'inférence FP16 sur les processeurs Ascend AI.

Comparaison des options de déploiement#

Le tableau suivant résume les options de déploiement pour les modèles YOLO26 selon les critères qui guident habituellement ton choix. Pour une vue détaillée de chaque format, consulte la documentation sur les formats d'exportation.

Option de déploiementBenchmarks de performanceCompatibilité et intégrationSupport communautaire et écosystèmeÉtudes de casMaintenance et mises à jourConsidérations de sécuritéAccélération matérielle
PyTorchBonne flexibilité ; peut compromettre les performances brutesExcellent avec les bibliothèques PythonRessources et communauté étenduesRecherche et prototypesDéveloppement régulier et actifDépend de l'environnement de déploiementSupport CUDA pour l'accélération GPU
TorchScriptMeilleur pour la production que PyTorchTransition fluide de PyTorch vers C++Spécialisé mais plus restreint que PyTorchIndustrie où Python est un goulot d'étranglementMises à jour cohérentes avec PyTorchSécurité améliorée sans Python completHérite du support CUDA de PyTorch
ONNXVariable selon le runtimeÉlevée entre différents frameworksVaste écosystème, soutenu par de nombreuses organisationsFlexibilité entre les frameworks MLMises à jour régulières pour les nouvelles opérationsAssurer des pratiques de conversion et de déploiement sécuriséesDiverses optimisations matérielles
OpenVINOOptimisé pour le matériel IntelIdéal au sein de l'écosystème IntelSolide dans le domaine de la vision par ordinateurIoT et périphérie avec le matériel IntelMises à jour régulières pour le matériel IntelFonctionnalités robustes pour les applications sensiblesAdapté au matériel Intel
TensorRTDe premier ordre sur les GPU NVIDIAMeilleur pour le matériel NVIDIARéseau solide grâce à NVIDIAInférence vidéo et image en temps réelMises à jour fréquentes pour les nouveaux GPUAccent mis sur la sécuritéConçu pour les GPU NVIDIA
CoreMLOptimisé pour le matériel Apple sur appareilExclusif à l'écosystème AppleSupport solide d'Apple et des développeursML sur appareil sur les produits AppleMises à jour régulières d'AppleAccent sur la confidentialité et la sécuritéMoteur neural et GPU Apple
TF SavedModelÉvolutif dans les environnements serveurLarge compatibilité dans l'écosystème TensorFlowSupport étendu dû à la popularité de TensorFlowService de modèles à grande échelleMises à jour régulières par Google et la communautéFonctionnalités robustes pour l'entrepriseDiverses accélérations matérielles
TF GraphDefStable pour les graphes de calcul statiquesS'intègre bien avec l'infrastructure TensorFlowRessources pour optimiser les graphes statiquesScénarios nécessitant des graphes statiquesMises à jour avec le noyau TensorFlowPratiques de sécurité établies par TensorFlowOptions d'accélération TensorFlow
TF Edge TPUOptimisé pour le matériel Edge TPU de GoogleExclusif aux appareils Edge TPUEn pleine croissance avec Google et des ressources tiercesAppareils IoT nécessitant un traitement en temps réelAméliorations pour le nouveau matériel Edge TPUSécurité IoT robuste de GoogleConçu sur mesure pour Google Coral
LiteRTVitesse et efficacité sur mobile/embarqué/webPrise en charge mobile, embarquée, edge et navigateurCommunauté robuste, soutenue par GoogleApplications sur appareil pour Android, iOS et webDernières fonctionnalités d'exécution sur appareilInférence sécurisée sur appareil et dans le navigateurAccélération GPU, DSP et WebGPU
PaddlePaddleCompétitif, facile à utiliser et évolutifÉcosystème Baidu, large support d'applicationsCroissance rapide, surtout en ChineMarché chinois et traitement linguistiqueFocus sur les applications d'IA chinoisesMet l'accent sur la confidentialité et la sécurité des donnéesIncluant les puces Kunlun de Baidu
MNNHaute performance pour les appareils mobilesSystèmes mobiles et embarqués ARM et CPU X86-64Communauté ML mobile/embarquéEfficacité des systèmes mobilesMaintenance de haute performance sur les appareils mobilesAvantages de la sécurité sur l'appareilOptimisations pour CPU et GPU ARM
NCNNOptimisé pour les appareils mobiles basés sur ARMSystèmes mobiles et embarqués ARMCommunauté ML mobile/embarqué de niche mais activeEfficacité des systèmes Android et ARMMaintenance haute performance sur ARMAvantages de la sécurité sur l'appareilOptimisations pour CPU et GPU ARM
Sony IMX500Inférence sur capteur à très faible consommationCapteur Sony IMX500, Raspberry Pi AI CameraÉcosystème Sony AITRIOSIA en périphérie sur caméraMises à jour de la chaîne d'outils SDK et MCT de SonyLes données restent sur le capteurAccélérateur sur puce Sony IMX500
Rockchip RKNNOptimisé pour les NPU RockchipCartes SoC Rockchip (par ex. RK3588)Communauté de développeurs RockchipSBC embarqués et appareils en périphérieMises à jour de Rockchip RKNN-ToolkitInférence locale sur appareilNPU Rockchip
ExecuTorchEnvironnement d'exécution PyTorch efficace sur appareiliOS, Android, embarqué via XNNPACKSoutenu par le projet PyTorchApplications mobiles et embarquéesMaintenu parallèlement à PyTorchL'inférence sur l'appareil garde les données en localBackends XNNPACK et CPU/GPU mobiles
Axelera AITrès haut débit (jusqu'à 856 TOPS)Metis AIPU via PCIe ou M.2SDK Axelera VoyagerInférence en périphérie à haut débitMises à jour du SDK AxeleraInférence en périphérie sur siteAIPU Axelera Metis
DEEPXInférence NPU optimisée INT8Matériel NPU DEEPXOutils de développement DEEPX (dx_com, dx_engine)Inférence en périphérie embarquéeMises à jour du SDK et de l'environnement d'exécution DEEPXInférence locale sur appareilNPU DEEPX
Qualcomm QNNInférence rapide sur appareil SnapdragonNPU Snapdragon Hexagon, GPU Adreno, CPUÉcosystème Qualcomm AI HubAppareils mobiles et en périphérie SnapdragonMises à jour de la pile Qualcomm AI (QAIRT)L'inférence sur l'appareil garde les données en localNPU Snapdragon Hexagon

Cette comparaison te donne une vue d'ensemble. Pour le déploiement, pèse les exigences et contraintes spécifiques de ton projet face à chaque option, et consulte le guide d'intégration lié pour le format que tu choisis.

Conclusion#

La grande variété de formats d'exportation de YOLO26 te permet d'adapter un modèle à presque n'importe quel environnement, d'un serveur GPU cloud à une caméra en périphérie intégrée au capteur. Une fois que tu as choisi un format, suis les bonnes pratiques de déploiement de modèles pour l'optimisation, le dépannage et la sécurité, et n'hésite pas à t'appuyer sur la communauté Ultralytics en cas de difficulté.

FAQ#

  • Ultralytics YOLO26 prend en charge divers formats de déploiement, chacun étant conçu pour des environnements et des plateformes matérielles spécifiques. Les principaux formats incluent :

    • PyTorch pour la recherche et le prototypage, avec une excellente intégration Python.
    • TorchScript pour les environnements de production où Python n'est pas disponible.
    • ONNX pour la compatibilité multiplateforme et l'accélération matérielle.
    • OpenVINO pour des performances optimisées sur le matériel Intel.
    • TensorRT pour une inférence à haute vitesse sur les GPU NVIDIA.

    Chaque format présente des avantages uniques. Pour un guide détaillé, consulte notre documentation sur le processus d'exportation.

  • Pour améliorer la vitesse d'inférence sur les CPU Intel, tu peux déployer ton modèle YOLO26 en utilisant la boîte à outils OpenVINO d'Intel. OpenVINO offre des gains de performance significatifs en optimisant les modèles pour tirer efficacement parti du matériel Intel.

    1. Convertis ton modèle YOLO26 au format OpenVINO à l'aide de la fonction model.export().
    2. Suis le guide de configuration détaillé dans la documentation sur l'exportation Intel OpenVINO.

    Pour plus d'informations, consulte notre article de blog.

  • Oui, les modèles YOLO26 peuvent être déployés sur des appareils mobiles en utilisant LiteRT (anciennement TensorFlow Lite) et NCNN pour Android, ainsi que CoreML ou LiteRT pour iOS. LiteRT est le runtime sur appareil de Google pour les appareils mobiles et embarqués et exécute le même modèle sur Android, iOS et le navigateur, offrant une inférence efficace sur appareil.

    Exemple
    # Export command for NCNN format
    model.export(format="ncnn")

    Pour plus de détails sur le déploiement de modèles sur mobile, réfère-toi à notre guide d'intégration LiteRT.

  • Lors du choix d'un format de déploiement pour YOLO26, prends en compte les facteurs suivants :

    • Performance : Certains formats comme TensorRT offrent des vitesses exceptionnelles sur les GPU NVIDIA, tandis qu'OpenVINO est optimisé pour le matériel Intel.
    • Compatibilité : ONNX offre une large compatibilité entre différentes plateformes.
    • Facilité d'intégration : Des formats comme CoreML ou LiteRT sont conçus spécifiquement pour des écosystèmes comme iOS et Android, respectivement.
    • Support communautaire : Des formats tels que PyTorch et TensorFlow disposent de ressources communautaires et d'un support étendus.

    Pour une analyse comparative, réfère-toi à notre documentation sur les formats d'exportation.

  • Pour déployer des modèles YOLO26 dans une application web, tu peux utiliser LiteRT.js, le runtime web de LiteRT, qui permet d'exécuter des modèles de machine learning directement dans le navigateur et sur Node.js. Cette approche élimine le besoin d'infrastructure backend et offre des performances en temps réel.

    1. Exporte le modèle YOLO26 au format LiteRT.
    2. Intègre le modèle exporté dans ton application web en utilisant LiteRT.js.

    Pour des instructions étape par étape, réfère-toi à notre guide d'intégration LiteRT.

Commentaires