Ultralytics YOLO27 :

Analyse comparative des options de déploiement de YOLO26#

YOLO26 prend en charge plus de 20 options de déploiement, chacune optimisée pour un runtime, une cible matérielle ou une plateforme différente — de PyTorch et ONNX à TensorRT, OpenVINO, CoreML et aux formats dédiés aux NPU edge. Le choix de la bonne option nécessite de trouver un équilibre entre la vitesse d'inférence, les contraintes matérielles et la facilité d'intégration. Ce guide compare chaque option afin que tu puisses choisir celle qui convient le mieux à ton application, puis consulter les bonnes pratiques de déploiement des modèles pour la déployer de manière fiable.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Le déploiement est l'étape du flux de travail d'un projet de vision par ordinateur où un modèle entraîné commence à effectuer un travail réel. Le format vers lequel tu l'exportes a donc un impact direct sur la vitesse, le coût et la portabilité.

Comment sélectionner la bonne option de déploiement pour ton modèle YOLO26#

Lorsque vient le moment de déployer ton modèle YOLO26, il est très important de sélectionner un format d'exportation adapté. Comme indiqué dans la documentation d'exportation d'Ultralytics YOLO26, la fonction model.export() convertit ton modèle entraîné dans différents formats adaptés à des environnements et des exigences de performances variés.

Le format idéal dépend du contexte opérationnel prévu pour ton modèle et de ton matériel.

Ignore l'exportation manuelle

Pour un déploiement géré sans exportation manuelle, Ultralytics Platform fournit des points de terminaison d'inférence prêts à l'emploi, avec mise à l'échelle automatique dans 42 régions du monde.

Les options de déploiement de YOLO26#

Voici une brève description de chaque format et des situations dans lesquelles l'utiliser. Pour découvrir la procédure complète d'exportation, consulte la documentation d'exportation ; pour comparer les critères côte à côte, consulte le tableau comparatif.

  • PyTorch (.pt) : le format natif pour l'entraînement et l'inférence, offrant une flexibilité maximale et une accélération GPU via NVIDIA CUDA ou AMD ROCm — idéal pour la recherche et le prototypage, sans étape d'exportation requise.
  • TorchScript (torchscript) : sérialise le modèle pour un runtime C++ sans Python, adapté aux systèmes de production où Python n'est pas disponible.
  • ONNX (onnx) : un format d'échange indépendant des frameworks, offrant une large prise en charge multiplateforme et matérielle via ONNX Runtime.
  • OpenVINO (openvino) : la boîte à outils d'Intel pour l'inférence optimisée sur les CPU Intel, les GPU intégrés et les NPU, courante dans l'IoT et l'informatique edge.
  • TensorRT (engine) : le runtime haute performance de NVIDIA, offrant une inférence GPU de premier ordre avec une optimisation FP16 et INT8.
  • CoreML (coreml) : le format Apple exécuté sur l'appareil pour iOS, macOS, watchOS et tvOS, utilisant l'Apple Neural Engine.
  • TF SavedModel (saved_model) : le format standard de TensorFlow pour le serving côté serveur à grande échelle avec TensorFlow Serving.
  • TF GraphDef (pb) : un format TensorFlow à graphe statique figé pour les environnements nécessitant un graphe de calcul fixe.
  • TF Edge TPU (edgetpu) : compile les modèles .tflite pour les accélérateurs Google Coral Edge TPU.
  • LiteRT (litert) : le runtime Google exécuté sur l'appareil (anciennement TensorFlow Lite) pour l'inférence mobile, embarquée et dans le navigateur à partir d'un unique modèle .tflite, avec prise en charge de FP32 et INT8 et exécution dans le navigateur via LiteRT.js.
  • PaddlePaddle (paddle) : le framework de deep learning de Baidu, très utilisé en Chine, offrant une large prise en charge matérielle.
  • MNN (mnn) : un moteur d'inférence léger et haute performance, optimisé pour les systèmes ARM et x86-64 mobiles et embarqués.
  • NCNN (ncnn) : un framework d'inférence haute performance et léger, optimisé pour les appareils mobiles ARM.
  • Sony IMX500 (imx) : exporte les modèles vers le capteur de vision intelligent IMX500 de Sony, avec traitement sur puce, comme celui de la Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn) : cible les NPU Rockchip sur les cartes embarquées avec quantification FP16 et INT8.
  • ExecuTorch (executorch) : le runtime natif de PyTorch exécuté sur l'appareil pour les environnements mobiles (iOS et Android) et embarqués via XNNPACK.
  • Axelera AI (axelera) : compile pour l'AIPU Metis d'Axelera (jusqu'à 856 TOPS) via PCIe ou M.2, pour l'inférence edge à haut débit.
  • DEEPX (deepx) : cible le matériel NPU DEEPX avec quantification INT8 pour l'inférence edge embarquée.
  • Qualcomm QNN (qnn) : inférence sur l'appareil avec le NPU Hexagon, le GPU Adreno et le CPU Snapdragon via la pile Qualcomm AI.
  • Core AI (coreai) : Le nouveau format .aimodel d'Apple pour iOS 27 et macOS 27, pris en charge sur le CPU, le GPU et le Apple Neural Engine ; l'exportation nécessite macOS 26 ou une version ultérieure sur Apple silicon.

L'intégration Hailo exporte directement les modèles YOLO de détection, de segmentation, de segmentation sémantique, d'estimation de profondeur, de classification, de pose et d'OBB vers Hailo HEF ; consulte son tableau de compatibilité pour connaître les modèles et cibles validés. L'intégration Ambarella suit un flux de travail axé sur ONNX et compile les exportations ONNX au format AmbaPB avec la chaîne d'outils CVflow d'Ambarella pour les SoC CVflow® tels que le CV72, en utilisant éventuellement l'entraînement tenant compte de la compression SpongeTorch. L'intégration Huawei Ascend compile les exportations ONNX au format hors ligne .om avec le compilateur CANN ATC pour l'inférence FP16 sur les processeurs Ascend AI.

Comparaison des options de déploiement#

Le tableau suivant récapitule les options de déploiement pour les modèles YOLO26 selon les critères qui déterminent généralement le choix. Pour une analyse approfondie de chaque format, consulte la documentation des formats d'exportation.

Option de déploiementBenchmarks de performanceCompatibilité et intégrationPrise en charge par la communauté et écosystèmeÉtudes de casMaintenance et mises à jourConsidérations de sécuritéAccélération matérielle
PyTorchBonne flexibilité ; peut entraîner un compromis sur les performances brutesExcellente avec les bibliothèques PythonRessources et communauté étenduesRecherche et prototypesDéveloppement régulier et actifDépend de l'environnement de déploiementPrise en charge de CUDA pour l'accélération GPU
TorchScriptMieux adapté à la production que PyTorchTransition fluide de PyTorch vers C++Spécialisé, mais plus limité que PyTorchSecteurs où Python constitue un goulot d'étranglementMises à jour cohérentes avec PyTorchSécurité améliorée sans Python completHérite de la prise en charge de CUDA de PyTorch
ONNXVariable selon le runtimeÉlevée entre les différents frameworksÉcosystème étendu, pris en charge par de nombreuses organisationsFlexibilité entre les frameworks MLMises à jour régulières pour les nouvelles opérationsVeille à appliquer des pratiques sécurisées de conversion et de déploiementDiverses optimisations matérielles
OpenVINOOptimisé pour le matériel IntelOptimal au sein de l'écosystème IntelSolide dans le domaine de la vision par ordinateurIoT et edge avec du matériel IntelMises à jour régulières pour le matériel IntelFonctionnalités robustes pour les applications sensiblesAdapté au matériel Intel
TensorRTDe premier ordre sur les GPU NVIDIAOptimal pour le matériel NVIDIARéseau solide grâce à NVIDIAInférence vidéo et image en temps réelMises à jour fréquentes pour les nouveaux GPUAccent mis sur la sécuritéConçu pour les GPU NVIDIA
CoreMLOptimisé pour le matériel Apple exécuté sur l'appareilExclusif à l'écosystème AppleSolide prise en charge par Apple et les développeursML exécuté sur l'appareil pour les produits AppleMises à jour régulières d'AppleAccent mis sur la confidentialité et la sécuritéApple Neural Engine et GPU
TF SavedModelÉvolutif dans les environnements serveurLarge compatibilité au sein de l'écosystème TensorFlowPrise en charge étendue grâce à la popularité de TensorFlowServir des modèles à grande échelleMises à jour régulières par Google et la communautéFonctionnalités robustes pour les entreprisesDiverses accélérations matérielles
TF GraphDefStable pour les graphes de calcul statiquesS'intègre bien à l'infrastructure TensorFlowRessources pour optimiser les graphes statiquesScénarios nécessitant des graphes statiquesMises à jour en parallèle du noyau TensorFlowPratiques de sécurité TensorFlow éprouvéesOptions d'accélération TensorFlow
TF Edge TPUOptimisé pour le matériel Edge TPU de GoogleExclusif aux appareils Edge TPUÉvolue grâce aux ressources de Google et de tiersAppareils IoT nécessitant un traitement en temps réelAméliorations pour les nouveaux matériels Edge TPUSécurité IoT robuste de GoogleConçu sur mesure pour Google Coral
LiteRTVitesse et efficacité sur mobile, systèmes embarqués et WebPrise en charge des appareils mobiles, systèmes embarqués, appareils edge et navigateursCommunauté solide, soutenue par GoogleApplications sur appareil pour Android, iOS et le WebFonctionnalités les plus récentes du runtime sur appareilInférence sécurisée sur appareil et dans le navigateurAccélération par GPU, DSP et WebGPU
PaddlePaddleCompétitif, facile à utiliser et évolutifÉcosystème Baidu, large prise en charge des applicationsCroissance rapide, particulièrement en ChineMarché chinois et traitement des languesAxé sur les applications d’IA chinoisesMet l’accent sur la confidentialité et la sécurité des donnéesNotamment les puces Kunlun de Baidu
MNNHautes performances pour les appareils mobilesSystèmes ARM mobiles et embarqués et CPU X86-64Communauté ML mobile et embarquéeEfficacité des systèmes mobilesMaintien de hautes performances sur les appareils mobilesAvantages de la sécurité sur appareilOptimisations pour les CPU et GPU ARM
NCNNOptimisé pour les appareils mobiles basés sur ARMSystèmes ARM mobiles et embarquésCommunauté ML mobile et embarquée restreinte, mais activeEfficacité sur les systèmes Android et ARMMaintien de hautes performances sur ARMAvantages de la sécurité sur appareilOptimisations pour les CPU et GPU ARM
Sony IMX500Inférence sur capteur avec une très faible consommation d’énergieCapteur Sony IMX500, Raspberry Pi AI CameraÉcosystème Sony AITRIOSIA edge sur caméraMises à jour du SDK Sony et de la chaîne d’outils MCTLes données restent sur le capteurAccélérateur intégré à la puce Sony IMX500
Rockchip RKNNOptimisé pour les NPU RockchipCartes SoC Rockchip (p. ex. RK3588)Communauté de développeurs RockchipSBC embarqués et appareils edgeMises à jour de Rockchip RKNN-ToolkitInférence locale sur appareilNPU Rockchip
ExecuTorchRuntime PyTorch efficace sur appareiliOS, Android et systèmes embarqués via XNNPACKSoutenu par le projet PyTorchApplications mobiles et embarquéesMaintenu en parallèle de PyTorchL’inférence sur appareil conserve les données localementBackends XNNPACK et CPU/GPU mobiles
Axelera AITrès haut débit (jusqu’à 856 TOPS)Metis AIPU via PCIe ou M.2SDK Axelera VoyagerInférence edge à haut débitMises à jour du SDK AxeleraInférence edge sur siteAIPU Axelera Metis
DEEPXInférence NPU optimisée pour INT8Matériel NPU DEEPXOutils de développement DEEPX (dx_com, dx_engine)Inférence edge embarquéeMises à jour du SDK et du runtime DEEPXInférence locale sur appareilNPU DEEPX
Qualcomm QNNInférence Snapdragon rapide sur appareilNPU Snapdragon Hexagon, GPU Adreno, CPUÉcosystème Qualcomm AI HubAppareils Snapdragon mobiles et edgeMises à jour de la pile d’IA Qualcomm (QAIRT)L’inférence sur appareil conserve les données localementNPU Snapdragon Hexagon
HailoInférence INT8 HEF sur les NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler et HailoRTCaméras, robots, systèmes de périphérie industrielleVersions de Hailo DFC et HailoRTInférence locale sur appareilNPU Hailo
Huawei AscendDébit accru sur l'Ascend AI CoreCartes Atlas et OrangePi AIProÉcosystème Huawei CANNInférence en périphérie sur les NPU AscendVersions de CANN et ATCInférence locale sur appareilAscend AI Core
Core AIOptimisé pour Apple siliconiOS 27 et macOS 27 ; l'exportation nécessite macOS 26+Framework Apple ; pas encore dans les SDK iOS/FlutterMachine learning sur appareil sur les plateformes Apple de nouvelle générationLié aux versions de systèmes d'exploitation Apple ; actuellement en version bêtaL’inférence sur appareil conserve les données localementApple Neural Engine, GPU et CPU

Cette comparaison te donne une vue d’ensemble. Pour le déploiement, évalue les exigences et contraintes spécifiques de ton projet au regard de chaque option, puis consulte le guide d’intégration associé au format que tu as choisi.

Conclusion#

La vaste gamme de formats d’exportation de YOLO26 te permet d’adapter un modèle à presque tous les environnements, d’un serveur cloud équipé d’un GPU à une caméra edge sur capteur. Une fois que tu as choisi un format, suis les bonnes pratiques de déploiement des modèles pour l’optimisation, le dépannage et la sécurité, et appuie-toi sur la communauté Ultralytics lorsque tu rencontres un problème.

FAQ#

  • Ultralytics YOLO26 prend en charge différents formats de déploiement, chacun étant conçu pour des environnements et des plateformes matérielles spécifiques. Les principaux formats sont les suivants :

    • PyTorch pour la recherche et le prototypage, avec une excellente intégration à Python.
    • TorchScript pour les environnements de production où Python n’est pas disponible.
    • ONNX pour la compatibilité multiplateforme et l’accélération matérielle.
    • OpenVINO pour des performances optimisées sur le matériel Intel.
    • TensorRT pour une inférence haute vitesse sur les GPU NVIDIA.

    Chaque format présente des avantages uniques. Pour un guide détaillé, consulte notre documentation sur le processus d’exportation.

  • Pour améliorer la vitesse d’inférence sur les CPU Intel, tu peux déployer ton modèle YOLO26 avec la boîte à outils OpenVINO d’Intel. OpenVINO offre des gains de performances significatifs en optimisant les modèles afin qu’ils exploitent efficacement le matériel Intel.

    1. Convertis ton modèle YOLO26 au format OpenVINO à l’aide de la fonction model.export().
    2. Suis le guide de configuration détaillé dans la documentation sur l’exportation Intel OpenVINO.

    Pour plus d’informations, consulte notre article de blog.

  • Oui, les modèles YOLO26 peuvent être déployés sur des appareils mobiles à l'aide de LiteRT (anciennement TensorFlow Lite) et de NCNN pour Android, ainsi que de CoreML ou de LiteRT pour iOS. LiteRT est le runtime Google sur appareil pour les appareils mobiles et embarqués. Il exécute le même modèle sur Android, iOS et le navigateur, offrant une inférence efficace sur appareil.

    Exemple
    # Export command for NCNN format
    model.export(format="ncnn")

    Pour plus de détails sur le déploiement de modèles sur mobile, consulte notre guide d'intégration de LiteRT.

  • Lors du choix d'un format de déploiement pour YOLO26, prends en compte les facteurs suivants :

    • Performances : certains formats comme TensorRT offrent des vitesses exceptionnelles sur les GPU NVIDIA, tandis qu'OpenVINO est optimisé pour le matériel Intel.
    • Compatibilité : ONNX offre une large compatibilité entre différentes plateformes.
    • Facilité d'intégration : les formats comme CoreML ou LiteRT sont conçus pour des écosystèmes spécifiques comme iOS et Android, respectivement.
    • Assistance de la communauté : les formats comme PyTorch et TensorFlow disposent de nombreuses ressources et d'un vaste support communautaires.

    Pour une analyse comparative, consulte notre documentation sur les formats d'exportation.

  • Pour déployer des modèles YOLO26 dans une application web, tu peux utiliser LiteRT.js, le runtime web de LiteRT, qui permet d'exécuter des modèles d'apprentissage automatique directement dans le navigateur et Node.js. Cette approche élimine le besoin d'une infrastructure backend et offre des performances en temps réel.

    1. Exporte le modèle YOLO26 au format LiteRT.
    2. Intègre le modèle exporté à ton application web à l'aide de LiteRT.js.

    Pour obtenir des instructions détaillées étape par étape, consulte notre guide d'intégration de LiteRT.

Commentaires