Ultralytics YOLO27 :
Get Started

Analyse comparative des options de déploiement de YOLO26#

YOLO26 prend en charge plus de 20 options de déploiement, chacune adaptée à un environnement d’exécution, une cible matérielle ou une plateforme différente — de PyTorch et ONNX à TensorRT, OpenVINO, CoreML et aux formats dédiés aux NPU de périphérie. Le choix de la bonne option implique de trouver un équilibre entre la vitesse d’inférence, les contraintes matérielles et la facilité d’intégration. Ce guide compare toutes les options pour t’aider à choisir celle qui convient le mieux à ton application, puis à passer aux bonnes pratiques de déploiement des modèles afin de la déployer de manière fiable.



À regarder : Comment choisir le meilleur format de déploiement Ultralytics YOLO26 pour ton projet | TensorRT | OpenVINO 🚀

Le déploiement est l’étape du flux de travail d’un projet de vision par ordinateur où un modèle entraîné commence à effectuer des tâches concrètes ; le format d’exportation a donc un impact direct sur la vitesse, le coût et la portabilité.

Comment choisir la bonne option de déploiement pour ton modèle YOLO26#

Au moment de déployer ton modèle YOLO26, il est très important de choisir un format d’exportation adapté. Comme l’explique la documentation d’exportation d’Ultralytics YOLO26, la fonction model.export() convertit ton modèle entraîné vers différents formats adaptés à divers environnements et exigences de performance.

Le format idéal dépend du contexte opérationnel prévu pour ton modèle et du matériel utilisé.

Évite l’exportation manuelle

Pour un déploiement géré sans exportation manuelle, Ultralytics Platform fournit des points de terminaison d’inférence prêts à l’emploi, avec mise à l’échelle automatique dans 42 régions du monde.

Options de déploiement de YOLO26#

Voici une brève description de chaque format et des situations dans lesquelles l’utiliser. Pour le guide complet de l’exportation, consulte la documentation sur l’exportation ; pour comparer les critères côte à côte, passe au tableau comparatif.

  • PyTorch (.pt) : Le format natif d’entraînement et d’inférence, qui offre une flexibilité maximale et une accélération GPU grâce à NVIDIA CUDA ou à AMD ROCm — idéal pour la recherche et le prototypage, sans étape d’exportation.
  • TorchScript (torchscript) : Sérialise le modèle pour un environnement d’exécution C++ sans Python, adapté aux systèmes de production où Python n’est pas disponible.
  • ONNX (onnx) : Un format d’échange indépendant des frameworks, offrant une large prise en charge multiplateforme et matérielle par l’intermédiaire d’ONNX Runtime, y compris pour les GPU NVIDIA via CUDA et les GPU AMD via MIGraphX.
  • OpenVINO (openvino) : La boîte à outils d’Intel pour l’inférence optimisée sur les processeurs Intel, les GPU intégrés et les NPU, courante dans l’IoT et l’informatique en périphérie.
  • TensorRT (engine) : L’environnement d’exécution haute performance de NVIDIA, qui offre une inférence GPU de premier ordre avec les optimisations FP16 et INT8.
  • CoreML (coreml) : Le format d’Apple pour l’exécution sur appareil sous iOS, macOS, watchOS et tvOS, utilisant l’Apple Neural Engine.
  • Core AI (coreai) : Le nouveau format .aimodel d’Apple pour iOS 27 et macOS 27, destiné au CPU, au GPU et à l’Apple Neural Engine ; l’exportation nécessite macOS 26 ou une version ultérieure sur Apple silicon, ou Linux x86_64 avec glibc 2.34 ou une version ultérieure, ainsi que Python 3.11 à 3.14.
  • TF SavedModel (saved_model) : Le format standard de TensorFlow pour le service évolutif côté serveur avec TensorFlow Serving.
  • TF GraphDef (pb) : Un format TensorFlow à graphe statique figé, pour les environnements qui nécessitent un graphe de calcul fixe.
  • TF Edge TPU (edgetpu) : Compile les modèles .tflite pour les accélérateurs Google Coral Edge TPU.
  • LiteRT (litert) : L’environnement d’exécution sur appareil de Google (anciennement TensorFlow Lite) pour l’inférence sur mobile, systèmes embarqués et navigateurs à partir d’un seul modèle .tflite, avec prise en charge de FP32 et INT8, ainsi qu’une exécution dans le navigateur via LiteRT.js.
  • PaddlePaddle (paddle) : Le framework d’apprentissage profond de Baidu, populaire en Chine et compatible avec de nombreux matériels.
  • MNN (mnn) : Un moteur d’inférence léger et performant, optimisé pour les systèmes mobiles et embarqués ARM et x86-64.
  • NCNN (ncnn) : Un framework d’inférence léger et performant, optimisé pour les appareils mobiles ARM.
  • Sony IMX500 (imx) : Exporte les modèles pour le capteur de vision intelligent IMX500 de Sony, doté d’un traitement sur puce, comme dans la Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn) : Destiné aux NPU Rockchip sur les cartes embarquées, avec quantification FP16 et INT8.
  • ExecuTorch (executorch) : L’environnement d’exécution natif sur appareil de PyTorch pour les systèmes mobiles (iOS et Android) et embarqués, via XNNPACK.
  • Axelera AI (axelera) : Compile les modèles pour l’AIPU Metis d’Axelera (jusqu’à 856 TOPS), via PCIe ou M.2, pour l’inférence en périphérie à haut débit.
  • DEEPX (deepx) : Destiné au matériel NPU DEEPX, avec quantification INT8 pour l’inférence embarquée en périphérie.
  • Qualcomm QNN (qnn) : Inférence sur appareil avec le NPU Snapdragon Hexagon, le GPU Adreno et le CPU, par l’intermédiaire de la pile d’IA de Qualcomm.

L’intégration Hailo exporte directement les modèles YOLO de détection, de segmentation, de segmentation sémantique, d’estimation de profondeur, de classification, de pose et OBB au format Hailo HEF ; consulte son tableau de compatibilité pour connaître les modèles et les cibles validés. L’intégration Ambarella repose d’abord sur ONNX et compile les exports ONNX au format AmbaPB avec la chaîne d’outils CVflow d’Ambarella, pour les SoC CVflow® tels que le CV72, avec la possibilité d’utiliser l’entraînement tenant compte de la compression SpongeTorch. L’intégration Huawei Ascend compile les exports ONNX au format hors ligne .om avec le compilateur CANN ATC pour l’inférence FP16 sur les processeurs IA Ascend. L’intégration AMD Xilinx quantifie les exports ONNX avec AMD Quark pour les NPU Versal AI Edge Series Gen 2, que le Vitis AI Execution Provider compile en modèle .rai.

Comparaison des options de déploiement#

Le tableau suivant résume les options de déploiement des modèles YOLO26 selon les critères qui guident généralement le choix. Pour un examen approfondi de chaque format, consulte la documentation sur les formats d’exportation.

Option de déploiementBancs d’essai de performancesCompatibilité et intégrationAssistance de la communauté et écosystèmeÉtudes de casMaintenance et mises à jourConsidérations de sécuritéAccélération matérielle
PyTorchBonne flexibilité ; les performances brutes peuvent être moindresExcellente compatibilité avec les bibliothèques PythonRessources et communauté très fourniesRecherche et prototypesDéveloppement régulier et actifDépend de l’environnement de déploiementPrise en charge de CUDA pour l’accélération GPU
TorchScriptMieux adapté à la production que PyTorchTransition fluide de PyTorch vers C++Spécialisé, mais moins généraliste que PyTorchSecteurs où Python constitue un goulot d’étranglementMises à jour régulières avec PyTorchSécurité renforcée sans Python completBénéficie de la prise en charge de CUDA par PyTorch
ONNXVariable selon l’environnement d’exécutionÉlevée entre différents frameworksÉcosystème vaste, pris en charge par de nombreuses organisationsFlexibilité entre les frameworks de MLMises à jour régulières pour les nouvelles opérationsVeille à appliquer des pratiques sûres de conversion et de déploiementDiverses optimisations matérielles
OpenVINOOptimisé pour le matériel IntelOptimal au sein de l’écosystème IntelSolide dans le domaine de la vision par ordinateurIoT et edge avec du matériel IntelMises à jour régulières pour le matériel IntelFonctionnalités robustes pour les applications sensiblesConçu sur mesure pour le matériel Intel
TensorRTDe premier ordre sur les GPU NVIDIAIdéal pour le matériel NVIDIARéseau solide grâce à NVIDIAInférence vidéo et image en temps réelMises à jour fréquentes pour les nouveaux GPUPriorité à la sécuritéConçu pour les GPU NVIDIA
CoreMLOptimisé pour le matériel Apple exécuté sur l’appareilExclusif à l’écosystème AppleSolide soutien d’Apple et des développeursML exécuté sur l’appareil dans les produits AppleMises à jour régulières d’ApplePriorité à la confidentialité et à la sécuritéNeural Engine et GPU d’Apple
Core AIOptimisé pour Apple siliconiOS 27 et macOS 27 ; exportation sur Apple silicon avec macOS 26+ ou Linux x86_64 (glibc 2.34+), Python 3.11-3.14Framework Apple ; activation facultative dans les SDK iOS/FlutterML exécuté sur l’appareil sur les plateformes Apple de nouvelle générationLié aux versions des systèmes d’exploitation Apple ; actuellement en bêtaL’inférence exécutée sur l’appareil conserve les données localementNeural Engine, GPU et CPU d’Apple
TF SavedModelÉvolutif dans les environnements serveurLarge compatibilité avec l’écosystème TensorFlowLarge soutien grâce à la popularité de TensorFlowDéploiement de modèles à grande échelleMises à jour régulières de Google et de la communautéFonctionnalités robustes pour les entreprisesDiverses accélérations matérielles
TF GraphDefStable pour les graphes de calcul statiquesS’intègre bien à l’infrastructure TensorFlowRessources pour optimiser les graphes statiquesScénarios nécessitant des graphes statiquesMises à jour parallèles à celles du cœur de TensorFlowPratiques de sécurité éprouvées de TensorFlowOptions d’accélération TensorFlow
TF Edge TPUOptimisé pour le matériel Edge TPU de GoogleExclusif aux appareils Edge TPUEnrichi par les ressources de Google et de tiersAppareils IoT nécessitant un traitement en temps réelAméliorations pour les nouveaux matériels Edge TPUSécurité IoT robuste de GoogleConçu sur mesure pour Google Coral
LiteRTVitesse et efficacité sur mobile, embarqué et webPrise en charge des appareils mobiles, embarqués et edge, ainsi que des navigateursCommunauté solide, avec le soutien de GoogleApplications exécutées sur l’appareil sous Android, iOS et sur le webFonctionnalités d’exécution les plus récentes pour les appareilsInférence sécurisée sur l’appareil et dans le navigateurAccélération par GPU, DSP et WebGPU
PaddlePaddleCompétitif, facile à utiliser et évolutifÉcosystème Baidu et prise en charge étendue des applicationsEn forte croissance, surtout en ChineMarché chinois et traitement des languesPriorité aux applications d’IA chinoisesMet l’accent sur la confidentialité et la sécurité des donnéesY compris les puces Kunlun de Baidu
MNNHaute performance pour les appareils mobilesSystèmes ARM mobiles et embarqués, et CPU X86-64Communauté ML mobile et embarquéeEfficacité des systèmes mobilesMaintien de performances élevées sur les appareils mobilesAvantages de la sécurité sur l’appareilOptimisations pour les CPU et GPU ARM
NCNNOptimisé pour les appareils mobiles basés sur ARMSystèmes ARM mobiles et embarquésCommunauté ML mobile et embarquée de niche, mais activeEfficacité des systèmes Android et ARMMaintien de performances élevées sur ARMAvantages de la sécurité sur l’appareilOptimisations pour les CPU et GPU ARM
Sony IMX500Inférence sur le capteur avec une très faible consommationCapteur Sony IMX500, caméra Raspberry Pi AI CameraÉcosystème Sony AITRIOSIA edge directement sur la caméraMises à jour du SDK Sony et de la chaîne d’outils MCTLes données restent sur le capteurAccélérateur intégré à la puce Sony IMX500
Rockchip RKNNOptimisé pour les NPU RockchipCartes SoC Rockchip (p. ex. RK3588)Communauté de développeurs RockchipSBC embarqués et appareils edgeMises à jour de Rockchip RKNN-ToolkitInférence locale exécutée sur l’appareilNPU Rockchip
ExecuTorchEnvironnement d’exécution PyTorch efficace sur l’appareiliOS, Android et systèmes embarqués via XNNPACKSoutenu par le projet PyTorchApplications mobiles et embarquéesMaintenu en parallèle de PyTorchL’inférence exécutée sur l’appareil conserve les données localementXNNPACK et backends CPU/GPU mobiles
Axelera AITrès haut débit (jusqu’à 856 TOPS)Metis AIPU via PCIe ou M.2SDK Axelera VoyagerInférence edge à haut débitMises à jour du SDK AxeleraInférence en périphérie sur siteAIPU Metis d’Axelera
DEEPXInférence sur NPU optimisée pour INT8Matériel NPU DEEPXOutils de développement DEEPX (dx_com, dx_engine)Inférence en périphérie embarquéeMises à jour du SDK et du runtime DEEPXInférence locale exécutée sur l’appareilNPU DEEPX
Qualcomm QNNInférence Snapdragon rapide sur l’appareilNPU Hexagon Snapdragon, GPU Adreno, CPUÉcosystème Qualcomm AI HubAppareils Snapdragon mobiles et de périphérieMises à jour de la pile d’IA Qualcomm (QAIRT)L’inférence exécutée sur l’appareil conserve les données localementNPU Hexagon Snapdragon
HailoInférence HEF INT8 sur les NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Compilateur Hailo Dataflow et HailoRTCaméras, robots, systèmes industriels en périphérieVersions de Hailo DFC et HailoRTInférence locale exécutée sur l’appareilNPU Hailo
Huawei AscendDébit supérieur sur l’Ascend AI CoreCartes Atlas et OrangePi AIProÉcosystème Huawei CANNInférence en périphérie sur les NPU AscendVersions de CANN et ATCInférence locale exécutée sur l’appareilAscend AI Core
AMD XilinxInférence INT8 sur les NPU Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI et QuarkVision embarquée sur SoC adaptatifsVersions de Vitis AI et QuarkInférence locale exécutée sur l’appareilNPU Versal AI Engine

Cette comparaison te donne une vue d’ensemble. Pour le déploiement, évalue les exigences et contraintes spécifiques de ton projet pour chaque option, et consulte le guide d’intégration lié au format que tu choisis.

Conclusion#

La vaste gamme de formats d’exportation de YOLO26 te permet d’adapter un modèle à presque tous les environnements, d’un serveur GPU dans le cloud à une caméra de périphérie dotée d’un capteur. Une fois le format choisi, suis les bonnes pratiques de déploiement des modèles pour l’optimisation, le dépannage et la sécurité, et fais appel à la communauté Ultralytics en cas de problème.

FAQ#

  • Ultralytics YOLO26 prend en charge différents formats de déploiement, chacun conçu pour des environnements et des plateformes matérielles spécifiques. Voici les principaux formats :

    • PyTorch pour la recherche et le prototypage, avec une excellente intégration à Python.
    • TorchScript pour les environnements de production où Python n’est pas disponible.
    • ONNX pour la compatibilité multiplateforme et l’accélération matérielle.
    • OpenVINO pour des performances optimisées sur le matériel Intel.
    • TensorRT pour une inférence à grande vitesse sur les GPU NVIDIA.

    Chaque format présente des avantages qui lui sont propres. Pour un guide détaillé, consulte notre documentation sur le processus d’exportation.

  • Pour accélérer l’inférence sur les CPU Intel, tu peux déployer ton modèle YOLO26 à l’aide de la boîte à outils OpenVINO d’Intel. OpenVINO améliore considérablement les performances en optimisant les modèles pour tirer efficacement parti du matériel Intel.

    1. Convertis ton modèle YOLO26 au format OpenVINO à l’aide de la fonction model.export().
    2. Suis le guide de configuration détaillé dans la documentation sur l’exportation Intel OpenVINO.

    Pour en savoir plus, consulte notre article de blog.

  • Oui, tu peux déployer des modèles YOLO26 sur des appareils mobiles avec LiteRT (anciennement TensorFlow Lite) et NCNN sur Android, ainsi qu’avec CoreML ou LiteRT sur iOS. LiteRT est le runtime de Google exécuté sur l’appareil pour les appareils mobiles et embarqués ; il exécute le même modèle sur Android, iOS et dans le navigateur, pour une inférence efficace sur l’appareil.

    Exemple
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Commande d’exportation au format NCNN
    model.export(format="ncnn")

    Pour en savoir plus sur le déploiement de modèles sur mobile, consulte notre guide d’intégration LiteRT.

  • Pour choisir un format de déploiement pour YOLO26, prends en compte les facteurs suivants :

    • Performances : certains formats comme TensorRT offrent des vitesses exceptionnelles sur les GPU NVIDIA, tandis qu’OpenVINO est optimisé pour le matériel Intel.
    • Compatibilité : ONNX offre une large compatibilité entre différentes plateformes.
    • Facilité d’intégration : des formats comme CoreML ou LiteRT sont adaptés à des écosystèmes spécifiques comme iOS et Android, respectivement.
    • Prise en charge par la communauté : des formats comme PyTorch et TensorFlow bénéficient de nombreuses ressources et d’un large soutien de la communauté.

    Pour une analyse comparative, consulte notre documentation sur les formats d’exportation.

  • Pour déployer des modèles YOLO26 dans une application web, tu peux utiliser LiteRT.js, le runtime web de LiteRT, qui permet d’exécuter des modèles d’apprentissage automatique directement dans le navigateur et dans Node.js. Cette approche élimine le besoin d’une infrastructure backend et offre des performances en temps réel.

    1. Exporte le modèle YOLO26 au format LiteRT.
    2. Intègre le modèle exporté à ton application web à l’aide de LiteRT.js.

    Pour obtenir des instructions détaillées, consulte notre guide d’intégration LiteRT.

Commentaires