Analyse comparative des options de déploiement de YOLO26#
YOLO26 prend en charge plus de 20 options de déploiement, chacune adaptée à un environnement d’exécution, une cible matérielle ou une plateforme différente — de PyTorch et ONNX à TensorRT, OpenVINO, CoreML et aux formats dédiés aux NPU de périphérie. Le choix de la bonne option implique de trouver un équilibre entre la vitesse d’inférence, les contraintes matérielles et la facilité d’intégration. Ce guide compare toutes les options pour t’aider à choisir celle qui convient le mieux à ton application, puis à passer aux bonnes pratiques de déploiement des modèles afin de la déployer de manière fiable.
À regarder : Comment choisir le meilleur format de déploiement Ultralytics YOLO26 pour ton projet | TensorRT | OpenVINO 🚀
Le déploiement est l’étape du flux de travail d’un projet de vision par ordinateur où un modèle entraîné commence à effectuer des tâches concrètes ; le format d’exportation a donc un impact direct sur la vitesse, le coût et la portabilité.
Comment choisir la bonne option de déploiement pour ton modèle YOLO26#
Au moment de déployer ton modèle YOLO26, il est très important de choisir un format d’exportation adapté. Comme l’explique la documentation d’exportation d’Ultralytics YOLO26, la fonction model.export() convertit ton modèle entraîné vers différents formats adaptés à divers environnements et exigences de performance.
Le format idéal dépend du contexte opérationnel prévu pour ton modèle et du matériel utilisé.
Pour un déploiement géré sans exportation manuelle, Ultralytics Platform fournit des points de terminaison d’inférence prêts à l’emploi, avec mise à l’échelle automatique dans 42 régions du monde.
Options de déploiement de YOLO26#
Voici une brève description de chaque format et des situations dans lesquelles l’utiliser. Pour le guide complet de l’exportation, consulte la documentation sur l’exportation ; pour comparer les critères côte à côte, passe au tableau comparatif.
- PyTorch (
.pt) : Le format natif d’entraînement et d’inférence, qui offre une flexibilité maximale et une accélération GPU grâce à NVIDIA CUDA ou à AMD ROCm — idéal pour la recherche et le prototypage, sans étape d’exportation. - TorchScript (
torchscript) : Sérialise le modèle pour un environnement d’exécution C++ sans Python, adapté aux systèmes de production où Python n’est pas disponible. - ONNX (
onnx) : Un format d’échange indépendant des frameworks, offrant une large prise en charge multiplateforme et matérielle par l’intermédiaire d’ONNX Runtime, y compris pour les GPU NVIDIA via CUDA et les GPU AMD via MIGraphX. - OpenVINO (
openvino) : La boîte à outils d’Intel pour l’inférence optimisée sur les processeurs Intel, les GPU intégrés et les NPU, courante dans l’IoT et l’informatique en périphérie. - TensorRT (
engine) : L’environnement d’exécution haute performance de NVIDIA, qui offre une inférence GPU de premier ordre avec les optimisations FP16 et INT8. - CoreML (
coreml) : Le format d’Apple pour l’exécution sur appareil sous iOS, macOS, watchOS et tvOS, utilisant l’Apple Neural Engine. - Core AI (
coreai) : Le nouveau format.aimodeld’Apple pour iOS 27 et macOS 27, destiné au CPU, au GPU et à l’Apple Neural Engine ; l’exportation nécessite macOS 26 ou une version ultérieure sur Apple silicon, ou Linux x86_64 avec glibc 2.34 ou une version ultérieure, ainsi que Python 3.11 à 3.14. - TF SavedModel (
saved_model) : Le format standard de TensorFlow pour le service évolutif côté serveur avec TensorFlow Serving. - TF GraphDef (
pb) : Un format TensorFlow à graphe statique figé, pour les environnements qui nécessitent un graphe de calcul fixe. - TF Edge TPU (
edgetpu) : Compile les modèles.tflitepour les accélérateurs Google Coral Edge TPU. - LiteRT (
litert) : L’environnement d’exécution sur appareil de Google (anciennement TensorFlow Lite) pour l’inférence sur mobile, systèmes embarqués et navigateurs à partir d’un seul modèle.tflite, avec prise en charge de FP32 et INT8, ainsi qu’une exécution dans le navigateur via LiteRT.js. - PaddlePaddle (
paddle) : Le framework d’apprentissage profond de Baidu, populaire en Chine et compatible avec de nombreux matériels. - MNN (
mnn) : Un moteur d’inférence léger et performant, optimisé pour les systèmes mobiles et embarqués ARM et x86-64. - NCNN (
ncnn) : Un framework d’inférence léger et performant, optimisé pour les appareils mobiles ARM. - Sony IMX500 (
imx) : Exporte les modèles pour le capteur de vision intelligent IMX500 de Sony, doté d’un traitement sur puce, comme dans la Raspberry Pi AI Camera. - Rockchip RKNN (
rknn) : Destiné aux NPU Rockchip sur les cartes embarquées, avec quantification FP16 et INT8. - ExecuTorch (
executorch) : L’environnement d’exécution natif sur appareil de PyTorch pour les systèmes mobiles (iOS et Android) et embarqués, via XNNPACK. - Axelera AI (
axelera) : Compile les modèles pour l’AIPU Metis d’Axelera (jusqu’à 856 TOPS), via PCIe ou M.2, pour l’inférence en périphérie à haut débit. - DEEPX (
deepx) : Destiné au matériel NPU DEEPX, avec quantification INT8 pour l’inférence embarquée en périphérie. - Qualcomm QNN (
qnn) : Inférence sur appareil avec le NPU Snapdragon Hexagon, le GPU Adreno et le CPU, par l’intermédiaire de la pile d’IA de Qualcomm.
L’intégration Hailo exporte directement les modèles YOLO de détection, de segmentation, de segmentation sémantique, d’estimation de profondeur, de classification, de pose et OBB au format Hailo HEF ; consulte son tableau de compatibilité pour connaître les modèles et les cibles validés. L’intégration Ambarella repose d’abord sur ONNX et compile les exports ONNX au format AmbaPB avec la chaîne d’outils CVflow d’Ambarella, pour les SoC CVflow® tels que le CV72, avec la possibilité d’utiliser l’entraînement tenant compte de la compression SpongeTorch. L’intégration Huawei Ascend compile les exports ONNX au format hors ligne .om avec le compilateur CANN ATC pour l’inférence FP16 sur les processeurs IA Ascend. L’intégration AMD Xilinx quantifie les exports ONNX avec AMD Quark pour les NPU Versal AI Edge Series Gen 2, que le Vitis AI Execution Provider compile en modèle .rai.
Comparaison des options de déploiement#
Le tableau suivant résume les options de déploiement des modèles YOLO26 selon les critères qui guident généralement le choix. Pour un examen approfondi de chaque format, consulte la documentation sur les formats d’exportation.
| Option de déploiement | Bancs d’essai de performances | Compatibilité et intégration | Assistance de la communauté et écosystème | Études de cas | Maintenance et mises à jour | Considérations de sécurité | Accélération matérielle |
|---|---|---|---|---|---|---|---|
| PyTorch | Bonne flexibilité ; les performances brutes peuvent être moindres | Excellente compatibilité avec les bibliothèques Python | Ressources et communauté très fournies | Recherche et prototypes | Développement régulier et actif | Dépend de l’environnement de déploiement | Prise en charge de CUDA pour l’accélération GPU |
| TorchScript | Mieux adapté à la production que PyTorch | Transition fluide de PyTorch vers C++ | Spécialisé, mais moins généraliste que PyTorch | Secteurs où Python constitue un goulot d’étranglement | Mises à jour régulières avec PyTorch | Sécurité renforcée sans Python complet | Bénéficie de la prise en charge de CUDA par PyTorch |
| ONNX | Variable selon l’environnement d’exécution | Élevée entre différents frameworks | Écosystème vaste, pris en charge par de nombreuses organisations | Flexibilité entre les frameworks de ML | Mises à jour régulières pour les nouvelles opérations | Veille à appliquer des pratiques sûres de conversion et de déploiement | Diverses optimisations matérielles |
| OpenVINO | Optimisé pour le matériel Intel | Optimal au sein de l’écosystème Intel | Solide dans le domaine de la vision par ordinateur | IoT et edge avec du matériel Intel | Mises à jour régulières pour le matériel Intel | Fonctionnalités robustes pour les applications sensibles | Conçu sur mesure pour le matériel Intel |
| TensorRT | De premier ordre sur les GPU NVIDIA | Idéal pour le matériel NVIDIA | Réseau solide grâce à NVIDIA | Inférence vidéo et image en temps réel | Mises à jour fréquentes pour les nouveaux GPU | Priorité à la sécurité | Conçu pour les GPU NVIDIA |
| CoreML | Optimisé pour le matériel Apple exécuté sur l’appareil | Exclusif à l’écosystème Apple | Solide soutien d’Apple et des développeurs | ML exécuté sur l’appareil dans les produits Apple | Mises à jour régulières d’Apple | Priorité à la confidentialité et à la sécurité | Neural Engine et GPU d’Apple |
| Core AI | Optimisé pour Apple silicon | iOS 27 et macOS 27 ; exportation sur Apple silicon avec macOS 26+ ou Linux x86_64 (glibc 2.34+), Python 3.11-3.14 | Framework Apple ; activation facultative dans les SDK iOS/Flutter | ML exécuté sur l’appareil sur les plateformes Apple de nouvelle génération | Lié aux versions des systèmes d’exploitation Apple ; actuellement en bêta | L’inférence exécutée sur l’appareil conserve les données localement | Neural Engine, GPU et CPU d’Apple |
| TF SavedModel | Évolutif dans les environnements serveur | Large compatibilité avec l’écosystème TensorFlow | Large soutien grâce à la popularité de TensorFlow | Déploiement de modèles à grande échelle | Mises à jour régulières de Google et de la communauté | Fonctionnalités robustes pour les entreprises | Diverses accélérations matérielles |
| TF GraphDef | Stable pour les graphes de calcul statiques | S’intègre bien à l’infrastructure TensorFlow | Ressources pour optimiser les graphes statiques | Scénarios nécessitant des graphes statiques | Mises à jour parallèles à celles du cœur de TensorFlow | Pratiques de sécurité éprouvées de TensorFlow | Options d’accélération TensorFlow |
| TF Edge TPU | Optimisé pour le matériel Edge TPU de Google | Exclusif aux appareils Edge TPU | Enrichi par les ressources de Google et de tiers | Appareils IoT nécessitant un traitement en temps réel | Améliorations pour les nouveaux matériels Edge TPU | Sécurité IoT robuste de Google | Conçu sur mesure pour Google Coral |
| LiteRT | Vitesse et efficacité sur mobile, embarqué et web | Prise en charge des appareils mobiles, embarqués et edge, ainsi que des navigateurs | Communauté solide, avec le soutien de Google | Applications exécutées sur l’appareil sous Android, iOS et sur le web | Fonctionnalités d’exécution les plus récentes pour les appareils | Inférence sécurisée sur l’appareil et dans le navigateur | Accélération par GPU, DSP et WebGPU |
| PaddlePaddle | Compétitif, facile à utiliser et évolutif | Écosystème Baidu et prise en charge étendue des applications | En forte croissance, surtout en Chine | Marché chinois et traitement des langues | Priorité aux applications d’IA chinoises | Met l’accent sur la confidentialité et la sécurité des données | Y compris les puces Kunlun de Baidu |
| MNN | Haute performance pour les appareils mobiles | Systèmes ARM mobiles et embarqués, et CPU X86-64 | Communauté ML mobile et embarquée | Efficacité des systèmes mobiles | Maintien de performances élevées sur les appareils mobiles | Avantages de la sécurité sur l’appareil | Optimisations pour les CPU et GPU ARM |
| NCNN | Optimisé pour les appareils mobiles basés sur ARM | Systèmes ARM mobiles et embarqués | Communauté ML mobile et embarquée de niche, mais active | Efficacité des systèmes Android et ARM | Maintien de performances élevées sur ARM | Avantages de la sécurité sur l’appareil | Optimisations pour les CPU et GPU ARM |
| Sony IMX500 | Inférence sur le capteur avec une très faible consommation | Capteur Sony IMX500, caméra Raspberry Pi AI Camera | Écosystème Sony AITRIOS | IA edge directement sur la caméra | Mises à jour du SDK Sony et de la chaîne d’outils MCT | Les données restent sur le capteur | Accélérateur intégré à la puce Sony IMX500 |
| Rockchip RKNN | Optimisé pour les NPU Rockchip | Cartes SoC Rockchip (p. ex. RK3588) | Communauté de développeurs Rockchip | SBC embarqués et appareils edge | Mises à jour de Rockchip RKNN-Toolkit | Inférence locale exécutée sur l’appareil | NPU Rockchip |
| ExecuTorch | Environnement d’exécution PyTorch efficace sur l’appareil | iOS, Android et systèmes embarqués via XNNPACK | Soutenu par le projet PyTorch | Applications mobiles et embarquées | Maintenu en parallèle de PyTorch | L’inférence exécutée sur l’appareil conserve les données localement | XNNPACK et backends CPU/GPU mobiles |
| Axelera AI | Très haut débit (jusqu’à 856 TOPS) | Metis AIPU via PCIe ou M.2 | SDK Axelera Voyager | Inférence edge à haut débit | Mises à jour du SDK Axelera | Inférence en périphérie sur site | AIPU Metis d’Axelera |
| DEEPX | Inférence sur NPU optimisée pour INT8 | Matériel NPU DEEPX | Outils de développement DEEPX (dx_com, dx_engine) | Inférence en périphérie embarquée | Mises à jour du SDK et du runtime DEEPX | Inférence locale exécutée sur l’appareil | NPU DEEPX |
| Qualcomm QNN | Inférence Snapdragon rapide sur l’appareil | NPU Hexagon Snapdragon, GPU Adreno, CPU | Écosystème Qualcomm AI Hub | Appareils Snapdragon mobiles et de périphérie | Mises à jour de la pile d’IA Qualcomm (QAIRT) | L’inférence exécutée sur l’appareil conserve les données localement | NPU Hexagon Snapdragon |
| Hailo | Inférence HEF INT8 sur les NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Compilateur Hailo Dataflow et HailoRT | Caméras, robots, systèmes industriels en périphérie | Versions de Hailo DFC et HailoRT | Inférence locale exécutée sur l’appareil | NPU Hailo |
| Huawei Ascend | Débit supérieur sur l’Ascend AI Core | Cartes Atlas et OrangePi AIPro | Écosystème Huawei CANN | Inférence en périphérie sur les NPU Ascend | Versions de CANN et ATC | Inférence locale exécutée sur l’appareil | Ascend AI Core |
| AMD Xilinx | Inférence INT8 sur les NPU Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI et Quark | Vision embarquée sur SoC adaptatifs | Versions de Vitis AI et Quark | Inférence locale exécutée sur l’appareil | NPU Versal AI Engine |
Cette comparaison te donne une vue d’ensemble. Pour le déploiement, évalue les exigences et contraintes spécifiques de ton projet pour chaque option, et consulte le guide d’intégration lié au format que tu choisis.
Conclusion#
La vaste gamme de formats d’exportation de YOLO26 te permet d’adapter un modèle à presque tous les environnements, d’un serveur GPU dans le cloud à une caméra de périphérie dotée d’un capteur. Une fois le format choisi, suis les bonnes pratiques de déploiement des modèles pour l’optimisation, le dépannage et la sécurité, et fais appel à la communauté Ultralytics en cas de problème.
FAQ#
Ultralytics YOLO26 prend en charge différents formats de déploiement, chacun conçu pour des environnements et des plateformes matérielles spécifiques. Voici les principaux formats :
- PyTorch pour la recherche et le prototypage, avec une excellente intégration à Python.
- TorchScript pour les environnements de production où Python n’est pas disponible.
- ONNX pour la compatibilité multiplateforme et l’accélération matérielle.
- OpenVINO pour des performances optimisées sur le matériel Intel.
- TensorRT pour une inférence à grande vitesse sur les GPU NVIDIA.
Chaque format présente des avantages qui lui sont propres. Pour un guide détaillé, consulte notre documentation sur le processus d’exportation.
Pour accélérer l’inférence sur les CPU Intel, tu peux déployer ton modèle YOLO26 à l’aide de la boîte à outils OpenVINO d’Intel. OpenVINO améliore considérablement les performances en optimisant les modèles pour tirer efficacement parti du matériel Intel.
- Convertis ton modèle YOLO26 au format OpenVINO à l’aide de la fonction
model.export(). - Suis le guide de configuration détaillé dans la documentation sur l’exportation Intel OpenVINO.
Pour en savoir plus, consulte notre article de blog.
- Convertis ton modèle YOLO26 au format OpenVINO à l’aide de la fonction
Oui, tu peux déployer des modèles YOLO26 sur des appareils mobiles avec LiteRT (anciennement TensorFlow Lite) et NCNN sur Android, ainsi qu’avec CoreML ou LiteRT sur iOS. LiteRT est le runtime de Google exécuté sur l’appareil pour les appareils mobiles et embarqués ; il exécute le même modèle sur Android, iOS et dans le navigateur, pour une inférence efficace sur l’appareil.
Exemplefrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Commande d’exportation au format NCNN model.export(format="ncnn")Pour en savoir plus sur le déploiement de modèles sur mobile, consulte notre guide d’intégration LiteRT.
Pour choisir un format de déploiement pour YOLO26, prends en compte les facteurs suivants :
- Performances : certains formats comme TensorRT offrent des vitesses exceptionnelles sur les GPU NVIDIA, tandis qu’OpenVINO est optimisé pour le matériel Intel.
- Compatibilité : ONNX offre une large compatibilité entre différentes plateformes.
- Facilité d’intégration : des formats comme CoreML ou LiteRT sont adaptés à des écosystèmes spécifiques comme iOS et Android, respectivement.
- Prise en charge par la communauté : des formats comme PyTorch et TensorFlow bénéficient de nombreuses ressources et d’un large soutien de la communauté.
Pour une analyse comparative, consulte notre documentation sur les formats d’exportation.
Pour déployer des modèles YOLO26 dans une application web, tu peux utiliser LiteRT.js, le runtime web de LiteRT, qui permet d’exécuter des modèles d’apprentissage automatique directement dans le navigateur et dans Node.js. Cette approche élimine le besoin d’une infrastructure backend et offre des performances en temps réel.
- Exporte le modèle YOLO26 au format LiteRT.
- Intègre le modèle exporté à ton application web à l’aide de LiteRT.js.
Pour obtenir des instructions détaillées, consulte notre guide d’intégration LiteRT.