Analyse comparative des options de déploiement de YOLO26#
YOLO26 prend en charge plus de 20 options de déploiement, chacune optimisée pour un runtime, une cible matérielle ou une plateforme différente — de PyTorch et ONNX à TensorRT, OpenVINO, CoreML et aux formats dédiés aux NPU edge. Le choix de la bonne option nécessite de trouver un équilibre entre la vitesse d'inférence, les contraintes matérielles et la facilité d'intégration. Ce guide compare chaque option afin que tu puisses choisir celle qui convient le mieux à ton application, puis consulter les bonnes pratiques de déploiement des modèles pour la déployer de manière fiable.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
Le déploiement est l'étape du flux de travail d'un projet de vision par ordinateur où un modèle entraîné commence à effectuer un travail réel. Le format vers lequel tu l'exportes a donc un impact direct sur la vitesse, le coût et la portabilité.
Comment sélectionner la bonne option de déploiement pour ton modèle YOLO26#
Lorsque vient le moment de déployer ton modèle YOLO26, il est très important de sélectionner un format d'exportation adapté. Comme indiqué dans la documentation d'exportation d'Ultralytics YOLO26, la fonction model.export() convertit ton modèle entraîné dans différents formats adaptés à des environnements et des exigences de performances variés.
Le format idéal dépend du contexte opérationnel prévu pour ton modèle et de ton matériel.
Pour un déploiement géré sans exportation manuelle, Ultralytics Platform fournit des points de terminaison d'inférence prêts à l'emploi, avec mise à l'échelle automatique dans 42 régions du monde.
Les options de déploiement de YOLO26#
Voici une brève description de chaque format et des situations dans lesquelles l'utiliser. Pour découvrir la procédure complète d'exportation, consulte la documentation d'exportation ; pour comparer les critères côte à côte, consulte le tableau comparatif.
- PyTorch (
.pt) : le format natif pour l'entraînement et l'inférence, offrant une flexibilité maximale et une accélération GPU via NVIDIA CUDA ou AMD ROCm — idéal pour la recherche et le prototypage, sans étape d'exportation requise. - TorchScript (
torchscript) : sérialise le modèle pour un runtime C++ sans Python, adapté aux systèmes de production où Python n'est pas disponible. - ONNX (
onnx) : un format d'échange indépendant des frameworks, offrant une large prise en charge multiplateforme et matérielle via ONNX Runtime. - OpenVINO (
openvino) : la boîte à outils d'Intel pour l'inférence optimisée sur les CPU Intel, les GPU intégrés et les NPU, courante dans l'IoT et l'informatique edge. - TensorRT (
engine) : le runtime haute performance de NVIDIA, offrant une inférence GPU de premier ordre avec une optimisation FP16 et INT8. - CoreML (
coreml) : le format Apple exécuté sur l'appareil pour iOS, macOS, watchOS et tvOS, utilisant l'Apple Neural Engine. - TF SavedModel (
saved_model) : le format standard de TensorFlow pour le serving côté serveur à grande échelle avec TensorFlow Serving. - TF GraphDef (
pb) : un format TensorFlow à graphe statique figé pour les environnements nécessitant un graphe de calcul fixe. - TF Edge TPU (
edgetpu) : compile les modèles.tflitepour les accélérateurs Google Coral Edge TPU. - LiteRT (
litert) : le runtime Google exécuté sur l'appareil (anciennement TensorFlow Lite) pour l'inférence mobile, embarquée et dans le navigateur à partir d'un unique modèle.tflite, avec prise en charge de FP32 et INT8 et exécution dans le navigateur via LiteRT.js. - PaddlePaddle (
paddle) : le framework de deep learning de Baidu, très utilisé en Chine, offrant une large prise en charge matérielle. - MNN (
mnn) : un moteur d'inférence léger et haute performance, optimisé pour les systèmes ARM et x86-64 mobiles et embarqués. - NCNN (
ncnn) : un framework d'inférence haute performance et léger, optimisé pour les appareils mobiles ARM. - Sony IMX500 (
imx) : exporte les modèles vers le capteur de vision intelligent IMX500 de Sony, avec traitement sur puce, comme celui de la Raspberry Pi AI Camera. - Rockchip RKNN (
rknn) : cible les NPU Rockchip sur les cartes embarquées avec quantification FP16 et INT8. - ExecuTorch (
executorch) : le runtime natif de PyTorch exécuté sur l'appareil pour les environnements mobiles (iOS et Android) et embarqués via XNNPACK. - Axelera AI (
axelera) : compile pour l'AIPU Metis d'Axelera (jusqu'à 856 TOPS) via PCIe ou M.2, pour l'inférence edge à haut débit. - DEEPX (
deepx) : cible le matériel NPU DEEPX avec quantification INT8 pour l'inférence edge embarquée. - Qualcomm QNN (
qnn) : inférence sur l'appareil avec le NPU Hexagon, le GPU Adreno et le CPU Snapdragon via la pile Qualcomm AI. - Core AI (
coreai) : Le nouveau format.aimodeld'Apple pour iOS 27 et macOS 27, pris en charge sur le CPU, le GPU et le Apple Neural Engine ; l'exportation nécessite macOS 26 ou une version ultérieure sur Apple silicon.
L'intégration Hailo exporte directement les modèles YOLO de détection, de segmentation, de segmentation sémantique, d'estimation de profondeur, de classification, de pose et d'OBB vers Hailo HEF ; consulte son tableau de compatibilité pour connaître les modèles et cibles validés. L'intégration Ambarella suit un flux de travail axé sur ONNX et compile les exportations ONNX au format AmbaPB avec la chaîne d'outils CVflow d'Ambarella pour les SoC CVflow® tels que le CV72, en utilisant éventuellement l'entraînement tenant compte de la compression SpongeTorch. L'intégration Huawei Ascend compile les exportations ONNX au format hors ligne .om avec le compilateur CANN ATC pour l'inférence FP16 sur les processeurs Ascend AI.
Comparaison des options de déploiement#
Le tableau suivant récapitule les options de déploiement pour les modèles YOLO26 selon les critères qui déterminent généralement le choix. Pour une analyse approfondie de chaque format, consulte la documentation des formats d'exportation.
| Option de déploiement | Benchmarks de performance | Compatibilité et intégration | Prise en charge par la communauté et écosystème | Études de cas | Maintenance et mises à jour | Considérations de sécurité | Accélération matérielle |
|---|---|---|---|---|---|---|---|
| PyTorch | Bonne flexibilité ; peut entraîner un compromis sur les performances brutes | Excellente avec les bibliothèques Python | Ressources et communauté étendues | Recherche et prototypes | Développement régulier et actif | Dépend de l'environnement de déploiement | Prise en charge de CUDA pour l'accélération GPU |
| TorchScript | Mieux adapté à la production que PyTorch | Transition fluide de PyTorch vers C++ | Spécialisé, mais plus limité que PyTorch | Secteurs où Python constitue un goulot d'étranglement | Mises à jour cohérentes avec PyTorch | Sécurité améliorée sans Python complet | Hérite de la prise en charge de CUDA de PyTorch |
| ONNX | Variable selon le runtime | Élevée entre les différents frameworks | Écosystème étendu, pris en charge par de nombreuses organisations | Flexibilité entre les frameworks ML | Mises à jour régulières pour les nouvelles opérations | Veille à appliquer des pratiques sécurisées de conversion et de déploiement | Diverses optimisations matérielles |
| OpenVINO | Optimisé pour le matériel Intel | Optimal au sein de l'écosystème Intel | Solide dans le domaine de la vision par ordinateur | IoT et edge avec du matériel Intel | Mises à jour régulières pour le matériel Intel | Fonctionnalités robustes pour les applications sensibles | Adapté au matériel Intel |
| TensorRT | De premier ordre sur les GPU NVIDIA | Optimal pour le matériel NVIDIA | Réseau solide grâce à NVIDIA | Inférence vidéo et image en temps réel | Mises à jour fréquentes pour les nouveaux GPU | Accent mis sur la sécurité | Conçu pour les GPU NVIDIA |
| CoreML | Optimisé pour le matériel Apple exécuté sur l'appareil | Exclusif à l'écosystème Apple | Solide prise en charge par Apple et les développeurs | ML exécuté sur l'appareil pour les produits Apple | Mises à jour régulières d'Apple | Accent mis sur la confidentialité et la sécurité | Apple Neural Engine et GPU |
| TF SavedModel | Évolutif dans les environnements serveur | Large compatibilité au sein de l'écosystème TensorFlow | Prise en charge étendue grâce à la popularité de TensorFlow | Servir des modèles à grande échelle | Mises à jour régulières par Google et la communauté | Fonctionnalités robustes pour les entreprises | Diverses accélérations matérielles |
| TF GraphDef | Stable pour les graphes de calcul statiques | S'intègre bien à l'infrastructure TensorFlow | Ressources pour optimiser les graphes statiques | Scénarios nécessitant des graphes statiques | Mises à jour en parallèle du noyau TensorFlow | Pratiques de sécurité TensorFlow éprouvées | Options d'accélération TensorFlow |
| TF Edge TPU | Optimisé pour le matériel Edge TPU de Google | Exclusif aux appareils Edge TPU | Évolue grâce aux ressources de Google et de tiers | Appareils IoT nécessitant un traitement en temps réel | Améliorations pour les nouveaux matériels Edge TPU | Sécurité IoT robuste de Google | Conçu sur mesure pour Google Coral |
| LiteRT | Vitesse et efficacité sur mobile, systèmes embarqués et Web | Prise en charge des appareils mobiles, systèmes embarqués, appareils edge et navigateurs | Communauté solide, soutenue par Google | Applications sur appareil pour Android, iOS et le Web | Fonctionnalités les plus récentes du runtime sur appareil | Inférence sécurisée sur appareil et dans le navigateur | Accélération par GPU, DSP et WebGPU |
| PaddlePaddle | Compétitif, facile à utiliser et évolutif | Écosystème Baidu, large prise en charge des applications | Croissance rapide, particulièrement en Chine | Marché chinois et traitement des langues | Axé sur les applications d’IA chinoises | Met l’accent sur la confidentialité et la sécurité des données | Notamment les puces Kunlun de Baidu |
| MNN | Hautes performances pour les appareils mobiles | Systèmes ARM mobiles et embarqués et CPU X86-64 | Communauté ML mobile et embarquée | Efficacité des systèmes mobiles | Maintien de hautes performances sur les appareils mobiles | Avantages de la sécurité sur appareil | Optimisations pour les CPU et GPU ARM |
| NCNN | Optimisé pour les appareils mobiles basés sur ARM | Systèmes ARM mobiles et embarqués | Communauté ML mobile et embarquée restreinte, mais active | Efficacité sur les systèmes Android et ARM | Maintien de hautes performances sur ARM | Avantages de la sécurité sur appareil | Optimisations pour les CPU et GPU ARM |
| Sony IMX500 | Inférence sur capteur avec une très faible consommation d’énergie | Capteur Sony IMX500, Raspberry Pi AI Camera | Écosystème Sony AITRIOS | IA edge sur caméra | Mises à jour du SDK Sony et de la chaîne d’outils MCT | Les données restent sur le capteur | Accélérateur intégré à la puce Sony IMX500 |
| Rockchip RKNN | Optimisé pour les NPU Rockchip | Cartes SoC Rockchip (p. ex. RK3588) | Communauté de développeurs Rockchip | SBC embarqués et appareils edge | Mises à jour de Rockchip RKNN-Toolkit | Inférence locale sur appareil | NPU Rockchip |
| ExecuTorch | Runtime PyTorch efficace sur appareil | iOS, Android et systèmes embarqués via XNNPACK | Soutenu par le projet PyTorch | Applications mobiles et embarquées | Maintenu en parallèle de PyTorch | L’inférence sur appareil conserve les données localement | Backends XNNPACK et CPU/GPU mobiles |
| Axelera AI | Très haut débit (jusqu’à 856 TOPS) | Metis AIPU via PCIe ou M.2 | SDK Axelera Voyager | Inférence edge à haut débit | Mises à jour du SDK Axelera | Inférence edge sur site | AIPU Axelera Metis |
| DEEPX | Inférence NPU optimisée pour INT8 | Matériel NPU DEEPX | Outils de développement DEEPX (dx_com, dx_engine) | Inférence edge embarquée | Mises à jour du SDK et du runtime DEEPX | Inférence locale sur appareil | NPU DEEPX |
| Qualcomm QNN | Inférence Snapdragon rapide sur appareil | NPU Snapdragon Hexagon, GPU Adreno, CPU | Écosystème Qualcomm AI Hub | Appareils Snapdragon mobiles et edge | Mises à jour de la pile d’IA Qualcomm (QAIRT) | L’inférence sur appareil conserve les données localement | NPU Snapdragon Hexagon |
| Hailo | Inférence INT8 HEF sur les NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler et HailoRT | Caméras, robots, systèmes de périphérie industrielle | Versions de Hailo DFC et HailoRT | Inférence locale sur appareil | NPU Hailo |
| Huawei Ascend | Débit accru sur l'Ascend AI Core | Cartes Atlas et OrangePi AIPro | Écosystème Huawei CANN | Inférence en périphérie sur les NPU Ascend | Versions de CANN et ATC | Inférence locale sur appareil | Ascend AI Core |
| Core AI | Optimisé pour Apple silicon | iOS 27 et macOS 27 ; l'exportation nécessite macOS 26+ | Framework Apple ; pas encore dans les SDK iOS/Flutter | Machine learning sur appareil sur les plateformes Apple de nouvelle génération | Lié aux versions de systèmes d'exploitation Apple ; actuellement en version bêta | L’inférence sur appareil conserve les données localement | Apple Neural Engine, GPU et CPU |
Cette comparaison te donne une vue d’ensemble. Pour le déploiement, évalue les exigences et contraintes spécifiques de ton projet au regard de chaque option, puis consulte le guide d’intégration associé au format que tu as choisi.
Conclusion#
La vaste gamme de formats d’exportation de YOLO26 te permet d’adapter un modèle à presque tous les environnements, d’un serveur cloud équipé d’un GPU à une caméra edge sur capteur. Une fois que tu as choisi un format, suis les bonnes pratiques de déploiement des modèles pour l’optimisation, le dépannage et la sécurité, et appuie-toi sur la communauté Ultralytics lorsque tu rencontres un problème.
FAQ#
Ultralytics YOLO26 prend en charge différents formats de déploiement, chacun étant conçu pour des environnements et des plateformes matérielles spécifiques. Les principaux formats sont les suivants :
- PyTorch pour la recherche et le prototypage, avec une excellente intégration à Python.
- TorchScript pour les environnements de production où Python n’est pas disponible.
- ONNX pour la compatibilité multiplateforme et l’accélération matérielle.
- OpenVINO pour des performances optimisées sur le matériel Intel.
- TensorRT pour une inférence haute vitesse sur les GPU NVIDIA.
Chaque format présente des avantages uniques. Pour un guide détaillé, consulte notre documentation sur le processus d’exportation.
Oui, les modèles YOLO26 peuvent être déployés sur des appareils mobiles à l'aide de LiteRT (anciennement TensorFlow Lite) et de NCNN pour Android, ainsi que de CoreML ou de LiteRT pour iOS. LiteRT est le runtime Google sur appareil pour les appareils mobiles et embarqués. Il exécute le même modèle sur Android, iOS et le navigateur, offrant une inférence efficace sur appareil.
Exemple# Export command for NCNN format model.export(format="ncnn")Pour plus de détails sur le déploiement de modèles sur mobile, consulte notre guide d'intégration de LiteRT.
Lors du choix d'un format de déploiement pour YOLO26, prends en compte les facteurs suivants :
- Performances : certains formats comme TensorRT offrent des vitesses exceptionnelles sur les GPU NVIDIA, tandis qu'OpenVINO est optimisé pour le matériel Intel.
- Compatibilité : ONNX offre une large compatibilité entre différentes plateformes.
- Facilité d'intégration : les formats comme CoreML ou LiteRT sont conçus pour des écosystèmes spécifiques comme iOS et Android, respectivement.
- Assistance de la communauté : les formats comme PyTorch et TensorFlow disposent de nombreuses ressources et d'un vaste support communautaires.
Pour une analyse comparative, consulte notre documentation sur les formats d'exportation.
Pour déployer des modèles YOLO26 dans une application web, tu peux utiliser LiteRT.js, le runtime web de LiteRT, qui permet d'exécuter des modèles d'apprentissage automatique directement dans le navigateur et Node.js. Cette approche élimine le besoin d'une infrastructure backend et offre des performances en temps réel.
- Exporte le modèle YOLO26 au format LiteRT.
- Intègre le modèle exporté à ton application web à l'aide de LiteRT.js.
Pour obtenir des instructions détaillées étape par étape, consulte notre guide d'intégration de LiteRT.
Pour améliorer la vitesse d’inférence sur les CPU Intel, tu peux déployer ton modèle YOLO26 avec la boîte à outils OpenVINO d’Intel. OpenVINO offre des gains de performances significatifs en optimisant les modèles afin qu’ils exploitent efficacement le matériel Intel.
model.export().Pour plus d’informations, consulte notre article de blog.