Analyse comparative des options de déploiement de YOLO26#
YOLO26 prend en charge plus de 20 options de déploiement, chacune optimisée pour un runtime, une cible matérielle ou une plateforme différente — de PyTorch et ONNX à TensorRT, OpenVINO, CoreML et des formats dédiés aux NPU de périphérie. Choisir la bonne option permet de trouver un équilibre entre vitesse d'inférence, contraintes matérielles et facilité d'intégration. Ce guide compare toutes les options pour t'aider à choisir la mieux adaptée à ton application, puis à consulter les bonnes pratiques de déploiement de modèles pour un déploiement fiable.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
Le déploiement est l'étape du flux de travail des projets de vision par ordinateur où un modèle entraîné commence à accomplir de vraies tâches ; le format vers lequel tu l'exportes a donc un impact direct sur la vitesse, le coût et la portabilité.
Comment choisir la bonne option de déploiement pour ton modèle YOLO26#
Quand le moment est venu de déployer ton modèle YOLO26, le choix d'un format d'exportation adapté est primordial. Comme indiqué dans la documentation d'exportation Ultralytics YOLO26, la fonction model.export() convertit ton modèle entraîné en une variété de formats adaptés à des environnements et des exigences de performance divers.
Le format idéal dépend du contexte opérationnel et du matériel prévus pour ton modèle.
Pour un déploiement géré sans exportation manuelle, Ultralytics Platform fournit des points de terminaison d'inférence prêts à l'emploi avec mise à l'échelle automatique dans 42 régions mondiales.
Options de déploiement de YOLO26#
Voici une brève description de chaque format et des cas où les utiliser. Pour consulter la procédure d'exportation complète, reporte-toi à la documentation sur l'exportation ; pour les critères comparatifs, passe directement au tableau comparatif.
- PyTorch (
.pt): Le format natif d'entraînement et d'inférence, offrant une flexibilité maximale et une accélération GPU via NVIDIA CUDA ou AMD ROCm — idéal pour la recherche et le prototypage sans étape d'exportation requise. - TorchScript (
torchscript): Sérialise le modèle pour un runtime C++ sans Python, adapté aux systèmes de production où Python n'est pas disponible. - ONNX (
onnx): Un format d'échange agnostique vis-à-vis des frameworks, bénéficiant d'un large support multiplateforme et matériel via ONNX Runtime. - OpenVINO (
openvino): La boîte à outils d'Intel pour une inférence optimisée sur les CPU Intel, les GPU intégrés et les NPU, courante dans l'IdO et l'informatique en périphérie. - TensorRT (
engine): Le runtime haute performance de NVIDIA offrant une inférence GPU de premier ordre avec une optimisation FP16 et INT8. - CoreML (
coreml): Le format sur appareil d'Apple pour iOS, macOS, watchOS et tvOS, utilisant l'Apple Neural Engine. - TF SavedModel (
saved_model): Le format standard de TensorFlow pour un service côté serveur évolutif avec TensorFlow Serving. - TF GraphDef (
pb): Un format TensorFlow à graphe statique figé pour les environnements nécessitant un graphe de calcul fixe. - TF Edge TPU (
edgetpu): Compile les modèles.tflitepour les accélérateurs Google Coral Edge TPU. - LiteRT (
litert): Le runtime sur appareil de Google (anciennement TensorFlow Lite) pour l'inférence mobile, embarquée et sur navigateur à partir d'un seul modèle.tflite, avec prise en charge FP32 et INT8 et exécution dans le navigateur via LiteRT.js. - PaddlePaddle (
paddle): Le framework de deep learning de Baidu, populaire en Chine, avec un large support matériel. - MNN (
mnn): Un moteur d'inférence léger et haute performance optimisé pour les systèmes mobiles et embarqués ARM et x86-64. - NCNN (
ncnn): Un framework d'inférence léger et haute performance conçu pour les appareils mobiles ARM. - Sony IMX500 (
imx): Exporte pour le capteur de vision intelligent IMX500 de Sony avec traitement sur puce, tel que la caméra Raspberry Pi AI. - Rockchip RKNN (
rknn): Cible les NPU Rockchip sur les cartes embarquées avec une quantification FP16 et INT8. - ExecuTorch (
executorch): Le runtime sur appareil natif de PyTorch pour mobile (iOS et Android) et les systèmes embarqués via XNNPACK. - Axelera AI (
axelera): Compile pour l'AIPU Metis d'Axelera (jusqu'à 856 TOPS) via PCIe ou M.2 pour une inférence en périphérie à haut débit. - DEEPX (
deepx): Cible le matériel NPU DEEPX avec une quantification INT8 pour l'inférence en périphérie embarquée. - Qualcomm QNN (
qnn): Inférence sur appareil sur le NPU Snapdragon Hexagon, le GPU Adreno et le CPU via la pile IA de Qualcomm.
L'intégration Hailo exporte les modèles de détection, de segmentation, de segmentation sémantique, d'estimation de profondeur, de classification, de pose et OBB de YOLO directement vers Hailo HEF ; consulte son tableau de compatibilité pour connaître les modèles et cibles validés. L'intégration Ambarella suit un flux de travail axé sur ONNX et compile les exportations ONNX au format AmbaPB avec la chaîne d'outils CVflow d'Ambarella pour les SoC CVflow® tels que le CV72, en utilisant éventuellement l'entraînement conscient de la compression SpongeTorch. L'intégration Huawei Ascend compile les exportations ONNX au format hors ligne .om avec le compilateur CANN ATC pour l'inférence FP16 sur les processeurs Ascend AI.
Comparaison des options de déploiement#
Le tableau suivant résume les options de déploiement pour les modèles YOLO26 selon les critères qui guident habituellement ton choix. Pour une vue détaillée de chaque format, consulte la documentation sur les formats d'exportation.
| Option de déploiement | Benchmarks de performance | Compatibilité et intégration | Support communautaire et écosystème | Études de cas | Maintenance et mises à jour | Considérations de sécurité | Accélération matérielle |
|---|---|---|---|---|---|---|---|
| PyTorch | Bonne flexibilité ; peut compromettre les performances brutes | Excellent avec les bibliothèques Python | Ressources et communauté étendues | Recherche et prototypes | Développement régulier et actif | Dépend de l'environnement de déploiement | Support CUDA pour l'accélération GPU |
| TorchScript | Meilleur pour la production que PyTorch | Transition fluide de PyTorch vers C++ | Spécialisé mais plus restreint que PyTorch | Industrie où Python est un goulot d'étranglement | Mises à jour cohérentes avec PyTorch | Sécurité améliorée sans Python complet | Hérite du support CUDA de PyTorch |
| ONNX | Variable selon le runtime | Élevée entre différents frameworks | Vaste écosystème, soutenu par de nombreuses organisations | Flexibilité entre les frameworks ML | Mises à jour régulières pour les nouvelles opérations | Assurer des pratiques de conversion et de déploiement sécurisées | Diverses optimisations matérielles |
| OpenVINO | Optimisé pour le matériel Intel | Idéal au sein de l'écosystème Intel | Solide dans le domaine de la vision par ordinateur | IoT et périphérie avec le matériel Intel | Mises à jour régulières pour le matériel Intel | Fonctionnalités robustes pour les applications sensibles | Adapté au matériel Intel |
| TensorRT | De premier ordre sur les GPU NVIDIA | Meilleur pour le matériel NVIDIA | Réseau solide grâce à NVIDIA | Inférence vidéo et image en temps réel | Mises à jour fréquentes pour les nouveaux GPU | Accent mis sur la sécurité | Conçu pour les GPU NVIDIA |
| CoreML | Optimisé pour le matériel Apple sur appareil | Exclusif à l'écosystème Apple | Support solide d'Apple et des développeurs | ML sur appareil sur les produits Apple | Mises à jour régulières d'Apple | Accent sur la confidentialité et la sécurité | Moteur neural et GPU Apple |
| TF SavedModel | Évolutif dans les environnements serveur | Large compatibilité dans l'écosystème TensorFlow | Support étendu dû à la popularité de TensorFlow | Service de modèles à grande échelle | Mises à jour régulières par Google et la communauté | Fonctionnalités robustes pour l'entreprise | Diverses accélérations matérielles |
| TF GraphDef | Stable pour les graphes de calcul statiques | S'intègre bien avec l'infrastructure TensorFlow | Ressources pour optimiser les graphes statiques | Scénarios nécessitant des graphes statiques | Mises à jour avec le noyau TensorFlow | Pratiques de sécurité établies par TensorFlow | Options d'accélération TensorFlow |
| TF Edge TPU | Optimisé pour le matériel Edge TPU de Google | Exclusif aux appareils Edge TPU | En pleine croissance avec Google et des ressources tierces | Appareils IoT nécessitant un traitement en temps réel | Améliorations pour le nouveau matériel Edge TPU | Sécurité IoT robuste de Google | Conçu sur mesure pour Google Coral |
| LiteRT | Vitesse et efficacité sur mobile/embarqué/web | Prise en charge mobile, embarquée, edge et navigateur | Communauté robuste, soutenue par Google | Applications sur appareil pour Android, iOS et web | Dernières fonctionnalités d'exécution sur appareil | Inférence sécurisée sur appareil et dans le navigateur | Accélération GPU, DSP et WebGPU |
| PaddlePaddle | Compétitif, facile à utiliser et évolutif | Écosystème Baidu, large support d'applications | Croissance rapide, surtout en Chine | Marché chinois et traitement linguistique | Focus sur les applications d'IA chinoises | Met l'accent sur la confidentialité et la sécurité des données | Incluant les puces Kunlun de Baidu |
| MNN | Haute performance pour les appareils mobiles | Systèmes mobiles et embarqués ARM et CPU X86-64 | Communauté ML mobile/embarqué | Efficacité des systèmes mobiles | Maintenance de haute performance sur les appareils mobiles | Avantages de la sécurité sur l'appareil | Optimisations pour CPU et GPU ARM |
| NCNN | Optimisé pour les appareils mobiles basés sur ARM | Systèmes mobiles et embarqués ARM | Communauté ML mobile/embarqué de niche mais active | Efficacité des systèmes Android et ARM | Maintenance haute performance sur ARM | Avantages de la sécurité sur l'appareil | Optimisations pour CPU et GPU ARM |
| Sony IMX500 | Inférence sur capteur à très faible consommation | Capteur Sony IMX500, Raspberry Pi AI Camera | Écosystème Sony AITRIOS | IA en périphérie sur caméra | Mises à jour de la chaîne d'outils SDK et MCT de Sony | Les données restent sur le capteur | Accélérateur sur puce Sony IMX500 |
| Rockchip RKNN | Optimisé pour les NPU Rockchip | Cartes SoC Rockchip (par ex. RK3588) | Communauté de développeurs Rockchip | SBC embarqués et appareils en périphérie | Mises à jour de Rockchip RKNN-Toolkit | Inférence locale sur appareil | NPU Rockchip |
| ExecuTorch | Environnement d'exécution PyTorch efficace sur appareil | iOS, Android, embarqué via XNNPACK | Soutenu par le projet PyTorch | Applications mobiles et embarquées | Maintenu parallèlement à PyTorch | L'inférence sur l'appareil garde les données en local | Backends XNNPACK et CPU/GPU mobiles |
| Axelera AI | Très haut débit (jusqu'à 856 TOPS) | Metis AIPU via PCIe ou M.2 | SDK Axelera Voyager | Inférence en périphérie à haut débit | Mises à jour du SDK Axelera | Inférence en périphérie sur site | AIPU Axelera Metis |
| DEEPX | Inférence NPU optimisée INT8 | Matériel NPU DEEPX | Outils de développement DEEPX (dx_com, dx_engine) | Inférence en périphérie embarquée | Mises à jour du SDK et de l'environnement d'exécution DEEPX | Inférence locale sur appareil | NPU DEEPX |
| Qualcomm QNN | Inférence rapide sur appareil Snapdragon | NPU Snapdragon Hexagon, GPU Adreno, CPU | Écosystème Qualcomm AI Hub | Appareils mobiles et en périphérie Snapdragon | Mises à jour de la pile Qualcomm AI (QAIRT) | L'inférence sur l'appareil garde les données en local | NPU Snapdragon Hexagon |
Cette comparaison te donne une vue d'ensemble. Pour le déploiement, pèse les exigences et contraintes spécifiques de ton projet face à chaque option, et consulte le guide d'intégration lié pour le format que tu choisis.
Conclusion#
La grande variété de formats d'exportation de YOLO26 te permet d'adapter un modèle à presque n'importe quel environnement, d'un serveur GPU cloud à une caméra en périphérie intégrée au capteur. Une fois que tu as choisi un format, suis les bonnes pratiques de déploiement de modèles pour l'optimisation, le dépannage et la sécurité, et n'hésite pas à t'appuyer sur la communauté Ultralytics en cas de difficulté.
FAQ#
Ultralytics YOLO26 prend en charge divers formats de déploiement, chacun étant conçu pour des environnements et des plateformes matérielles spécifiques. Les principaux formats incluent :
- PyTorch pour la recherche et le prototypage, avec une excellente intégration Python.
- TorchScript pour les environnements de production où Python n'est pas disponible.
- ONNX pour la compatibilité multiplateforme et l'accélération matérielle.
- OpenVINO pour des performances optimisées sur le matériel Intel.
- TensorRT pour une inférence à haute vitesse sur les GPU NVIDIA.
Chaque format présente des avantages uniques. Pour un guide détaillé, consulte notre documentation sur le processus d'exportation.
Oui, les modèles YOLO26 peuvent être déployés sur des appareils mobiles en utilisant LiteRT (anciennement TensorFlow Lite) et NCNN pour Android, ainsi que CoreML ou LiteRT pour iOS. LiteRT est le runtime sur appareil de Google pour les appareils mobiles et embarqués et exécute le même modèle sur Android, iOS et le navigateur, offrant une inférence efficace sur appareil.
Exemple# Export command for NCNN format model.export(format="ncnn")Pour plus de détails sur le déploiement de modèles sur mobile, réfère-toi à notre guide d'intégration LiteRT.
Lors du choix d'un format de déploiement pour YOLO26, prends en compte les facteurs suivants :
- Performance : Certains formats comme TensorRT offrent des vitesses exceptionnelles sur les GPU NVIDIA, tandis qu'OpenVINO est optimisé pour le matériel Intel.
- Compatibilité : ONNX offre une large compatibilité entre différentes plateformes.
- Facilité d'intégration : Des formats comme CoreML ou LiteRT sont conçus spécifiquement pour des écosystèmes comme iOS et Android, respectivement.
- Support communautaire : Des formats tels que PyTorch et TensorFlow disposent de ressources communautaires et d'un support étendus.
Pour une analyse comparative, réfère-toi à notre documentation sur les formats d'exportation.
Pour déployer des modèles YOLO26 dans une application web, tu peux utiliser LiteRT.js, le runtime web de LiteRT, qui permet d'exécuter des modèles de machine learning directement dans le navigateur et sur Node.js. Cette approche élimine le besoin d'infrastructure backend et offre des performances en temps réel.
- Exporte le modèle YOLO26 au format LiteRT.
- Intègre le modèle exporté dans ton application web en utilisant LiteRT.js.
Pour des instructions étape par étape, réfère-toi à notre guide d'intégration LiteRT.
Pour améliorer la vitesse d'inférence sur les CPU Intel, tu peux déployer ton modèle YOLO26 en utilisant la boîte à outils OpenVINO d'Intel. OpenVINO offre des gains de performance significatifs en optimisant les modèles pour tirer efficacement parti du matériel Intel.
model.export().Pour plus d'informations, consulte notre article de blog.