YOLO11 ou YOLOv9#
Le domaine de la vision par ordinateur évolue constamment, de nouvelles architectures repoussant les limites de ce qui est possible en détection d’objets en temps réel. Deux étapes importantes de cette évolution sont Ultralytics YOLO11 et YOLOv9. Bien que les deux modèles offrent des performances exceptionnelles, ils représentent des approches différentes pour résoudre les principaux défis de l’inférence et de l’entraînement en deep learning.
Ce guide propose une comparaison technique complète entre YOLO11 et YOLOv9, en analysant leurs architectures, leurs métriques de performance et leurs scénarios de déploiement idéaux afin de t’aider à choisir le modèle adapté à ton prochain projet d’intelligence artificielle.
Présentation des modèles#
Ultralytics YOLO11#
YOLO11 est un modèle hautement optimisé et polyvalent, conçu pour les environnements de production. Il équilibre une précision de pointe avec les exigences pratiques de l’informatique en périphérie et des déploiements à grande échelle.
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : https://docs.ultralytics.com/models/yolo11
YOLOv9#
YOLOv9 est une contribution académique puissante qui introduit de nouveaux concepts pour atténuer la perte d’information dans les réseaux neuronaux profonds, en se concentrant fortement sur les avancées théoriques de l’extraction de caractéristiques.
- Auteurs : Chien-Yao Wang et Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica, Taïwan
- Date : 2024-02-21
- Arxiv : https://arxiv.org/abs/2402.13616
- GitHub : https://github.com/WongKinYiu/yolov9
- Documentation : https://docs.ultralytics.com/models/yolov9
Innovations architecturales#
YOLOv9 : informations de gradient programmables#
YOLOv9 s’attaque au problème du « goulot d’étranglement de l’information », où des données sont perdues lorsqu’elles traversent les couches successives d’un réseau profond. Pour résoudre ce problème, les auteurs ont introduit les Informations de gradient programmables (PGI) et le Réseau d’agrégation de couches efficace généralisé (GELAN). PGI garantit que les gradients utilisés pour mettre à jour les poids lors de la rétropropagation contiennent toutes les informations nécessaires, ce qui produit des représentations de caractéristiques très précises. L’architecture GELAN maximise l’efficacité des paramètres, permettant à YOLOv9 d’atteindre une grande précision avec une structure relativement légère.
YOLO11 : écosystème et efficacité#
Alors que YOLOv9 se concentre sur le flux des gradients, YOLO11 est conçu pour offrir robustesse et polyvalence dans des conditions réelles. Il affine l’architecture fondamentale de YOLO afin de réduire considérablement les besoins en mémoire CUDA pendant l’entraînement par rapport aux alternatives fortement basées sur les Transformer. De plus, YOLO11 n’est pas seulement un détecteur d’objets : il prend nativement en charge la segmentation d’instances, la classification d’images, l’estimation de pose et les boîtes englobantes orientées (OBB).
L’un des principaux atouts de YOLO11 est son intégration à la plateforme Ultralytics, qui abstrait les complexités du chargement des données, de l’augmentation des données et de l’entraînement distribué au sein d’une API unifiée.
Comparaison des performances#
Lors de la sélection d’un modèle pour la production, il est essentiel d’évaluer le compromis entre la précision moyenne (mAP), la vitesse d’inférence et le nombre de paramètres.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Comme le montre le tableau, YOLOv9e atteint la meilleure précision globale, ce qui en fait un excellent choix pour l’évaluation comparative académique. Cependant, YOLO11 offre globalement un meilleur rapport entre vitesse et précision. Par exemple, YOLO11m atteint 51.5 mAP en 4.7 ms (TensorRT), dépassant YOLOv9m, de taille similaire, en matière de vitesse.
Méthodes d’entraînement et écosystème#
L’expérience de développement diffère considérablement entre les deux frameworks.
Entraîner YOLOv9#
L’entraînement de YOLOv9 nécessite souvent d’utiliser un code de recherche fortement personnalisé, de gérer des versions spécifiques des dépendances et d’employer des arguments complexes en ligne de commande. Bien que puissante, cette approche peut être intimidante dans des environnements d’entreprise au rythme soutenu.
Entraîner YOLO11#
YOLO11 s’appuie sur l’API Python Ultralytics, bien maintenue, pour offrir une expérience fluide « de zéro à expert ». Les processus d’entraînement efficaces bénéficient de poids préentraînés facilement disponibles et d’un excellent support de la communauté.
from ultralytics import YOLO
# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train on a custom dataset with built-in augmentations
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export to ONNX format for deployment
model.export(format="onnx")Avec seulement trois lignes de Python, les développeurs peuvent charger un modèle, lancer l’entraînement avec des valeurs par défaut optimisées pour les hyperparamètres et exporter l’architecture entraînée vers des frameworks tels que ONNX ou TensorRT pour un déploiement en périphérie.
Applications concrètes#
Quand choisir YOLOv9#
YOLOv9 est un excellent choix pour les chercheurs qui souhaitent explorer les architectures de deep learning. Son framework PGI en fait un candidat idéal pour l’analyse à grande vitesse dans le commerce de détail, lorsque des exigences extrêmes en matière de précision sur des jeux de données denses priment sur la simplicité du déploiement et que les performances algorithmiques sont prioritaires.
Quand choisir YOLO11#
YOLO11 est l’outil par excellence pour la production. Ses capacités simplifiées de détection d’objets le rendent idéal pour la gestion du trafic dans les villes intelligentes et les appareils en périphérie tels que le Raspberry Pi ou NVIDIA Jetson. De plus, sa polyvalence pour différentes tâches permet à un seul pipeline de développement de gérer la segmentation dans l’industrie manufacturière et l’estimation de pose pour l’analyse sportive.
À la pointe : découvrez YOLO26#
Bien que YOLO11 et YOLOv9 soient remarquables, le domaine de l’intelligence artificielle évolue rapidement. Pour les développeurs qui commencent de nouveaux projets aujourd’hui, Ultralytics recommande vivement YOLO26 (sorti en janvier 2026), qui repousse encore davantage les limites de la vision par ordinateur.
YOLO26 réunit le meilleur des innovations récentes dans une solution puissante prête pour la production :
- Conception de bout en bout sans NMS : YOLO26 élimine nativement le post-traitement de suppression des non-maxima (NMS), ce qui donne des pipelines de déploiement nettement plus simples et plus rapides.
- Suppression de DFL : la suppression de la perte focale de distribution garantit une meilleure compatibilité avec les microcontrôleurs basse consommation et les accélérateurs d’IA en périphérie.
- Optimiseur MuSGD : inspiré des innovations liées à l’entraînement des LLM, l’optimiseur MuSGD (un hybride de SGD et de Muon) offre un entraînement stable et une convergence plus rapide.
- Inférence CPU jusqu’à 43 % plus rapide : optimisée spécifiquement pour les appareils en périphérie dépourvus de GPU dédiés.
- ProgLoss + STAL : ces fonctions de perte améliorées améliorent considérablement la reconnaissance des petits objets, ce qui est essentiel pour la surveillance agricole et l’imagerie aérienne.
Les utilisateurs qui souhaitent explorer diverses architectures peuvent également s’intéresser à RT-DETR pour le suivi basé sur les Transformer ou à YOLO-World pour la détection zero-shot avec un vocabulaire ouvert.
Conclusion#
YOLO11 et YOLOv9 ont tous deux marqué durablement l’histoire de la vision par ordinateur. YOLOv9 propose des innovations architecturales remarquables pour maximiser la conservation des caractéristiques. Cependant, pour la grande majorité des déploiements en conditions réelles, des applications d’IA d’entreprise aux appareils mobiles en périphérie, la facilité d’utilisation, l’efficacité mémoire et la prise en charge de tâches variées de YOLO11 offrent un avantage inégalé. Alors que le secteur continue d’évoluer, adopter le plus récent YOLO26 garantit que tes systèmes utilisent aujourd’hui l’inférence la plus rapide et la plus fiable possible.