Comparaison entre YOLOv9 et YOLOv10#
Le domaine de la vision par ordinateur en temps réel a connu d'immenses avancées, largement portées par des chercheurs qui repoussent continuellement les limites entre performances et efficacité. Lorsqu'on analyse l'évolution des modèles de vision de pointe, YOLOv9 et YOLOv10 représentent deux étapes majeures. Lancés au début de 2024, ces deux modèles ont introduit des architectures qui changent de paradigme afin de relever des défis persistants des réseaux neuronaux profonds, des goulots d'étranglement de l'information à la latence du post-traitement.
Cette comparaison technique complète examine leurs architectures, leurs métriques de performance et leurs scénarios de déploiement idéaux, pour t'aider à naviguer dans les complexités des écosystèmes modernes de détection d'objets.
Origines des modèles et avancées architecturales#
Comprendre la lignée et les fondements théoriques de ces modèles est essentiel pour sélectionner l'architecture adaptée à ton projet spécifique de vision par ordinateur.
YOLOv9 : maîtriser le flux d'information#
Présenté le 21 février 2024, YOLOv9 s'attaque au problème théorique de la perte d'information lorsque les données traversent des réseaux neuronaux profonds.
- Auteurs : Chien-Yao Wang et Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica, Taïwan
- Référence : Article arXiv sur YOLOv9
- Dépôt : YOLOv9 sur GitHub
YOLOv9 introduit le réseau généralisé d'agrégation efficace des couches (GELAN), qui maximise l'utilisation des paramètres en combinant les atouts de CSPNet et d'ELAN. Il utilise en outre les informations de gradient programmables (PGI), un mécanisme de supervision auxiliaire qui garantit que les couches profondes conservent les informations spatiales essentielles. Cela rend YOLOv9 particulièrement performant pour les tâches exigeant une grande fidélité des caractéristiques, comme l'analyse d'images médicales ou la surveillance à longue distance.
YOLOv10 : efficacité de bout en bout en temps réel#
Sorti peu après, le 23 mai 2024, YOLOv10 repense le pipeline de déploiement en éliminant l'un des goulots d'étranglement de latence les plus connus de la détection d'objets : la suppression des maxima non maximaux (NMS).
- Auteurs : Ao Wang, Hui Chen, Lihao Liu, et al.
- Organisation : Tsinghua University
- Référence : Article arXiv sur YOLOv10
- Dépôt : YOLOv10 sur GitHub
YOLOv10 utilise des assignations doubles cohérentes pendant l'entraînement, ce qui permet une conception native sans NMS. Cela élimine la surcharge du post-traitement lors de l'inférence et réduit considérablement la latence. Associé à une conception de modèle globale axée sur l'efficacité et la précision, YOLOv10 atteint un équilibre remarquable, en réduisant la charge de calcul (FLOPs) tout en maintenant une précision compétitive, ce qui le rend particulièrement intéressant pour les applications d'informatique en périphérie.
Comparaison des performances et des métriques#
Lorsqu'on compare ces deux modèles puissants sur le jeu de données standard MS COCO, des compromis distincts apparaissent entre la précision pure et la latence d'inférence.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
Analyse des données#
- Latence par rapport à la précision : Les modèles YOLOv10 offrent généralement des vitesses d'inférence supérieures. Par exemple, YOLOv10s atteint 46,7 % de mAP en seulement 2,66 ms sur TensorRT, contre 3,54 ms pour YOLOv9s avec une mAP presque identique de 46,8 %.
- Précision de premier ordre : Pour les scénarios de recherche exigeant une précision de détection maximale, YOLOv9e reste un choix redoutable, atteignant une mAP impressionnante de 55,6 %. Son architecture PGI garantit l'extraction fiable des caractéristiques subtiles.
- Efficacité : YOLOv10 excelle en efficacité en FLOPs. Cela se traduit directement par une consommation énergétique plus faible, une métrique essentielle pour les appareils alimentés par batterie qui exécutent des modèles d'IA de vision.
Si tu déploies le modèle sur des CPU ou du matériel périphérique aux ressources limitées, comme un Raspberry Pi, l'architecture sans NMS de YOLOv10 fournira généralement un pipeline plus fluide en éliminant les étapes de post-traitement non déterministes.
L'avantage d'Ultralytics : entraînement et écosystème#
Bien que les différences architecturales soient essentielles, l'écosystème logiciel environnant détermine largement la réussite d'un projet. YOLOv9 et YOLOv10 sont tous deux entièrement intégrés à l'écosystème Ultralytics, offrant une expérience développeur inégalée.
Simplicité d'utilisation et efficacité mémoire#
Contrairement aux architectures complexes basées sur Transformer qui souffrent d'une importante surcharge mémoire, les modèles YOLO d'Ultralytics sont conçus pour optimiser l'utilisation de la mémoire GPU. Les chercheurs peuvent ainsi utiliser des tailles de lot plus importantes sur du matériel grand public, rendant l'IA de pointe accessible.
L'API Python unifiée masque les complexités de l'augmentation des données et de l'optimisation des hyperparamètres. Tu peux passer facilement d'une architecture à l'autre en modifiant simplement la chaîne du fichier de poids.
from ultralytics import YOLO
# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Validate the model's performance
metrics = model.val()
# Export the trained model to ONNX format for deployment
model.export(format="onnx")Que tu aies besoin d'enregistrer des métriques dans MLflow ou d'exporter vers TensorRT pour un déploiement matériel haute vitesse, la plateforme Ultralytics le gère nativement.
Cas d’utilisation idéaux#
Le choix entre ces modèles dépend de tes contraintes de déploiement :
- Choisis YOLOv9 si : tu travailles sur des tâches de détection de petits objets, comme l'imagerie aérienne par drone ou la détection de petites tumeurs, pour lesquelles la rétention des caractéristiques de l'architecture GELAN offre la meilleure fidélité.
- Choisis YOLOv10 si : ta cible principale est l'inférence en temps réel sur des appareils périphériques. La conception sans NMS est idéale pour la robotique autonome, la surveillance du trafic en temps réel et la surveillance intelligente.
Anticiper l'avenir : le passage à YOLO26#
Bien que YOLOv8, YOLOv9 et YOLOv10 soient d'excellents modèles, les développeurs qui souhaitent créer des solutions d'IA modernes devraient envisager Ultralytics YOLO26, sorti en janvier 2026.
YOLO26 représente la synthèse ultime des générations précédentes, en combinant les meilleurs aspects de la précision de YOLOv9 et de l'efficacité de YOLOv10.
Principales innovations de YOLO26#
- Conception de bout en bout sans NMS : s'appuyant sur les fondations posées par YOLOv10, YOLO26 élimine nativement le post-traitement NMS pour simplifier le déploiement.
- Optimiseur MuSGD : hybride de SGD et de Muon, il apporte à la vision par ordinateur des innovations issues de l'entraînement des LLM pour une convergence extrêmement stable et rapide.
- Jusqu'à 43 % d'inférence CPU plus rapide : spécifiquement optimisée pour l'informatique en périphérie et les appareils dépourvus de GPU dédiés.
- Suppression de DFL : la perte focale de distribution a été supprimée afin de simplifier l'exportation du modèle et d'améliorer la compatibilité avec les appareils basse consommation.
- ProgLoss + STAL : ces fonctions de perte améliorées apportent des gains notables en reconnaissance des petits objets, égalant ou dépassant les capacités de YOLOv9.
Pour les chercheurs qui évaluent des architectures historiques, RT-DETR et YOLO11 sont également des alternatives bien documentées au sein de l'écosystème Ultralytics. Cependant, pour une polyvalence maximale dans toutes les tâches de vision, passer à YOLO26 sur la plateforme Ultralytics garantit que tu exploites le nec plus ultra de l'IA de vision open source.