YOLOv9 vs DAMO-YOLO#
L’évolution rapide de la vision par ordinateur a donné naissance à tout un éventail d’architectures puissantes, adaptées à différentes contraintes de déploiement et exigences de précision. Parmi les modèles notables figurent YOLOv9, réputé pour sa gestion robuste des goulots d’étranglement de l’information, et DAMO-YOLO, qui mise fortement sur la recherche d’architecture neuronale (NAS) et des pyramides de caractéristiques efficaces.
Ce guide propose une comparaison technique approfondie de YOLOv9 et DAMO-YOLO, en mettant en lumière leurs différences architecturales, leurs méthodes d’entraînement et leurs scénarios de déploiement idéaux. Nous verrons également comment l’écosystème Ultralytics assure une transition fluide du développement à la production, et pourquoi les modèles modernes comme YOLO26 sont devenus la référence recommandée pour les nouveaux projets.
Analyse approfondie de l’architecture#
Comprendre les mécanismes fondamentaux de chaque modèle permet d’expliquer leurs performances différentes selon les indicateurs.
YOLOv9 : informations de gradient programmables#
YOLOv9 a été conçu pour remédier directement à la perte d’information qui survient lorsque les données circulent dans des réseaux neuronaux profonds.
- Auteurs : Chien-Yao Wang, Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica, Taïwan
- Date : 21 février 2024
- Liens : Arxiv, GitHub, Documentation
YOLOv9 introduit l’information de gradient programmable (PGI) et le réseau généralisé d’agrégation efficace des couches (GELAN). PGI garantit que les informations spatiales et sémantiques essentielles sont conservées pendant la propagation avant, ce qui empêche la dégradation des gradients utilisés pour mettre à jour les poids. GELAN complète cette approche en maximisant l’efficacité des paramètres, ce qui permet au modèle d’atteindre une précision moyenne (mAP) de pointe avec moins de FLOPs que de nombreux CNNs classiques.
DAMO-YOLO : l’efficacité pilotée par NAS#
Développé par Alibaba Group, DAMO-YOLO adopte une approche différente en exploitant la recherche automatisée d’architectures pour trouver le meilleur équilibre entre vitesse et précision.
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : Alibaba Group
- Date : 23 novembre 2022
- Liens : Arxiv, GitHub
DAMO-YOLO s’appuie sur un backbone MAE-NAS (recherche d’architecture neuronale à entropie maximale) pour générer automatiquement des structures de réseau efficaces. Il utilise un RepGFPN (réseau généralisé de pyramide de caractéristiques reparamétré) pour une fusion robuste des caractéristiques et une conception « ZeroHead » afin de réduire au minimum la charge de calcul de la tête de détection. Il intègre également AlignedOTA pour l’attribution des étiquettes et la distillation des connaissances afin d’améliorer les performances de ses variantes plus petites.
La recherche d’architecture neuronale (NAS) automatise la conception des réseaux neuronaux artificiels. Elle peut produire des modèles très efficaces comme DAMO-YOLO, mais nécessite souvent d’importantes ressources de calcul pour explorer l’espace des architectures, contrairement à la philosophie de conception plus déterministe de modèles comme YOLOv9.
Comparaison des performances et des métriques#
Lors du choix d’un modèle de détection d’objets, il est essentiel de trouver un équilibre entre précision, vitesse et empreinte de calcul.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Analyse#
- Précision et nombre de paramètres : YOLOv9 affiche généralement un meilleur rapport entre le nombre de paramètres et la précision. Par exemple, YOLOv9c atteint un mAP de 53.0 % avec 25.5M de paramètres, tandis que DAMO-YOLOl atteint un mAP de 50.8 % mais nécessite beaucoup plus de paramètres (42.1M).
- Vitesse d’inférence : l’architecture de DAMO-YOLO offre des vitesses d’inférence TensorRT compétitives sur les GPU T4 et devance légèrement YOLOv9 dans les catégories intermédiaires. Toutefois, l’efficacité de YOLOv9 en matière de FLOPs et de nombre de paramètres se traduit par une excellente efficacité mémoire du GPU.
- Besoins en mémoire : les modèles Ultralytics YOLO, dont YOLOv9, consomment généralement moins de mémoire pendant l’entraînement et l’inférence que les modèles complexes générés par NAS ou les architectures Transformer lourdes, ce qui les rend très accessibles pour un déploiement sur du matériel en périphérie aux ressources limitées.
Les avantages de l’écosystème Ultralytics#
Les indicateurs théoriques sont importants, mais la réussite d’un projet dépend largement de sa mise en œuvre pratique. C’est là que la plateforme Ultralytics et son écosystème logiciel complet surpassent les dépôts autonomes comme DAMO-YOLO.
Facilité d’utilisation et efficacité de l’entraînement#
L’entraînement d’un modèle YOLOv9 personnalisé nécessite très peu de code passe-partout. L’API Python d’Ultralytics masque les processus complexes comme l’augmentation des données, l’entraînement distribué et l’optimisation matérielle.
from ultralytics import YOLO
# Charger un modèle YOLOv9 préentraîné
model = YOLO("yolov9c.pt")
# Entraîner le modèle sur ton jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Valider les performances du modèle
metrics = model.val()
# Exporter pour le déploiement en production
model.export(format="onnx")À l’inverse, l’utilisation de DAMO-YOLO nécessite souvent de parcourir des fichiers de configuration rigides et des chaînes de dépendances complexes propres à son pipeline d’entraînement particulier, ce qui rend sa prise en main plus difficile.
Polyvalence entre les tâches#
La polyvalence intrinsèque des modèles Ultralytics est l’une de leurs caractéristiques majeures. Au-delà de la détection standard de boîtes englobantes, le framework Ultralytics prend en charge de manière transparente des tâches telles que la segmentation d’instances, l’estimation de pose, la classification d’images et la détection de boîtes englobantes orientées (OBB). DAMO-YOLO est strictement optimisé pour la détection d’objets en 2D et nécessite un important travail de réingénierie pour s’adapter à d’autres paradigmes visuels.
Ultralytics simplifie le pipeline de déploiement en proposant l’exportation de modèles en un clic vers des formats comme TensorRT, OpenVINO et CoreML, afin de garantir des performances maximales quelle que soit la cible matérielle.
Cas d’utilisation et recommandations#
Le choix entre YOLOv9 et DAMO-YOLO dépend des exigences propres à ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLOv9#
YOLOv9 est un excellent choix pour :
- Recherche sur les goulots d’étranglement de l’information : les projets universitaires qui étudient les architectures à informations de gradient programmables (PGI) et à réseau généralisé d’agrégation efficace des couches (GELAN).
- Études sur l’optimisation du flux de gradients : les recherches axées sur la compréhension et l’atténuation des pertes d’information dans les couches profondes des réseaux pendant l’entraînement.
- Évaluation comparative de la détection de haute précision : les scénarios où les solides performances de YOLOv9 sur COCO servent de référence pour comparer les architectures.
Quand choisir DAMO-YOLO#
DAMO-YOLO est recommandé pour :
- Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
- Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
- Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
L’avenir : passer à YOLO26#
Bien que YOLOv9 et DAMO-YOLO représentent des jalons historiques importants, la vision par ordinateur moderne s’est tournée vers des architectures nativement de bout en bout. Pour tout nouveau développement, YOLO26 est le modèle recommandé.
Sorti en 2026, YOLO26 s’appuie sur les réussites de ses prédécesseurs et offre un bond en avant en matière de précision et de simplicité de déploiement.
Principales innovations de YOLO26#
- Conception de bout en bout sans NMS : la tête optionnelle one-to-one de YOLO26 (
nms=False) élimine entièrement le post-traitement par suppression non maximale (NMS). Elle crée ainsi un pipeline de déploiement simplifié, nativement de bout en bout, une avancée inaugurée par YOLOv10. - Suppression de DFL : la Distribution Focal Loss est supprimée pour simplifier l’exportation et améliorer la compatibilité avec les appareils périphériques et à faible consommation.
- Inférence CPU jusqu’à 43 % plus rapide : en supprimant DFL et en optimisant les convolutions fondamentales, YOLO26 est particulièrement adapté aux scénarios d’informatique en périphérie dépourvus de GPU dédié.
- Optimiseur MuSGD : inspiré des innovations de l’entraînement des LLM, YOLO26 utilise une approche hybride associant SGD et Muon (MuSGD) pour garantir des entraînements plus stables et une convergence nettement plus rapide.
- ProgLoss + STAL : ces fonctions de perte avancées améliorent remarquablement la reconnaissance des petits objets, ce qui rend YOLO26 idéal pour les images aériennes prises à haute altitude et les appareils IoT.
Si tu étudies actuellement YOLO11 ou YOLOv8 pour ton prochain projet, passer à YOLO26 te garantit d’utiliser le framework d’IA visuelle le plus optimisé et le plus avancé disponible aujourd’hui.
Résumé#
Le choix du modèle adapté dépend de tes contraintes opérationnelles spécifiques :
- DAMO-YOLO offre un aperçu intéressant de l’optimisation pilotée par NAS et des vitesses compétitives pour des profils matériels très spécifiques, où son architecture RepGFPN excelle.
- YOLOv9 est un excellent choix pour les chercheurs qui souhaitent préserver les détails visuels fins, grâce à son architecture PGI qui évite la perte d’informations dans les réseaux profonds.
- Ultralytics YOLO26 s’impose comme le choix de référence pour les applications modernes en entreprise et en recherche. Sa simplicité d’utilisation inégalée, son architecture sans NMS et ses optimisations d’entraînement MuSGD de pointe en font le modèle le plus fiable, précis et facile à déployer dans le domaine de la vision par ordinateur.