Ultralytics YOLO27 :
Get Started

DAMO-YOLO vs YOLOv9#

Le domaine de la détection d’objets en temps réel continue d’évoluer à un rythme effréné. Alors que les équipes d’ingénierie et les chercheurs cherchent à trouver le juste équilibre entre précision, vitesse d’inférence et efficacité de calcul, deux architectures remarquables ont émergé de la communauté de recherche : DAMO-YOLO et YOLOv9. Ces deux modèles introduisent d’importantes innovations architecturales qui repoussent les limites de la vision par ordinateur.

Ce guide technique détaillé propose une analyse approfondie de ces deux modèles et compare leurs approches architecturales distinctives, leurs méthodes d’entraînement et leurs capacités de déploiement en conditions réelles. Nous examinerons également le rôle crucial de l’écosystème logiciel au sens large dans le développement moderne de l’IA, en soulignant les avantages des plateformes intégrées comme l’Ultralytics Platform et des modèles de nouvelle génération comme YOLO26.

Résumé : choisir la bonne architecture#

Bien que les deux modèles constituent des jalons importants de la recherche en apprentissage profond, ils répondent à des philosophies de déploiement légèrement différentes.

DAMO-YOLO excelle dans les environnements où l’on peut exploiter une recherche d’architecture neuronale (NAS) poussée pour obtenir des profils de performance précis, ce qui en fait un sujet d’étude intéressant pour les déploiements edge personnalisés. À l’inverse, YOLOv9 vise surtout à résoudre les goulots d’étranglement de l’information dans l’apprentissage profond et offre une efficacité exceptionnelle en matière de paramètres.

Cependant, pour les déploiements prêts pour la production, les équipes d’ingénierie recommandent systématiquement de tirer parti de l’écosystème unifié Ultralytics. Pour les nouveaux projets, le dernier modèle YOLO26 offre le meilleur des deux mondes : une précision de pointe combinée à une conception de bout en bout optionnelle qui élimine le besoin d’un post-traitement complexe.

Prépare ton pipeline de vision par ordinateur pour l’avenir

Bien que DAMO-YOLO et YOLOv9 soient des modèles universitaires puissants, leur déploiement en production nécessite souvent un travail d’ingénierie personnalisé important. Avec Ultralytics YOLO26, tu bénéficies de performances de pointe et d’une API simplifiée et facile à maintenir.

Spécifications techniques et auteurs#

Comprendre l’origine et les objectifs de développement de ces modèles permet de mieux cerner leurs atouts respectifs.

DAMO-YOLO#

Développé par des chercheurs du groupe Alibaba, DAMO-YOLO se concentre fortement sur la génération automatisée d’architectures et la fusion efficace des caractéristiques.

En savoir plus sur DAMO-YOLO

YOLOv9#

Conçu pour remédier à la perte d’information dans les réseaux convolutifs profonds, YOLOv9 repousse les limites théoriques de la préservation du gradient pendant l’entraînement.

En savoir plus sur YOLOv9

Innovations architecturales#

DAMO-YOLO se distingue par des composants fortement personnalisés et générés par machine. Son backbone est généré par recherche d’architecture neuronale (NAS), avec pour objectif précis une inférence à faible latence sur différents matériels.

L’architecture comprend un RepGFPN (réseau pyramidal généralisé de caractéristiques reparamétré) efficace pour la fusion des caractéristiques, qui améliore la détection d’objets à plusieurs échelles sans augmenter excessivement la charge de calcul. Elle utilise également une conception ZeroHead pour simplifier la tête de détection, ainsi qu’AlignedOTA pour l’assignation des étiquettes, le tout associé à un processus sophistiqué d’amélioration par distillation pendant l’entraînement. Ces techniques permettent une inférence rapide, mais le processus de distillation en plusieurs étapes nécessite souvent une quantité importante de VRAM et des temps d’entraînement prolongés.

YOLOv9 : résoudre le goulot d’étranglement de l’information#

YOLOv9 s’attaque à un problème fondamental des réseaux profonds : la perte progressive des informations contenues dans les données d’entrée à mesure qu’elles traversent des couches successives.

Pour remédier à ce problème, les auteurs ont introduit Programmable Gradient Information (PGI), un cadre de supervision auxiliaire conçu pour préserver les détails essentiels dans les couches profondes et générer des gradients très fiables pour la mise à jour des poids. PGI s’accompagne de l’architecture GELAN (Réseau généralisé d’agrégation efficace des couches). GELAN optimise l’efficacité des paramètres en combinant les atouts de CSPNet et d’ELAN, tout en maximisant le flux d’informations et en réduisant strictement les opérations en virgule flottante (FLOPs).

Analyse des performances et métriques#

Lors de l’évaluation des performances, les deux modèles affichent une précision moyenne moyenne (mAP) élevée sur des benchmarks standard comme COCO. YOLOv9 atteint une précision supérieure pour un nombre de paramètres comparable, ainsi que la précision absolue la plus élevée dans l’ensemble, grâce à son architecture PGI qui préserve une grande fidélité sur les jeux de données difficiles.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Comme indiqué ci-dessus, YOLOv9-E atteint la précision la plus élevée, tandis que DAMO-YOLO et les variantes plus petites de YOLOv9 conservent des vitesses d’inférence très compétitives grâce aux optimisations TensorRT.

Méthodes d’entraînement et écosystème#

Si l’architecture brute est importante, la convivialité et l’efficacité de l’entraînement, déterminées par l’écosystème d’un modèle, sont primordiales pour les applications concrètes.

Le recours à la distillation des connaissances par DAMO-YOLO nécessite souvent d’entraîner un modèle « enseignant » encombrant avant de transférer ses connaissances au modèle « étudiant » cible. Cette approche de recherche traditionnelle augmente considérablement les besoins en mémoire et la durée des cycles d’entraînement. De même, le dépôt d’origine de YOLOv9 impose de parcourir des fichiers de configuration complexes, ce qui peut ralentir le développement agile.

À l’inverse, l’intégration des modèles à la plateforme Ultralytics transforme complètement l’expérience de développement. Le package Python Ultralytics masque le code répétitif, ce qui permet aux équipes de gérer facilement l’augmentation des données, le réglage des hyperparamètres et l’exportation des modèles.

Applications et cas d’utilisation concrets#

Les différentes architectures excellent naturellement dans certains secteurs, en fonction de leurs besoins en ressources et de leurs profils de précision.

  • DAMO-YOLO dans l’IA en périphérie : Grâce à ses backbones optimisés par NAS, DAMO-YOLO est souvent étudié pour les systèmes embarqués où le reparamétrage spécifique au matériel est indispensable, par exemple pour le déploiement d’ASIC personnalisés dans le cadre du contrôle qualité de base en production.
  • YOLOv9 dans l’analyse de précision : Grâce à l’efficacité élevée de ses paramètres et à la préservation des gradients assurée par PGI, YOLOv9 convient parfaitement aux scénarios de détection dense d’objets, comme l’analyse d’images aériennes ou le suivi de très petits objets dans des espaces de vente bondés.

Cas d’utilisation et recommandations#

Le choix entre DAMO-YOLO et YOLOv9 dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir DAMO-YOLO#

DAMO-YOLO est un excellent choix pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
  • Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
  • Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.

Quand choisir YOLOv9#

YOLOv9 est recommandé pour :

  • Recherche sur les goulots d’étranglement de l’information : les projets universitaires qui étudient les architectures à informations de gradient programmables (PGI) et à réseau généralisé d’agrégation efficace des couches (GELAN).
  • Études sur l’optimisation du flux de gradients : les recherches axées sur la compréhension et l’atténuation des pertes d’information dans les couches profondes des réseaux pendant l’entraînement.
  • Évaluation comparative de la détection de haute précision : les scénarios où les solides performances de YOLOv9 sur COCO servent de référence pour comparer les architectures.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics : passer à YOLO26#

Pour les utilisateurs qui comparent des architectures héritées, passer à l’écosystème Ultralytics moderne — et plus précisément aux derniers modèles YOLO26 — offre un avantage sans égal.

YOLO26 transforme fondamentalement le paysage du déploiement grâce à sa conception de bout en bout sans NMS. Sa tête facultative à correspondance un-à-un (nms=False) élimine le post-traitement par suppression des boîtes non maximales (NMS), pour des architectures de déploiement plus rapides et nettement plus simples. Associé à la suppression de Distribution Focal Loss (DFL), ce choix confère à YOLO26 une meilleure compatibilité avec les appareils en périphérie et à faible consommation.

En outre, YOLO26 intègre le solveur MuSGD novateur, qui associe la descente de gradient stochastique et les optimisations Muon, inspirées des innovations de l’entraînement des LLM. Il en résulte une convergence de l’entraînement très stable et une utilisation de la mémoire remarquablement faible par rapport aux solutions fortement basées sur les Transformer.

Entraînement simplifié avec YOLO26

Grâce à l’API Ultralytics intuitive, tu peux entraîner un modèle YOLO26 de pointe avec le suivi des expériences intégré en seulement quelques lignes de Python.

from ultralytics import YOLO

# Charger le dernier modèle YOLO26
model = YOLO("yolo26n.pt")

# Entraîner efficacement sur ton jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporter le modèle entraîné au format ONNX
model.export(format="onnx")

Que tu aies besoin de segmentation d’instances avancée, d’une estimation de pose très précise ou de la détection standard de boîtes englobantes, la polyvalence du framework Ultralytics permet à ton équipe de consacrer moins de temps à configurer des environnements d’apprentissage profond et davantage à déployer des solutions d’IA robustes. Grâce à des améliorations spécifiques aux tâches, comme ProgLoss + STAL pour mieux reconnaître les petits objets, YOLO26 s’impose comme le premier choix pour la nouvelle génération d’applications de vision.

Commentaires