YOLO Vision 2026 :

YOLOv9 vs DAMO-YOLO#

L'évolution rapide de la vision par ordinateur a produit une gamme d'architectures puissantes adaptées à diverses contraintes de déploiement et exigences de précision. Deux entrées notables dans ce domaine sont YOLOv9, célèbre pour sa gestion robuste des goulots d'étranglement de l'information, et DAMO-YOLO, qui met fortement l'accent sur la recherche d'architecture neuronale (NAS) et les pyramides de caractéristiques efficaces.

Ce guide propose une comparaison technique approfondie de YOLOv9 et de DAMO-YOLO, en mettant en avant leurs différences architecturales, leurs méthodologies d'entraînement et leurs scénarios de déploiement idéaux. Nous allons également explorer comment l'écosystème Ultralytics offre un parcours fluide du développement à la production, et pourquoi les modèles modernes comme YOLO26 sont devenus le standard recommandé pour les nouveaux projets.

Plongée architecturale#

Comprendre les mécanismes fondamentaux qui animent chaque modèle révèle pourquoi leurs performances diffèrent selon diverses métriques.

YOLOv9 : Programmable Gradient Information#

YOLOv9 a été conçu pour traiter directement la perte d'information qui se produit lorsque les données circulent à travers des réseaux neuronaux profonds.

Auteurs : Chien-Yao Wang, Hong-Yuan Mark Liao
Organisation : Institute of Information Science, Academia Sinica, Taïwan
Date : 21 février 2024
Liens : Arxiv, GitHub, Docs

En savoir plus sur YOLOv9

YOLOv9 introduit la technologie Programmable Gradient Information (PGI) et le réseau Generalized Efficient Layer Aggregation Network (GELAN). La PGI garantit que les informations spatiales et sémantiques essentielles sont conservées lors du processus de propagation avant, évitant ainsi la dégradation des gradients utilisés pour les mises à jour des poids. Le GELAN complète cette approche en maximisant l'efficacité des paramètres, permettant au modèle d'atteindre des performances de pointe en matière de mean Average Precision (mAP) avec moins de FLOPs que de nombreux CNN conventionnels.

DAMO-YOLO : Efficacité pilotée par NAS#

Développé par Alibaba Group, DAMO-YOLO adopte une approche différente, en exploitant la recherche architecturale automatisée pour trouver l'équilibre optimal entre vitesse et précision.

Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
Organisation : Alibaba Group
Date : 23 novembre 2022
Liens : Arxiv, GitHub

En savoir plus sur DAMO-YOLO

DAMO-YOLO s'appuie sur une structure (backbone) MAE-NAS (Masked Autoencoders for Neural Architecture Search) pour générer automatiquement des structures de réseau efficaces. Il utilise un RepGFPN (Reparameterized Generalized Feature Pyramid Network) pour une fusion robuste des caractéristiques et une conception « ZeroHead » pour minimiser la charge de calcul de la tête de détection. De plus, il intègre AlignedOTA pour l'affectation des étiquettes et la distillation de connaissances pour booster les performances de ses variantes plus petites.

Le rôle du NAS dans la vision par ordinateur

La recherche d'architecture neuronale (NAS) automatise la conception des réseaux neuronaux artificiels. Bien qu'elle puisse produire des modèles très efficaces comme DAMO-YOLO, elle nécessite souvent des ressources de calcul massives pour explorer l'espace architectural, ce qui contraste avec la philosophie de conception plus déterministe de modèles comme YOLOv9.

Comparaison des performances et des mesures#

Lors du choix d'un modèle de détection d'objets, il est essentiel de trouver un équilibre entre précision, vitesse et empreinte informatique.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Analyse#

  • Précision vs Paramètres : YOLOv9 démontre généralement un meilleur rapport paramètres/précision. Par exemple, YOLOv9c atteint 53,0% de mAP avec 25,3M de paramètres, tandis que DAMO-YOLOl atteint 50,8% de mAP mais nécessite significativement plus de paramètres (42,1M).
  • Vitesse d'inférence : L'architecture de DAMO-YOLO offre des vitesses d'inférence TensorRT compétitives sur les GPU T4, devançant légèrement YOLOv9 dans les catégories intermédiaires. Cependant, l'efficacité de YOLOv9 en termes de FLOPs et de nombre de paramètres se traduit par une efficacité de la mémoire GPU exceptionnelle.
  • Exigences de mémoire : Les modèles Ultralytics YOLO, incluant YOLOv9, présentent généralement une consommation de mémoire inférieure pendant l'entraînement et l'inférence par rapport aux modèles complexes générés par NAS ou aux architectures transformeurs lourdes, ce qui les rend très accessibles pour un déploiement sur du matériel de périphérie (edge) contraint.

L'avantage de l'écosystème Ultralytics#

Bien que les métriques théoriques soient importantes, la mise en œuvre pratique dicte fortement le succès d'un projet. C'est là que la plateforme Ultralytics et son écosystème logiciel complet surpassent les dépôts autonomes comme DAMO-YOLO.

Facilité d'utilisation et efficacité de l'entraînement#

L'entraînement d'un modèle YOLOv9 personnalisé nécessite un code passe-partout minimal. L'API Python d'Ultralytics abstrait les processus complexes tels que l'augmentation des données, l'entraînement distribué et l'optimisation matérielle.

from ultralytics import YOLO

# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate model performance
metrics = model.val()

# Export for production deployment
model.export(format="onnx")

À l'inverse, l'utilisation de DAMO-YOLO nécessite souvent de naviguer dans des fichiers de configuration rigides et des chaînes de dépendances complexes spécifiques à son pipeline d'entraînement unique, ce qui résulte en une courbe d'apprentissage plus raide.

Polyvalence des tâches#

L'une des caractéristiques phares des modèles Ultralytics est leur polyvalence inhérente. Au-delà de la détection de boîtes englobantes standard, le framework Ultralytics prend en charge de manière transparente des tâches telles que la segmentation d'instances, l'estimation de pose, la classification d'images et la détection par boîte englobante orientée (OBB). DAMO-YOLO est strictement optimisé pour la détection d'objets 2D, ce qui nécessite une réingénierie importante pour s'adapter à d'autres paradigmes visuels.

Exportation vers des appareils de périphérie (Edge)

Ultralytics simplifie le pipeline de déploiement en proposant l'exportation de modèles en un clic vers des formats tels que TensorRT, OpenVINO et CoreML, garantissant des performances maximales quel que soit ton matériel cible.

Cas d'utilisation et recommandations#

Le choix entre YOLOv9 et DAMO-YOLO dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir YOLOv9#

YOLOv9 est un choix solide pour :

  • Recherche sur le goulot d'étranglement de l'information : Projets académiques étudiant les architectures Programmable Gradient Information (PGI) et Generalized Efficient Layer Aggregation Network (GELAN).
  • Études sur l'optimisation du flux de gradient : Recherche axée sur la compréhension et l'atténuation de la perte d'informations dans les couches profondes du réseau pendant l'entraînement.
  • Benchmarks de détection haute précision : Scénarios où les performances solides de YOLOv9 sur le benchmark COCO sont nécessaires comme point de référence pour les comparaisons architecturales.

Quand choisir DAMO-YOLO#

DAMO-YOLO est recommandé pour :

  • Analytique vidéo à haut débit : Traitement de flux vidéo FPS élevés sur une infrastructure GPU NVIDIA fixe où le débit par lot est la mesure principale.
  • Lignes de fabrication industrielle : Scénarios avec des contraintes strictes de latence GPU sur du matériel dédié, comme l'inspection qualité en temps réel sur les lignes d'assemblage.
  • Recherche sur la recherche d'architecture neuronale : Étude des effets de la recherche d'architecture automatisée (MAE-NAS) et des backbones reparamétrés efficaces sur les performances de détection.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre la meilleure combinaison de performance et d'expérience développeur :

  • Déploiement en périphérie sans NMS : Applications nécessitant une inférence cohérente et à faible latence sans la complexité du post-traitement par Non-Maximum Suppression.
  • Environnements CPU uniquement : Appareils sans accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 offre un avantage décisif.
  • Détection de petits objets : Les scénarios complexes tels que l'imagerie par drone aérien ou l'analyse par capteurs IoT où ProgLoss et STAL améliorent considérablement la précision sur les minuscules objets.

L'avenir : Passer à YOLO26#

Bien que YOLOv9 et DAMO-YOLO représentent de solides jalons historiques, la vision par ordinateur moderne s'est orientée vers des architectures natives de bout en bout. Pour tout nouveau développement, YOLO26 est le standard recommandé.

Lancé en 2026, YOLO26 s'appuie sur les succès de ses prédécesseurs, offrant un bond en avant tant en précision qu'en simplicité de déploiement.

Innovations clés de YOLO26#

  • Conception de bout en bout sans NMS : YOLO26 élimine entièrement le post-traitement par suppression non maximale (NMS). Cela crée un pipeline de déploiement rationalisé qui est nativement de bout en bout, une avancée pionnière introduite pour la première fois dans YOLOv10.
  • Suppression du DFL : Le Distribution Focal Loss est supprimé pour une exportation simplifiée et une meilleure compatibilité avec les appareils de périphérie/faible consommation.
  • Jusqu'à 43 % d'inférence CPU plus rapide : En supprimant le post-traitement complexe et en optimisant les convolutions principales, YOLO26 est parfaitement adapté aux scénarios d'edge computing dépourvus de GPU dédiés.
  • Optimiseur MuSGD : Inspiré par les innovations dans l'entraînement des LLM, YOLO26 utilise un hybride de SGD et de Muon (MuSGD) pour garantir des cycles d'entraînement plus stables et des temps de convergence nettement plus rapides.
  • ProgLoss + STAL : Ces fonctions de perte avancées offrent des améliorations remarquables dans la reconnaissance des petits objets, rendant YOLO26 idéal pour l'imagerie aérienne à haute altitude et les appareils IoT.

Si tu recherches actuellement YOLO11 ou YOLOv8 pour ton prochain projet, passer à YOLO26 te garantit d'utiliser le framework d'IA de vision le plus optimisé et le plus avancé disponible aujourd'hui.

Résumé#

Le choix du bon modèle dépend de tes contraintes opérationnelles spécifiques :

  • DAMO-YOLO offre un aperçu fascinant de l'optimisation pilotée par NAS, offrant des vitesses compétitives pour des profils matériels très spécifiques où son architecture RepGFPN excelle.
  • YOLOv9 est un excellent choix pour les chercheurs qui se concentrent sur la conservation des détails visuels fins, en tirant parti de son architecture PGI pour éviter la perte d'information dans les réseaux profonds.
  • Ultralytics YOLO26 s'impose comme le choix définitif pour les applications d'entreprise et de recherche modernes. Sa facilité d'utilisation inégalée, son architecture sans NMS et ses optimisations d'entraînement de pointe MuSGD en font le modèle le plus fiable, précis et facilement déployable dans le paysage de la vision par ordinateur.
Contributeurs

Commentaires