Ultralytics YOLO27 :
Get Started

DAMO-YOLO et YOLOv5#

L’évolution de la vision par ordinateur est marquée par une innovation continue dans la détection d’objets en temps réel. Aujourd’hui, les développeurs et les chercheurs doivent choisir parmi une multitude d’architectures pour concevoir leurs pipelines de vision. Cette comparaison technique complète examine les différences entre DAMO-YOLO et Ultralytics YOLOv5, et met en évidence leurs architectures, leurs méthodes d’entraînement, leurs métriques de performance et leurs scénarios de déploiement idéaux.

Présentation de DAMO-YOLO#

Lancé par le groupe Alibaba, DAMO-YOLO a introduit plusieurs techniques inédites visant à repousser les limites de la vitesse et de la précision de détection.

En savoir plus sur DAMO-YOLO

Innovations architecturales#

DAMO-YOLO repose sur la recherche d’architecture neuronale (NAS). Les auteurs ont utilisé MAE-NAS pour concevoir automatiquement des backbones offrant un équilibre entre latence et précision. Le modèle introduit RepGFPN (réseau pyramidal de caractéristiques généralisé reparamétré), efficace pour améliorer la fusion des caractéristiques à différentes échelles. De plus, DAMO-YOLO intègre une conception « ZeroHead », qui remplace les têtes de prédiction complexes à branches multiples par une structure plus simple et plus efficace, reposant largement sur la reparamétrisation pendant l’inférence.

Pour améliorer l’entraînement, le modèle utilise AlignedOTA pour l’affectation des étiquettes et un processus de distillation renforcé, dans lequel un modèle « enseignant » plus grand guide un modèle « étudiant » plus petit afin d’en améliorer la précision.

Présentation d’Ultralytics YOLOv5#

Ultralytics YOLOv5 est l’une des architectures de vision les plus utilisées au monde, réputée pour sa stabilité, sa facilité d’utilisation et son vaste écosystème de déploiement.

La référence de l’écosystème#

YOLOv5 a redéfini les standards du secteur en matière de facilité d’utilisation. Développé nativement avec PyTorch, il utilise un backbone CSPNet hautement optimisé et un neck PANet pour une agrégation robuste des caractéristiques. Bien qu’il soit antérieur à la tendance des modèles sans ancres observée dans les modèles plus récents, son approche avec ancres, largement optimisée et associée à l’apprentissage automatique des ancres, garantit d’excellentes performances dès la première utilisation.

La véritable force de YOLOv5 réside dans son écosystème bien entretenu. Il s’intègre facilement à des outils de suivi comme Comet et Weights & Biases, et prend en charge l’export en un clic vers des formats tels que ONNX, TensorRT et CoreML.

Bien démarrer avec YOLOv5

YOLOv5 est très facile à entraîner sur des jeux de données personnalisés. Son API rationalisée facilite le passage du prototype à la production, ce qui en fait un favori des équipes d’ingénierie agiles.

Comparaison des performances et des métriques#

Pour comparer ces modèles, il est essentiel d’examiner l’équilibre entre la précision moyenne (mAP), la vitesse d’inférence et le nombre de paramètres.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

Analyse des compromis#

DAMO-YOLO atteint des scores mAP impressionnants au regard de son nombre de paramètres, en grande partie grâce à sa phase d’entraînement par distillation. Cela se fait toutefois au détriment de l’efficacité de l’entraînement. Le processus de distillation en plusieurs étapes nécessite d’abord l’entraînement d’un modèle enseignant lourd, ce qui augmente considérablement le temps de calcul GPU et la VRAM nécessaires.

À l’inverse, YOLOv5 offre d’excellents besoins en mémoire. Les modèles YOLO d’Ultralytics sont réputés pour leur faible consommation de mémoire à l’entraînement comme à l’inférence, par rapport aux pipelines de distillation complexes ou aux modèles basés sur Transformer comme RT-DETR. YOLOv5 peut ainsi être entraîné efficacement sur du matériel grand public ou dans des environnements cloud accessibles comme Google Colab.

Applications en conditions réelles et polyvalence#

Le choix de l’architecture appropriée dépend souvent de l’environnement de déploiement.

Les points forts de DAMO-YOLO#

DAMO-YOLO est exclusivement un modèle de détection d’objets. C’est un excellent choix pour la recherche universitaire, en particulier pour les équipes qui étudient la recherche d’architecture neuronale ou qui souhaitent reproduire les techniques de reparamétrisation décrites dans l’article. Si un projet dispose de ressources de calcul importantes pour effectuer la phase d’entraînement par distillation et vise uniquement à gagner le moindre point de précision sur les boîtes englobantes 2D, DAMO-YOLO est un candidat sérieux.

L’avantage Ultralytics#

Pour les applications en production, la facilité d’utilisation et la polyvalence des modèles Ultralytics en font le choix privilégié. YOLOv5 reste une référence pour la détection et la classification d’images, mais l’écosystème Ultralytics plus vaste permet aux développeurs de passer facilement d’une tâche à l’autre.

Par exemple, les versions plus récentes de la famille Ultralytics prennent nativement en charge la segmentation d’instances, l’estimation de pose et la détection par boîtes englobantes orientées (OBB). Cette capacité multitâche permet aux équipes d’utiliser une API Python unifiée pour des pipelines complexes, comme l’association de la reconnaissance automatique des plaques d’immatriculation à la segmentation des véhicules.

Cas d’utilisation et recommandations#

Le choix entre DAMO-YOLO et YOLOv5 dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir DAMO-YOLO#

DAMO-YOLO est un excellent choix pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
  • Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
  • Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.

Quand choisir YOLOv5#

YOLOv5 est recommandé pour :

  • Systèmes de production éprouvés : les déploiements existants où la longue expérience de stabilité de YOLOv5, sa documentation exhaustive et le soutien important de sa communauté sont appréciés.
  • Entraînement avec des ressources limitées : les environnements disposant de ressources GPU limitées, où le pipeline d’entraînement efficace de YOLOv5 et ses besoins en mémoire réduits sont avantageux.
  • Prise en charge étendue des formats d’exportation : les projets qui nécessitent un déploiement dans de nombreux formats, notamment ONNX, TensorRT, CoreML et LiteRT.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avenir : passer à YOLO26#

YOLOv5 est légendaire et DAMO-YOLO apporte des enseignements universitaires intéressants, mais les technologies de pointe ont évolué. Sorti en janvier 2026, Ultralytics YOLO26 représente un bond en avant considérable pour la communauté de la vision par ordinateur.

YOLO26 s’attaque aux goulots d’étranglement traditionnels du déploiement en périphérie et à l’instabilité de l’entraînement :

  • Conception de bout en bout sans NMS : la tête optionnelle de bout en bout de YOLO26 (nms=False) élimine le post-traitement par suppression non maximale. Cette avancée simplifie la logique de déploiement et réduit considérablement les variations de latence, ce qui en fait une solution idéale pour la robotique à grande vitesse et les systèmes autonomes.
  • Optimiseur MuSGD : inspiré des innovations en matière d’entraînement des LLM (comme Kimi K2 de Moonshot AI), YOLO26 utilise l’optimiseur MuSGD, une approche hybride de SGD et de Muon. Il assure ainsi des entraînements très stables et une convergence nettement plus rapide.
  • Inférence CPU jusqu’à 43 % plus rapide : en supprimant stratégiquement la Distribution Focal Loss (DFL), YOLO26n s’exécute jusqu’à 43 % plus rapidement que YOLO11n sur CPU avec ONNX et offre de meilleures vitesses sur CPU et sur les appareils en périphérie que ses prédécesseurs comme YOLO11 et YOLOv8.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent sensiblement la reconnaissance des petits objets, un point essentiel pour l’analyse de l’imagerie aérienne par drone et des flux de capteurs IoT.

Exemple de code : la simplicité en action#

Le package Ultralytics te permet d’entraîner et de déployer des modèles avec seulement quelques lignes de code. Que tu utilises YOLOv5 ou que tu passes à YOLO26, le modèle recommandé, l’interface reste cohérente et intuitive.

from ultralytics import YOLO

# Charger le modèle YOLO26 small à la pointe de la technologie
model = YOLO("yolo26s.pt")

# Entraîne-le facilement sur un jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Lancer l’inférence sur une image et afficher les résultats
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Exporter le modèle pour le déploiement en périphérie
model.export(format="onnx")

Conclusion#

DAMO-YOLO et YOLOv5 ont tous deux contribué de manière significative au domaine de la vision par ordinateur. DAMO-YOLO met en évidence la puissance de la recherche d’architecture neuronale et de la distillation, ce qui en fait un sujet d’étude intéressant pour les chercheurs. Cependant, YOLOv5 reste une solution pratique puissante grâce à son équilibre entre les performances, à ses faibles besoins en mémoire et à sa facilité d’utilisation inégalée.

Pour les développeurs qui démarrent de nouveaux projets aujourd’hui, nous recommandons de tirer parti de la plateforme Ultralytics et d’adopter YOLO26. Il associe l’écosystème convivial de YOLOv5, très apprécié, à des avancées architecturales révolutionnaires, garantissant une précision de premier ordre et une inférence ultrarapide pour les applications d’IA dans le cloud comme en périphérie. Selon les contraintes du matériel existant, les développeurs peuvent également explorer d’autres modèles efficaces comme YOLOv6 ou YOLOX.

Commentaires