Ultralytics YOLO27 :
Get Started

YOLOv5 vs DAMO-YOLO#

Le domaine de la vision par ordinateur en temps réel évolue sans cesse, les chercheurs et les ingénieurs s'efforçant de trouver l'équilibre idéal entre précision, vitesse et facilité d'utilisation. Deux modèles majeurs ont marqué cette évolution : Ultralytics YOLOv5 et DAMO-YOLO d'Alibaba.

Ce guide propose une analyse technique approfondie de leurs architectures, de leurs métriques de performance et de leurs méthodes d'entraînement, afin de t'aider à choisir le modèle adapté à ton prochain déploiement.

Origines des modèles#

Avant d'examiner les aspects techniques, il est important de comprendre les origines et les principales philosophies de conception de chacun de ces modèles de vision influents.

Ultralytics YOLOv5#

Développé par Glenn Jocher et l'équipe d'Ultralytics, YOLOv5 est devenu une référence du secteur depuis sa sortie. Conçu nativement sur le framework PyTorch, il a privilégié dès le départ une expérience de développement fluide et de solides capacités de déploiement.

DAMO-YOLO#

Créé par des chercheurs du groupe Alibaba, DAMO-YOLO mise fortement sur la recherche d'architecture neuronale (NAS) et les techniques avancées de distillation. Il repousse les limites théoriques des performances propres au matériel et s'adresse particulièrement aux environnements de recherche et périphériques nécessitant un réglage poussé.

En savoir plus sur DAMO-YOLO

Innovations architecturales#

Les deux modèles s'appuient sur des concepts structurels spécifiques pour atteindre leurs performances en temps réel, mais leurs approches diffèrent considérablement.

YOLOv5 : stabilité et polyvalence#

YOLOv5 utilise un backbone CSP (partiel entre étapes) modifié, associé à un neck PANet (réseau d'agrégation de chemins). Cette structure est très efficace et minimise l'utilisation de mémoire CUDA pendant l'entraînement comme pendant l'inférence.

L'un des principaux atouts de YOLOv5 est sa polyvalence pour différentes tâches. Au-delà des prédictions de boîtes englobantes, il propose des architectures dédiées à la segmentation d'images et à la classification d'images, ce qui permet aux développeurs d'unifier leurs pipelines de vision autour d'un seul framework cohérent.

L'innovation centrale de DAMO-YOLO est son backbone MAE-NAS. Grâce à une recherche guidée par l'entropie maximale, l'équipe Alibaba a découvert des backbones qui équilibrent dynamiquement précision de détection et vitesse d'inférence.

Il intègre également le neck Efficient RepGFPN pour améliorer la fusion des caractéristiques, ce qui est très utile pour les variations d'échelle complexes souvent rencontrées dans l'analyse d'images satellite. Sa conception ZeroHead simplifie les couches de prédiction finales afin de réduire la latence, mais cette génération structurelle complexe peut rendre l'architecture rigide et plus difficile à modifier pour des applications personnalisées.

Besoins en mémoire

Les architectures fondées sur Transformer ont souvent du mal à maîtriser leur consommation élevée de VRAM. YOLOv5 et DAMO-YOLO utilisent tous deux des conceptions convolutionnelles efficaces pour limiter leur empreinte mémoire, mais les modèles Ultralytics sont particulièrement optimisés pour les GPU grand public, ce qui les rend bien plus accessibles aux chercheurs indépendants et aux start-up.

Performances et métriques#

L'évaluation des détecteurs d'objets en temps réel nécessite d'examiner une matrice de mAP (précision moyenne), de vitesse d'inférence et de paramètres de taille du modèle.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Bien que DAMO-YOLO obtienne des scores mAP très compétitifs pour certains nombres de paramètres, YOLOv5 affiche systématiquement des vitesses TensorRT exceptionnelles et un nombre de paramètres incroyablement faible dans ses configurations nano et small. Cet équilibre des performances garantit que YOLOv5 fonctionne efficacement dans divers scénarios de déploiement en périphérie.

Efficacité de l’entraînement et écosystème#

La précision théorique d'un modèle ne vaut que si celui-ci peut être mis en œuvre concrètement. C'est sur ce point que les modèles divergent considérablement.

La complexité de la distillation#

DAMO-YOLO dépend fortement d'une méthode d'entraînement en plusieurs étapes. Il associe l'attribution d'étiquettes AlignedOTA à une technique de distillation des connaissances entre enseignant et élève. Cette approche permet d'extraire les meilleures performances du modèle élève, mais exige d'abord d'entraîner un modèle enseignant massif. Cela augmente considérablement le temps de calcul, les coûts énergétiques et les besoins matériels, créant un goulot d'étranglement pour les équipes de ML agiles.

L’avantage d’Ultralytics : simplicité d’utilisation#

À l'inverse, l'écosystème Ultralytics est réputé dans le monde entier pour ses API intuitives et son efficacité d'entraînement. Grâce à un développement actif et à une immense communauté open source, les développeurs peuvent entraîner, valider et déployer des modèles sans difficulté.

from ultralytics import YOLO

# Charger un modèle YOLOv5 préentraîné
model = YOLO("yolov5su.pt")  # YOLOv5u : poids YOLOv5 sans ancres pour le package ultralytics

# Entraîne-le facilement sur un jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporter au format ONNX pour le déploiement
model.export(format="onnx")

Ultralytics intègre également la prise en charge du suivi des expériences avec des outils comme Weights & Biases et Comet ML, pour créer un flux de travail sans friction.

Cas d'utilisation concrets#

  • YOLOv5 excelle dans les environnements de production au rythme soutenu. Sa facilité d'exportation en fait le choix idéal pour l'analytique du commerce de détail intelligent, la détection à grande vitesse de défauts de fabrication et l'intégration aux applications mobiles via CoreML.
  • DAMO-YOLO convient particulièrement aux évaluations comparatives universitaires strictes et aux situations où d'importantes ressources de calcul sont disponibles pour effectuer de longs entraînements par distillation, dans le but d'obtenir de légères améliorations du mAP sur des cibles matérielles spécifiques et fixes.

Cas d’utilisation et recommandations#

Le choix entre YOLOv5 et DAMO-YOLO dépend de tes exigences de projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir YOLOv5#

YOLOv5 est un excellent choix pour :

  • Systèmes de production éprouvés : les déploiements existants où la longue expérience de stabilité de YOLOv5, sa documentation exhaustive et le soutien important de sa communauté sont appréciés.
  • Entraînement avec des ressources limitées : les environnements disposant de ressources GPU limitées, où le pipeline d’entraînement efficace de YOLOv5 et ses besoins en mémoire réduits sont avantageux.
  • Prise en charge étendue des formats d’exportation : les projets qui nécessitent un déploiement dans de nombreux formats, notamment ONNX, TensorRT, CoreML et LiteRT.

Quand choisir DAMO-YOLO#

DAMO-YOLO est recommandé pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
  • Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
  • Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

La prochaine évolution : YOLO26#

Si tu démarres un nouveau projet, il est fortement recommandé de te tourner vers l'avenir. Ultralytics YOLO26 s'appuie sur les bases remarquables de YOLOv5 et intègre des avancées révolutionnaires qui redéfinissent l'IA pour la vision de pointe.

Pourquoi passer à YOLO26 ?

Accueilli avec un enthousiasme unanime, YOLO26 est nativement de bout en bout. Il intègre une conception de bout en bout sans NMS (nms=False) qui évite le post-traitement par suppression non maximale, pour un déploiement nettement plus rapide et plus simple.

Les principales innovations de YOLO26 comprennent :

  • Optimiseur MuSGD : inspiré des innovations en matière d'entraînement des LLM, cet hybride de SGD et de Muon garantit un entraînement très stable et une convergence rapide.
  • Inférence CPU jusqu'à 43 % plus rapide : hautement optimisé pour l'informatique en périphérie, il est idéal pour les appareils IoT qui fonctionnent sans GPU dédié.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent considérablement la reconnaissance des petits objets, essentielle pour l'imagerie aérienne par drone et la robotique.
  • Améliorations propres aux tâches : de la fonction de perte d'angle spécialisée pour les boîtes englobantes orientées (OBB) à l'estimation résiduelle de la log-vraisemblance (RLE) pour une estimation de pose précise, YOLO26 gère facilement les domaines complexes.

Conclusion#

YOLOv5 et DAMO-YOLO ont tous deux marqué l'histoire de la détection d'objets. DAMO-YOLO reste une étude fascinante sur la recherche d'architecture neuronale et la distillation. Cependant, pour les organisations qui privilégient un écosystème bien maintenu, la facilité d'utilisation et un passage rapide en production, les modèles Ultralytics restent inégalés.

Nous recommandons vivement d'utiliser la plateforme Ultralytics pour annoter, entraîner et déployer la prochaine génération de modèles, comme YOLO26, afin que ton pipeline de vision par ordinateur soit pérenne, rapide et remarquablement précis.

Pour aller plus loin#

  • Découvre le modèle RT-DETR fondé sur Transformer pour les applications qui exigent une grande précision.
  • Découvre le modèle YOLO11 de la génération précédente.
  • Découvre comment optimiser les déploiements avec OpenVINO.

Commentaires