Ultralytics YOLO27 :

YOLOv5 vs DAMO-YOLO#

Le paysage de la vision par ordinateur en temps réel évolue constamment, les chercheurs et les ingénieurs cherchant à trouver le juste équilibre entre précision, vitesse et facilité d’utilisation. Deux modèles majeurs qui ont façonné cette évolution sont Ultralytics YOLOv5 et DAMO-YOLO d’Alibaba.

Ce guide propose une analyse technique approfondie de leurs architectures, de leurs métriques de performance et de leurs méthodes d’entraînement afin de t’aider à choisir le modèle adapté à ton prochain déploiement.

Historique des modèles#

Avant d’examiner les subtilités techniques, il est important de comprendre les origines et les principales philosophies de conception de chacun de ces modèles de vision influents.

Ultralytics YOLOv5#

Développé par Glenn Jocher et l’équipe d’Ultralytics, YOLOv5 est devenu une référence du secteur dès sa sortie. Conçu nativement sur le framework PyTorch, il a privilégié une expérience développeur simplifiée et de solides capacités de déploiement dès la première utilisation.

DAMO-YOLO#

Créé par des chercheurs du groupe Alibaba, DAMO-YOLO met fortement l’accent sur la recherche d’architecture neuronale (NAS) et sur des techniques avancées de distillation. Il repousse les limites théoriques des performances spécifiques au matériel, en ciblant particulièrement les environnements de recherche et périphériques nécessitant un réglage extrêmement fin.

Innovations architecturales#

Les deux modèles exploitent des concepts structurels uniques pour atteindre leurs performances en temps réel, même si leurs approches diffèrent considérablement.

YOLOv5 : stabilité et polyvalence#

YOLOv5 utilise un backbone CSP modifié (partiel entre étapes) associé à un neck PANet (réseau d’agrégation de chemins). Cette structure est très efficace et réduit au minimum l’utilisation de la mémoire CUDA pendant l’entraînement comme pendant l’inférence.

L’un des principaux atouts de YOLOv5 réside dans sa polyvalence pour différentes tâches. Au-delà des prédictions de boîtes englobantes, il propose des architectures dédiées à la segmentation d’images et à la classification d’images, ce qui permet aux développeurs de standardiser leurs pipelines de vision autour d’un framework unique et cohérent.

DAMO-YOLO : recherche d’architecture automatisée#

L'innovation principale de DAMO-YOLO est son MAE-NAS Backbone. En utilisant une recherche guidée par l'entropie maximale, l'équipe d'Alibaba a découvert des dorsales qui équilibrent dynamiquement la précision de détection et la vitesse d'inférence.

Il intègre également le neck Efficient RepGFPN, qui améliore la fusion des caractéristiques — un atout majeur pour les variations complexes d’échelle souvent observées dans l’analyse d’images satellites. Sa conception ZeroHead simplifie les couches de prédiction finales afin de réduire la latence, mais cette génération structurelle complexe peut rendre l’architecture rigide et plus difficile à modifier pour des applications personnalisées.

Exigences mémoire

Les architectures basées sur des Transformers rencontrent souvent des difficultés liées à une forte consommation de VRAM. YOLOv5 et DAMO-YOLO utilisent tous deux des conceptions convolutionnelles efficaces pour limiter leur empreinte mémoire, mais les modèles Ultralytics sont particulièrement optimisés pour les GPU grand public, ce qui les rend beaucoup plus accessibles aux chercheurs indépendants et aux startups.

Performances et métriques#

L’évaluation des détecteurs d’objets en temps réel nécessite d’examiner une combinaison de paramètres : la mAP (précision moyenne), la vitesse d’inférence et la taille du modèle.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Bien que DAMO-YOLO obtienne des scores de mAP très compétitifs pour certains nombres de paramètres, YOLOv5 affiche systématiquement des vitesses [TensorRT](https://ultralytics-translation-0.invalid exceptionnelles et un nombre de paramètres extrêmement faible dans ses configurations nano et small. Cet équilibre des performances permet à YOLOv5 de fonctionner efficacement dans divers scénarios de déploiement périphérique.

Efficacité de l’entraînement et écosystème#

La précision théorique d’un modèle ne vaut que par sa facilité de mise en œuvre pratique. C’est sur ce point que les modèles divergent considérablement.

La complexité de la distillation#

DAMO-YOLO repose fortement sur une méthodologie d'entraînement en plusieurs étapes. Il associe l'attribution d'étiquettes AlignedOTA à une technique de distillation des connaissances enseignant-élève. Bien que cela extrait des performances maximales du modèle élève, cela nécessite d'entraîner initialement un modèle enseignant massif. Cela augmente considérablement le temps de calcul, les coûts énergétiques et le matériel requis, ce qui constitue un goulot d'étranglement pour les équipes de ML agiles.

L’avantage d’Ultralytics : la simplicité d’utilisation#

À l’inverse, l’écosystème Ultralytics est reconnu dans le monde entier pour ses API intuitives et son efficacité d’entraînement. Grâce à un développement actif et à une vaste communauté open source, les développeurs peuvent entraîner, valider et déployer des modèles de manière fluide.

from ultralytics import YOLO

# Load a pretrained YOLOv5 model
model = YOLO("yolov5s.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to ONNX format for deployment
model.export(format="onnx")

Ultralytics fournit également une prise en charge intégrée du suivi des expériences via des outils comme Weights & Biases et Comet ML, pour créer un workflow sans friction.

Cas d’utilisation réels#

  • YOLOv5 excelle dans les environnements de production au rythme soutenu. Son exportation simple en fait le choix privilégié pour l’analyse du commerce de détail intelligent, la détection de défauts de fabrication à grande vitesse et l’intégration dans des applications mobiles via CoreML.
  • DAMO-YOLO convient particulièrement aux benchmarks universitaires rigoureux et aux scénarios disposant de vastes ressources de calcul pour exécuter de longues phases d’entraînement par distillation visant à obtenir de modestes gains de mAP pour des cibles matérielles spécifiques et fixes.

Cas d'utilisation et recommandations#

Le choix entre YOLOv5 et DAMO-YOLO dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir YOLOv5#

YOLOv5 est un excellent choix pour :

  • Systèmes éprouvés en production : les déploiements existants qui accordent de l'importance à la longue expérience de YOLOv5 en matière de stabilité, à sa documentation étendue et au soutien massif de sa communauté.
  • Entraînement avec des ressources limitées : les environnements disposant de ressources GPU limitées, où le pipeline d'entraînement efficace de YOLOv5 et ses besoins en mémoire réduits constituent des avantages.
  • Prise en charge étendue des formats d'exportation : les projets nécessitant un déploiement dans de nombreux formats, notamment ONNX, TensorRT, CoreML et TFLite.

Quand choisir DAMO-YOLO#

DAMO-YOLO est recommandé pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est la métrique principale.
  • Lignes de fabrication industrielles : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l'inspection qualité en temps réel sur les lignes d'assemblage.
  • Recherche sur la recherche d'architecture neuronale : Étude des effets de la recherche automatisée d'architecture (MAE-NAS) et des backbones reparamétrés efficaces sur les performances de détection.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :

  • Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.

La prochaine évolution : YOLO26#

Si tu démarres un nouveau projet, il est vivement recommandé de te tourner vers l’avenir. Ultralytics YOLO26 s’appuie sur les fondations remarquables de YOLOv5 et intègre des avancées révolutionnaires qui redéfinissent l’état de l’art de l’IA appliquée à la vision.

Pourquoi passer à YOLO26 ?

Lancé sous les acclamations générales, YOLO26 est nativement de bout en bout. Il propose une conception de bout en bout sans NMS, qui élimine complètement le post-traitement de suppression non maximale pour un déploiement nettement plus rapide et plus simple.

Les principales innovations de YOLO26 comprennent :

  • Optimiseur MuSGD : inspiré des innovations de l’entraînement des LLM, cet hybride de SGD et de Muon garantit un entraînement très stable et une convergence rapide.
  • Inférence CPU jusqu’à 43 % plus rapide : fortement optimisée pour l’informatique en périphérie, cette fonctionnalité est idéale pour les appareils IoT fonctionnant sans GPU dédié.
  • ProgLoss + STAL : des fonctions de perte avancées qui améliorent considérablement la reconnaissance des petits objets, un élément essentiel pour les images aériennes prises par drone et la robotique.
  • Améliorations spécifiques aux tâches : d’une fonction de perte angulaire spécialisée pour les boîtes englobantes orientées (OBB) à l’estimation résiduelle du log-vraisemblance (RLE) pour une estimation de pose précise, YOLO26 gère facilement les domaines complexes.

Conclusion#

YOLOv5 et DAMO-YOLO ont tous deux marqué l’histoire de la détection d’objets. DAMO-YOLO reste une étude fascinante de la recherche d’architecture neuronale et de la distillation. Cependant, pour les organisations qui privilégient un écosystème bien maintenu, la facilité d’utilisation et un accès rapide à la production, les modèles Ultralytics restent inégalés.

Nous te recommandons vivement d’utiliser la plateforme Ultralytics pour annoter, entraîner et déployer la prochaine génération de modèles, comme YOLO26, afin de garantir que ton pipeline de vision par ordinateur soit pérenne, rapide et remarquablement précis.

Pour aller plus loin#

  • Découvre le RT-DETR basé sur un Transformer pour les applications nécessitant une grande précision.
  • Découvre le modèle de génération précédente YOLO11.
  • Découvre comment optimiser tes déploiements avec OpenVINO.

Commentaires