Ultralytics YOLO27 :
Get Started

DAMO-YOLO et YOLOv6-3.0#

L’évolution rapide de la vision par ordinateur a donné naissance à des architectures hautement spécialisées, adaptées aux applications industrielles. Parmi elles, deux modèles de référence se distinguent par leur priorité accordée aux performances en temps réel et à l’efficacité du déploiement : DAMO-YOLO et YOLOv6-3.0. Cette page propose une comparaison technique approfondie de leurs architectures, de leurs métriques de performance et de leurs méthodes d’entraînement pour t’aider à choisir une solution de déploiement.

DAMO-YOLO : la recherche d’architecture neuronale au service de la détection d’objets#

Développé par des chercheurs du groupe Alibaba, DAMO-YOLO propose une nouvelle approche de la famille YOLO en intégrant largement la recherche d’architecture neuronale (NAS) à la conception de son backbone.

Innovations architecturales#

DAMO-YOLO utilise un backbone optimisé par NAS, nommé MAE-NAS, qui recherche automatiquement les structures de réseau optimales selon des contraintes de latence spécifiques. Le modèle s’adapte ainsi efficacement à différents profils matériels. Pour améliorer la fusion des caractéristiques, l’architecture utilise Efficient RepGFPN (réseau pyramidal de caractéristiques généralisé reparamétré), ce qui améliore considérablement la représentation mult-échelle.

De plus, le modèle introduit une conception « ZeroHead ». En supprimant les structures complexes à branches multiples de la tête de détection, elle préserve plus efficacement les informations spatiales tout en réduisant la charge de calcul. La méthode d’entraînement exploite également AlignedOTA (affectation optimale des transports alignés) et une distillation des connaissances robuste, permettant aux modèles étudiants plus petits d’apprendre à partir de réseaux enseignants plus lourds.

En savoir plus sur DAMO-YOLO

Complexité de la distillation

Bien que la distillation des connaissances aide DAMO-YOLO à atteindre une grande précision, elle nécessite un pipeline d’entraînement en plusieurs étapes. Cela augmente considérablement les ressources de calcul GPU nécessaires par rapport à l’entraînement de modèles classiques en une seule étape.

YOLOv6-3.0 : maximiser le débit industriel#

Développé par le département Vision AI de Meituan, YOLOv6-3.0 est explicitement présenté comme un détecteur d’objets industriel, conçu spécialement pour maximiser le débit sur le matériel NVIDIA.

  • Auteurs : Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu et Xiangxiang Chu
  • Organisation : Meituan
  • Date : 2023-01-13
  • Arxiv : 2301.05586
  • GitHub : meituan/YOLOv6

Fonctionnalités clés et améliorations#

YOLOv6-3.0 repose sur le backbone EfficientRep, adapté au matériel, ce qui le rend particulièrement rapide lorsqu’il exploite des optimisations comme TensorRT sur les GPU modernes. Dans sa version 3.0, le réseau intègre un module de concaténation bidirectionnelle (BiC) pour améliorer la localisation d’objets de tailles variées.

Une autre fonctionnalité remarquable est la stratégie d’entraînement assistée par ancres (AAT). AAT associe la stabilité des détecteurs avec ancres pendant l’entraînement à la vitesse d’inférence d’une architecture sans ancres. Cette approche hybride assure une excellente convergence sans sacrifier la latence de déploiement, ce qui en fait un choix puissant pour traiter d’importants flux vidéo dans l’analyse des villes intelligentes et les systèmes de caisse automatisés.

En savoir plus sur YOLOv6

Comparaison des performances#

Pour évaluer ces modèles en vue de l’inférence en temps réel, il est essentiel de trouver un équilibre entre le nombre de paramètres, les FLOPs et la précision. Voici une évaluation détaillée de leurs performances.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

DAMO-YOLO présente un léger avantage dans la catégorie des petits modèles (46,0 mAP contre 45,0 mAP), mais YOLOv6-3.0 offre une meilleure évolutivité et l’emporte dans les catégories moyenne et grande, tout en ayant le plus faible nombre de paramètres dans sa configuration nano.

Choisir entre les deux

Si ton environnement matériel permet d’effectuer des recherches automatisées intensives pour personnaliser ton backbone, l’approche NAS de DAMO-YOLO est très efficace. En revanche, si tu t’appuies entièrement sur une accélération GPU standard (comme T4 ou A100), les structures EfficientRep de YOLOv6 offrent souvent un débit brut plus élevé en FPS.

Cas d’utilisation et recommandations#

Le choix entre DAMO-YOLO et YOLOv6 dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir DAMO-YOLO#

DAMO-YOLO est un excellent choix pour :

  • Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
  • Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
  • Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.

Quand choisir YOLOv6#

YOLOv6 est recommandé pour :

  • Déploiement adapté au matériel industriel : les scénarios où la conception de YOLOv6, adaptée au matériel, et son reparamétrage efficace optimisent les performances sur un matériel cible spécifique.
  • Détection rapide à un seul étage : les applications qui privilégient la vitesse d’inférence brute sur GPU pour le traitement vidéo en temps réel dans des environnements contrôlés.
  • Intégration à l’écosystème Meituan : les équipes qui travaillent déjà dans la pile technologique et l’infrastructure de déploiement de Meituan.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics : présentation de YOLO26#

Bien que DAMO-YOLO et YOLOv6-3.0 soient très performants, leurs écosystèmes fragmentés, leurs limites à une seule tâche et leurs pipelines de déploiement complexes constituent des inconvénients. Pour les équipes d’ingénierie modernes, les modèles Ultralytics offrent une expérience de développement nettement meilleure, avec en point d’orgue le révolutionnaire YOLO26.

Sorti en janvier 2026, YOLO26 établit une nouvelle référence pour le déploiement en périphérie et dans le cloud, en optimisant fortement les besoins en mémoire et l’efficacité du calcul.

Pourquoi choisir YOLO26 ?#

  1. Conception de bout en bout sans NMS : s’appuyant sur des concepts de YOLOv10, YOLO26 prend en charge l’inférence native de bout en bout, qui ignore le post-traitement par suppression non maximale grâce à sa tête optionnelle un-à-un (nms=False). Cela simplifie considérablement le code de déploiement et réduit les variations de latence d’inférence sur tous les appareils en périphérie.
  2. Optimisation supérieure : YOLO26 utilise l’optimiseur MuSGD, une approche hybride de SGD et de Muon (inspirée des grands modèles de langage), qui assure des entraînements très stables et une convergence plus rapide.
  3. Polyvalence matérielle : grâce à la suppression de DFL (Distribution Focal Loss), les têtes de sortie sont simplifiées, ce qui améliore la compatibilité avec les appareils en périphérie. En fait, YOLO26 offre une inférence CPU jusqu’à 43 % plus rapide, ce qui le rend nettement supérieur à YOLOv6 pour les environnements mobiles ou IoT en périphérie.
  4. Précision améliorée : grâce à ProgLoss + STAL, YOLO26 améliore considérablement la détection des petits objets, ce qui en fait le choix optimal pour l’imagerie aérienne et l’inspection des défauts.
  5. Polyvalence inégalée : contrairement aux modèles industriels qui se limitent aux boîtes englobantes, la famille YOLO26 prend en charge plusieurs tâches, notamment la classification d’images, la segmentation d’instances, l’estimation de pose et les boîtes englobantes orientées (OBB).

Une expérience fluide au sein de l’écosystème#

La plateforme Ultralytics transforme l’ensemble du cycle de vie du machine learning. L’entraînement d’un modèle n’est plus un casse-tête de distillation en plusieurs étapes. Grâce à l’augmentation automatique des données, au réglage unifié des hyperparamètres et à l’export en un clic vers des formats comme ONNX, OpenVINO et CoreML, tu passes du jeu de données à la production en quelques heures, et non en quelques semaines.

De plus, les modèles Ultralytics sont réputés pour leur efficacité mémoire, évitant les importants goulots d’étranglement liés à la VRAM qui affectent les architectures Transformer comme RT-DETR.

Exemple de code pour démarrer rapidement#

L’entraînement et l’inférence avec un modèle Ultralytics comme YOLO26 sont d’une grande simplicité. Le script Python suivant montre comment lancer immédiatement l’entraînement, l’inférence et l’export avec seulement quelques lignes de code :

from ultralytics import YOLO

# Charger le modèle nano YOLO26 hautement efficace
model = YOLO("yolo26n.pt")

# Entraîner facilement le modèle sur ton jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Lancer l’inférence sur une image d’exemple
prediction = model("https://ultralytics.com/images/bus.jpg")

# Exporter vers TensorRT pour un débit GPU maximal
model.export(format="engine", dynamic=True)

Conclusion#

DAMO-YOLO et YOLOv6-3.0 sont tous deux de remarquables prouesses d’ingénierie qui repoussent les limites de la détection d’objets industrielle. Ce sont toutefois des outils très spécialisés qui nécessitent souvent des configurations complexes et imposent des contraintes matérielles rigides.

Pour les développeurs et les chercheurs qui exigent un équilibre parfait entre les performances, des capacités multitâches et un écosystème activement maintenu, Ultralytics YOLO26 est sans égal. En combinant des optimiseurs inspirés des LLM à une architecture épurée prenant en charge l’inférence sans NMS, YOLO26 simplifie le déploiement de l’IA tout en offrant une précision de pointe dans les environnements en périphérie et dans le cloud.

Si tu évalues des modèles pour un nouveau projet de vision par ordinateur, nous te recommandons vivement d’explorer les capacités de l’écosystème Ultralytics YOLO. Tu peux aussi les comparer à d’autres architectures comme EfficientDet ou à des étapes antérieures comme YOLO11 pour bien comprendre l’évolution de l’IA de vision en temps réel.

Contributeurs

Commentaires