Ultralytics YOLO27 :
Get Started

DAMO-YOLO vs YOLOX#

Le paysage de la vision par ordinateur en temps réel évolue constamment. DAMO-YOLO et YOLOX en sont deux jalons marquants, chacun apportant des innovations uniques à la détection d’objets rapide et précise. Bien que ces deux modèles aient contribué de manière significative à la communauté open source, il est essentiel pour les ingénieurs en apprentissage automatique de comprendre leurs différences architecturales, leurs méthodes d’entraînement et leurs scénarios de déploiement idéaux.

Ce guide complet examine les nuances techniques des deux modèles et explique pourquoi les solutions modernes comme la plateforme Ultralytics YOLO26 offrent de meilleures performances et une plus grande facilité d’utilisation dans les environnements de production actuels.

Présentation des modèles#

Détails sur DAMO-YOLO#

Développé par une équipe de chercheurs du groupe Alibaba, DAMO-YOLO a été présenté comme une méthode de détection d’objets très efficace qui s’appuie sur la découverte automatisée d’architectures.

En savoir plus sur DAMO-YOLO

Détails sur YOLOX#

Créé par des chercheurs de Megvii, YOLOX visait à rapprocher les milieux de la recherche et de l’industrie en faisant évoluer la série YOLO vers une architecture sans ancres, ce qui simplifiait considérablement l’architecture tout en améliorant les performances de l’époque.

En savoir plus sur YOLOX

Analyse architecturale#

Architecture de DAMO-YOLO#

DAMO-YOLO s’appuie largement sur la recherche d’architecture neuronale (NAS). Ses principaux composants sont les suivants :

  • Backbones MAE-NAS : Ils utilisent une recherche guidée par l’entropie maximale pour découvrir des backbones offrant un équilibre optimal entre vitesse d’inférence et précision.
  • RepGFPN efficace : Une conception de neck épaisse adaptée à la fusion des caractéristiques, qui aide le modèle à maintenir une grande précision pour différentes échelles d’objets.
  • ZeroHead : Une tête de détection simplifiée et légère qui réduit la charge de calcul dans les dernières couches de prédiction.

Architecture de YOLOX#

YOLOX adopte une approche différente, axée sur la simplicité structurelle et une architecture sans ancres :

  • Mécanisme sans ancres : En prédisant directement les coordonnées des boîtes englobantes sans ancres prédéfinies, YOLOX réduit le nombre de paramètres de conception et de réglages heuristiques nécessaires.
  • Tête découplée : Elle répartit les tâches de classification et de régression dans différentes branches de caractéristiques, ce qui améliore la vitesse de convergence et la précision globale.
  • Attribution d’étiquettes SimOTA : Une stratégie avancée d’attribution d’étiquettes qui affecte dynamiquement les échantillons positifs aux annotations de référence, améliorant ainsi l’efficacité de l’entraînement.
Philosophies de conception

Alors que DAMO-YOLO utilise des recherches NAS pilotées par machine pour trouver des architectures optimales sous des contraintes strictes, YOLOX mise sur d’élégantes simplifications conçues par des humains — comme les têtes sans ancres — pour rationaliser le pipeline de détection d’objets.

Comparaison des performances#

Pour évaluer ces modèles, il faut examiner la précision moyenne (mAP), la vitesse d’inférence et le nombre de paramètres. Voici un tableau comparatif détaillé des variantes standard et légères des deux architectures.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

YOLOXx atteint le mAP absolu le plus élevé, à 51,1, tandis que DAMO-YOLOl affiche un mAP très compétitif de 50,8 avec moins de la moitié des paramètres (42,1 M contre 99,1 M) et une exécution TensorRT nettement plus rapide.

Méthodes d’entraînement#

Entraînement de DAMO-YOLO#

DAMO-YOLO utilise des techniques complexes d’amélioration par distillation pendant l’entraînement. Souvent, un grand modèle « enseignant » est d’abord entraîné, puis ses connaissances sont distillées dans les modèles « élèves », plus petits. Le modèle utilise également AlignedOTA pour l’attribution dynamique des étiquettes. Bien que très efficace, ce processus d’entraînement en plusieurs étapes augmente considérablement le temps de calcul GPU et la mémoire nécessaires.

Entraînement de YOLOX#

YOLOX s’appuie sur de puissantes stratégies d’augmentation des données comme MixUp et Mosaic. Cependant, les auteurs ont découvert que désactiver ces augmentations fortes pendant les 15 dernières époques permet au modèle de réduire l’écart avec la réalité et d’améliorer considérablement les métriques de précision finales.

Cas d’utilisation idéaux#

  • DAMO-YOLO : Idéal pour les déploiements industriels à forts enjeux, où des pipelines de distillation côté serveur peuvent être pris en charge et où le matériel cible — comme certains GPU NVIDIA — tire directement parti de son architecture NAS à neck épais.
  • YOLOX : Excellent pour les développeurs qui recherchent une approche entièrement sans ancres. Le modèle YOLOXnano extrêmement léger convient aux anciens appareils Android, à l’informatique en périphérie et aux capteurs IoT très contraints, où le nombre de paramètres constitue le principal goulot d’étranglement.

L’avantage Ultralytics : place à YOLO26#

Bien que DAMO-YOLO et YOLOX représentent des jalons importants, les développeurs d’aujourd’hui recherchent des solutions plus complètes, polyvalentes et faciles à utiliser. C’est là que la plateforme Ultralytics et le tout nouveau Ultralytics YOLO26 se démarquent.

Sorti en janvier 2026, YOLO26 est le modèle recommandé par excellence pour toutes les tâches de vision par ordinateur. Il introduit plusieurs avancées qui surpassent les architectures plus anciennes :

  • Conception de bout en bout sans NMS : La tête facultative un-à-un de YOLO26 (nms=False) évite le post-traitement par suppression non maximale (NMS). Le déploiement est ainsi beaucoup plus simple et rapide, sans les goulots d’étranglement en matière de latence propres aux têtes de détection traditionnelles.
  • Inférence CPU jusqu’à 43 % plus rapide : En supprimant stratégiquement la perte focale de distribution (DFL) et en optimisant les couches, YOLO26 offre des vitesses inégalées sur les CPU et le matériel de périphérie.
  • Optimiseur MuSGD : Inspiré des techniques d’entraînement des grands modèles de langage (LLM), YOLO26 introduit l’optimiseur MuSGD, un hybride de SGD et de Muon, qui permet des entraînements très stables et une convergence beaucoup plus rapide que les configurations héritées de YOLOX.
  • ProgLoss + STAL : Ces fonctions de perte avancées améliorent considérablement la reconnaissance des petits objets, faisant de YOLO26 un modèle nettement supérieur pour les images de drones et la robotique.
  • Polyvalence : Contrairement à DAMO-YOLO, strictement limité à la détection d’objets, YOLO26 prend nativement en charge la segmentation d’instances, l’estimation de pose, la classification et les boîtes englobantes orientées (OBB), le tout dans un même écosystème bien maintenu.

Facilité d’utilisation avec Ultralytics#

L’API Python Ultralytics simplifie l’expérience des développeurs. L’entraînement d’un modèle YOLO26 de pointe nécessite beaucoup moins de code passe-partout et évite les pipelines de distillation complexes de DAMO-YOLO. De plus, les modèles Ultralytics nécessitent exceptionnellement peu de mémoire CUDA pendant l’entraînement, comparés aux modèles lourds basés sur des Transformers.

from ultralytics import YOLO

# Charger le dernier modèle nano Ultralytics YOLO26
model = YOLO("yolo26n.pt")

# Entraîner le modèle sur ton jeu de données personnalisé avec une seule ligne de code
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Effectuer une inférence rapide sans NMS sur une image
results = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Exporte facilement vers ONNX ou TensorRT
model.export(format="onnx")
Entraînement et déploiement dans le cloud

Tu peux annoter, entraîner et déployer automatiquement des modèles en périphérie à l’aide de la plateforme Ultralytics, qui gère pour toi le versionnement des données et le provisionnement des GPU dans le cloud.

Conclusion#

Le choix entre DAMO-YOLO et YOLOX dépend de contraintes spécifiques : DAMO-YOLO offre un rapport vitesse-précision exceptionnel sur certains GPU grâce à NAS, tandis que YOLOX propose une architecture sans ancres épurée, idéale pour les scénarios légers en périphérie.

Cependant, pour les équipes qui recherchent une solution moderne et pérenne, soutenue par une communauté active, l’architecture Ultralytics YOLO26 est le choix évident. Son inférence facultative sans NMS, sa grande vitesse d’inférence CPU et son API unifiée pour la détection, la segmentation et l’estimation de pose en font une solution inégalée pour passer en toute fluidité de la recherche à une production robuste en conditions réelles.

Pour les développeurs qui souhaitent explorer d’autres architectures modernes, nous recommandons également Ultralytics YOLO11 ou des modèles basés sur des Transformers comme RT-DETR, disponibles dans la documentation complète d’Ultralytics.

Commentaires