YOLO Vision 2026 :

YOLOX vs DAMO-YOLO#

L'évolution de la détection d'objets en temps réel a connu de nombreux changements de paradigme, des architectures avec ancres aux architectures sans ancres, et des backbones conçus manuellement à la recherche d'architecture neurale automatisée (NAS). Dans cette comparaison technique complète, nous allons analyser deux jalons importants de ce parcours : YOLOX et DAMO-YOLO. Nous explorerons leurs innovations architecturales, leurs méthodologies d'entraînement et leurs compromis de performance, tout en soulignant la façon dont le moderne Ultralytics YOLO26 offre une alternative inégalée pour les développeurs modernes.

YOLOX : Pionnier du paradigme sans ancres#

Publié le 18 juillet 2021 par Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun chez Megvii, YOLOX a marqué un tournant crucial en intégrant avec succès une conception sans ancres dans la famille YOLO. Décrit dans leur rapport technique détaillé sur ArXiv, YOLOX visait à combler le fossé entre la recherche académique et le déploiement industriel.

Innovations architecturales clés#

YOLOX a introduit plusieurs changements structurels fondamentaux qui ont considérablement amélioré ses prédécesseurs :

  • Mécanisme sans ancres : En prédisant directement le centre d'un objet et les dimensions de sa bounding box, YOLOX a réduit le nombre d'heuristiques de conception et simplifié les processus complexes de clustering d'ancres. Cela le rend hautement adaptable à divers scénarios de computer vision.
  • Tête découplée : Les modèles YOLO traditionnels utilisaient une tête couplée unique pour la classification et la régression. YOLOX a mis en œuvre une tête découplée, traitant la classification et la localisation séparément, ce qui a permis une convergence beaucoup plus rapide et une précision améliorée.
  • Assignation d'étiquettes SimOTA : Une version simplifiée de l'Optimal Transport Assignment (OTA) a été utilisée pour assigner dynamiquement les échantillons positifs, réduisant ainsi les temps d'entraînement et surmontant les ambiguïtés liées aux assignations par point central.
L'héritage de YOLOX

La conception de la tête découplée de YOLOX a fortement influencé les générations suivantes de détecteurs d'objets, devenant une fonctionnalité standard dans de nombreux modèles modernes.

En savoir plus sur YOLOX

DAMO-YOLO : Recherche d'architecture automatisée à grande échelle#

Développé par Xianzhe Xu et une équipe de chercheurs du Alibaba Group, DAMO-YOLO a été introduit le 23 novembre 2022. Comme détaillé dans leur publication ArXiv, le modèle a largement utilisé la recherche d'architecture neurale (NAS) pour repousser la frontière de Pareto de la vitesse et de la précision.

Innovations architecturales clés#

La stratégie de DAMO-YOLO repose sur l'automatisation de la conception de structures efficaces :

  • Backbones MAE-NAS : Utilisant un algorithme évolutionnaire multi-objectif, DAMO-YOLO a découvert des backbones hautement efficaces personnalisés pour des budgets de latence spécifiques, en particulier lors de l'exportation vers des frameworks comme TensorRT.
  • RepGFPN efficace : Une conception de cou lourd qui améliore considérablement la fusion de caractéristiques à travers différentes résolutions spatiales, ce qui est extrêmement bénéfique pour aerial imagery analysis et la détection d'objets à des échelles variées.
  • ZeroHead : Une tête de prédiction simplifiée qui réduit la redondance computationnelle sans sacrifier la moyenne de la précision moyenne (mAP) globale du modèle.
  • AlignedOTA et Distillation : Intègre une assignation d'étiquettes avancée et une distillation de connaissances enseignant-élève pour extraire une performance maximale des petits modèles étudiants.

En savoir plus sur DAMO-YOLO

Comparaison des performances et des mesures#

Lorsque nous comparons ces deux modèles, nous devons examiner le nombre de leurs paramètres, les FLOPs requis et les profils de latence. Vous trouverez ci-dessous les données de référence comparant YOLOX et DAMO-YOLO à différentes échelles.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Bien que les deux modèles obtiennent des résultats impressionnants, ils comportent des réserves. YOLOX nécessite un réglage minutieux de sa tête découplée, tandis que la forte dépendance de DAMO-YOLO à l'égard de la distillation rend le réentraînement sur des jeux de données personnalisés très exigeant en ressources, nécessitant de vastes quantités de GPU memory.

Cas d'utilisation et recommandations#

Le choix entre YOLOX et DAMO-YOLO dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir YOLOX#

YOLOX est un choix solide pour :

  • Recherche sur la détection sans ancres : La recherche académique utilisant l'architecture propre et sans ancres de YOLOX comme base pour expérimenter de nouvelles têtes de détection ou des fonctions de perte.
  • Appareils en périphérie ultra-légers : Le déploiement sur des microcontrôleurs ou du matériel mobile ancien où l'empreinte extrêmement réduite de la variante YOLOX-Nano (0.91 M de paramètres) est critique.
  • Études sur l'assignation de labels SimOTA : Les projets de recherche étudiant les stratégies d'assignation de labels basées sur le transport optimal et leur impact sur la convergence de l'entraînement.

Quand choisir DAMO-YOLO#

DAMO-YOLO est recommandé pour :

  • Analytique vidéo à haut débit : Traitement de flux vidéo FPS élevés sur une infrastructure GPU NVIDIA fixe où le débit par lot est la mesure principale.
  • Lignes de fabrication industrielle : Scénarios avec des contraintes strictes de latence GPU sur du matériel dédié, comme l'inspection qualité en temps réel sur les lignes d'assemblage.
  • Recherche sur la recherche d'architecture neuronale : Étude des effets de la recherche d'architecture automatisée (MAE-NAS) et des backbones reparamétrés efficaces sur les performances de détection.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre la meilleure combinaison de performance et d'expérience développeur :

  • Déploiement en périphérie sans NMS : Applications nécessitant une inférence cohérente et à faible latence sans la complexité du post-traitement par Non-Maximum Suppression.
  • Environnements CPU uniquement : Appareils sans accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 offre un avantage décisif.
  • Détection de petits objets : Les scénarios complexes tels que l'imagerie par drone aérien ou l'analyse par capteurs IoT où ProgLoss et STAL améliorent considérablement la précision sur les minuscules objets.

L'avantage Ultralytics : Présentation de YOLO26#

Bien que YOLOX et DAMO-YOLO représentent des jalons historiques importants, les développeurs modernes exigent une solution qui associe une précision de pointe à une facilité d'utilisation inégalée. C'est là que Ultralytics YOLO26 transforme le paysage. Publié en janvier 2026, YOLO26 s'appuie sur l'héritage des NMS-free models pour offrir l'équilibre ultime entre vitesse, précision et expérience développeur.

Pourquoi choisir YOLO26 ?#

L'écosystème Ultralytics intégré surpasse les dépôts universitaires fragmentés en offrant :

  • Conception de bout en bout sans NMS : YOLO26 élimine nativement la suppression des non-maximales (NMS) pendant l'inférence. Il en résulte une latence incroyablement rapide et prévisible, essentielle pour les déploiements en edge et les autonomous vehicles.
  • Suppression du DFL : En supprimant la Distribution Focal Loss, YOLO26 simplifie les processus d'exportation vers des appareils en périphérie, réduisant considérablement les besoins en mémoire pour les applications légères.
  • Optimiseur MuSGD : YOLO26 emprunte des innovations de formation LLM avec son optimiseur hybride SGD et Muon, garantissant une stabilité d'entraînement solide comme le roc et une convergence ultra-rapide.
  • Jusqu'à 43 % d'inférence CPU plus rapide : Grâce à des optimisations structurelles profondes, YOLO26 s'exécute de manière fulgurante sur les CPU sans avoir besoin de matériel GPU coûteux.
  • Fonctions de perte avancées : L'intégration de ProgLoss + STAL apporte des améliorations massives dans la reconnaissance de petits objets, le rendant idéal pour des tâches telles que drone inspections et la surveillance IoT.
  • Polyvalence : Contrairement à DAMO-YOLO, qui est strictement un détecteur, YOLO26 prend nativement en charge les tâches de Instance Segmentation, Pose Estimation, Image Classification et Oriented Bounding Box (OBB) dans un cadre unique et unifié.
Commence à construire instantanément

Avec le Ultralytics Python API, tu n'as pas besoin de configurer manuellement des pipelines de distillation complexes ou d'écrire des centaines de lignes de code C++ pour déployer ton modèle.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model effortlessly on a custom dataset
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run ultra-fast, NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX or OpenVINO with a single command
model.export(format="openvino")

En savoir plus sur YOLO26

Autres modèles à considérer#

L'écosystème de vision par ordinateur est vaste. En fonction de tes contraintes spécifiques, tu pourrais également souhaiter explorer d'autres architectures entièrement prises en charge par l'écosystème Ultralytics :

  • YOLO11 : Le prédécesseur hautement performant de YOLO26, connu pour sa robustesse dans retail analytics et manufacturing quality control.
  • YOLOv8 : Un modèle sans ancres légendaire et hautement stable qui a popularisé le déploiement edge à grande échelle.
  • RT-DETR : Un transformateur de détection en temps réel développé par Baidu, offrant une excellente alternative pour les tâches bénéficiant grandement des mécanismes d'attention globale, bien qu'au prix d'exigences plus élevées en matière de mémoire d'entraînement.

Conclusion#

YOLOX et DAMO-YOLO ont tous deux apporté des concepts essentiels à la progression du deep learning : YOLOX validant l'approche découplée sans ancres, et DAMO-YOLO démontrant la puissance de la recherche d'architecture automatisée. Cependant, pour la production réelle, la complexité de leurs bases de code de recherche originales peut ralentir les équipes agiles.

En tirant parti de la plateforme complète Ultralytics Platform, les développeurs peuvent contourner ces obstacles. Grâce à la conception de bout en bout de YOLO26, à ses vitesses CPU supérieures et à sa vaste documentation, l'obtention d'une vision par IA de pointe est plus accessible que jamais. Que tu construises une infrastructure de ville intelligente, des diagnostics de santé ou de la robotique avancée, Ultralytics fournit le chemin le plus efficace des données brutes au déploiement robuste dans le monde réel.

Commentaires