YOLOX face à DAMO-YOLO#
L’évolution de la détection d’objets en temps réel a connu de nombreux changements de paradigme, des architectures avec ancres aux architectures sans ancres, ainsi que des réseaux de neurones convolutifs conçus manuellement à la recherche automatisée d’architecture neuronale (NAS). Dans cette comparaison technique complète, nous analyserons deux étapes importantes de cette évolution : YOLOX et DAMO-YOLO. Nous examinerons leurs innovations architecturales, leurs méthodes d’entraînement et les compromis en matière de performances, tout en montrant comment le moderne Ultralytics YOLO26 offre une solution inégalée aux développeurs d’aujourd’hui.
YOLOX : pionnier du paradigme sans ancres#
Lancé le 18 juillet 2021 par Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun chez Megvii, YOLOX a marqué un tournant décisif en intégrant avec succès une conception sans ancres à la famille YOLO. Présenté dans leur rapport technique sur ArXiv détaillé, YOLOX visait à combler le fossé entre la recherche universitaire et le déploiement industriel.
Principales innovations architecturales#
YOLOX a introduit plusieurs changements structurels fondamentaux qui ont considérablement amélioré ses prédécesseurs :
- Mécanisme sans ancres : En prédisant directement le centre d’un objet et les dimensions de sa boîte englobante, YOLOX a réduit le nombre d’heuristiques de conception et simplifié les processus complexes de regroupement des ancres. Le modèle s’adapte ainsi très bien à divers scénarios de vision par ordinateur.
- Tête découplée : Les modèles YOLO traditionnels utilisaient une seule tête couplée pour la classification et la régression. YOLOX a mis en œuvre une tête découplée qui traite séparément la classification et la localisation, ce qui a accéléré la convergence et amélioré la précision.
- Affectation des étiquettes SimOTA : Une version simplifiée de l’affectation par transport optimal (OTA) a servi à attribuer dynamiquement les échantillons positifs, réduisant ainsi les temps d’entraînement et évitant les ambiguïtés liées à l’affectation par points centraux.
La conception de tête découplée de YOLOX a fortement influencé les générations suivantes de détecteurs d’objets et est devenue une caractéristique standard de nombreux modèles modernes.
DAMO-YOLO : recherche automatisée d’architecture à grande échelle#
Développé par Xianzhe Xu et une équipe de chercheurs du groupe Alibaba, DAMO-YOLO a été présenté le 23 novembre 2022. Comme l’explique leur publication sur ArXiv, le modèle s’est largement appuyé sur la recherche d’architecture neuronale (NAS) pour repousser la frontière de Pareto entre vitesse et précision.
Principales innovations architecturales#
La stratégie de DAMO-YOLO reposait sur l’automatisation de la conception de structures efficaces :
- Réseaux dorsaux MAE-NAS : Grâce à une recherche guidée par l’entropie maximale, DAMO-YOLO a découvert des réseaux dorsaux très efficaces, adaptés à des budgets de latence spécifiques, en particulier lors de l’exportation vers des frameworks comme TensorRT.
- RepGFPN efficace : Une conception de réseau de fusion imposante qui améliore considérablement la fusion des caractéristiques à différentes résolutions spatiales, particulièrement utile pour l’analyse d’images aériennes et la détection d’objets de différentes tailles.
- ZeroHead : Une tête de prédiction simplifiée qui réduit la redondance des calculs sans sacrifier la précision moyenne de détection (mAP) globale du modèle.
- AlignedOTA et distillation : Intègre des méthodes avancées d’affectation des étiquettes et de distillation des connaissances entre enseignant et élève afin d’extraire un maximum de performances de modèles élèves plus petits.
Comparaison des performances et des métriques#
Pour comparer ces deux modèles, nous devons examiner le nombre de paramètres, les FLOPs requis et les profils de latence. Voici les données de référence comparant YOLOX et DAMO-YOLO à différentes échelles.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Bien que les deux modèles obtiennent des résultats impressionnants, ils présentent certaines limites. YOLOX nécessite un réglage minutieux de sa tête découplée, tandis que la forte dépendance de DAMO-YOLO à la distillation rend son réentraînement sur des jeux de données personnalisés très gourmand en ressources et nécessite de grandes quantités de mémoire GPU.
Cas d’utilisation et recommandations#
Le choix entre YOLOX et DAMO-YOLO dépend des besoins de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLOX#
YOLOX est un excellent choix pour :
- Recherche sur la détection sans ancres : recherche universitaire qui utilise l’architecture épurée sans ancres de YOLOX comme référence pour expérimenter de nouvelles têtes de détection ou fonctions de perte.
- Appareils périphériques ultralégers : déploiement sur des microcontrôleurs ou du matériel mobile ancien, où l’empreinte extrêmement réduite (0,91 M de paramètres) de la variante YOLOX-Nano est essentielle.
- Études sur l’assignation d’étiquettes SimOTA : projets de recherche qui étudient les stratégies d’assignation d’étiquettes basées sur le transport optimal et leur impact sur la convergence de l’entraînement.
Quand choisir DAMO-YOLO#
DAMO-YOLO est recommandé pour :
- Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
- Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
- Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
L’avantage Ultralytics : présentation de YOLO26#
YOLOX et DAMO-YOLO représentent d’importantes étapes historiques, mais les développeurs d’aujourd’hui ont besoin d’une solution qui allie une précision de pointe à une simplicité d’utilisation inégalée. C’est là qu’Ultralytics YOLO26 change la donne. Lancé en janvier 2026, YOLO26 s’inscrit dans la lignée des modèles sans NMS pour offrir l’équilibre ultime entre vitesse, précision et expérience de développement.
Pourquoi choisir YOLO26 ?#
L’écosystème intégré d’Ultralytics surpasse les dépôts universitaires fragmentés en proposant :
- Conception de bout en bout sans NMS : La tête optionnelle un-à-un de YOLO26 (
nms=False) élimine la suppression des non-maximums (NMS) pendant l’inférence. Cela se traduit par une latence extrêmement rapide et prévisible, essentielle aux déploiements en périphérie et aux véhicules autonomes. - Suppression du DFL : En supprimant la perte focale de distribution, YOLO26 simplifie les processus d’exportation vers les appareils en périphérie et réduit considérablement les besoins en mémoire des applications légères.
- Optimiseur MuSGD : YOLO26 reprend des innovations issues de l’entraînement des LLM grâce à son optimiseur hybride SGD et Muon, garantissant une stabilité d’entraînement à toute épreuve et une convergence ultra-rapide.
- Inférence CPU jusqu’à 43 % plus rapide : Grâce à de profondes optimisations structurelles, YOLO26 s’exécute à toute vitesse sur les CPU sans nécessiter de coûteux GPU.
- Fonctions de perte avancées : L’intégration de ProgLoss + STAL améliore considérablement la reconnaissance des petits objets, ce qui est idéal pour des tâches comme les inspections par drone et la surveillance de l’IoT.
- Polyvalence : Contrairement à DAMO-YOLO, qui est exclusivement un détecteur, YOLO26 prend nativement en charge la segmentation d’instances, l’estimation de pose, la classification d’images et la détection par boîtes englobantes orientées (OBB), le tout dans un framework unifié.
Avec l’API Python d’Ultralytics, tu n’as pas besoin de configurer manuellement des pipelines complexes de distillation ni d’écrire des centaines de lignes de code C++ pour déployer ton modèle.
from ultralytics import YOLO
# Charger le modèle nano YOLO26 de pointe
model = YOLO("yolo26n.pt")
# Entraîne facilement le modèle sur un jeu de données personnalisé
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exécute une inférence ultra-rapide sans NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Exporte vers ONNX ou OpenVINO avec une seule commande
model.export(format="openvino")Autres modèles à envisager#
L’écosystème de la vision par ordinateur est vaste. Selon tes contraintes, tu peux aussi explorer d’autres architectures entièrement prises en charge par l’écosystème Ultralytics :
- YOLO11 : Le prédécesseur très performant de YOLO26, réputé pour sa robustesse dans l’analyse du commerce de détail et le contrôle qualité manufacturier.
- YOLOv8 : Un modèle sans ancres légendaire et très stable, qui a popularisé le déploiement à grande échelle en périphérie.
- RT-DETR : Un transformeur de détection en temps réel développé par Baidu, qui offre une excellente solution de remplacement pour les tâches tirant pleinement parti des mécanismes d’attention globale, au prix toutefois de besoins accrus en mémoire pendant l’entraînement.
Conclusion#
YOLOX et DAMO-YOLO ont tous deux apporté des concepts essentiels à l’évolution de l’apprentissage profond : YOLOX a validé l’approche découplée et sans ancres, tandis que DAMO-YOLO a démontré la puissance de la recherche automatisée d’architecture. Cependant, dans un contexte de production réel, la complexité de leurs bases de code de recherche d’origine peut ralentir les équipes agiles.
En tirant parti de la plateforme Ultralytics complète, les développeurs peuvent contourner ces obstacles. Grâce à la conception de bout en bout de YOLO26, à ses vitesses CPU supérieures et à sa documentation détaillée, l’accès à une IA de vision de pointe n’a jamais été aussi simple. Que tu développes une infrastructure pour une ville intelligente, des outils de diagnostic médical ou une robotique avancée, Ultralytics t’offre le chemin le plus efficace, des données brutes au déploiement robuste en conditions réelles.