YOLOX vs DAMO-YOLO#
L’évolution de la détection d’objets en temps réel a vu de nombreux paradigmes changer, des architectures basées sur des ancres aux architectures sans ancres, et des backbones conçus manuellement à la recherche automatisée d’architectures neuronales (NAS). Dans cette comparaison technique complète, nous analyserons deux étapes importantes de cette évolution : YOLOX et DAMO-YOLO. Nous examinerons leurs innovations architecturales, leurs méthodologies d’entraînement et leurs compromis en matière de performances, tout en montrant comment le moderne Ultralytics YOLO26 offre une alternative inégalée aux développeurs d’aujourd’hui.
YOLOX : pionnier du paradigme sans ancres#
Publié le 18 juillet 2021 par Zheng Ge, Songtao Liu, Feng Wang, Zeming Li et Jian Sun chez Megvii, YOLOX a marqué un tournant décisif en intégrant avec succès une conception sans ancres à la famille YOLO. Comme décrit dans leur rapport technique sur ArXiv détaillé, YOLOX visait à combler l’écart entre la recherche universitaire et le déploiement industriel.
Principales innovations architecturales#
YOLOX a introduit plusieurs changements structurels fondamentaux qui ont considérablement amélioré ses prédécesseurs :
- Mécanisme sans ancres : En prédisant directement le centre d’un objet et les dimensions de sa boîte englobante, YOLOX a réduit le nombre d’heuristiques de conception et simplifié les processus complexes de regroupement des ancres. Cela le rend très adaptable à divers scénarios de vision par ordinateur.
- Tête découplée : Les modèles YOLO traditionnels utilisaient une seule tête couplée pour la classification et la régression. YOLOX a mis en œuvre une tête découplée, traitant séparément la classification et la localisation, ce qui a accéléré la convergence et amélioré la précision.
- Attribution des labels SimOTA : Une version simplifiée de l’attribution par transport optimal (OTA) a été utilisée pour attribuer dynamiquement les échantillons positifs, réduisant les temps d’entraînement et surmontant les ambiguïtés liées à l’attribution par points centraux.
La conception à tête découplée de YOLOX a fortement influencé les générations suivantes de détecteurs d’objets, devenant une fonctionnalité standard de nombreux modèles modernes.
DAMO-YOLO : recherche automatisée d’architectures à grande échelle#
Développé par Xianzhe Xu et une équipe de chercheurs d’Alibaba Group, DAMO-YOLO a été présenté le 23 novembre 2022. Comme l’explique leur publication sur ArXiv, le modèle a largement utilisé la recherche d’architectures neuronales (NAS) pour repousser la frontière de Pareto entre vitesse et précision.
Principales innovations architecturales#
La stratégie de DAMO-YOLO reposait sur l’automatisation de la conception de structures efficaces :
- Backbones MAE-NAS : En utilisant une recherche guidée par l'entropie maximale, DAMO-YOLO a découvert des backbones hautement efficaces adaptés à des budgets de latence spécifiques, en particulier lors de l'exportation vers des frameworks tels que TensorRT.
- Efficient RepGFPN : Une conception de neck lourde qui améliore considérablement la fusion des caractéristiques entre différentes résolutions spatiales, ce qui est particulièrement bénéfique pour l’analyse d’images aériennes et la détection d’objets à différentes échelles.
- ZeroHead : Une tête de prédiction simplifiée qui réduit la redondance des calculs sans sacrifier la précision moyenne (mAP) globale du modèle.
- AlignedOTA et distillation : Intègre une attribution avancée des labels ainsi qu’une distillation des connaissances enseignant-élève afin d’extraire les performances maximales de modèles élèves plus petits.
Comparaison des performances et des métriques#
Pour comparer ces deux modèles, nous devons examiner leur nombre de paramètres, leurs FLOPs requis et leurs profils de latence. Les données de référence ci-dessous comparent YOLOX et DAMO-YOLO sur plusieurs échelles.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Bien que les deux modèles obtiennent des résultats impressionnants, ils présentent certaines limites. YOLOX nécessite un réglage minutieux de sa tête découplée, tandis que la forte dépendance de DAMO-YOLO à la distillation rend le réentraînement sur des jeux de données personnalisés très gourmand en ressources et exige de grandes quantités de mémoire GPU.
Cas d'utilisation et recommandations#
Le choix entre YOLOX et DAMO-YOLO dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLOX#
YOLOX est un choix solide pour :
- Recherche sur la détection sans ancres : La recherche universitaire utilisant l’architecture sans ancres claire de YOLOX comme référence pour expérimenter de nouvelles têtes de détection ou fonctions de perte.
- Appareils edge ultralégers : Le déploiement sur des microcontrôleurs ou du matériel mobile ancien, lorsque l’empreinte extrêmement réduite de la variante YOLOX-Nano (0.91M paramètres) est essentielle.
- Études sur l’attribution des labels SimOTA : Les projets de recherche qui étudient les stratégies d’attribution de labels fondées sur le transport optimal et leur impact sur la convergence de l’entraînement.
Quand choisir DAMO-YOLO#
DAMO-YOLO est recommandé pour :
- Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est la métrique principale.
- Lignes de fabrication industrielles : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l'inspection qualité en temps réel sur les lignes d'assemblage.
- Recherche sur la recherche d'architecture neuronale : Étude des effets de la recherche automatisée d'architecture (MAE-NAS) et des backbones reparamétrés efficaces sur les performances de détection.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
L’avantage d’Ultralytics : présentation de YOLO26#
Bien que YOLOX et DAMO-YOLO représentent d’importantes étapes historiques, les développeurs modernes ont besoin d’une solution qui associe une précision de pointe à une facilité d’utilisation inégalée. C’est là qu’Ultralytics YOLO26 transforme le paysage. Sorti en janvier 2026, YOLO26 s’appuie sur l’héritage des modèles sans NMS pour offrir l’équilibre ultime entre vitesse, précision et expérience développeur.
Pourquoi choisir YOLO26 ?#
L’écosystème Ultralytics intégré surpasse les dépôts universitaires fragmentés en proposant :
- Conception de bout en bout sans NMS : YOLO26 élimine nativement la suppression des non-maxima (NMS) lors de l’inférence. Il en résulte une latence extrêmement rapide et prévisible, essentielle pour les déploiements en périphérie et les véhicules autonomes.
- Suppression de la DFL : En supprimant la Distribution Focal Loss, YOLO26 simplifie les processus d’exportation vers les appareils edge et réduit considérablement les besoins en mémoire des applications légères.
- Optimiseur MuSGD : YOLO26 reprend les innovations de l’entraînement des LLM avec son optimiseur hybride SGD et Muon, garantissant une stabilité d’entraînement à toute épreuve et une convergence ultra-rapide.
- Inférence CPU jusqu’à 43 % plus rapide : Grâce à de profondes optimisations structurelles, YOLO26 s’exécute à très grande vitesse sur les CPU sans nécessiter de matériel GPU coûteux.
- Fonctions de perte avancées : L’intégration de ProgLoss + STAL améliore considérablement la reconnaissance des petits objets, ce qui rend le modèle idéal pour des tâches comme les inspections par drone et la surveillance IoT.
- Polyvalence : Contrairement à DAMO-YOLO, qui est strictement un détecteur, YOLO26 prend nativement en charge les tâches de segmentation d’instances, d’estimation de pose, de classification d’images et de boîtes englobantes orientées (OBB) dans un framework unifié.
Avec l’API Python d’Ultralytics, tu n’as pas besoin de configurer manuellement des pipelines complexes de distillation ni d’écrire des centaines de lignes de code C++ pour déployer ton modèle.
from ultralytics import YOLO
# Load the cutting-edge YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model effortlessly on a custom dataset
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run ultra-fast, NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX or OpenVINO with a single command
model.export(format="openvino")Autres modèles à envisager#
L’écosystème de la vision par ordinateur est vaste. Selon tes contraintes spécifiques, tu peux également explorer d’autres architectures entièrement prises en charge par l’écosystème Ultralytics :
- YOLO11 : Le prédécesseur très performant de YOLO26, connu pour sa robustesse dans l’analyse du commerce de détail et le contrôle qualité industriel.
- YOLOv8 : Un modèle sans ancres légendaire et très stable, qui a popularisé le déploiement en périphérie à grande échelle.
- RT-DETR : Un Transformer de détection en temps réel (RT-DETR) développé par Baidu, offrant une excellente alternative pour les tâches qui bénéficient fortement des mécanismes d’attention globale, au prix toutefois de besoins plus élevés en mémoire lors de l’entraînement.
Conclusion#
YOLOX et DAMO-YOLO ont tous deux apporté des concepts essentiels à la progression de l’apprentissage profond : YOLOX en validant l’approche découplée et sans ancres, et DAMO-YOLO en démontrant la puissance de la recherche automatisée d’architectures. Cependant, pour la production dans le monde réel, la complexité de leurs bases de code de recherche d’origine peut ralentir les équipes agiles.
En s’appuyant sur l’Ultralytics Platform complète, les développeurs peuvent contourner ces obstacles. Grâce à la conception de bout en bout de YOLO26, à ses vitesses CPU supérieures et à sa documentation exhaustive, l’IA de vision de pointe est plus accessible que jamais. Que tu construises une infrastructure de ville intelligente, des solutions de diagnostic médical ou une robotique avancée, Ultralytics fournit le moyen le plus efficace de passer de données brutes à un déploiement robuste dans le monde réel.