DAMO-YOLO vs RTDETRv2#
Le paysage en constante évolution de la vision par ordinateur a produit un éventail impressionnant d’architectures conçues pour équilibrer vitesse, précision et efficacité de calcul. Deux modèles remarquables ayant apporté des approches originales à ces défis sont DAMO-YOLO et RTDETRv2. Bien que les deux modèles visent à fournir des solutions de pointe pour l’inférence en temps réel, leurs philosophies architecturales diffèrent fondamentalement.
Ce guide complet examine en profondeur les spécifications techniques, les innovations architecturales et les cas d’utilisation pratiques des deux modèles, tout en explorant comment des solutions modernes comme la plateforme Ultralytics et le YOLO26 de pointe ont redéfini les standards du secteur en matière de déploiement et de facilité d’utilisation.
Présentation des modèles#
Comprendre DAMO-YOLO#
Développé par des chercheurs d’Alibaba Group, DAMO-YOLO introduit une méthode de détection d’objets rapide et précise reposant largement sur la recherche d’architecture neuronale (NAS). Il remplace les backbones traditionnels conçus manuellement par des structures générées par NAS et optimisées pour réduire la latence. Il intègre également un RepGFPN (réseau pyramidal de caractéristiques généralisé reparamétré) efficace ainsi qu’une conception ZeroHead afin de rationaliser l’agrégation des caractéristiques et les prédictions de boîtes englobantes.
Détails clés du modèle :
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : Alibaba Group
- Date : 2022-11-23
- Arxiv : 2211.15444v2
- GitHub : tinyvision/DAMO-YOLO
- Documentation : Documentation de DAMO-YOLO
Comprendre RTDETRv2#
Le RTDETRv2 de Baidu représente une avancée majeure pour les Transformers de détection en temps réel. Contrairement aux réseaux neuronaux convolutifs (CNN) traditionnels qui reposent sur des boîtes d’ancrage et la suppression des non-maxima (NMS), RTDETRv2 utilise des mécanismes d’auto-attention pour prendre en compte l’intégralité du contexte de l’image. Il produit directement les boîtes englobantes, contournant entièrement l’étape de post-traitement NMS. Ce modèle introduit une stratégie d’entraînement fondée sur un « ensemble d’améliorations gratuites » afin d’améliorer la précision de référence sans augmenter la latence d’inférence.
Détails clés du modèle :
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Arxiv : 2407.17140
- GitHub : Dépôt RT-DETR
- Documentation : Documentation de RTDETRv2
Bien que les Transformers nécessitent davantage de ressources de calcul, leur capacité à traiter le contexte global les rend extrêmement efficaces pour comprendre des scènes complexes, ce qui constitue un atout majeur de RTDETRv2.
Comparaison des performances#
Lors de l’évaluation de ces modèles en vue d’un déploiement dans le monde réel, des paramètres tels que la précision moyenne moyenne (mAP), la vitesse d’inférence et l’empreinte mémoire sont essentiels. Les modèles fondés sur les Transformers comme RTDETRv2 nécessitent généralement davantage de mémoire CUDA pendant l’entraînement et l’inférence que les CNN légers comme DAMO-YOLO.
Voici une comparaison détaillée de leurs métriques de performance.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Cas d’utilisation idéaux#
Les points forts de DAMO-YOLO : Grâce à son backbone optimisé par NAS et à son nombre de paramètres exceptionnellement faible dans ses variantes plus petites (comme DAMO-YOLOt), il convient parfaitement au déploiement sur du matériel fortement limité. Si tu développes des solutions pour des appareils embarqués utilisant des runtimes comme ONNX ou des moteurs TensorRT spécialisés pour l’informatique en périphérie, DAMO-YOLO fournit un framework particulièrement réactif.
Les points forts de RTDETRv2 : RTDETRv2 excelle dans les situations où des GPU de niveau serveur sont disponibles et où le contexte global de l’image est primordial. Son architecture Transformer lui permet de résoudre naturellement les boîtes englobantes qui se chevauchent sans NMS, ce qui en fait un choix robuste pour la gestion des foules ou le suivi d’objets complexes, lorsque les relations spatiales entre des objets éloignés sont essentielles.
L’avantage d’Ultralytics : présentation de YOLO26#
Bien que DAMO-YOLO et RTDETRv2 représentent des avancées universitaires importantes, transformer ces modèles en applications évolutives prêtes pour la production peut s’avérer difficile. Les développeurs sont souvent confrontés à des bases de code fragmentées, à l’absence de prise en charge de l’apprentissage multitâche et à des pipelines de déploiement complexes.
C’est ici que l’écosystème Ultralytics se distingue véritablement. En donnant la priorité à la facilité d’utilisation, à une API Python bien maintenue et à une polyvalence inégalée, Ultralytics permet aux développeurs de consacrer moins de temps au débogage et davantage à la création.
Le modèle Ultralytics YOLO26 récemment publié pousse ces avantages encore plus loin, avec des avancées qui dépassent celles de DAMO-YOLO et de RTDETRv2 :
- Conception de bout en bout sans NMS : Initiée à l’origine dans YOLOv10, YOLO26 est nativement de bout en bout. Cela élimine complètement le post-traitement NMS, accélérant et simplifiant considérablement le déploiement par rapport aux CNN traditionnels, tout en offrant les avantages de sortie directe de RTDETRv2.
- Jusqu’à 43 % d’inférence plus rapide sur CPU : Fortement optimisé pour les appareils d’IA en périphérie dépourvus de GPU dédiés, ce qui en fait un choix largement supérieur aux Transformers gourmands en mémoire pour les applications IoT.
- Optimiseur MuSGD : Inspiré de Kimi K2 de Moonshot AI, cet hybride de SGD et de Muon introduit les innovations de l’entraînement des grands modèles de langage (LLM) dans la vision par ordinateur, ce qui permet un entraînement remarquablement stable et une convergence plus rapide.
- ProgLoss + STAL : Ces fonctions de perte avancées améliorent notablement la reconnaissance des petits objets, un domaine où les modèles rencontrent traditionnellement des difficultés. Cela est essentiel pour l’imagerie aérienne et les applications de drones.
- Suppression de DFL : La perte focale de distribution a été supprimée afin de simplifier les formats d’exportation et d’améliorer la compatibilité avec les appareils en périphérie basse consommation.
- Polyvalence inégalée : Contrairement aux modèles concurrents strictement limités à la détection, YOLO26 inclut des améliorations spécifiques à chaque tâche, comme une fonction de perte angulaire spécialisée pour les boîtes englobantes orientées (OBB), une fonction de perte de segmentation sémantique pour une précision parfaite au niveau des pixels et l’estimation résiduelle de log-vraisemblance (RLE) pour l’estimation de pose.
L’entraînement de modèles fondés sur les Transformers comme RTDETRv2 nécessite d’immenses allocations de mémoire CUDA, ce qui impose souvent des configurations coûteuses à plusieurs GPU. Les modèles Ultralytics YOLO conservent des besoins en mémoire remarquablement plus faibles pendant l’entraînement comme pendant l’inférence, démocratisant ainsi le développement de l’IA pour les chercheurs et les passionnés.
Exemple de code : l’API Ultralytics unifiée#
L'un des plus grands avantages de l'écosystème Ultralytics est son API unifiée. Tu peux charger, entraîner et valider de manière transparente une variété de modèles — y compris une implémentation PyTorch de RT-DETR et des modèles YOLO de pointe — sans modifier ton flux de travail.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
results_yolo[0].show()Cette simplicité s’étend à l’entraînement sur des jeux de données personnalisés et à l’exportation. Grâce au package Python Ultralytics, les développeurs peuvent facilement envoyer leurs poids entraînés vers des plateformes de déploiement comme CoreML ou OpenVINO à l’aide d’une seule commande.
Conclusion et pistes d’exploration#
DAMO-YOLO et RTDETRv2 ont indéniablement repoussé les limites de la détection d’objets en temps réel. DAMO-YOLO fournit des structures réseau hautement optimisées et générées automatiquement pour une efficacité brute, tandis que RTDETRv2 démontre que les Transformers peuvent rivaliser dans le domaine du temps réel en éliminant les goulots d’étranglement traditionnels comme le NMS.
Cependant, pour les développeurs qui recherchent l’équilibre ultime entre performance, documentation complète et maturité pour la production, les modèles Ultralytics YOLO restent la référence absolue. Avec l’introduction de YOLO26, les utilisateurs bénéficient d’une détection de bout en bout comparable à celle des Transformers, d’une efficacité d’entraînement inspirée des LLM et de vitesses CPU inégalées, le tout au sein d’un écosystème intuitif et robuste.
Si tu évalues des modèles pour ton prochain projet, tu trouveras peut-être aussi de l'intérêt à lire nos comparaisons sur EfficientDet vs RT-DETR, à explorer la génération précédente YOLO11, ou à passer en revue des références académiques comme YOLOX. Commence à construire dès aujourd'hui en explorant le guide de démarrage rapide d'Ultralytics.