RTDETRv2 vs DAMO-YOLO#
Le paysage de la vision par ordinateur évolue constamment, les chercheurs et les ingénieurs s’efforçant de créer des modèles qui équilibrent parfaitement vitesse, précision et efficacité. Deux architectures marquantes qui ont fait sensation dans ce domaine sont RTDETRv2, développé par Baidu, et DAMO-YOLO, créé par Alibaba Group. Les deux modèles repoussent les limites de la détection d’objets en temps réel, mais adoptent des philosophies architecturales fondamentalement différentes pour obtenir leurs résultats impressionnants.
Dans cette comparaison technique, nous examinerons en détail leurs architectures, leurs méthodologies d’entraînement et leurs capacités de déploiement dans le monde réel. Nous verrons également comment ces modèles se comparent à l’écosystème plus large, notamment à la Ultralytics Platform, hautement optimisée, et à l’architecture YOLO26 de pointe.
Innovations architecturales#
Comprendre les mécanismes fondamentaux de ces modèles est essentiel pour les ingénieurs en apprentissage automatique chargés de choisir l’outil adapté aux environnements de production.
RTDETRv2 : l’approche Transformer#
S’appuyant sur le succès du RT-DETR original, RTDETRv2 utilise un encodeur hybride et un décodeur Transformer. Cette conception permet au modèle de traiter très efficacement le contexte global, ce qui le rend particulièrement performant pour distinguer les objets qui se chevauchent dans les scènes denses. Le principal avantage de cette architecture est sa conception native sans NMS (suppression non maximale). En éliminant l’étape de post-traitement NMS, RTDETRv2 simplifie le pipeline d’inférence et assure une latence plus stable sur différentes configurations matérielles.
DAMO-YOLO : améliorer l’efficacité des CNN#
DAMO-YOLO, quant à lui, reste ancré dans la lignée des modèles YOLO basés sur les CNN, qui a connu un grand succès, tout en introduisant plusieurs améliorations révolutionnaires. Il exploite la recherche d’architecture neuronale (NAS) pour optimiser son backbone et garantir une efficacité maximale de l’extraction de caractéristiques. Il intègre également un RepGFPN efficace (réseau pyramidal de caractéristiques généralisé reparamétré) et une conception ZeroHead, ainsi que les techniques d’amélioration AlignedOTA et de distillation. Ces innovations permettent à DAMO-YOLO d’atteindre des vitesses d’inférence élevées tout en conservant un score mAPval très compétitif.
RTDETRv2 mise sur les mécanismes d’attention pour comprendre les caractéristiques globales sans NMS, tandis que DAMO-YOLO maximise l’efficacité des CNN traditionnels grâce à NAS et à une distillation avancée. Il nécessite un post-traitement standard, mais offre des avantages distincts en matière de vitesse sur certains matériels.
Comparaison des performances et des métriques#
Lors de l’évaluation de modèles pour le déploiement, les métriques de performance, comme la précision moyenne moyenne (mAP), la vitesse d’inférence et le nombre de paramètres, sont primordiales. Tu trouveras ci-dessous une comparaison détaillée des deux familles de modèles.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Analyse des résultats#
Comme le montre le tableau, RTDETRv2-x atteint la meilleure précision, avec un mAPval de 54,3, démontrant la puissance de l’architecture Transformer sur des validations complexes comme le jeu de données COCO. Cela implique toutefois un nombre de paramètres (76 M) et un nombre de FLOPs nettement plus élevés.
À l’inverse, DAMO-YOLOt (Tiny) est particulièrement léger : il ne nécessite que 8,5 M de paramètres, ce qui en fait une option très rapide pour les environnements où la mémoire CUDA est fortement limitée. DAMO-YOLO offre généralement un compromis avantageux entre vitesse et précision pour les anciens appareils en périphérie.
Écosystème, facilité d’utilisation et avantage Ultralytics#
Alors que des dépôts indépendants comme le dépôt RT-DETR officiel sur GitHub et le dépôt DAMO-YOLO officiel sur GitHub fournissent le code brut pour entraîner ces modèles, leur intégration dans des pipelines de production nécessite souvent beaucoup de code passe-partout et une optimisation manuelle.
C’est là que l’écosystème Ultralytics simplifie considérablement l’expérience des développeurs. Ultralytics intègre directement des détecteurs Transformer comme le RT-DETR original à son API unifiée, ce qui permet aux utilisateurs d’entraîner, de valider et d’exporter des modèles avec une seule ligne de code. De plus, les modèles Ultralytics sont réputés pour leurs besoins en mémoire réduits pendant l’entraînement, comparativement aux dépôts autonomes reposant sur de lourds modèles Transformer.
Exemple de code : intégration fluide#
Voici comme il est facile d’utiliser la bibliothèque Python Ultralytics pour effectuer une inférence. L’API reste cohérente, que tu utilises un modèle Transformer ou un CNN de pointe.
from ultralytics import RTDETR, YOLO
# Charger un modèle RT-DETR pour comprendre des scènes complexes
model_rtdetr = RTDETR("rtdetr-l.pt")
# Charger le dernier modèle Ultralytics YOLO26 pour des performances optimales en périphérie
model_yolo26 = YOLO("yolo26n.pt")
# Effectuer facilement une inférence sur une image d’exemple
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")
# Afficher les résultats
results_yolo[0].show()Avec l’API Ultralytics, tu peux facilement exporter tes modèles entraînés vers des formats comme TensorRT, ONNX ou CoreML à l’aide d’une simple commande model.export(format="engine"), ce qui réduit considérablement les difficultés de déploiement.
Cas d’utilisation idéaux#
Le choix entre ces architectures dépend entièrement des exigences spécifiques de ton projet :
- RTDETRv2 excelle dans les traitements côté serveur où la VRAM est abondante. Sa compréhension du contexte global est idéale pour l’imagerie médicale et l’analyse de foules denses où les occultations sont fréquentes.
- DAMO-YOLO convient particulièrement aux applications IoT embarquées et aux lignes d’inspection industrielle à grande vitesse, où un faible nombre de paramètres et un FPS élevé sont des exigences strictes.
L'avenir : Ultralytics YOLO26#
RTDETRv2 et DAMO-YOLO ont tous deux leurs mérites, mais le domaine de la vision par ordinateur évolue rapidement. Pour les nouveaux projets, le tout dernier Ultralytics YOLO26 représente la synthèse ultime de la vitesse, de la précision et de l’expérience développeur.
YOLO26 adopte une conception de bout en bout sans NMS, qui reprend le principal avantage des Transformers sans leur énorme surcharge de calcul. Il intègre l’innovant optimiseur MuSGD, inspiré de l’entraînement des grands modèles de langage, pour une convergence stable et rapide. De plus, grâce à la suppression de DFL (suppression de la Distribution Focal Loss pour simplifier l’exportation et améliorer la compatibilité avec les appareils en périphérie et à faible consommation), YOLO26 offre une inférence CPU jusqu’à 43 % plus rapide, ce qui en fait le champion incontesté de l’informatique en périphérie. En outre, ProgLoss + STAL fournit des fonctions de perte améliorées qui améliorent sensiblement la reconnaissance des petits objets, essentielle pour l’IoT, la robotique et l’imagerie aérienne.
Contrairement aux modèles strictement limités aux boîtes englobantes, la famille YOLO26 offre une polyvalence inégalée et prend en charge des tâches allant de la segmentation d’instances à l’estimation de pose, en passant par les boîtes englobantes orientées (OBB), le tout géré facilement depuis l’Ultralytics Platform, intuitive.
Détails des modèles et références#
RTDETRv2#
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Arxiv : 2407.17140
- GitHub : Dépôt RT-DETR
DAMO-YOLO#
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : groupe Alibaba
- Date : 2022-11-23
- Arxiv : 2211.15444v2
- GitHub : Dépôt DAMO-YOLO
Si tu souhaites découvrir d’autres comparaisons, consulte nos guides sur RTDETRv2 vs. YOLO11 ou DAMO-YOLO vs. YOLOv8 pour voir comment ces modèles se comparent aux générations précédentes de la famille Ultralytics.