YOLO Vision 2026 :

RTDETRv2 vs DAMO-YOLO#

Le paysage de la vision par ordinateur évolue constamment, les chercheurs et les ingénieurs s'efforçant de construire des modèles qui équilibrent parfaitement vitesse, précision et efficacité. Deux architectures de premier plan qui ont fait des vagues significatives dans ce domaine sont RTDETRv2, développé par Baidu, et DAMO-YOLO, conçu par Alibaba Group. Les deux modèles repoussent les limites de la object detection en temps réel, tout en adoptant des philosophies architecturales fondamentalement différentes pour obtenir leurs résultats impressionnants.

Dans cette comparaison technique, nous allons plonger en profondeur dans leurs architectures, leurs méthodologies d'entraînement et leurs capacités de déploiement dans le monde réel. Nous explorerons également la façon dont ces modèles se comparent à l'écosystème plus large, en particulier la Ultralytics Platform hautement optimisée et l'architecture de pointe YOLO26 architecture.

Innovations architecturales#

Comprendre les mécanismes fondamentaux de ces modèles est crucial pour les machine learning engineers chargés de sélectionner le bon outil pour les environnements de production.

RTDETRv2 : L'approche Transformer#

S'appuyant sur le succès du RT-DETR original, RTDETRv2 utilise un encodeur hybride et un transformer decoder. Cette conception permet au modèle de traiter le contexte global de manière très efficace, le rendant exceptionnellement doué pour distinguer les objets qui se chevauchent dans des scènes denses. L'avantage le plus significatif de cette architecture est sa conception native sans NMS (Non-Maximum Suppression). En éliminant l'étape de post-traitement NMS, RTDETRv2 rationalise le pipeline d'inférence et garantit une latence plus stable à travers différentes configurations matérielles.

En savoir plus sur RTDETRv2

DAMO-YOLO : Faire progresser l'efficacité des CNN#

DAMO-YOLO, en revanche, reste ancré dans la lignée YOLO basée sur les CNN qui a connu un grand succès, mais introduit plusieurs améliorations révolutionnaires. Il exploite la recherche d'architecture neuronale (NAS) pour optimiser son squelette, garantissant une efficacité maximale d'extraction de caractéristiques. De plus, il intègre un RepGFPN (Reparameterized Generalized Feature Pyramid Network) efficace et une conception ZeroHead, ainsi que des techniques d'alignement AlignedOTA et d'amélioration par distillation. Ces innovations permettent à DAMO-YOLO d'atteindre des vitesses d'inférence rapides tout en maintenant un score mAPval très compétitif.

En savoir plus sur DAMO-YOLO

Divergence architecturale

Alors que RTDETRv2 se concentre sur l'exploitation des mécanismes d'attention pour la compréhension globale des caractéristiques sans NMS, DAMO-YOLO maximise l'efficacité traditionnelle des CNN via le NAS et une distillation avancée, nécessitant un post-traitement standard mais offrant des avantages de vitesse distincts sur certains matériels.

Comparaison des performances et des mesures#

Lors de l'évaluation des modèles pour le déploiement, les performance metrics telles que la précision moyenne (mAP), la vitesse d'inférence et le nombre de paramètres sont primordiales. Vous trouverez ci-dessous une comparaison détaillée des deux familles de modèles.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Analyse des résultats#

Comme on peut le voir dans le tableau, le RTDETRv2-x atteint la plus haute précision avec un mAPval de 54.3, démontrant la puissance de l'architecture transformer sur des validations complexes comme le COCO dataset. Cependant, cela se fait au prix d'un nombre de paramètres (76M) et de FLOPs considérablement plus élevé.

À l'inverse, DAMO-YOLOt (Tiny) est exceptionnellement léger, nécessitant seulement 8,5M de paramètres, ce qui en fait une option incroyablement rapide pour les environnements où la mémoire CUDA est sévèrement limitée. DAMO-YOLO offre généralement un compromis favorable entre vitesse et précision pour les appareils edge existants.

Écosystème, utilisabilité et l'avantage Ultralytics#

Alors que des dépôts indépendants tels que le RT-DETR GitHub et le DAMO-YOLO GitHub officiels offrent le code brut pour entraîner ces modèles, les intégrer dans des pipelines de production nécessite souvent beaucoup de code boilerplate et une optimisation manuelle.

C'est là que l'Ultralytics ecosystem simplifie considérablement l'expérience du développeur. Ultralytics intègre des modèles tels que RTDETRv2 directement dans son API unifiée, permettant aux utilisateurs d'entraîner, de valider et d'exporter des modèles avec une seule ligne de code. De plus, les modèles Ultralytics sont connus pour leurs exigences de mémoire minimales pendant l'entraînement par rapport aux dépôts autonomes lourds basés sur les transformers.

Exemple de code : Intégration transparente#

Voici à quel point il est facile d'exploiter la bibliothèque Python Ultralytics pour effectuer une inférence. L'API reste cohérente, que tu utilises un modèle transformer ou un CNN de pointe.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")

# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Display the results
results_yolo[0].show()
Exporter des modèles pour la production

En utilisant l'API Ultralytics, tu peux export your trained models de manière transparente vers des formats tels que TensorRT, ONNX ou CoreML avec une simple commande model.export(format="engine"), ce qui réduit considérablement les frictions de déploiement.

Cas d'utilisation idéaux#

Le choix entre ces architectures dépend entièrement des exigences spécifiques de ton projet :

  • RTDETRv2 excelle dans le traitement côté serveur où la VRAM est abondante. Sa conscience du contexte global est parfaite pour medical imaging et l'analyse de foules denses où les occlusions sont fréquentes.
  • DAMO-YOLO est parfaitement adapté aux embedded IoT applications et aux lignes d'inspection industrielle rapides où un faible nombre de paramètres et des FPS élevés sont des exigences strictes.

L'avenir : Ultralytics YOLO26#

Bien que RTDETRv2 et DAMO-YOLO aient tous deux leurs mérites, le domaine de la vision par ordinateur progresse rapidement. Pour les nouveaux projets, le dernier Ultralytics YOLO26 représente la synthèse ultime de la vitesse, de la précision et de l'expérience développeur.

YOLO26 adopte une conception End-to-End NMS-Free, capturant le principal avantage des transformers sans la surcharge de calcul massive. Il intègre l'innovant MuSGD Optimizer — inspiré par l'entraînement des Large Language Model — pour une convergence stable et rapide. De plus, avec la suppression de DFL (Distribution Focal Loss supprimée pour une exportation simplifiée et une meilleure compatibilité avec les appareils de périphérie/faible consommation), YOLO26 atteint jusqu'à 43% d'inférence CPU plus rapide, ce qui en fait le champion incontesté de l'edge computing. En outre, ProgLoss + STAL fournit des fonctions de perte améliorées avec des améliorations notables de la reconnaissance des petits objets, ce qui est essentiel pour l'IoT, la robotique et l'imagerie aérienne.

Contrairement aux modèles strictement limités aux boîtes englobantes, la famille YOLO26 offre une polyvalence inégalée, prenant en charge des tâches allant de instance segmentation et pose estimation à oriented bounding boxes (OBB), le tout géré de manière transparente via l'intuitif Ultralytics Platform.

Explorer YOLO26 sur la Plateforme

Détails du modèle et références#

RTDETRv2#

  • Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
  • Organisation : Baidu
  • Date : 24-07-2024
  • Arxiv : 2407.17140
  • GitHub : RT-DETR Repository

DAMO-YOLO#

Pour les utilisateurs souhaitant explorer d'autres comparaisons, consulte nos guides sur RTDETRv2 vs. YOLO11 ou DAMO-YOLO vs. YOLOv8 pour voir comment ces modèles se comportent par rapport aux générations précédentes de la famille Ultralytics.

Commentaires