Ultralytics YOLO27 :
Get Started

RTDETRv2 vs YOLOv6-3.0#

Le paysage de la vision par ordinateur évolue constamment, offrant aux développeurs une multitude de choix architecturaux pour la détection d’objets. Deux modèles importants illustrent des approches différentes : RTDETRv2, un transformer de vision de pointe, et YOLOv6-3.0, un réseau neuronal convolutif (CNN) hautement optimisé pour les applications industrielles.

Cette comparaison technique complète examine leurs architectures respectives, leurs métriques de performance et leurs scénarios de déploiement idéaux. Nous verrons également comment l’écosystème élargi d’Ultralytics offre une meilleure expérience développeur, avant de nous intéresser aux capacités de nouvelle génération d’Ultralytics YOLO26.

RTDETRv2 : l’approche par transformer de vision#

Développé par des chercheurs de Baidu, RTDETRv2 s'appuie sur les bases du RT-DETR original et marque une avancée majeure dans la détection d'objets fondée sur les transformers.

Points forts de l’architecture#

RTDETRv2 utilise une architecture hybride qui associe un extracteur de caractéristiques CNN à un puissant décodeur Transformer. La caractéristique la plus distinctive de ce modèle est sa conception native sans NMS. En éliminant la suppression non maximale (NMS) lors du post-traitement, le modèle prédit directement les boîtes englobantes, ce qui simplifie le déploiement et stabilise la latence d'inférence.

Le « Bag-of-Freebies » intégré à RTDETRv2 améliore sa capacité à traiter les scènes complexes et les objets qui se chevauchent, car les mécanismes d'attention globale comprennent intrinsèquement mieux les relations spatiales que les convolutions localisées.

Utilisation mémoire des Transformers

Même si les Transformers excellent dans la compréhension des scènes complexes, ils nécessitent généralement beaucoup plus de mémoire CUDA pendant l'entraînement que les CNN. Cela peut limiter la taille des lots sur les GPU grand public standard et augmenter la durée totale de l'entraînement.

En savoir plus sur RTDETRv2

YOLOv6-3.0 : maximiser le débit industriel#

Issu du département Vision AI de Meituan, YOLOv6-3.0 a été explicitement conçu comme un détecteur de nouvelle génération pour les chaînes industrielles où le débit du GPU est primordial.

  • Auteurs : Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu et Xiangxiang Chu
  • Organisation : Meituan
  • Date : 2023-01-13
  • Arxiv : 2301.05586
  • GitHub : meituan/YOLOv6

Orientation architecturale#

YOLOv6-3.0 s'appuie sur un backbone EfficientRep, minutieusement conçu pour réduire au minimum les coûts d'accès à la mémoire sur les accélérateurs matériels comme les GPU NVIDIA. L'architecture du neck intègre un module de concaténation bidirectionnelle (BiC) afin d'améliorer la fusion des caractéristiques à différentes échelles.

Pendant l'entraînement, le modèle utilise une stratégie d'entraînement assistée par ancres (AAT) pour tirer parti des paradigmes fondés sur les ancres, tout en conservant un mode d'inférence sans ancres pour accélérer l'exécution. Il atteint un débit exceptionnel sur les GPU de classe serveur (par exemple, T4, A100), mais son architecture spécialisée peut entraîner une latence sous-optimale sur les appareils edge dotés uniquement d'un CPU.

En savoir plus sur YOLOv6

Comparaison des performances#

Lorsqu'on évalue des modèles pour la production, il est essentiel de trouver un équilibre entre la précision (mAP), la vitesse d'inférence et le coût de calcul (FLOPs). Le tableau ci-dessous compare les performances de ces modèles.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

YOLOv6-3.0 domine en vitesse de traitement pure sur TensorRT, tandis que RTDETRv2 obtient des scores mAP plus élevés, notamment en passant mieux à l'échelle avec les variantes de modèles plus grandes. Cependant, aucun des deux modèles n'offre la polyvalence étendue des frameworks unifiés modernes. YOLOv6-3.0 est principalement spécialisé dans la détection et ne prend pas en charge nativement des tâches comme la segmentation d'instances et l'estimation de pose.

Cas d’utilisation et recommandations#

Le choix entre RT-DETR et YOLOv6 dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir RT-DETR#

RT-DETR est un excellent choix pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir YOLOv6#

YOLOv6 est recommandé pour :

  • Déploiement adapté au matériel industriel : les scénarios où la conception de YOLOv6, adaptée au matériel, et son reparamétrage efficace optimisent les performances sur un matériel cible spécifique.
  • Détection rapide à un seul étage : les applications qui privilégient la vitesse d’inférence brute sur GPU pour le traitement vidéo en temps réel dans des environnements contrôlés.
  • Intégration à l’écosystème Meituan : les équipes qui travaillent déjà dans la pile technologique et l’infrastructure de déploiement de Meituan.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics#

Choisir le bon modèle ne se résume pas aux scores bruts des benchmarks : l'expérience de développement, la flexibilité du déploiement et la prise en charge de l'écosystème sont tout aussi essentielles. En utilisant des modèles intégrés à la plateforme Ultralytics, les utilisateurs bénéficient d'avantages considérables par rapport aux dépôts de recherche statiques.

  • Facilité d'utilisation : le package Python ultralytics fournit une API fluide. Il suffit de quelques lignes de code pour entraîner, valider et exporter des modèles.
  • Écosystème bien entretenu : contrairement aux dépôts universitaires isolés, la plateforme Ultralytics est régulièrement mise à jour. Elle propose des intégrations solides avec des outils comme ONNX, OpenVINO et CoreML.
  • Efficacité de l'entraînement : les modèles Ultralytics consomment généralement beaucoup moins de VRAM pendant l'entraînement que les architectures Transformer comme RTDETRv2, ce qui permet d'utiliser des lots plus grands sur du matériel grand public.
  • Polyvalence : contrairement au champ d'application ciblé de YOLOv6-3.0, les modèles Ultralytics sont multitâches et prennent nativement en charge la segmentation, la classification d'images et les boîtes englobantes orientées (OBB) dans un framework unifié.
Déploiement simplifié

Avec la CLI Ultralytics, exporter un modèle entraîné pour un déploiement edge est aussi simple que d'exécuter : yolo export model=yolo11n.pt format=tensorrt.

Découvrez YOLO26 : la solution ultime#

RTDETRv2 et YOLOv6-3.0 offrent des avantages spécifiques, mais le domaine évolue rapidement. Pour les équipes qui lancent de nouveaux projets de vision par ordinateur, nous recommandons vivement YOLO26, publié par Ultralytics en janvier 2026.

YOLO26 réunit les atouts des CNN industriels et des Transformers modernes tout en éliminant leurs faiblesses respectives :

  • Conception de bout en bout sans NMS : reprenant l'innovation introduite pour la première fois dans YOLOv10, YOLO26 propose une tête facultative sans NMS (nms=False) qui supprime le post-traitement NMS et garantit un déploiement stable et prévisible, comme avec RTDETRv2, mais avec une surcharge bien moindre.
  • Optimiseur MuSGD : inspiré de techniques avancées d'entraînement des LLM (comme Kimi K2 de Moonshot AI), cet optimiseur hybride garantit un entraînement stable et une convergence plus rapide, surmontant l'instabilité notoire des Transformers de vision traditionnels.
  • Optimisé pour l'edge : avec une inférence CPU jusqu'à 43 % plus rapide que les générations précédentes et la suppression stratégique de la perte focale distributionnelle (DFL), YOLO26 convient parfaitement aux appareils mobiles et IoT dépourvus d'accélération GPU.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent notablement la reconnaissance des petits objets, un défi historique pour les CNN, et font de YOLO26 un modèle idéal pour l'imagerie aérienne et la robotique.

Exemple d’entraînement#

L'API intuitive d'Ultralytics te permet d'entraîner facilement des modèles de pointe. Voici un exemple exécutable montrant comment entraîner le modèle YOLO26 Nano sur le jeu de données COCO8 :

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

Résumé#

Pour choisir entre RTDETRv2 et YOLOv6-3.0, la décision dépend principalement de ton matériel et de tes contraintes de latence. RTDETRv2 excelle dans les environnements de recherche et le traitement côté serveur, où il est essentiel de gérer des objets complexes qui se chevauchent. YOLOv6-3.0 reste un excellent choix pour les lignes de production à haut débit équipées de puissants GPU NVIDIA.

Cependant, pour les développeurs qui recherchent le meilleur des deux mondes — l'élégance sans NMS des Transformers, associée à la vitesse fulgurante et à la faible empreinte mémoire des CNN — YOLO26 est inégalé. Soutenu par la documentation complète et la communauté active de l'écosystème Ultralytics, YOLO26 permet de créer des projets d'IA visuelle robustes, évolutifs et pérennes.

Commentaires