Ultralytics YOLO27 :
Get Started

RTDETRv2 vs YOLO26#

Le domaine de la détection d'objets en temps réel a considérablement évolué, les chercheurs repoussant sans cesse les limites de la vitesse, de la précision et de l'efficacité du déploiement. Deux des architectures les plus en vue sont actuellement le modèle RTDETRv2 basé sur un Transformer et le réseau de neurones convolutif (CNN) à la pointe de la technologie, Ultralytics YOLO26. Ce guide analyse en détail leurs architectures, leurs métriques de performance et leurs cas d'utilisation idéaux pour t'aider à choisir le bon modèle pour ton prochain projet de vision par ordinateur.

RTDETRv2 : Transformers de détection en temps réel#

RTDETRv2 s'appuie sur l'architecture originale RT-DETR et vise à combiner la compréhension du contexte global des Transformers de vision avec la vitesse nécessaire aux applications en temps réel.

Caractéristiques principales :

  • Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
  • Organisation : Baidu
  • Date : 2024-07-24
  • Liens : Arxiv, GitHub, Documentation

Architecture et points forts#

Contrairement aux détecteurs classiques basés sur des ancres, RTDETRv2 utilise une approche basée sur un Transformer qui élimine nativement le besoin de suppression non maximale (NMS) lors du post-traitement. Grâce à un mécanisme d'attention flexible, le modèle comprend très bien les scènes complexes et les objets qui se chevauchent. Ses améliorations « Bag-of-Freebies » ont considérablement accru sa précision sur le jeu de données COCO, tout en maintenant des vitesses d'inférence acceptables sur les GPU haut de gamme.

Limites#

RTDETRv2 obtient des résultats universitaires impressionnants, mais pose souvent des difficultés en production. Par nature, les architectures Transformer nécessitent davantage de mémoire pendant l'entraînement et l'inférence que les CNN. Cela peut compliquer leur déploiement sur des appareils d'IA en périphérie aux ressources limitées. De plus, l'entraînement des Transformers nécessite généralement des tailles de lot plus importantes et davantage de mémoire CUDA, ce qui peut constituer un goulot d'étranglement pour les chercheurs disposant de matériel limité.

En savoir plus sur RTDETRv2

YOLO26 : le summum de l'IA visuelle conçue pour la périphérie#

Sorti au début de 2026, Ultralytics YOLO26 redéfinit les possibilités de la détection d'objets basée sur les CNN. Il intègre des optimisations de pointe spécialement conçues pour faciliter le déploiement en production et maximiser l'efficacité matérielle.

Caractéristiques principales :

Avancées architecturales#

YOLO26 introduit plusieurs fonctionnalités révolutionnaires qui répondent aux difficultés courantes du déploiement des modèles :

  • Conception de bout en bout sans NMS : s'appuyant sur les concepts introduits par YOLOv10, YOLO26 est nativement un modèle de bout en bout. En éliminant le post-traitement NMS grâce à sa tête optionnelle one-to-one (nms=False), il réduit considérablement la variabilité de la latence et garantit des temps d'inférence très prévisibles en production.
  • Inférence CPU jusqu'à 43 % plus rapide : grâce à des améliorations architecturales ciblées et à la suppression de Distribution Focal Loss (DFL), YOLO26 atteint des vitesses CPU inédites et devient le choix de premier plan pour le calcul en périphérie sans GPU dédié.
  • Optimiseur MuSGD : inspiré des techniques d'entraînement des grands modèles de langage (LLM), comme Kimi K2 de Moonshot AI, YOLO26 utilise l'optimiseur MuSGD, un hybride de SGD et de Muon. Il assure un entraînement très stable et une convergence incroyablement rapide.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent considérablement la reconnaissance des petits objets, une avancée essentielle pour les applications d'imagerie aérienne et de surveillance par drone.
Améliorations de YOLO26 spécifiques aux tâches

Au-delà de la détection classique, YOLO26 propose des améliorations spécialisées : une fonction de perte de segmentation sémantique et un proto à plusieurs échelles pour les tâches de segmentation, l'estimation résiduelle du maximum de vraisemblance (RLE) pour l'estimation de pose et une fonction de perte d'angle personnalisée pour résoudre les problèmes de limites lors de la détection des boîtes englobantes orientées (OBB).

Comparaison des performances#

Lors de l'évaluation de ces modèles, il est essentiel d'obtenir un bon équilibre entre précision (mAP) et efficacité de calcul. Le tableau ci-dessous montre que YOLO26 surpasse systématiquement RTDETRv2 dans différentes tailles de modèle.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Comme le montre le tableau ci-dessus, le modèle YOLO26x atteint une remarquable précision de 57,5 mAP, dépassant nettement le modèle RTDETRv2-x tout en utilisant moins de paramètres et en conservant une vitesse d'inférence TensorRT plus élevée. De plus, YOLO26 nécessite beaucoup moins de mémoire, ce qui en fait le choix optimal pour les déploiements en temps réel en périphérie.

Écosystème et facilité d'utilisation#

Les performances brutes sont essentielles, mais l'écosystème qui entoure un modèle détermine la rapidité avec laquelle il peut passer de la recherche à la production. C'est là que la plateforme Ultralytics offre un avantage inégalé.

Un écosystème unifié et bien entretenu#

RTDETRv2 se présente principalement sous la forme d'un dépôt de recherche, ce qui peut nécessiter une configuration complexe de l'environnement et des scripts manuels pour les tâches personnalisées. À l'inverse, Ultralytics YOLO26 bénéficie d'un package Python mature et largement éprouvé. L'écosystème Ultralytics offre une expérience utilisateur particulièrement fluide, avec une API simple pour l'entraînement, la validation, la prédiction et l'exportation.

Grâce aux intégrations natives avec Weights & Biases et Comet ML, le suivi des expériences se fait en toute simplicité. En outre, les modèles Ultralytics sont très polyvalents : alors que RTDETRv2 se concentre sur la détection d'objets, YOLO26 prend nativement en charge la segmentation d'instances, l'estimation de pose et la classification d'images dans un seul et même framework.

Exemple de code : la simplicité en action#

L’API Ultralytics permet aux développeurs de charger, d’entraîner et d’exécuter des inférences avec seulement quelques lignes de code. Elle améliore considérablement l’efficacité de l’entraînement et réduit le délai de mise sur le marché.

from ultralytics import RTDETR, YOLO

# Charger un modèle RT-DETR
model_rtdetr = RTDETR("rtdetr-l.pt")

# Charger un modèle YOLO26 de pointe
model_yolo = YOLO("yolo26n.pt")

# Exécuter facilement une inférence sur une image
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Afficher les résultats de YOLO26
results_yolo[0].show()

# Exporter YOLO26 au format ONNX en un clic
model_yolo.export(format="onnx")

Cas d’utilisation et recommandations#

Le choix entre RT-DETR et YOLO26 dépend des exigences propres à ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir RT-DETR#

RT-DETR est un excellent choix pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir YOLO26#

YOLO26 est recommandé pour :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

Explorer d’autres architectures#

Bien que YOLO26 représente actuellement le summum des performances, les développeurs peuvent aussi trouver un intérêt à explorer les versions précédentes. Le modèle YOLO11, qui a connu un grand succès, reste robuste et entièrement pris en charge pour divers systèmes existants. Tu peux approfondir ses capacités en lisant notre comparatif RT-DETR et YOLO11. De plus, si tu analyses des architectures plus anciennes, le comparatif EfficientDet et YOLO26 offre un excellent aperçu historique des progrès réalisés par les architectures de détection d’objets.

En conclusion#

RTDETRv2 et YOLO26 apportent tous deux des avancées remarquables dans le domaine de l’IA. Toutefois, pour les équipes qui privilégient une transition fluide vers la production, une empreinte mémoire minimale et une grande polyvalence des tâches, Ultralytics YOLO26 est le choix évident. Son architecture sans NMS, sa rapidité sur CPU et le solide écosystème Ultralytics garantissent que tes projets d’IA visuelle restent évolutifs, efficaces et pérennes. Que tu le déploies sur un serveur cloud ou sur un Raspberry Pi aux ressources limitées, YOLO26 offre d’emblée des performances sans compromis.

Commentaires