Ultralytics YOLO27 :
Get Started

RTDETRv2 et YOLO11#

Le domaine de la vision par ordinateur évolue constamment, et de nouvelles architectures repoussent les limites du possible sur les appareils périphériques et les serveurs cloud. Deux des principaux concurrents actuels dans le domaine de la détection d’objets en temps réel sont RTDETRv2 et YOLO11. Bien que les deux modèles offrent des performances exceptionnelles, ils incarnent des philosophies architecturales fondamentalement différentes : l’approche basée sur Transformer et le réseau neuronal convolutif (CNN) hautement optimisé.

Dans ce comparatif technique complet, nous examinerons les architectures, les métriques de performance, les méthodologies d’entraînement et les cas d’usage idéaux des deux modèles, afin de t’aider à prendre une décision éclairée pour ta prochaine application d’intelligence artificielle.

RTDETRv2 : le challenger basé sur Transformer#

Conçu comme une évolution du modèle original Real-Time Detection Transformer, RTDETRv2 exploite des mécanismes d’attention pour traiter les données visuelles. En traitant les zones de l’image comme des séquences, il acquiert une compréhension globale du contexte de l’image, particulièrement utile pour détecter des objets qui se chevauchent fortement dans des scènes complexes.

Détails du modèle :

Points forts et faiblesses de l’architecture#

La principale innovation de RTDETRv2 est son architecture de bout en bout sans NMS. En éliminant la suppression non maximale (NMS), elle simplifie le pipeline de post-traitement. De plus, ses capacités d’extraction de caractéristiques multi-échelles ont été améliorées par rapport au modèle RT-DETR d’origine, ce qui lui permet de mieux identifier les objets de tailles variées.

Cependant, comme il repose sur les Transformers, RTDETRv2 nécessite généralement beaucoup plus de mémoire pendant l’entraînement. Les Transformers convergent généralement plus lentement et nécessitent bien plus de mémoire CUDA que les CNN traditionnels, ce qui les rend moins accessibles aux chercheurs disposant de matériel grand public ou qui les déploient dans des environnements d’IA en périphérie aux ressources limitées.

En savoir plus sur RTDETRv2

Ultralytics YOLO11 : le summum de l’efficacité des CNN#

Forte de plusieurs années de recherche fondamentale, Ultralytics a lancé YOLO11, une avancée majeure dans la lignée YOLO. Ce modèle affine l’architecture CNN pour atteindre une vitesse et une précision sans précédent, tout en conservant la flexibilité et l’écosystème convivial pour les développeurs auxquels la communauté s’attend.

Détails du modèle :

L’avantage Ultralytics#

YOLO11 se distingue par son équilibre des performances. Il offre un compromis exceptionnel entre vitesse et précision, ce qui le rend particulièrement polyvalent dans divers scénarios de déploiement réels, des grands clusters de cloud computing aux appareils mobiles légers.

De plus, les modèles Ultralytics YOLO sont réputés pour leur faible consommation de mémoire pendant l’entraînement et l’inférence. Contrairement aux modèles Transformer, qui peuvent facilement saturer la VRAM, YOLO11 permet d’utiliser des tailles de lot plus importantes sur des GPU standard. En outre, YOLO11 ne se limite pas à la détection d’objets : il offre une polyvalence remarquable, avec une prise en charge native de la segmentation d’instances, de la classification d’images, de l’estimation de pose et des boîtes englobantes orientées (OBB).

Comparaison des performances et des métriques#

La comparaison des chiffres bruts montre que, si RTDETRv2 atteint une précision impressionnante, YOLO11 offre un choix de tailles de modèles beaucoup plus précis et des vitesses d’inférence supérieures, notamment sur TensorRT.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Comme le montre le tableau, le modèle YOLO11x atteint un mAPval supérieur de 54,7 % tout en utilisant moins de FLOPs (195,3B contre 259B) et en offrant une inférence plus rapide sur TensorRT (11,3 ms contre 15,03 ms) que la variante RTDETRv2-x. Les variantes nano et small de YOLO11 proposent des options légères inégalées pour les appareils aux ressources limitées, comme le Raspberry Pi.

Écosystème, facilité d’utilisation et entraînement#

L’expérience utilisateur simplifiée est la caractéristique principale des modèles Ultralytics. Le package Python ultralytics fournit une API unifiée et intuitive qui prend en charge les tâches complexes d’augmentation de données, d’entraînement distribué et d’exportation de modèles. Alors que le dépôt de recherche RTDETRv2 exige beaucoup de code standard et de configuration, Ultralytics fournit un pipeline qui te mène de débutant à expert.

Fait intéressant, l’écosystème Ultralytics est si robuste qu’il prend en charge nativement l’exécution de modèles RT-DETR aux côtés des modèles YOLO ! Tu peux ainsi tirer parti de l’écosystème bien entretenu d’Ultralytics, notamment de ses intégrations avec Weights & Biases et Comet ML, pour suivre tes expériences en toute simplicité.

from ultralytics import RTDETR, YOLO

# Charger facilement un modèle RTDETR via l’API Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")

# Charger un modèle YOLO11 hautement optimisé
model_yolo = YOLO("yolo11n.pt")

# Entraîner YOLO11 avec une utilisation de la mémoire très efficace
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporter le modèle YOLO entraîné au format ONNX
model_yolo.export(format="onnx")
Simplifie ton workflow

L’efficacité de l’entraînement est primordiale en machine learning. Les modèles Ultralytics utilisent des poids pré-entraînés qui convergent rapidement. Pour gérer tes jeux de données, tes entraînements et tes points de terminaison de déploiement sans écrire de code, découvre la plateforme Ultralytics et profite d’une expérience MLOps intégrée.

Applications concrètes#

Le choix entre ces architectures dépend souvent des contraintes de déploiement propres à ton projet.

Les points forts de RTDETRv2 : La base Transformer de RTDETRv2 est très efficace dans les situations où les objets sont denses et fortement occultés, et où le contexte global est nécessaire. Ce modèle est souvent évalué dans le cadre de recherches universitaires et d’applications où le budget de calcul importe moins que la cartographie brute des relations fondée sur l’attention.

Les points forts de YOLO11 : YOLO11 est le champion incontesté du déploiement pratique en conditions réelles. Son empreinte mémoire minimale et ses vitesses d’inférence fulgurantes le rendent idéal pour :

  • Fabrication intelligente : détecter les défauts en temps réel sur les chaînes de production à l’aide de PC industriels.
  • Agriculture : déployer des drones pour surveiller en temps réel l’état des cultures et automatiser les robots de récolte.
  • Analyse du commerce de détail : traiter simultanément plusieurs flux de caméras pour gérer les files d’attente et suivre les stocks sans avoir besoin d’immenses fermes de serveurs.

Cas d’utilisation et recommandations#

Le choix entre RT-DETR et YOLO11 dépend des exigences propres à ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir RT-DETR#

RT-DETR est un excellent choix pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir YOLO11#

YOLO11 est recommandé pour :

  • Déploiement en périphérie en production : applications commerciales sur des appareils comme Raspberry Pi ou NVIDIA Jetson, où la fiabilité et la maintenance active sont primordiales.
  • Applications de vision multitâches : projets nécessitant la détection, la segmentation, l’estimation de pose et les OBB au sein d’un framework unifié.
  • Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production à l’aide de l’API Python Ultralytics simplifiée.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

Perspectives : l’arrivée de YOLO26#

Si tu démarres un nouveau projet, pense aussi à la prochaine génération d’IA visuelle : Ultralytics YOLO26. Lancé en janvier 2026, YOLO26 réunit le meilleur des deux mondes. Il introduit une tête de bout en bout sans NMS facultative (nms=False, inaugurée dans YOLOv10), qui supprime le post-traitement NMS comme RTDETRv2, tout en offrant la vitesse inégalée d’un CNN.

YOLO26 intègre l’optimiseur MuSGD, inspiré des innovations en matière d’entraînement des LLM, pour une convergence extrêmement stable et rapide. Il offre également une inférence CPU jusqu’à 43 % plus rapide grâce à la suppression de Distribution Focal Loss (DFL). Ses fonctions de perte spécialisées ProgLoss + STAL améliorent considérablement la reconnaissance des petits objets. YOLO26 est donc le choix ultime pour tout pipeline moderne de vision par ordinateur.

Que tu choisisses YOLO11 pour sa polyvalence éprouvée, RTDETRv2 pour ses mécanismes d’attention ou YOLO26, à la pointe de la technologie, pour des performances optimales en périphérie, la documentation Ultralytics fournit toutes les ressources nécessaires à la réussite de ton projet de vision par ordinateur.

Commentaires