RTDETRv2 vs YOLO11#
Le paysage de la vision par ordinateur évolue constamment, de nouvelles architectures repoussant les limites de ce qui est possible sur les appareils edge et les serveurs cloud. Deux des principaux concurrents actuels dans le domaine de la détection d'objets en temps réel sont RTDETRv2 et YOLO11. Bien que les deux modèles offrent des performances exceptionnelles, ils représentent des philosophies architecturales fondamentalement différentes : l'approche basée sur les Transformers et le réseau neuronal convolutif (CNN) hautement optimisé.
Dans cette comparaison technique complète, nous examinerons les architectures, les métriques de performance, les méthodologies d'entraînement et les cas d'utilisation idéaux de ces deux modèles, afin de t'aider à prendre une décision éclairée pour ta prochaine application d'intelligence artificielle.
RTDETRv2 : le challenger basé sur les Transformers#
Présenté comme une évolution du Transformer de détection en temps réel d'origine, RTDETRv2 s'appuie sur des mécanismes d'attention pour traiter les données visuelles. En traitant les portions d'image comme des séquences, il acquiert une compréhension globale du contexte de l'image, ce qui est particulièrement utile pour détecter des objets fortement superposés dans des scènes complexes.
Détails du modèle :
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Arxiv : 2407.17140
- GitHub : Dépôt RT-DETR
- Documentation : Documentation de RTDETRv2
Forces et faiblesses architecturales#
L'innovation principale de RTDETRv2 réside dans son architecture de bout en bout sans NMS. En éliminant la suppression des non-maxima (NMS), elle simplifie le pipeline de post-traitement. De plus, ses capacités d'extraction de caractéristiques multi-échelles ont été améliorées par rapport au modèle RT-DETR d'origine, ce qui lui permet de mieux identifier les objets de tailles variées.
Cependant, comme il repose sur des Transformers, RTDETRv2 nécessite généralement beaucoup plus de mémoire pendant l'entraînement. Les Transformers convergent généralement plus lentement et nécessitent beaucoup plus de mémoire CUDA que les CNN traditionnels, ce qui les rend moins accessibles aux chercheurs travaillant avec du matériel grand public ou déployant leurs modèles dans des environnements d'IA edge aux ressources limitées.
Ultralytics YOLO11 : le summum de l'efficacité des CNN#
S'appuyant sur des années de recherche fondamentale, Ultralytics a lancé YOLO11, qui représente une avancée majeure dans la lignée YOLO. Il affine l'architecture CNN pour atteindre une vitesse et une précision sans précédent, tout en conservant la flexibilité et l'écosystème convivial pour les développeurs auxquels la communauté s'attend désormais.
Détails du modèle :
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 27 septembre 2024
- GitHub : Dépôt Ultralytics
L'avantage Ultralytics#
YOLO11 se distingue par son équilibre des performances. Il offre un compromis exceptionnel entre vitesse et précision, ce qui le rend particulièrement polyvalent pour diverses situations de déploiement réelles, des clusters massifs de cloud computing aux appareils mobiles légers.
De plus, les modèles Ultralytics YOLO sont réputés pour leur faible utilisation de la mémoire pendant l'entraînement et l'inférence. Contrairement aux modèles Transformer, qui peuvent facilement épuiser la VRAM, YOLO11 permet d'utiliser des tailles de lot plus importantes sur des GPU standard. En outre, YOLO11 ne se limite pas à la simple détection d'objets : il offre une polyvalence remarquable, avec une prise en charge native de la segmentation d'instances, de la classification d'images, de l'estimation de pose et des boîtes englobantes orientées (OBB).
Comparaison des performances et des métriques#
Lorsque l'on compare les chiffres bruts, il apparaît clairement que, si RTDETRv2 atteint une précision impressionnante, YOLO11 offre une sélection de tailles de modèles beaucoup plus granulaire, avec des vitesses d'inférence supérieures, notamment sur TensorRT.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Comme le montre le tableau, le modèle YOLO11x atteint un mAPval supérieur de 54,7 %, tout en utilisant moins de FLOPs (194.9B contre 259B) et en offrant une inférence plus rapide sur TensorRT (11.3ms contre 15.03ms) que la variante RTDETRv2-x. Les variantes nano et small de YOLO11 offrent des options légères inégalées pour les appareils aux ressources limitées, comme le Raspberry Pi.
Écosystème, facilité d'utilisation et entraînement#
La caractéristique distinctive des modèles Ultralytics est leur expérience utilisateur fluide. Le paquet Python ultralytics fournit une API unifiée et intuitive qui prend en charge les tâches complexes d'augmentation des données, l'entraînement distribué et l'exportation des modèles. Alors que le dépôt de recherche de RTDETRv2 nécessite une quantité importante de code et de configuration répétitifs, Ultralytics fournit un pipeline permettant de passer de zéro à expert.
Fait intéressant, l'écosystème Ultralytics est si robuste qu'il prend nativement en charge l'exécution de modèles RT-DETR aux côtés des modèles YOLO ! Tu peux ainsi tirer parti de l'écosystème bien maintenu d'Ultralytics, notamment de ses intégrations avec Weights & Biases et Comet ML, pour suivre tes expériences sans effort.
from ultralytics import RTDETR, YOLO
# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")
# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")L'efficacité de l'entraînement est primordiale en apprentissage automatique. Les modèles Ultralytics utilisent des poids pré-entraînés qui convergent rapidement. Pour gérer tes jeux de données, tes exécutions d'entraînement et tes points de terminaison de déploiement sans écrire de code, découvre la plateforme Ultralytics pour bénéficier d'une expérience MLOps intégrée.
Applications concrètes#
Le choix entre ces architectures dépend souvent des contraintes de déploiement spécifiques à ton projet.
Cas où RTDETRv2 excelle : Le backbone Transformer de RTDETRv2 est particulièrement efficace dans les scénarios comportant des objets denses et fortement occultés, où le contexte global est nécessaire. Il est souvent évalué dans le cadre de recherches universitaires et d'applications où le budget de calcul est moins important que la cartographie brute des relations fondée sur l'attention.
Cas où YOLO11 domine : YOLO11 est le champion incontesté du déploiement pratique dans le monde réel. Son empreinte mémoire minimale et ses vitesses d'inférence fulgurantes le rendent idéal pour :
- Fabrication intelligente : exécuter une détection des défauts en temps réel sur des lignes de production à l'aide de PC industriels.
- Agriculture : déployer le modèle sur des drones pour surveiller en temps réel la santé des cultures et piloter des robots de récolte automatisés.
- Analyse de la vente au détail : traiter simultanément plusieurs flux de caméras pour gérer les files d'attente et suivre les stocks, sans nécessiter d'immenses fermes de serveurs.
Cas d'utilisation et recommandations#
Le choix entre RT-DETR et YOLO11 dépend de tes exigences spécifiques, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.
Quand choisir RT-DETR#
RT-DETR est un choix pertinent pour :
- Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
- Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
- Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.
Quand choisir YOLO11#
YOLO11 est recommandé pour :
- Déploiement edge en production : applications commerciales sur des appareils tels que Raspberry Pi ou NVIDIA Jetson, pour lesquelles la fiabilité et la maintenance active sont primordiales.
- Applications de vision multitâches : projets nécessitant la détection, la segmentation, l'estimation de pose et les OBB dans un framework unifié unique.
- Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production grâce à l'API Python Ultralytics simplifiée.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
Perspectives : l'arrivée de YOLO26#
Si tu démarres un nouveau projet, tu devrais également envisager la prochaine génération de l'IA pour la vision : Ultralytics YOLO26. Lancé en janvier 2026, YOLO26 réunit le meilleur des deux mondes. Il introduit une conception de bout en bout sans NMS (d'abord mise au point dans YOLOv10), éliminant complètement la latence du post-traitement comme RTDETRv2, tout en offrant la vitesse inégalée d'un CNN.
YOLO26 intègre l'optimiseur MuSGD — inspiré des innovations de l'entraînement des LLM — pour une convergence extrêmement stable et rapide, et offre jusqu'à 43 % d'inférence plus rapide sur CPU en supprimant la perte focale de distribution (DFL). Grâce à ses fonctions de perte spécialisées ProgLoss + STAL, qui améliorent considérablement la reconnaissance des petits objets, YOLO26 constitue la recommandation ultime pour tout pipeline moderne de vision par ordinateur.
Que tu choisisses YOLO11 pour sa polyvalence éprouvée, RTDETRv2 pour ses mécanismes d'attention ou YOLO26, à la pointe de la technologie, pour des performances ultimes sur les appareils edge, la documentation Ultralytics fournit toutes les ressources nécessaires pour réussir ton projet de vision par ordinateur.