RTDETRv2 vs YOLOv5#
L'évolution de la vision par ordinateur a été largement guidée par la recherche constante d'un équilibre entre précision et vitesse d'inférence en temps réel. Comparer RTDETRv2 et Ultralytics YOLOv5 revient essentiellement à mettre en balance les capacités sophistiquées de contexte global des architectures Transformer et l'efficacité hautement optimisée et éprouvée des réseaux neuronaux convolutifs (CNN).
Ce guide présente une analyse technique approfondie de ces deux architectures majeures. Il détaille leurs métriques de performance, leurs méthodes d'entraînement, leurs besoins en mémoire et leurs scénarios de déploiement idéaux pour t'aider à choisir le meilleur modèle de détection d'objets pour ton cas d'utilisation.
RTDETRv2 : l’approche transformer pour la détection en temps réel#
En s'appuyant sur le Transformer de détection en temps réel (RT-DETR) original, RTDETRv2 introduit une série de « bag-of-freebies » pour améliorer l'architecture de base sans sacrifier sa latence d'inférence.
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Liens : Article Arxiv, dépôt GitHub
Architecture et capacités#
RTDETRv2 exploite une architecture hybride CNN-Transformer. Le CNN sert de backbone pour extraire des caractéristiques visuelles détaillées, tandis que les couches encodeur-décodeur Transformer traitent l'ensemble de la carte de caractéristiques afin de comprendre le contexte global. RTDETRv2 se distingue notamment par son fonctionnement de bout en bout, qui élimine entièrement le besoin de post-traitement par suppression non maximale (NMS).
RTDETRv2 atteint une précision impressionnante, particulièrement dans les scènes complexes et denses où les objets se chevauchent, mais cela implique des compromis notables. Le mécanisme d'attention inhérent aux Transformers exige beaucoup plus de mémoire CUDA pendant l'entraînement que les CNN classiques. De plus, même s'il fonctionne bien sur les GPU haut de gamme comme les NVIDIA A100 ou T4, son architecture est nettement plus lente sur les CPU standard et fortement limitée sur les appareils edge.
Ultralytics YOLOv5 : la référence du secteur en matière d’efficacité#
À sa sortie, Ultralytics YOLOv5 a profondément transformé le paysage de l'apprentissage automatique appliqué en rendant la vision par ordinateur haute performance accessible aux développeurs du monde entier grâce à un framework particulièrement intuitif.
- Auteur : Glenn Jocher
- Organisation : Ultralytics
- Date : 26 juin 2020
- Liens : Documentation officielle, Dépôt GitHub
Équilibre entre écosystème et performances#
YOLOv5 repose entièrement sur le framework PyTorch et utilise une architecture CNN extrêmement efficace. Il a été conçu dès le départ pour être facile à utiliser, avec une API simplifiée et l'une des documentations les plus complètes du secteur de l'IA.
Le principal atout de YOLOv5 réside dans sa polyvalence inégalée et ses faibles besoins en mémoire. L'entraînement d'un modèle YOLOv5 nécessite beaucoup moins de VRAM que celui des modèles basés sur des Transformers, ce qui le rend accessible aux chercheurs et aux ingénieurs disposant d'un budget matériel limité. De plus, alors que RTDETRv2 se concentre exclusivement sur la détection de boîtes englobantes, YOLOv5 est devenu un modèle polyvalent qui prend en charge la segmentation d'instances et la classification d'images.
Pour profiter d'un flux de travail parfaitement simplifié, tu peux entraîner, valider et déployer YOLOv5 directement depuis la plateforme Ultralytics. La plateforme propose des fonctionnalités d'entraînement dans le cloud et des pipelines de déploiement sans code.
Comparaison des performances et des métriques#
L'analyse des performances brutes sur le jeu de données COCO standard met clairement en évidence les différences de priorités entre ces modèles en matière de ressources.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Analyse des compromis#
Les données montrent que RTDETRv2-x atteint une précision moyenne moyenne (mAP) maximale de 54,3 %, dépassant légèrement les 50,7 % de YOLOv5x. Ce léger gain de précision a toutefois un coût de calcul considérable. YOLOv5x présente une latence plus faible (11,89 ms contre 15,03 ms sur TensorRT) et n'utilise qu'une fraction de la mémoire. Pour les déploiements edge à très faible consommation, YOLOv5n (Nano) reste inégalé : il réalise ses inférences en seulement 1,12 ms avec un minuscule modèle de 1,9 million de paramètres, un niveau auquel RTDETRv2 ne cherche même pas à rivaliser.
Efficacité de l'entraînement et simplicité du code#
L'API unifiée est l'un des principaux atouts de l'écosystème Ultralytics. Même si tu choisis d'utiliser l'architecture Transformer de RT-DETR pour une tâche exigeante en calcul, tu peux le faire entièrement dans le package Python Ultralytics et changer de modèle en toute simplicité avec une seule ligne de code.
from ultralytics import RTDETR, YOLO
# Charger le petit modèle Ultralytics YOLOv5
model_yolo = YOLO("yolov5su.pt") # YOLOv5u : poids YOLOv5 sans ancres pour le package ultralytics
# Charger le grand modèle RT-DETR via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")
# Entraîner YOLOv5 facilement sur tes données personnalisées
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exécuter facilement l'inférence avec les deux modèles
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo[0].show()En utilisant la bibliothèque Ultralytics, les développeurs accèdent automatiquement à un écosystème bien entretenu qui comprend des intégrations de suivi des expériences (comme Weights & Biases et Comet ML), ainsi que des exports en un clic vers des formats de déploiement comme ONNX et OpenVINO.
Applications concrètes et cas d'usage idéaux#
Les points forts de RTDETRv2#
RTDETRv2 convient particulièrement aux environnements sans aucune limite matérielle, où l'objectif unique est d'obtenir la précision maximale possible.
- Imagerie médicale côté serveur : détecter des anomalies microscopiques sur des radiographies haute résolution.
- Imagerie satellite : suivre des objets denses qui se chevauchent dans des tâches de surveillance aérienne exécutées sur de puissants clusters cloud.
Les points forts de YOLOv5#
YOLOv5 est sans conteste le modèle de référence pour les déploiements pratiques en conditions réelles sur des matériels variés.
- Appareils d'IA en périphérie : déployer des systèmes d'alarme de sécurité sur des appareils Raspberry Pi ou NVIDIA Jetson où la mémoire est strictement limitée.
- Applications mobiles : exécuter rapidement l'inférence de boîtes englobantes et de segmentation en temps réel, directement sur les smartphones via CoreML ou LiteRT.
- Fabrication industrielle à grande vitesse : inspecter des pièces sur des lignes de production rapides où une latence de l'ordre de la milliseconde est essentielle à la réussite des opérations.
YOLOv5 est un modèle légendaire, mais l'écosystème Ultralytics continue de repousser les limites de l'IA. Si tu compares des modèles pour un nouveau projet en 2026, pense à découvrir Ultralytics YOLO26, à la pointe de la technologie. YOLO26 intègre une conception native de bout en bout sans NMS grâce à sa tête facultative un-à-un (nms=False), semblable à celle des Transformers mais aussi rapide qu'un CNN, ainsi que le révolutionnaire optimiseur MuSGD, qui garantit un entraînement particulièrement stable, et offre une inférence CPU jusqu'à 43 % plus rapide. Autre possibilité, YOLO11 reste un excellent modèle très bien pris en charge pour les déploiements polyvalents nécessitant l'estimation de pose et la détection OBB.
En définitive, RTDETRv2 repousse les limites de la précision grâce aux couches Transformer, mais le framework Ultralytics YOLO offre un équilibre inégalé entre vitesse, faibles besoins en mémoire et expérience de développement brillamment conçue, réduisant considérablement le délai entre le prototype et la production.