YOLO11 vs RTDETRv2#
Le domaine de la vision par ordinateur s’est rapidement développé, offrant aux développeurs une multitude de choix pour créer des applications de vision robustes. Dans le domaine de la détection d’objets en temps réel, le débat entre les réseaux neuronaux convolutifs (CNNs) et les Transformers de vision (ViTs) est plus présent que jamais. Cette comparaison technique examine deux architectures de premier plan : YOLO11, qui représente l’aboutissement des frameworks CNN hautement optimisés, et RTDETRv2, une évolution puissante de la famille des Detection Transformers.
En analysant leurs architectures, leurs indicateurs de performance et leurs scénarios de déploiement idéaux, ce guide vise à aider les ingénieurs en machine learning à prendre des décisions éclairées. Bien que les deux modèles repoussent les limites de la précision, les modèles Ultralytics YOLO offrent généralement un meilleur équilibre entre vitesse, prise en charge de l’écosystème et facilité d’utilisation pour la production dans le monde réel.
YOLO11 : la référence en matière de polyvalence pour les applications réelles#
Présenté par Ultralytics, YOLO11 s’appuie sur des années de recherche fondamentale pour fournir un modèle rapide, précis et incroyablement polyvalent. Il est conçu pour gérer nativement et de manière transparente la détection d’objets, la segmentation d’instances, la classification d’images, l’estimation de pose et l’extraction de boîtes englobantes orientées (OBB).
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : Dépôt Ultralytics
- Documentation : Documentation YOLO11
Architecture et atouts#
YOLO11 intègre un backbone CNN épuré et des pyramides de caractéristiques spatiales avancées, ce qui le rend exceptionnellement économe en ressources. Il s'épanouit dans les environnements soumis à des contraintes matérielles strictes, offrant une empreinte mémoire minimale lors de l'entraînement et de l'inférence. La Plateforme Ultralytics offre un support natif pour YOLO11, permettant un suivi de modèle rationalisé, une annotation de données et un entraînement dans le cloud sans avoir besoin d'assembler des outils MLOps hétérogènes.
Pour les développeurs qui ciblent l’informatique en périphérie, YOLO11 offre une latence extrêmement faible. Sa légèreté lui permet de fonctionner efficacement sur des appareils allant des Raspberry Pi aux téléphones mobiles grand public, ce qui en fait une référence pour le commerce intelligent, le contrôle qualité dans l’industrie et la gestion automatisée du trafic.
RTDETRv2 : les Transformers en temps réel de Baidu#
RTDETRv2 (Detection Transformer en temps réel, version 2) représente les efforts de Baidu pour rendre les architectures basées sur les Transformers adaptées aux tâches en temps réel. Il s’appuie sur le RT-DETR original en intégrant une approche de « bag-of-freebies » afin d’améliorer la précision de référence sans augmenter la latence d’inférence.
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Arxiv : 2407.17140
- GitHub : Dépôt RTDETRv2
- Documentation : README de RTDETRv2
Architecture et atouts#
Contrairement aux CNN traditionnels, RTDETRv2 utilise une architecture encodeur-décodeur dotée de mécanismes d’auto-attention, ce qui lui permet de capturer le contexte global d’une image. Cela est particulièrement avantageux dans les scènes encombrées, où les occultations sont fréquentes. RTDETRv2 élimine le besoin de suppression des non-maxima (NMS) lors du post-traitement et s’appuie plutôt sur l’appariement hongrois pendant l’entraînement pour effectuer un appariement biparti un-à-un.
Cependant, les modèles Transformer sont notoirement gourmands en mémoire VRAM et mémoire CUDA. Entraîner RTDETRv2 à partir de zéro ou l’affiner sur des jeux de données personnalisés nécessite souvent d’importants clusters de GPU haut de gamme, ce qui peut constituer un obstacle pour les petites équipes agiles, comparativement à la faible empreinte d’entraînement des modèles Ultralytics.
Analyse des performances et des métriques#
Lorsque nous évaluons ces modèles sur le jeu de données COCO standard, nous observons des compromis nets entre le nombre de paramètres, les FLOPs et la précision brute.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Décryptage des résultats#
Comme le montre le tableau, YOLO11 offre un rapport performance/taille remarquable. YOLO11x atteint un mAPval supérieur (54,7) à celui de RTDETRv2-x (54,3), tout en utilisant nettement moins de paramètres (56,9 M contre 76 M) et beaucoup moins de FLOPs de calcul (194,9 B contre 259 B).
De plus, les vitesses d’inférence de YOLO11 sur T4 TensorRT sont exceptionnellement élevées. YOLO11s termine l’inférence en seulement 2,5 ms, tandis que le plus petit modèle RTDETRv2-s nécessite 5,03 ms. YOLO11 constitue donc le choix idéal pour les flux d’analyse vidéo en temps réel à haute vitesse, lorsque le temps de traitement des images est le principal goulot d’étranglement.
Bien que RTDETRv2 atteigne une excellente précision grâce à ses couches d’attention, ces mécanismes évoluent de manière quadratique avec la résolution des images, ce qui entraîne une consommation accrue de VRAM pendant l’entraînement et l’inférence. YOLO11 contourne ce problème grâce à ses blocs convolutionnels extrêmement efficaces.
Écosystème d’entraînement et facilité d’utilisation#
Le principal avantage de l’adoption d’un modèle Ultralytics réside dans l’écosystème qui l’entoure. L’entraînement de RTDETRv2 implique souvent de parcourir des dépôts complexes de niveau recherche, d’ajuster des pondérations sophistiquées pour la fonction de perte d’appariement biparti et de gérer une importante surcharge mémoire.
À l’inverse, Ultralytics accorde une grande importance à l’expérience des développeurs. L’API Python unifiée masque le code répétitif, s’intègre parfaitement à des outils comme Weights & Biases pour le suivi des expériences et gère automatiquement les augmentations de données.
Voici à quel point il est simple d’entraîner et d’exporter un modèle avec le package ultralytics :
from ultralytics import YOLO
# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")
# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Utilize CUDA GPU
)
# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")Une fois entraîné, l’exportation d’un modèle YOLO11 vers des formats comme ONNX, OpenVINO ou CoreML ne nécessite qu’une seule commande, ce qui permet à ton pipeline de vision de s’adapter facilement à diverses plateformes matérielles.
N’oublie pas que RTDETRv2 se concentre exclusivement sur la détection de boîtes englobantes, tandis que l’architecture YOLO11 prend nativement en charge l’estimation de pose et la segmentation d’instances, ce qui te permet de regrouper plusieurs tâches de vision au sein d’une même famille de modèles.
Cas d'utilisation et recommandations#
Le choix entre YOLO11 et RT-DETR dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLO11#
YOLO11 est un choix particulièrement adapté pour :
- Déploiement edge en production : applications commerciales sur des appareils tels que Raspberry Pi ou NVIDIA Jetson, pour lesquelles la fiabilité et la maintenance active sont primordiales.
- Applications de vision multitâches : projets nécessitant la détection, la segmentation, l'estimation de pose et les OBB dans un framework unifié unique.
- Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production grâce à l'API Python Ultralytics simplifiée.
Quand choisir RT-DETR#
RT-DETR est recommandé pour :
- Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
- Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
- Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
Et maintenant : la puissance de YOLO26#
Bien que YOLO11 soit un excellent choix pour la production, les équipes à la recherche de la technologie la plus avancée devraient sérieusement envisager YOLO26. Sorti en janvier 2026, YOLO26 comble l’écart architectural en intégrant directement à son cœur une conception de bout en bout sans NMS (introduite pour la première fois dans YOLOv10), éliminant entièrement la latence du post-traitement et la complexité de la logique de déploiement.
YOLO26 introduit également plusieurs fonctionnalités révolutionnaires :
- Optimiseur MuSGD : Inspiré des techniques d’entraînement des LLM de Kimi K2 de Moonshot AI, cet hybride de SGD et de Muon garantit un entraînement extrêmement stable et une convergence nettement plus rapide.
- Suppression de DFL : La Distribution Focal Loss a été supprimée pour simplifier et épurer le processus d’exportation, améliorant considérablement la compatibilité avec les appareils edge basse consommation.
- ProgLoss + STAL : Ces fonctions de perte avancées offrent des améliorations notables pour la reconnaissance des petits objets, une exigence essentielle pour la surveillance par drone, le suivi agricole et les capteurs edge IoT.
- Jusqu’à 43 % d’inférence CPU plus rapide : Pour les déploiements dépourvus de GPU dédiés, YOLO26 est spécifiquement optimisé pour l’exécution sur CPU et surpasse largement les générations précédentes.
Pour découvrir un éventail plus large d’architectures, la documentation Ultralytics propose également des informations sur YOLOv8, le très répandu YOLOv5 et des modèles spécialisés comme YOLO-World pour les applications de détection à vocabulaire ouvert. En définitive, qu’il s’agisse de privilégier la stabilité éprouvée de YOLO11 ou les innovations de rupture de YOLO26, l’écosystème Ultralytics fournit des outils inégalés pour donner vie à tes solutions de vision par ordinateur.