Ultralytics YOLO27 :
Get Started

YOLO11 vs RTDETRv2#

Le domaine de la vision par ordinateur s’est rapidement développé, offrant aux développeurs une multitude d’options pour créer des applications robustes fondées sur la vision. Dans le domaine de la détection d’objets en temps réel, le débat entre les réseaux neuronaux convolutifs (CNNs) et les Transformers de vision (ViTs) n’a jamais été aussi présent. Cette comparaison technique examine deux architectures de premier plan : YOLO11, qui représente le sommet des frameworks CNN hautement optimisés, et RTDETRv2, une version puissante de la famille Detection Transformer.

En analysant leurs architectures, leurs indicateurs de performance et leurs scénarios de déploiement idéaux, ce guide vise à aider les ingénieurs en machine learning à prendre des décisions éclairées. Bien que les deux modèles repoussent les limites de la précision, les modèles Ultralytics YOLO offrent généralement un meilleur équilibre entre vitesse, prise en charge de l’écosystème et facilité d’utilisation en production réelle.

YOLO11 : la référence en matière de polyvalence en conditions réelles#

Introduit par Ultralytics, YOLO11 s’appuie sur des années de recherche fondamentale pour proposer un modèle rapide, précis et incroyablement polyvalent. Il est conçu pour gérer facilement, de manière native, la détection d’objets, la segmentation d’instances, la classification d’images, l’estimation de pose et l’extraction de boîtes englobantes orientées (OBB).

Architecture et points forts#

YOLO11 est doté d’un backbone CNN affiné et de pyramides de caractéristiques spatiales avancées, ce qui le rend particulièrement économe en ressources. Il excelle dans les environnements soumis à de fortes contraintes matérielles et nécessite très peu de mémoire pendant l’entraînement comme pendant l’inférence. La plateforme Ultralytics prend en charge YOLO11 de manière native et simplifie ainsi la surveillance des modèles, l’annotation des données et l’entraînement dans le cloud, sans qu’il soit nécessaire de combiner des outils MLOps disparates.

Pour les développeurs qui ciblent l’informatique en périphérie, YOLO11 offre une latence extrêmement faible. Sa légèreté lui permet de fonctionner efficacement sur des appareils allant des Raspberry Pi aux téléphones mobiles grand public, ce qui en fait une référence pour le commerce intelligent, le contrôle qualité en fabrication et la gestion automatisée du trafic.

RTDETRv2 : les Transformers en temps réel de Baidu#

RTDETRv2 (version 2 de Real-Time Detection Transformer) est la tentative de Baidu de rendre les architectures fondées sur les Transformers viables pour les tâches en temps réel. Ce modèle reprend RT-DETR en y intégrant une approche de type « bag of freebies » afin d’améliorer la précision de référence sans augmenter la latence d’inférence.

En savoir plus sur RTDETRv2

Architecture et points forts#

Contrairement aux CNN traditionnels, RTDETRv2 utilise une architecture encodeur-décodeur avec des mécanismes d’attention personnelle, ce qui lui permet de saisir le contexte global d’une image. Cet atout est particulièrement utile dans les scènes encombrées, où les occultations sont fréquentes. RTDETRv2 élimine le besoin de suppression des non-maxima (NMS) lors du post-traitement et s’appuie plutôt sur l’appariement hongrois pendant l’entraînement pour effectuer un appariement biparti un-à-un.

Cependant, les modèles Transformer sont réputés pour leur forte consommation de mémoire VRAM et CUDA. Entraîner RTDETRv2 de zéro ou l’affiner sur des jeux de données personnalisés nécessite souvent de vastes clusters de GPU haut de gamme, ce qui peut constituer un obstacle pour les petites équipes agiles, contrairement à l’empreinte d’entraînement légère des modèles Ultralytics.

Analyse des performances et des indicateurs#

Lorsque nous évaluons ces modèles sur le jeu de données COCO standard, nous constatons des compromis évidents entre le nombre de paramètres, les FLOPs et la précision brute.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Analyse des résultats#

Comme le montre le tableau, YOLO11 offre un rapport performances/taille remarquable. YOLO11x atteint une mAPval supérieure (54,7) à celle de RTDETRv2-x (54,3), tout en utilisant nettement moins de paramètres (56,9 M contre 76 M) et bien moins de FLOPs (195,3 B contre 259 B).

De plus, les vitesses d’inférence de YOLO11 sur T4 avec TensorRT sont exceptionnelles. YOLO11s effectue l’inférence en seulement 2,5 ms, tandis que le plus petit RTDETRv2-s prend 5,03 ms. YOLO11 s’impose donc comme le choix de référence pour les flux d’analyse vidéo en temps réel à haute vitesse, où le temps de traitement des images constitue le principal goulot d’étranglement.

Le coût des Transformers

RTDETRv2 atteint une excellente précision grâce à ses couches d’attention, mais celles-ci évoluent de façon quadratique avec la résolution des images, ce qui entraîne une consommation accrue de VRAM pendant l’entraînement comme pendant l’inférence. YOLO11 évite ce problème grâce à ses blocs convolutionnels très efficaces.

Écosystème d’entraînement et facilité d’utilisation#

Le principal avantage d’adopter un modèle Ultralytics réside dans l’écosystème qui l’entoure. L’entraînement de RTDETRv2 implique souvent de naviguer dans des dépôts complexes de niveau recherche, d’ajuster des pondérations complexes pour les fonctions de perte d’appariement biparti et de gérer une importante surcharge mémoire.

À l’inverse, Ultralytics accorde une grande importance à l’expérience développeur. L’API Python unifiée masque le code répétitif, s’intègre facilement à des outils comme Weights & Biases pour le suivi des expériences et gère automatiquement les augmentations de données.

Voici à quel point il est simple d’entraîner et d’exporter un modèle avec le package ultralytics :

from ultralytics import YOLO

# Initialiser le modèle YOLO11 avec des poids pré-entraînés
model = YOLO("yolo11n.pt")

# Entraîner efficacement le modèle sur un GPU local ou une instance cloud
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Utiliser le GPU CUDA
)

# Exporter le modèle entraîné au format ONNX pour un déploiement à grande échelle
export_path = model.export(format="onnx")

Une fois entraîné, un modèle YOLO11 peut être exporté vers des formats tels que ONNX, OpenVINO ou CoreML à l’aide d’une seule commande, ce qui permet à ton pipeline de vision de s’adapter facilement à différents backends matériels.

Capacités multitâches

N’oublie pas que RTDETRv2 se concentre exclusivement sur la détection de boîtes englobantes, tandis que l’architecture YOLO11 prend nativement en charge la segmentation d’instances et l’estimation de pose, ce qui te permet de regrouper plusieurs tâches de vision dans une seule famille de modèles.

Cas d’utilisation et recommandations#

Le choix entre YOLO11 et RT-DETR dépend des besoins spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir YOLO11#

YOLO11 est un excellent choix pour :

  • Déploiement en périphérie en production : applications commerciales sur des appareils comme Raspberry Pi ou NVIDIA Jetson, où la fiabilité et la maintenance active sont primordiales.
  • Applications de vision multitâches : projets nécessitant la détection, la segmentation, l’estimation de pose et les OBB au sein d’un framework unifié.
  • Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production à l’aide de l’API Python Ultralytics simplifiée.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

Perspectives : la puissance de YOLO26#

YOLO11 est un excellent choix pour la production, mais les équipes qui recherchent la technologie la plus avancée devraient sérieusement envisager YOLO26. Sorti en janvier 2026, YOLO26 comble le fossé architectural en intégrant directement à son cœur une tête de bout en bout sans NMS facultative (nms=False, introduite pour la première fois dans YOLOv10), ce qui élimine la latence du post-traitement NMS et la complexité de la logique de déploiement.

YOLO26 introduit également plusieurs fonctionnalités révolutionnaires :

  • Optimiseur MuSGD : inspiré des techniques d’entraînement des LLM employées pour Kimi K2 de Moonshot AI, cet hybride de SGD et de Muon garantit un entraînement extrêmement stable et une convergence nettement plus rapide.
  • Suppression du DFL : la Distribution Focal Loss a été supprimée pour simplifier le processus d’exportation et améliorer considérablement la compatibilité avec les appareils en périphérie à faible puissance.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent considérablement la reconnaissance des petits objets, indispensable pour la surveillance par drone, le suivi agricole et les capteurs IoT en périphérie.
  • Jusqu’à 43 % d’inférence CPU plus rapide : YOLO26 est spécialement optimisé pour une exécution sur CPU dans les déploiements sans GPU dédié, et surpasse largement les générations précédentes.

Pour découvrir un éventail plus large d’architectures, la documentation Ultralytics présente également YOLOv8, le très répandu YOLOv5 et des modèles spécialisés comme YOLO-World pour les applications de détection à vocabulaire ouvert. En définitive, que tu privilégies la stabilité éprouvée de YOLO11 ou les innovations révolutionnaires de YOLO26, l’écosystème Ultralytics fournit des outils inégalés pour concrétiser tes solutions de vision par ordinateur.

Commentaires