Ultralytics YOLO27 :
Get Started

RTDETRv2 vs YOLOX#

Le paysage de la vision par ordinateur a rapidement évolué, offrant aux développeurs et aux chercheurs un éventail d’architectures parmi lesquelles choisir pour créer des systèmes de vision. Deux jalons importants de cette évolution sont RTDETRv2, basé sur un Transformer, et YOLOX, basé sur un CNN. Les deux modèles ont contribué de manière significative à la détection d’objets en temps réel, mais représentent des approches fondamentalement différentes de la reconnaissance visuelle.

Ce guide complet explore les subtilités architecturales, les métriques de performance et les scénarios de déploiement idéaux pour les deux modèles. Nous examinerons également comment les solutions modernes, comme le tout dernier Ultralytics YOLO26, s’appuient sur ces bases pour offrir une précision, une efficacité et une facilité d’utilisation supérieures.

RTDETRv2 : Transformers de détection en temps réel#

Présenté comme le successeur du RT-DETR original, RTDETRv2 exploite l’architecture Transformer pour assurer une détection d’objets en temps réel hautement performante. En éliminant le besoin de suppression non maximale (NMS), il simplifie le pipeline d’inférence.

Architecture et conception#

RTDETRv2 s’appuie fortement sur les mécanismes d’auto-attention propres aux Transformers, ce qui permet au modèle de saisir le contexte global de l’image entière. Cette compréhension globale lui permet de prédire directement les boîtes englobantes et les probabilités de classe. Il introduit des caractéristiques de détection multi-échelles qui améliorent sa capacité à reconnaître les petits objets dans les environnements encombrés.

Goulots d’étranglement des Transformers

Bien que les Transformers excellent dans la capture du contexte global, leurs mécanismes d’auto-attention évoluent de manière quadratique avec la longueur de séquence, entraînant souvent une consommation de mémoire CUDA nettement supérieure pendant l’entraînement à celle des CNN traditionnels.

Points forts et points faibles#

Le principal atout de RTDETRv2 réside dans sa conception native de bout en bout. En omettant NMS, il évite les pics de latence souvent associés aux prédictions denses qui se chevauchent. Cependant, l’empreinte de calcul importante de ses blocs Transformer exige des ressources GPU considérables, aussi bien pour l’entraînement que pour le déploiement. Il est donc moins adapté aux appareils en périphérie aux ressources limitées ou aux anciens appareils mobiles.

En savoir plus sur RTDETRv2

YOLOX : faire progresser les CNN sans ancres#

Conçu pour combler le fossé entre la recherche universitaire et les applications industrielles, YOLOX a introduit une tête découplée et une conception sans ancres dans la célèbre famille de modèles YOLO.

Architecture et conception#

YOLOX se démarque des détecteurs traditionnels basés sur des ancres en prédisant directement la position des objets, sans boîtes d’ancrage prédéfinies. Cela simplifie la conception du réseau et réduit le nombre de paramètres de réglage heuristiques nécessaires pour obtenir des performances optimales. De plus, YOLOX utilise une tête découplée qui sépare les tâches de classification et de régression, ce qui accélère la convergence pendant l’entraînement.

Points forts et points faibles#

La conception sans ancres de YOLOX le rend très adaptable à diverses tâches de vision par ordinateur et facilite son entraînement sur des jeux de données personnalisés. Ses variantes plus légères, comme YOLOX-Nano, sont bien adaptées au déploiement sur des microcontrôleurs et des appareils IoT à faible consommation. Cependant, comme YOLOX est antérieur à la révolution sans NMS, il repose encore sur le post-traitement traditionnel, ce qui peut compliquer le déploiement et accroître la latence dans les scènes denses.

En savoir plus sur YOLOX

Comparaison des performances et des métriques#

Pour comparer ces modèles, il est essentiel d’évaluer leur vitesse, leur précision et l’efficacité de leurs paramètres afin de déterminer celui qui convient le mieux à ton cas d’usage. Le tableau ci-dessous présente les performances de différentes tailles de modèles sur le jeu de données COCO standard.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Comme le montrent les données, RTDETRv2 atteint une précision maximale plus élevée (54,3 mAP) avec sa variante la plus grande que YOLOXx. YOLOX propose toutefois des variantes nettement plus petites et plus rapides, comme YOLOXs, qui compte moins de paramètres et offre des vitesses d’inférence plus élevées sur les GPU NVIDIA T4.

L’avantage Ultralytics : place à YOLO26#

RTDETRv2 et YOLOX offrent tous deux des avantages uniques, mais les développeurs d’aujourd’hui ont souvent besoin d’une solution unifiée qui combine le meilleur des deux mondes : une précision élevée, une inférence extrêmement rapide et un écosystème accessible. Le tout nouveau Ultralytics YOLO26 représente le sommet de cette évolution.

Principales innovations de YOLO26#

  • Conception de bout en bout sans NMS : s’appuyant sur des concepts introduits pour la première fois dans YOLOv10, YOLO26 propose une tête facultative sans NMS (nms=False). Elle offre une inférence fluide comme RTDETRv2, sans les énormes besoins en mémoire des Transformers.
  • Optimiseur MuSGD : inspiré des innovations dans l’entraînement des grands modèles de langage, l’optimiseur hybride MuSGD (combinant SGD et Muon) stabilise le processus d’entraînement et accélère considérablement la convergence.
  • Inférence CPU jusqu’à 43 % plus rapide : en supprimant stratégiquement le module Distribution Focal Loss (DFL), YOLO26 est spécialement optimisé pour l’informatique en périphérie et les appareils à faible consommation, ce qui le rend nettement plus rapide sur CPU que les versions précédentes comme YOLO11.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent sensiblement la reconnaissance des petits objets et répondent à un problème courant dans l’imagerie aérienne et les applications robotiques.

Polyvalence et écosystème inégalés#

Au-delà des performances brutes, l’Ultralytics Platform offre un écosystème complet, de la création à la production. Contrairement aux dépôts universitaires statiques, les modèles Ultralytics sont activement maintenus et prennent facilement en charge plusieurs tâches depuis une seule API intuitive. Que tu réalises de la segmentation d’instances, le suivi des poses grâce à l’estimation de pose ou le traitement d’objets pivotés avec des boîtes englobantes orientées (OBB), le workflow reste identique.

De plus, les modèles Ultralytics sont réputés pour leurs faibles besoins en mémoire pendant l’entraînement comme pendant l’inférence, ce qui permet aux chercheurs d’exécuter des lots plus volumineux sur du matériel grand public, contrairement à l’empreinte mémoire importante des architectures basées sur les Transformers.

Exemple de code d’entraînement#

La simplicité illustre au mieux la puissance de l’écosystème Ultralytics. L’entraînement d’un modèle YOLO26 de pointe ne demande que quelques lignes de code, qui masquent entièrement la complexité du chargement des données et de la configuration des hyperparamètres.

from ultralytics import YOLO

# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)

# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")

# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)

Applications concrètes et cas d'usage idéaux#

Le choix de l’architecture dépend entièrement de tes contraintes de déploiement et du matériel disponible.

Traitement cloud haute fidélité#

Si ton application s’exécute sur des GPU de serveur haut de gamme et privilégie une précision maximale, par exemple pour analyser des foules denses ou traiter des images médicales haute résolution, les mécanismes d’attention robustes de RTDETRv2 peuvent se révéler très efficaces.

Déploiement sur des appareils en périphérie anciens#

Pour les déploiements sur d’anciens téléphones mobiles ou des microcontrôleurs très limités, où un nombre minimal de FLOPs est indispensable, l’ultraléger YOLOX-Nano reste une solution de repli viable grâce à son architecture CNN simple.

La nouvelle norme : AIoT et robotique#

Pour la grande majorité des cas d’usage modernes, allant des infrastructures des villes intelligentes à l’analyse du commerce de détail et à la navigation autonome, Ultralytics YOLO26 est le choix incontournable. Son inférence CPU 43 % plus rapide le rend inégalé pour l’informatique en périphérie, tandis que sa tête facultative sans NMS fournit une latence faible et constante. Associé à la documentation complète et au soutien actif de la communauté de l’écosystème Ultralytics, il permet aux équipes de passer de l’annotation des jeux de données au déploiement mondial plus rapidement que jamais.

Simplifie ton workflow

Prêt à faire passer tes projets de vision par ordinateur au niveau supérieur ? Explore les fonctionnalités complètes de l’Ultralytics Platform pour gérer facilement les données, entraîner des modèles dans le cloud et déployer des applications intelligentes à grande échelle.

Si tu souhaites explorer d’autres architectures de l’écosystème Ultralytics, tu peux aussi découvrir YOLOv8, qui bénéficie d’intégrations communautaires bien établies, ou YOLOv5, pour une stabilité inégalée dans les anciens pipelines. Toutefois, pour repousser les limites du possible en 2026, YOLO26 reste la référence du secteur.

Commentaires