Ultralytics YOLO27 :
Get Started

YOLOX vs RTDETRv2#

Choisir l’architecture optimale pour les applications de vision par ordinateur nécessite de trouver le juste équilibre entre précision, vitesse d’inférence et faisabilité du déploiement. Dans cette analyse technique approfondie, nous étudions les différences fondamentales entre YOLOX, une architecture CNN sans ancres très performante, et RTDETRv2, un Transformer de détection en temps réel à la pointe de la technologie.

Bien que les deux modèles aient contribué de manière importante au domaine de la détection d’objets, les développeurs qui conçoivent des applications prêtes pour la production constatent souvent que les solutions modernes comme Ultralytics YOLO26 offrent un entraînement plus efficace, des besoins en mémoire réduits et un écosystème de déploiement plus robuste.

YOLOX : rapprocher la recherche de l’industrie#

YOLOX s’est imposé comme une adaptation sans ancres très populaire de la série YOLO, avec une conception simplifiée qui offrait des gains de performance impressionnants à sa sortie.

Innovations architecturales#

YOLOX a fait passer la famille YOLO à une approche sans ancres, en intégrant une tête découplée et la stratégie avancée d’affectation des étiquettes SimOTA. En éliminant les boîtes d’ancrage, l’architecture a considérablement réduit le nombre de paramètres de conception et amélioré la généralisation sur divers jeux de données de référence. Ses versions légères, YOLOX-Nano et YOLOX-Tiny, sont devenues des choix populaires pour le déploiement d’applications d’IA visuelle sur des appareils en périphérie.

Considérations liées à l’héritage

YOLOX a apporté des avancées notables, mais sa dépendance à des pipelines d’augmentation lourds et à d’anciennes méthodes de post-traitement (comme la NMS traditionnelle) peut entraîner une latence plus élevée que celle des modèles nativement de bout en bout.

En savoir plus sur YOLOX

RTDETRv2 : faire progresser les Transformers visuels en temps réel#

S’appuyant sur les bases posées par son prédécesseur, RTDETRv2 tire parti des Transformers visuels (ViTs) pour obtenir une précision très compétitive sans sacrifier la vitesse d’inférence en temps réel.

  • Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
  • Organisation : Baidu
  • Date : 2024-07-24
  • Liens : Arxiv, GitHub

Innovations architecturales#

RTDETRv2 repense fondamentalement le pipeline de détection en utilisant une architecture fondée sur les Transformers qui contourne nativement la suppression non maximale (NMS). Pour cela, il s’appuie sur un encodeur hybride et une sélection des requêtes sensible à l’IoU, qui améliore l’initialisation des requêtes d’objets. Le modèle traite efficacement les caractéristiques mult échelles, ce qui lui permet de saisir des détails complexes dans des environnements difficiles, comme la détection de véhicules dans des vidéos de nuit.

Cependant, les Transformers nécessitent intrinsèquement beaucoup de ressources. L’entraînement de RTDETRv2 demande généralement beaucoup plus de mémoire GPU et de cycles de calcul que les solutions basées sur des CNN, ce qui peut constituer un obstacle pour les équipes aux budgets serrés ou qui doivent effectuer fréquemment le réglage des modèles.

En savoir plus sur RTDETRv2

Tableau comparatif des performances#

Pour évaluer objectivement ces architectures, nous examinons leurs performances sur le jeu de données COCO. Le tableau ci-dessous présente les compromis entre précision (mAP), nombre de paramètres et complexité de calcul.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

RTDETRv2 offre une précision impressionnante, mais YOLOX conserve un avantage grâce à ses profils légers en paramètres, en particulier dans ses variantes Nano et Tiny.

Cas d’utilisation et recommandations#

Le choix entre YOLOX et RT-DETR dépend des exigences propres à ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir YOLOX#

YOLOX est un excellent choix pour :

  • Recherche sur la détection sans ancres : recherche universitaire qui utilise l’architecture épurée sans ancres de YOLOX comme référence pour expérimenter de nouvelles têtes de détection ou fonctions de perte.
  • Appareils périphériques ultralégers : déploiement sur des microcontrôleurs ou du matériel mobile ancien, où l’empreinte extrêmement réduite (0,91 M de paramètres) de la variante YOLOX-Nano est essentielle.
  • Études sur l’assignation d’étiquettes SimOTA : projets de recherche qui étudient les stratégies d’assignation d’étiquettes basées sur le transport optimal et leur impact sur la convergence de l’entraînement.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics : YOLO26#

Bien que YOLOX et RTDETRv2 aient chacun leurs points forts, le nouveau modèle Ultralytics YOLO26 redéfinit l’état de l’art en IA visuelle en résolvant les compromis historiques entre vitesse, précision et facilité de déploiement.

1. Architecture de bout en bout sans NMS#

S’inspirant des modèles Transformer tout en conservant l’efficacité des CNN, YOLO26 propose une architecture de bout en bout sans NMS facultative (nms=False). En éliminant la suppression non maximale lors du post-traitement, YOLO26 simplifie considérablement les pipelines de déploiement et garantit une latence d’inférence constante sur différents appareils en périphérie, sans les réglages complexes de seuils.

2. Inférence CPU jusqu’à 43 % plus rapide#

Contrairement aux architectures Transformer comme RTDETRv2, qui s’appuient fortement sur des GPU haut de gamme, YOLO26 est spécialement optimisé pour les environnements d’informatique en périphérie. La suppression de la perte focale de distribution (DFL) simplifie l’exportation du modèle et permet à YOLO26 d’accélérer l’inférence CPU jusqu’à 43 %, ce qui en fait le choix idéal pour une intégration sur du matériel comme le Raspberry Pi ou des appareils mobiles standards.

3. Efficacité de l’entraînement avec MuSGD#

L’entraînement de modèles Transformer entraîne souvent une consommation excessive de mémoire CUDA et des durées d’entraînement prolongées. YOLO26 introduit le nouvel optimiseur MuSGD, qui combine la descente de gradient stochastique et l’optimiseur Muon inspiré des LLM. Cette innovation offre un entraînement particulièrement stable et une convergence plus rapide, tout en réduisant considérablement les besoins matériels par rapport à RTDETRv2.

4. Écosystème et polyvalence inégalés#

L’écosystème Ultralytics offre une expérience de développement intuitive et fluide. Grâce à une documentation complète, à une communauté active et à la plateforme Ultralytics propulsée par le cloud, gérer l’ensemble du cycle de vie de l’IA n’a jamais été aussi simple. De plus, YOLO26 est très polyvalent. Alors que RTDETRv2 se concentre sur la détection d’objets, YOLO26 prend nativement en charge et sans difficulté la segmentation d’instances, la classification d’images, l’estimation de pose et les tâches de boîtes englobantes orientées (OBB). Grâce à ProgLoss + STAL (perte progressive et affectation des étiquettes tenant compte des petites cibles), YOLO26 excelle aussi dans la reconnaissance des petits objets, une fonctionnalité essentielle pour l’imagerie aérienne et la détection de défauts industriels.

Autres modèles pris en charge

Le framework Ultralytics prend également en charge les modèles de la génération précédente, YOLO11 et YOLOv8, ce qui permet aux utilisateurs d’évaluer facilement leurs anciens pipelines et de migrer vers de nouveaux modèles.

Intégration fluide avec Ultralytics#

Le déploiement de modèles ne devrait pas t’obliger à te débattre avec des bases de code complexes et fragmentées. L’API Python Ultralytics te permet de charger, d’entraîner et d’exporter des modèles de pointe en quelques lignes de code seulement.

from ultralytics import YOLO

# Charger le dernier modèle YOLO26 nano pour des performances optimales en périphérie
model = YOLO("yolo26n.pt")

# Entraîner le modèle sur ton jeu de données personnalisé avec une utilisation minimale de mémoire
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valider les performances du modèle
metrics = model.val()

# Exporter facilement vers ONNX ou TensorRT pour le déploiement
model.export(format="onnx")

En utilisant Ultralytics, tu évites les configurations d’environnement complexes généralement associées aux dépôts de recherche, ce qui accélère ta mise sur le marché.

Conclusion#

YOLOX et RTDETRv2 marquent des étapes importantes dans l’évolution de la détection d’objets en temps réel. YOLOX a démontré la viabilité des CNN sans ancres très efficaces, tandis que RTDETRv2 a adapté avec succès les Transformers aux contraintes du temps réel.

Cependant, pour les applications modernes allant de l’analyse intelligente du commerce de détail à la robotique embarquée, Ultralytics YOLO26 constitue la solution de référence. En associant une inférence sans NMS à des vitesses CPU inégalées, une empreinte mémoire réduite et le soutien solide de la plateforme Ultralytics, YOLO26 permet aux développeurs de créer la prochaine génération de systèmes de vision par ordinateur fiables et performants.

Commentaires