Ultralytics YOLO27 :

Comparaison entre YOLOX et RTDETRv2#

Choisir l'architecture optimale pour les applications de vision par ordinateur nécessite de trouver un équilibre précis entre la précision, la vitesse d'inférence et la faisabilité du déploiement. Dans cette analyse technique complète, nous examinons les différences fondamentales entre YOLOX, une architecture CNN sans ancres particulièrement performante, et RTDETRv2, un Transformer de détection en temps réel de pointe.

Bien que les deux modèles aient apporté des contributions importantes au domaine de la détection d'objets, les développeurs qui créent des applications prêtes pour la production constatent souvent que des alternatives modernes comme Ultralytics YOLO26 offrent une meilleure efficacité d'entraînement, des besoins en mémoire réduits et un écosystème de déploiement plus robuste.

YOLOX : combler le fossé entre la recherche et l'industrie#

YOLOX s'est imposé comme une adaptation sans ancres très populaire de la série YOLO, en introduisant une conception simplifiée qui offrait des améliorations impressionnantes des performances au moment de sa sortie.

Innovations architecturales#

YOLOX a fait passer la famille YOLO à un paradigme sans ancres, en intégrant une tête découplée et la stratégie avancée d'affectation des labels SimOTA. En éliminant les boîtes d'ancrage, l'architecture a considérablement réduit le nombre de paramètres de conception et amélioré la généralisation sur différents jeux de données de référence. Ses versions légères, YOLOX-Nano et YOLOX-Tiny, sont devenues des choix populaires pour déployer des applications d'IA visuelle sur des appareils edge.

Considérations liées aux modèles historiques

Bien que YOLOX ait apporté des avancées notables, sa dépendance à des pipelines d'augmentation lourds et à d'anciennes routines de post-traitement (comme la NMS traditionnelle) peut entraîner une latence supérieure à celle des modèles nativement de bout en bout.

En apprends plus sur YOLOX

RTDETRv2 : faire progresser les Transformers de vision en temps réel#

S'appuyant sur les bases de son prédécesseur, RTDETRv2 exploite la puissance des Transformers de vision (ViTs) pour atteindre une précision très compétitive sans sacrifier les vitesses d'inférence en temps réel.

  • Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
  • Organisation : Baidu
  • Date : 2024-07-24
  • Liens : Arxiv, GitHub

Innovations architecturales#

RTDETRv2 repense fondamentalement le pipeline de détection en utilisant une architecture basée sur un Transformer qui contourne nativement la suppression des maxima non locaux (NMS). Cela repose sur un encodeur hybride et une sélection des requêtes tenant compte de l'IoU, ce qui améliore l'initialisation des requêtes d'objets. Le modèle gère efficacement les caractéristiques multi-échelles, ce qui lui permet de capturer des détails complexes dans des environnements difficiles, comme la détection dans des vidéos de circulation nocturnes.

Cependant, les Transformers sont par nature gourmands en ressources. L'entraînement de RTDETRv2 nécessite généralement beaucoup plus de mémoire GPU et de cycles de calcul que les alternatives basées sur des CNN, ce qui peut constituer un obstacle pour les équipes soumises à des contraintes budgétaires strictes ou ayant besoin d'effectuer fréquemment un ajustement du modèle.

ultralytics-translation-0

Tableau comparatif des performances#

Pour évaluer objectivement ces architectures, nous examinons leurs performances sur le jeu de données COCO. Le tableau ci-dessous illustre les compromis entre la précision (mAP), le nombre de paramètres et la complexité de calcul.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Bien que RTDETRv2 atteigne une précision impressionnante, YOLOX conserve un avantage en matière de nombre réduit de paramètres, notamment avec ses variantes Nano et Tiny.

Cas d'utilisation et recommandations#

Le choix entre YOLOX et RT-DETR dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir YOLOX#

YOLOX est un choix solide pour :

  • Recherche sur la détection sans ancres : La recherche universitaire utilisant l’architecture sans ancres claire de YOLOX comme référence pour expérimenter de nouvelles têtes de détection ou fonctions de perte.
  • Appareils edge ultralégers : Le déploiement sur des microcontrôleurs ou du matériel mobile ancien, lorsque l’empreinte extrêmement réduite de la variante YOLOX-Nano (0.91M paramètres) est essentielle.
  • Études sur l’attribution des labels SimOTA : Les projets de recherche qui étudient les stratégies d’attribution de labels fondées sur le transport optimal et leur impact sur la convergence de l’entraînement.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
  • Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
  • Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :

  • Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.

L'avantage d'Ultralytics : YOLO26#

Bien que YOLOX et RTDETRv2 offrent chacun des atouts distincts, le nouveau Ultralytics YOLO26 redéfinit l'état de l'art en IA visuelle en résolvant les compromis historiques entre vitesse, précision et facilité de déploiement.

1. Architecture de bout en bout sans NMS#

S'inspirant des modèles Transformer tout en conservant l'efficacité des CNN, YOLO26 intègre une conception nativement de bout en bout et sans NMS. En éliminant la suppression des maxima non locaux comme étape de post-traitement, YOLO26 simplifie considérablement les pipelines de déploiement et garantit une latence d'inférence cohérente sur différents appareils edge, sans la surcharge liée au réglage complexe des seuils.

2. Inférence CPU jusqu'à 43 % plus rapide#

Contrairement aux architectures Transformer comme RTDETRv2, qui dépendent fortement de GPU haut de gamme, YOLO26 est spécifiquement optimisé pour les environnements d'edge computing. Grâce à la suppression de la Distribution Focal Loss (DFL), YOLO26 simplifie l'exportation des modèles et atteint une inférence CPU jusqu'à 43 % plus rapide, ce qui en fait le choix idéal pour l'intégration sur du matériel comme le Raspberry Pi ou sur des appareils mobiles standard.

3. Efficacité d'entraînement avec MuSGD#

L'entraînement de modèles Transformer entraîne souvent une consommation excessive de mémoire CUDA et des durées d'entraînement prolongées. YOLO26 introduit le nouvel optimiseur MuSGD, un hybride de la descente de gradient stochastique et de l'optimiseur Muon inspiré des LLM. Cette innovation offre un entraînement exceptionnellement stable et une convergence plus rapide, tout en réduisant considérablement les besoins matériels par rapport à RTDETRv2.

4. Un écosystème et une polyvalence inégalés#

L'écosystème Ultralytics offre une expérience développeur intuitive et rationalisée. Grâce à une documentation complète, à une communauté active et à l'Ultralytics Platform propulsée par le cloud, la gestion de l'ensemble du cycle de vie de l'IA n'a jamais été aussi simple. De plus, YOLO26 est très polyvalent. Alors que RTDETRv2 se concentre sur la détection d'objets, YOLO26 prend nativement en charge la segmentation d'instances, l'estimation de pose, la classification d'images et les tâches de boîte englobante orientée (OBB). Renforcé par les nouvelles fonctions de perte ProgLoss + STAL, YOLO26 excelle également dans la reconnaissance des petits objets, une fonctionnalité essentielle pour l'imagerie aérienne et la détection de défauts industriels.

Autres modèles pris en charge

Le framework Ultralytics prend également en charge les générations précédentes YOLO11 et YOLOv8, ce qui permet aux utilisateurs d'évaluer facilement leurs pipelines historiques et d'en assurer la transition.

Intégration fluide avec Ultralytics#

Le déploiement de modèles ne devrait pas nécessiter de se débattre avec des bases de code complexes et fragmentées. L'API Python d'Ultralytics te permet de charger, d'entraîner et d'exporter des modèles de pointe en seulement quelques lignes de code.

from ultralytics import YOLO

# Load the latest YOLO26 nano model for optimal edge performance
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset with minimal memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance
metrics = model.val()

# Export seamlessly to ONNX or TensorRT for deployment
model.export(format="onnx", optimize=True)

En utilisant Ultralytics, tu évites les configurations d'environnement complexes généralement associées aux dépôts de recherche, ce qui accélère ta mise sur le marché.

Conclusion#

YOLOX et RTDETRv2 représentent des étapes importantes dans l'évolution de la détection d'objets en temps réel. YOLOX a démontré la viabilité de CNN sans ancres très efficaces, tandis que RTDETRv2 a adapté avec succès les Transformers aux contraintes du temps réel.

Cependant, pour les applications modernes allant de l'analyse du commerce de détail intelligent à la robotique embarquée, Ultralytics YOLO26 offre la solution de référence. En combinant une inférence sans NMS avec des vitesses CPU inégalées, une empreinte mémoire réduite et le support robuste d'Ultralytics Platform, YOLO26 permet aux développeurs de créer la prochaine génération de systèmes de vision par ordinateur fiables et hautement performants.

Commentaires