Ultralytics YOLO27 :
Get Started

PP-YOLOE+ vs RTDETRv2#

Le domaine de la vision par ordinateur a connu une évolution spectaculaire ces dernières années, en particulier dans celui de la détection d’objets en temps réel. Choisir la bonne architecture pour ton déploiement peut faire toute la différence entre une application lente et gourmande en mémoire et un système réactif hautement optimisé. Dans cette comparaison technique, nous étudions deux modèles remarquables de Baidu : PP-YOLOE+, basé sur un CNN, et RTDETRv2, basé sur un Transformer. Nous analyserons leurs architectures, leurs indicateurs de performance et leurs cas d’utilisation idéaux, tout en examinant comment ils se comparent à la plateforme de pointe Ultralytics YOLO26.

PP-YOLOE+ : repousser les limites des CNN#

Conçu comme une évolution de ses prédécesseurs, PP-YOLOE+ repousse les limites de ce que les réseaux neuronaux convolutifs (CNNs) traditionnels peuvent accomplir en détection d’objets. Ce détecteur sans ancres très performant s’appuie sur les mécanismes fondamentaux de la série YOLO, tout en intégrant des optimisations spécifiques à l’écosystème PaddlePaddle.

Détails du modèle :

Architecture et méthodes#

PP-YOLOE+ s’appuie sur un backbone fortement optimisé et un réseau pyramidal de caractéristiques personnalisé pour agréger efficacement les caractéristiques à différentes échelles. Il utilise une conception sans ancres, ce qui simplifie le réglage heuristique généralement nécessaire pour générer les boîtes d’ancrage. De plus, sa méthode d’entraînement comprend des stratégies avancées d’assignation des étiquettes afin de mieux faire correspondre les prédictions aux boîtes de référence pendant l’apprentissage.

Atouts et cas d’utilisation#

Le principal atout de PP-YOLOE+ réside dans ses performances fiables sur du matériel serveur standard et sa forte intégration aux outils de Baidu. Il convient bien aux flux de travail industriels classiques, comme la détection de défauts statique dans les environnements de fabrication où les contraintes matérielles ne sont pas trop strictes.

En savoir plus sur PP-YOLOE+

Considérations liées à l’écosystème

Même si PP-YOLOE+ offre une grande précision, son déploiement en dehors de son écosystème natif peut parfois nécessiter des étapes de conversion supplémentaires, contrairement aux formats d’export natifs facilement accessibles dans les pipelines Ultralytics modernes.

RTDETRv2 : Transformers de détection en temps réel#

En s’éloignant des CNN purs, RTDETRv2 (version 2 du Transformer de détection en temps réel) marque une avancée vers les mécanismes fondés sur l’attention pour les tâches de vision par ordinateur. Le modèle cherche à associer la compréhension du contexte global propre aux Transformers à la faible latence nécessaire aux applications réelles.

Détails du modèle :

Architecture et méthodes#

RTDETRv2 exploite une architecture hybride qui combine un backbone CNN pour l’extraction des caractéristiques et un encodeur-décodeur Transformer optimisé. Sa conception native de bout en bout, qui évite le post-traitement classique par suppression non maximale (NMS), est une caractéristique essentielle. Le modèle introduit également des fonctionnalités comme la détection à plusieurs échelles et la gestion de scènes complexes, en utilisant l’auto-attention pour comprendre les relations spatiales entre des objets éloignés.

Atouts et cas d’utilisation#

L’architecture Transformer rend RTDETRv2 particulièrement efficace dans les situations où la compréhension du contexte global est cruciale. Cependant, les modèles Transformer nécessitent généralement beaucoup plus de mémoire CUDA à l’entraînement comme à l’inférence que les CNN légers. Ils conviennent mieux aux environnements sans contraintes matérielles, comme l’analyse vidéo dans le cloud sur de puissants serveurs GPU.

En savoir plus sur RTDETRv2

Comparaison des performances et des métriques#

Pour évaluer ces modèles, il est essentiel de tenir compte du compromis entre la précision moyenne (mAP) et le coût de calcul (mesuré en FLOPs et en latence d’inférence). Le tableau ci-dessous présente les principaux indicateurs des différentes tailles de PP-YOLOE+ et de RTDETRv2.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

RTDETRv2 affiche une mAP élevée, mais au prix d’un nombre supérieur de paramètres et de FLOPs. Les développeurs qui souhaitent le déployer sur des appareils périphériques aux ressources limitées se heurtent souvent à des goulots d’étranglement liés aux besoins élevés en mémoire typiques des couches Transformer.

Cas d’utilisation et recommandations#

Le choix entre PP-YOLOE+ et RT-DETR dépend des exigences précises de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir PP-YOLOE+#

PP-YOLOE+ est un bon choix pour :

  • Intégration à l’écosystème PaddlePaddle : Les organisations dotées d’une infrastructure existante reposant sur le framework et les outils PaddlePaddle de Baidu.
  • Déploiement en périphérie avec Paddle Lite : Déploiement sur du matériel doté de noyaux d’inférence fortement optimisés spécifiquement pour Paddle Lite ou le moteur d’inférence Paddle.
  • Détection côté serveur de haute précision : Scénarios privilégiant une précision de détection maximale sur de puissants serveurs GPU, sans contrainte liée aux dépendances du framework.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics : présentation de YOLO26#

Même si PP-YOLOE+ et RTDETRv2 représentent tous deux des jalons importants, les développeurs d’aujourd’hui ont besoin d’un écosystème qui allie parfaitement performances exceptionnelles et facilité d’utilisation. La plateforme Ultralytics et le modèle révolutionnaire YOLO26 offrent exactement cela.

Lancé en janvier 2026, YOLO26 établit une nouvelle référence pour l’IA de vision conçue en priorité pour les appareils périphériques. Il résout avec élégance les difficultés de déploiement associées aux architectures plus anciennes, tout en les surpassant en vitesse et en précision.

Innovations architecturales#

YOLO26 introduit plusieurs améliorations novatrices qui surpassent les CNN traditionnels et les Transformers lourds :

  • Conception de bout en bout sans NMS : Comme RTDETRv2, YOLO26 prend en charge l’inférence native de bout en bout. En évitant le post-traitement par suppression non maximale (NMS) grâce à sa tête facultative one-to-one (nms=False), il permet un déploiement plus rapide et plus simple, avec une gigue de latence réduite, idéal pour la robotique en temps réel et les systèmes autonomes.
  • Jusqu’à 43 % d’inférence CPU plus rapide : Grâce à des optimisations architecturales poussées, YOLO26 surpasse nettement les modèles concurrents sur les appareils périphériques dépourvus de GPU dédiés, ce qui en fait le choix de premier plan pour l’IoT et les applications de ville intelligente.
  • Optimiseur MuSGD : Inspiré des innovations en matière d’entraînement des LLM, YOLO26 utilise une approche hybride combinant SGD et Muon. Elle assure des trajectoires d’entraînement plus stables et une convergence remarquablement plus rapide, réduisant considérablement le nombre d’heures d’entraînement sur GPU.
  • ProgLoss + STAL : Ces fonctions de perte avancées améliorent considérablement la reconnaissance des petits objets, un domaine où des modèles comme PP-YOLOE+ ont historiquement des difficultés. Elles sont essentielles pour l’imagerie aérienne et les applications par drone.
  • Suppression de DFL : La suppression de Distribution Focal Loss simplifie le processus d’export et garantit une compatibilité fluide avec différents appareils périphériques et à faible consommation.
Polyvalence adaptée aux tâches

Contrairement aux détecteurs d’objets spécialisés, YOLO26 est très polyvalent et prend en charge la segmentation d’instances, l’estimation de pose, la classification et les boîtes englobantes orientées (OBB). Il intègre des améliorations adaptées à chaque tâche, comme RLE pour la pose et une fonction de perte d’angle spécifique aux OBB.

Une simplicité d'utilisation inégalée#

L’un des principaux inconvénients de l’adoption d’architectures complexes comme RTDETRv2 est la courbe d’apprentissage abrupte et l’intégration souvent décousue. L’écosystème Ultralytics masque entièrement ces complexités grâce à une API Python intuitive et à une plateforme web complète.

Que tu entraînes des jeux de données personnalisés ou que tu exécutes une inférence rapide, le processus est simple :

from ultralytics import RTDETR, YOLO

# Initialise le modèle YOLO26 de pointe
model_yolo = YOLO("yolo26n.pt")

# Autre possibilité : initialiser un modèle RT-DETR avec la même API simple
model_rtdetr = RTDETR("rtdetr-l.pt")

# Exécuter facilement l’inférence en temps réel
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()

# Exporter pour un déploiement en périphérie en une seule ligne
model_yolo.export(format="engine", quantize=16)

Les modèles YOLO d’Ultralytics nécessitent généralement moins de mémoire, ce qui te permet d’entraîner plus rapidement et de déployer sur du matériel moins coûteux que leurs équivalents basés sur des Transformers. De plus, le développement actif et une documentation de premier ordre contribuent à la stabilité de tes pipelines de production.

Pour les équipes qui étudient d’autres solutions, YOLO11 reste un prédécesseur très bien pris en charge et particulièrement performant au sein de l’écosystème, offrant une excellente référence pour les intégrations avec du matériel ancien. Tu peux aussi consulter notre comparaison entre YOLO11 et RT-DETR.

Résumé#

PP-YOLOE+ et RTDETRv2 ont contribué de manière importante à l’évolution de la vision par ordinateur, en démontrant respectivement la viabilité des pipelines CNN avancés et des Transformers en temps réel. Cependant, pour les organisations qui souhaitent déployer en 2026 des applications de vision par ordinateur fiables, polyvalentes et hautement optimisées, Ultralytics YOLO26 offre une solution inégalée. Son inférence facultative sans NMS, son inférence CPU nettement plus rapide et son écosystème simplifié permettent aux développeurs de passer de l’idée à une production évolutive plus rapidement que jamais.

Commentaires