Ultralytics YOLO27 :
Get Started

RTDETRv2 et YOLOv10#

L’évolution de la vision par ordinateur a été largement motivée par la recherche constante d’un équilibre entre vitesse et précision. Traditionnellement, les pipelines de détection d’objets en temps réel s’appuient sur la suppression non maximale (NMS), une étape de post-traitement qui élimine les boîtes englobantes qui se chevauchent. Cependant, la NMS entraîne des goulots d’étranglement en matière de latence et nécessite un réglage complexe des hyperparamètres. Récemment, deux approches architecturales distinctes ont émergé pour résoudre ce problème nativement : les modèles basés sur Transformer, comme RTDETRv2, et les modèles basés sur CNN, comme YOLOv10.

Ce guide propose un comparatif technique complet de ces deux modèles. Il analyse leurs architectures, leurs métriques de performance et leurs cas d’usage idéaux, tout en soulignant comment les dernières innovations de l’écosystème Ultralytics offrent la solution ultime pour les déploiements modernes.

RTDETRv2 : Transformers de détection en temps réel#

RTDETRv2 s’appuie sur l’architecture RT-DETR d’origine et vise à combiner la compréhension du contexte global propre aux Vision Transformers avec les exigences de vitesse en temps réel traditionnellement dominées par les modèles YOLO.

Caractéristiques principales :

Architecture et méthodologies d’entraînement#

RTDETRv2 utilise une architecture Transformer de bout en bout qui évite intrinsèquement la NMS. Il améliore son prédécesseur en introduisant une approche « Bag-of-Freebies », qui optimise la stratégie d’entraînement et intègre des capacités de détection multi-échelles. Le modèle utilise une base CNN pour extraire des cartes de caractéristiques (des détails visuels comme les contours et les textures), ensuite traitées par une structure encodeur-décodeur Transformer. Le modèle peut ainsi analyser simultanément le contexte de l’image entière, ce qui le rend particulièrement efficace pour comprendre les scènes complexes où les objets sont rapprochés ou se chevauchent.

Points forts et points faibles#

Points forts :

  • Contexte global : le mécanisme d’attention permet au modèle d’exceller dans les environnements complexes et encombrés.
  • Sans NMS : prédit directement les coordonnées des objets, ce qui simplifie le pipeline de déploiement.
  • Haute précision : atteint une excellente précision moyenne (mAP) sur le jeu de données COCO.

Points faibles :

  • Gourmand en ressources : les architectures Transformer nécessitent généralement beaucoup plus de mémoire CUDA que les CNN pendant l’entraînement, ce qui rend leur réglage fin coûteux sur du matériel standard.
  • Variabilité de la vitesse d’inférence : bien que rapides, les calculs d’attention lourds peuvent réduire les FPS en vision par ordinateur sur les appareils périphériques dépourvus d’accélérateurs d’IA dédiés.

En savoir plus sur RTDETRv2

YOLOv10 : détection d’objets de bout en bout en temps réel#

YOLOv10 marque un tournant majeur dans la lignée de la détection d’objets YOLO, car il résout directement le goulot d’étranglement de longue date lié à la NMS au sein d’un framework CNN.

Caractéristiques principales :

Architecture et méthodologies d’entraînement#

L’innovation centrale de YOLOv10 est l’utilisation d’assignations doubles cohérentes pour l’entraînement sans NMS. Le modèle utilise deux têtes de détection pendant l’entraînement : l’une avec une assignation un-à-plusieurs (comme les modèles YOLO traditionnels) pour fournir des signaux de supervision riches, et l’autre avec une assignation un-à-un pour éliminer le besoin de NMS. À l’inférence, seule la tête un-à-un est utilisée, ce qui donne un processus de bout en bout. De plus, les auteurs ont appliqué une stratégie de conception de modèle axée sur l’efficacité et la précision globales, en optimisant de manière exhaustive divers composants pour réduire la redondance des calculs.

Points forts et points faibles#

Points forts :

  • Vitesse extrême : en supprimant la NMS et en optimisant l’architecture, YOLOv10 atteint une latence d’inférence extrêmement faible.
  • Efficacité : nécessite moins de paramètres et de FLOPs pour atteindre une précision comparable à celle d’autres modèles, ce qui le rend particulièrement adapté aux environnements aux ressources limitées.
  • Déploiements sans NMS : simplifie l’intégration dans des applications en périphérie, comme la vidéosurveillance intelligente.

Points faibles :

  • Concept de première génération : premier modèle YOLO à mettre en œuvre cette architecture spécifique sans NMS, il a posé les bases, mais laissait une marge de progression pour la polyvalence multi-tâches et les optimisations observées dans les modèles ultérieurs, comme YOLO11 et YOLO26.

En savoir plus sur YOLOv10

Comparaison des performances#

Lors de l’évaluation de modèles destinés à la production, il est essentiel de trouver un équilibre entre précision et coût de calcul. Le tableau ci-dessous met en évidence les compromis de performance entre différentes tailles de RTDETRv2 et de YOLOv10.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

RTDETRv2 offre une précision solide, mais YOLOv10 présente un avantage remarquable en matière de latence et d’efficacité des paramètres, notamment dans ses variantes plus petites (Nano et Small), ce qui le rend particulièrement intéressant pour les applications d’informatique en périphérie et d’AIoT.

Choisir la bonne taille

Si tu déploies tes modèles sur des GPU de niveau serveur où la taille de lot et la VRAM sont moins limitées, les modèles plus grands (comme -x ou -l) maximisent la précision. Pour les appareils périphériques comme le Raspberry Pi ou les téléphones mobiles, privilégie les variantes nano (-n) ou small (-s) afin de maintenir une fréquence d’images en temps réel.

Cas d’utilisation et recommandations#

Le choix entre RT-DETR et YOLOv10 dépend des exigences propres à ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir RT-DETR#

RT-DETR est un excellent choix pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir YOLOv10#

YOLOv10 est recommandé pour :

  • Détection en temps réel sans NMS : les applications qui tirent parti de la détection de bout en bout sans suppression non maximale, ce qui réduit la complexité du déploiement.
  • Équilibre entre vitesse et précision : les projets qui nécessitent un bon compromis entre vitesse d’inférence et précision de détection, pour différentes tailles de modèles.
  • Applications à latence constante : les scénarios de déploiement où des temps d’inférence prévisibles sont essentiels, comme en robotique ou dans les systèmes autonomes.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics : présentation de YOLO26#

RTDETRv2 et YOLOv10 apportent tous deux des avancées universitaires intéressantes, mais leur déploiement en conditions réelles exige un écosystème logiciel robuste et bien entretenu. La plateforme Ultralytics offre une expérience développeur inégalée, alliant facilité d’utilisation, documentation complète et outils puissants d’annotation de données et de déploiement.

Pour les développeurs qui recherchent la technologie la plus avancée en 2026, Ultralytics YOLO26 est le choix ultime. Il synthétise les meilleures idées des deux architectures et introduit des améliorations révolutionnaires :

  • Conception de bout en bout sans NMS : s’appuyant sur le concept inauguré par YOLOv10, YOLO26 propose une tête un-à-un facultative (nms=False) qui ignore le post-traitement NMS, pour une logique de déploiement plus rapide et plus simple, ainsi qu’une latence plus constante.
  • Suppression de DFL : en supprimant Distribution Focal Loss, YOLO26 simplifie l’exportation des modèles et améliore considérablement la compatibilité avec les appareils périphériques et à faible consommation.
  • Optimiseur MuSGD : cet optimiseur inédit, qui associe SGD et Muon et s’inspire des innovations en matière d’entraînement des LLM, offre un entraînement plus stable et une convergence nettement plus rapide que les méthodes traditionnelles.
  • Inférence CPU jusqu’à 43 % plus rapide : soigneusement optimisée pour les environnements dépourvus de GPU dédiés, elle démocratise l’IA visuelle haute performance.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent nettement la reconnaissance des petits objets, un aspect crucial pour les applications faisant appel à des drones et aux capteurs IoT.
  • Polyvalence inégalée : contrairement aux modèles limités aux boîtes englobantes, YOLO26 prend en charge une gamme complète de tâches, notamment la segmentation d’instances, l’estimation de pose, la classification d’images et la détection OBB, avec des améliorations spécifiques à chaque tâche, comme Residual Log-Likelihood Estimation (RLE) pour la pose.

Mise en œuvre fluide avec Python#

L’entraînement et le déploiement de ces modèles avec l’API Python Ultralytics sont conçus pour se faire sans friction. Les besoins en mémoire pendant l’entraînement sont nettement inférieurs à ceux des architectures fortement basées sur Transformer, ce qui te permet d’entraîner des modèles puissants sur du matériel standard.

from ultralytics import YOLO

# Charger le modèle YOLO26 de pointe (recommandé)
# Autre possibilité : charger un modèle YOLOv10 avec YOLO('yolov10n.pt')
model = YOLO("yolo26n.pt")

# Entraîner le modèle sur ton jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporter facilement vers différents formats pour un déploiement en périphérie
model.export(format="onnx", simplify=True)

Que tu mettes en œuvre des systèmes d’alarme de sécurité ou que tu réalises de l’analyse d’images médicales, choisir un modèle soutenu par la communauté active Ultralytics te garantit l’accès aux outils, aux guides de réglage des hyperparamètres et aux mises à jour continues nécessaires à ta réussite. YOLOv10 et RTDETRv2 ont ouvert la voie aux architectures sans NMS ; YOLO26 perfectionne la formule en offrant le meilleur équilibre entre performances, polyvalence et préparation à la production.

Commentaires