YOLOv10 vs RTDETRv2#
Le paysage de la vision par ordinateur évolue à un rythme effréné, de nouvelles architectures redéfinissant constamment l'état de l'art en détection d'objets en temps réel. Deux étapes majeures de cette évolution sont YOLOv10 et RTDETRv2. Les deux modèles cherchent à résoudre un goulot d'étranglement fondamental des pipelines de détection traditionnels en éliminant le besoin d'une post-traitement de suppression des maxima non maximaux (NMS), mais ils abordent ce défi selon des paradigmes architecturaux totalement différents.
Cette comparaison technique propose une analyse approfondie de leurs architectures, de leurs méthodologies d'entraînement et de leurs scénarios de déploiement idéaux afin de t'aider, ainsi que les chercheurs, à choisir l'outil adapté à votre prochain projet d'IA pour la vision.
YOLOv10 : le pionnier sans NMS#
Développé par des chercheurs de l'université Tsinghua, YOLOv10 se concentre fortement sur l'efficacité architecturale et la suppression des goulots d'étranglement liés au post-traitement. En introduisant des assignations doubles cohérentes pour un entraînement sans NMS, il atteint des performances compétitives tout en réduisant considérablement la latence d'inférence.
Spécifications techniques#
- Auteurs : Ao Wang, Hui Chen, Lihao Liu, et al.
- Organisation : Tsinghua University
- Date : 2024-05-23
- ArXiv : YoloV10 Paper
- GitHub : THU-MIG/yolov10
- Documentation : Documentation YOLOv10
Architecture et méthodologies#
La principale avancée de YOLOv10 réside dans sa conception de modèle globale, guidée par l'efficacité et la précision. Il optimise différents composants selon ces deux perspectives, réduisant considérablement la surcharge de calcul. La stratégie d'assignations doubles cohérentes permet au modèle de s'entraîner sans dépendre de NMS, ce qui se traduit par un pipeline de déploiement rationalisé de bout en bout. Cela est particulièrement avantageux lors de l'exportation des modèles vers des formats edge comme ONNX ou TensorRT, où les opérations de post-traitement peuvent introduire une latence imprévue.
Forces et faiblesses#
Le modèle offre un excellent compromis vitesse-précision, en particulier dans les variantes plus petites (N et S). Sa latence minimale le rend idéal pour les environnements edge à haute vitesse. Cependant, bien que YOLOv10 excelle en vitesse de détection brute, il reste un modèle spécialisé exclusivement dans la détection. Les équipes ayant besoin de segmentation d'instances ou d'estimation de pose devront se tourner vers des frameworks plus polyvalents.
En apprendre davantage sur YOLOv10
RTDETRv2 : perfectionner le Transformer dédié à la détection#
S'appuyant sur le Transformer de détection en temps réel original, RTDETRv2 intègre un « bag of freebies » pour améliorer sa base de référence, démontrant que les Transformers peuvent rivaliser avec les CNN dans les scénarios en temps réel.
Spécifications techniques#
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- ArXiv : RTDETRv2 Paper
- GitHub : lyuwenyu/RT-DETR
- Documentation : Documentation de RTDETRv2
Architecture et méthodologies#
RTDETRv2 utilise une architecture hybride, combinant un réseau de neurones convolutif (CNN) comme backbone pour l'extraction des caractéristiques visuelles avec un encodeur-décodeur Transformer pour une compréhension globale de la scène. Le mécanisme d'auto-attention du Transformer permet au modèle d'observer l'image dans son ensemble, ce qui le rend particulièrement efficace pour gérer les scènes complexes, les objets qui se chevauchent et les foules denses.
Forces et faiblesses#
L'architecture Transformer offre une excellente précision, notamment avec les modèles comportant davantage de paramètres, et produit nativement les détections finales sans NMS. Cela a toutefois un coût. Les modèles Transformer nécessitent traditionnellement beaucoup plus de mémoire CUDA pendant l'entraînement et peuvent converger plus lentement que les architectures CNN pures. Bien que RTDETRv2 ait amélioré ses vitesses d'inférence, il consomme généralement plus de mémoire que les variantes YOLO légères.
Comparaison des performances#
L'évaluation des métriques de performance donne une image plus claire des domaines dans lesquels chaque modèle excelle. Le tableau suivant met en évidence leurs capacités sur le jeu de données COCO :
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
L'analyse des données montre que YOLOv10 conserve un avantage net en matière d'efficacité paramétrique et de vitesse d'inférence TensorRT pour des tailles comparables. RTDETRv2-x égale le très grand YOLOv10x en précision, mais nécessite près de 20 millions de paramètres supplémentaires et un nombre de FLOPs nettement supérieur.
Cas d'utilisation et recommandations#
Le choix entre YOLOv10 et RT-DETR dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.
Quand choisir YOLOv10#
YOLOv10 est un choix pertinent pour :
- Détection en temps réel sans NMS : les applications qui bénéficient d’une détection de bout en bout sans suppression des non-maxima, réduisant ainsi la complexité du déploiement.
- Compromis équilibré entre vitesse et précision : les projets nécessitant un équilibre solide entre la vitesse d’inférence et la précision de détection pour différentes tailles de modèles.
- Applications à latence constante : les scénarios de déploiement où des temps d’inférence prévisibles sont essentiels, comme la robotique ou les systèmes autonomes.
Quand choisir RT-DETR#
RT-DETR est recommandé pour :
- Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
- Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
- Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
L'avantage d'Ultralytics : écosystème et innovation#
Bien que YOLOv10 et RTDETRv2 offrent de solides capacités de détection, le choix d'un modèle dépend souvent de l'écosystème logiciel qui l'entoure. La plateforme Ultralytics fournit une interface unifiée et fluide qui masque les complexités du deep learning.
La nouvelle référence : Ultralytics YOLO26#
Pour les développeurs à la recherche des meilleures performances possibles, Ultralytics YOLO26 représente l'aboutissement des avancées architecturales récentes. Sorti au début de 2026, YOLO26 reprend la conception de bout en bout sans NMS inaugurée par YOLOv10, éliminant complètement le post-traitement NMS pour un déploiement plus rapide et plus simple.
YOLO26 apporte à la vision par ordinateur des innovations d'entraînement issues des LLM grâce à l'optimiseur MuSGD (un hybride de SGD et de Muon), ce qui permet un entraînement plus stable et une convergence plus rapide. Il offre également jusqu'à 43 % d'inférence CPU plus rapide, ce qui en fait le premier choix pour l'edge computing.
En outre, YOLO26 introduit ProgLoss + STAL pour améliorer notablement la reconnaissance des petits objets et, contrairement à YOLOv10 qui est spécialisé, offre une polyvalence extrême. Il prend nativement en charge la détection d'objets, la segmentation, la pose et les boîtes englobantes orientées (OBB), avec des améliorations spécifiques à chaque tâche, comme la fonction de perte de segmentation sémantique et l'estimation résiduelle de la log-vraisemblance (RLE) pour la pose. En outre, la suppression de Distribution Focal Loss (DFL) garantit un export simplifié et une meilleure compatibilité avec les appareils à faible consommation.
Facilité d'utilisation et efficacité de l'entraînement#
Que tu expérimentes avec des modèles d'ancienne génération comme Ultralytics YOLO11 ou avec le modèle de pointe YOLO26, l'API Python rationalisée garantit une utilisation moindre de la mémoire pendant l'entraînement et des workflows extrêmement rapides.
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")L'écosystème bien maintenu fournit des outils pour faciliter l'optimisation des hyperparamètres et s'intègre parfaitement à de nombreuses solutions de suivi ainsi qu'aux options de déploiement de modèles.
Conclusion#
YOLOv10 et RTDETRv2 représentent tous deux des étapes majeures dans la quête d'une détection d'objets sans NMS. RTDETRv2 prouve que les Transformers peuvent atteindre une latence en temps réel avec une excellente compréhension du contexte global, au prix toutefois d'une consommation mémoire plus élevée. YOLOv10 fournit une alternative CNN très efficace et rapide, adaptée aux tâches de détection soumises à des contraintes de ressources.
Cependant, pour un équilibre entre performances, polyvalence multitâche et écosystème le plus mature, les développeurs sont vivement encouragés à tirer parti d'Ultralytics YOLO26. Il combine élégamment les innovations architecturales de ses prédécesseurs avec des outils robustes et conviviaux qui rendent le déploiement de l'IA pour la vision parfaitement fluide.