YOLOv10 vs RTDETRv2#
Le paysage de la vision par ordinateur évolue à un rythme fulgurant, de nouvelles architectures redéfinissant constamment l'état de l'art en matière de détection d'objets en temps réel. Deux jalons importants de cette évolution sont YOLOv10 et RTDETRv2. Les deux modèles visent à résoudre un goulet d'étranglement fondamental dans les pipelines de détection traditionnels en éliminant le besoin de post-traitement par suppression des non-maximums (NMS), tout en abordant ce défi à partir de paradigmes architecturaux entièrement différents.
Cette comparaison technique fournit une analyse approfondie de leurs architectures, méthodologies d'entraînement et scénarios de déploiement idéaux pour aider les développeurs et chercheurs à choisir le bon outil pour ton prochain projet de vision par IA.
YOLOv10 : Le pionnier sans NMS#
Développé par des chercheurs de l'Université Tsinghua, YOLOv10 se concentre fortement sur l'efficacité architecturale et la suppression des goulots d'étranglement liés au post-traitement. En introduisant des assignations doubles cohérentes pour un entraînement sans NMS, il atteint des performances compétitives tout en réduisant considérablement la latence d'inférence.
Spécifications techniques#
- Auteurs : Ao Wang, Hui Chen, Lihao Liu, et al.
- Organisation : Tsinghua University
- Date : 23/05/2024
- ArXiv : Article sur YOLOv10
- GitHub : THU-MIG/yolov10
- Documentation : Documentation de YOLOv10
Architecture et méthodologies#
La principale avancée de YOLOv10 réside dans sa conception de modèle axée sur l'efficacité et la précision globales. Il optimise divers composants sous les deux perspectives, réduisant considérablement la surcharge de calcul. La stratégie d'affectation double cohérente permet au modèle de s'entraîner sans dépendre de NMS, ce qui se traduit par un pipeline de déploiement de bout en bout rationalisé. Ceci est particulièrement bénéfique lors de l'exportation de modèles vers des formats de périphérie comme ONNX ou TensorRT, où les opérations de post-traitement peuvent introduire une latence inattendue.
Points forts et faiblesses#
Le modèle offre des compromis vitesse-précision exceptionnels, en particulier dans les variantes plus petites (N et S). Sa latence minimale le rend idéal pour les environnements de périphérie à haute vitesse. Cependant, bien que YOLOv10 excelle en vitesse de détection brute, il reste un modèle spécialisé uniquement dédié à la détection. Les équipes nécessitant une segmentation d'instances ou une estimation de pose devront se tourner vers des frameworks plus polyvalents.
RTDETRv2 : Affiner le Detection Transformer#
S'appuyant sur le Real-Time Detection Transformer original, RTDETRv2 intègre un "bag of freebies" pour améliorer sa base de référence, démontrant que les transformers peuvent rivaliser avec les CNN en temps réel.
Spécifications techniques#
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 24/07/2024
- ArXiv : Article sur RTDETRv2
- GitHub : lyuwenyu/RT-DETR
- Documentation : Documentation de RTDETRv2
Architecture et méthodologies#
RTDETRv2 utilise une architecture hybride, combinant un backbone de réseau de neurones convolutifs (CNN) pour l'extraction de caractéristiques visuelles avec un encodeur-décodeur Transformer pour une compréhension complète de la scène. Le mécanisme d'auto-attention du transformer permet au modèle de visualiser l'image globalement, ce qui le rend très efficace pour gérer des scènes complexes, des objets qui se chevauchent et des foules denses.
Points forts et faiblesses#
L'architecture transformer offre une excellente précision, en particulier sur les échelles de paramètres plus larges, et produit nativement des détections finales sans NMS. Cependant, cela a un coût. Les modèles de type transformer nécessitent traditionnellement beaucoup plus de mémoire CUDA pendant l'entraînement et peuvent converger plus lentement que les architectures CNN pures. Bien que RTDETRv2 ait amélioré les vitesses d'inférence, il consomme généralement plus de mémoire que les variantes légères de YOLO.
Comparaison des performances#
L'évaluation des métriques de performance donne une image plus claire de là où chaque modèle excelle. Le tableau suivant met en évidence leurs capacités sur le dataset COCO :
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
En analysant les données, YOLOv10 conserve un avantage strict en termes d'efficacité des paramètres et de vitesse d'inférence TensorRT pour des tailles comparables. RTDETRv2-x égale le massif YOLOv10x en précision mais nécessite près de 20 millions de paramètres de plus et des FLOPs nettement plus élevés.
Cas d'utilisation et recommandations#
Le choix entre YOLOv10 et RT-DETR dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d'écosystème.
Quand choisir YOLOv10#
YOLOv10 est un choix solide pour :
- Détection temps réel sans NMS : Applications bénéficiant d'une détection de bout en bout sans NMS (Non-Maximum Suppression), ce qui réduit la complexité du déploiement.
- Compromis vitesse-précision équilibré : Projets nécessitant un bon équilibre entre la vitesse d'inférence et la précision de détection pour différentes tailles de modèles.
- Applications à latence constante : Les scénarios de déploiement où des temps d'inférence prévisibles sont essentiels, tels que la robotique ou les systèmes autonomes.
Quand choisir RT-DETR#
RT-DETR est recommandé pour :
- Recherche sur la détection basée sur les Transformers : Projets explorant les mécanismes d'attention et les architectures de transformateurs pour la détection d'objets de bout en bout sans NMS.
- Scénarios de haute précision avec latence flexible : Applications où la précision de détection est la priorité absolue et où une latence d'inférence légèrement plus élevée est acceptable.
- Détection de grands objets : Scènes avec principalement des objets de taille moyenne à grande où le mécanisme d'attention globale des transformateurs offre un avantage naturel.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre la meilleure combinaison de performance et d'expérience développeur :
- Déploiement en périphérie sans NMS : Applications nécessitant une inférence cohérente et à faible latence sans la complexité du post-traitement par Non-Maximum Suppression.
- Environnements CPU uniquement : Appareils sans accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 offre un avantage décisif.
- Détection de petits objets : Les scénarios complexes tels que l'imagerie par drone aérien ou l'analyse par capteurs IoT où ProgLoss et STAL améliorent considérablement la précision sur les minuscules objets.
L'avantage Ultralytics : Écosystème et innovation#
Alors que YOLOv10 et RTDETRv2 offrent des capacités de détection robustes, choisir un modèle dépend souvent de l'écosystème logiciel environnant. La plateforme Ultralytics fournit une interface transparente et unifiée qui abstrait les complexités du deep learning.
Le nouveau standard : Ultralytics YOLO26#
Pour les développeurs recherchant les performances absolues, Ultralytics YOLO26 représente l'aboutissement des récentes avancées architecturales. Sorti au début de 2026, YOLO26 hérite de la conception de bout en bout sans NMS initiée par YOLOv10, éliminant complètement le post-traitement NMS pour un déploiement plus rapide et plus simple.
YOLO26 apporte les innovations d'entraînement des LLM à la vision par ordinateur via l'optimiseur MuSGD (un hybride de SGD et Muon), ce qui permet un entraînement plus stable et une convergence plus rapide. Il bénéficie également d'une inférence CPU jusqu'à 43 % plus rapide, ce qui en fait le choix privilégié pour l'informatique edge.
De plus, YOLO26 introduit ProgLoss + STAL pour des améliorations notables dans la reconnaissance des petits objets, et contrairement au YOLOv10 spécialisé, il offre une polyvalence extrême. Il prend en charge nativement la détection d'objets, la segmentation, la pose et les boîtes englobantes orientées (OBB) avec des améliorations spécifiques aux tâches telles que la perte de segmentation sémantique et l'estimation de la log-vraisemblance résiduelle (RLE) pour la pose. En outre, la suppression de la perte focale de distribution (DFL) garantit un export simplifié et une meilleure compatibilité avec les appareils à faible consommation.
Facilité d'utilisation et efficacité de l'entraînement#
Que tu expérimentes avec des modèles de génération précédente comme Ultralytics YOLO11 ou le révolutionnaire YOLO26, l'API Python rationalisée garantit une utilisation moindre de la mémoire pendant l'entraînement et des flux de travail extrêmement rapides.
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")L'écosystème bien entretenu fournit des outils pour un réglage facile des hyperparamètres et s'intègre parfaitement avec de vastes solutions de suivi et des options de déploiement de modèles.
Conclusion#
YOLOv10 et RTDETRv2 représentent tous deux des étapes marquantes dans la quête d'une détection d'objets sans NMS. RTDETRv2 prouve que les transformers peuvent atteindre une latence en temps réel avec une excellente compréhension du contexte global, bien qu'avec des besoins en mémoire plus élevés. YOLOv10 fournit une alternative CNN très efficace et rapide, adaptée aux tâches de détection limitées en ressources.
Cependant, pour une performance équilibrée, une polyvalence multi-tâches et l'écosystème le plus mature, les développeurs sont vivement encouragés à tirer parti d'Ultralytics YOLO26. Il marie magnifiquement les innovations architecturales de ses prédécesseurs avec l'outillage robuste et convivial qui fait du déploiement de la vision par IA une réalité fluide.