Comparaison entre YOLOv8 et RTDETRv2#
Le domaine de la vision par ordinateur évolue constamment, de nouvelles architectures repoussant les limites de ce qui est possible en détection d'objets en temps réel. Deux modèles majeurs qui ont suscité beaucoup d'intérêt sont Ultralytics YOLOv8 et RTDETRv2 de Baidu. Ce guide propose une comparaison technique complète de ces deux modèles performants, en examinant leur architecture, leurs métriques de performance et leurs scénarios de déploiement idéaux.
Présentation de YOLOv8#
Ultralytics YOLOv8 représente une étape majeure dans la famille de modèles YOLO (Tu ne regardes qu'une fois). Il s'appuie sur des années de recherche fondamentale pour offrir une vitesse, une précision et une facilité d'utilisation exceptionnelles dans un large éventail de tâches.
Caractéristiques principales :
- Auteurs : Glenn Jocher, Ayush Chaurasia et Jing Qiu
- Organisation : Ultralytics
- Date : 10 janvier 2023
- GitHub : Dépôt Ultralytics
- Documentation : Documentation de YOLOv8
Architecture et atouts#
YOLOv8 introduit une architecture rationalisée qui optimise à la fois l'extraction des caractéristiques et la régression des boîtes englobantes. Il s'agit d'un détecteur sans ancres, ce qui simplifie la tête de prédiction et réduit le nombre d'ajustements d'hyperparamètres nécessaires pendant l'entraînement. Cette architecture garantit un excellent équilibre des performances entre la vitesse d'inférence et la précision moyenne (mAP), ce qui la rend particulièrement adaptée au déploiement dans des environnements réels, aussi bien sur des appareils périphériques que sur des serveurs cloud.
De plus, YOLOv8 nécessite beaucoup moins de mémoire pendant l'entraînement que les architectures basées sur des Transformers. Les développeurs peuvent ainsi entraîner des modèles sur des GPU grand public standard sans rencontrer d'erreurs de mémoire insuffisante.
Polyvalence#
L'une des principales forces de YOLOv8 est sa polyvalence native. Alors que de nombreux modèles se concentrent uniquement sur les boîtes englobantes, YOLOv8 prend en charge nativement la détection d'objets, la segmentation d'instances, la classification d'images, l'estimation de pose et la détection de boîtes englobantes orientées (OBB).
Présentation de RTDETRv2#
RTDETRv2 (Transformateur de détection en temps réel, version 2) s'appuie sur RT-DETR, avec pour objectif d'intégrer les puissants mécanismes d'attention des Transformers de vision aux applications de détection d'objets en temps réel.
Caractéristiques principales :
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Arxiv : 2407.17140
- GitHub : Dépôt RT-DETR
- Documentation : README de RTDETRv2
Architecture et atouts#
RTDETRv2 exploite une architecture hybride qui associe un réseau neuronal convolutif (CNN) comme backbone à une structure encodeur-décodeur basée sur un Transformer. Le modèle peut ainsi capturer des relations spatiales complexes et le contexte global grâce à des mécanismes d'auto-attention. En utilisant un ensemble de stratégies d'entraînement de type « bag-of-freebies », RTDETRv2 obtient des scores mAP compétitifs sur des jeux de données de référence standard comme le jeu de données COCO.
Points faibles#
Malgré sa grande précision, la nature de RTDETRv2, basée sur un Transformer, entraîne une consommation mémoire plus élevée et des temps d'entraînement plus longs que ceux des architectures CNN pures. Les Transformers nécessitent intrinsèquement davantage de VRAM, ce qui les rend difficiles à entraîner sur du matériel aux ressources limitées. De plus, bien que RTDETRv2 soit performant en détection, il ne possède pas la polyvalence multi-tâches — notamment pour la pose et la segmentation — inhérente à l'écosystème Ultralytics.
Comparaison des performances#
Lors de l'évaluation de modèles destinés à la production, le compromis entre la taille du modèle, la vitesse d'inférence et la précision est primordial. Le tableau ci-dessous compare directement les variantes de YOLOv8 et de RTDETRv2.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Les vitesses ont été mesurées sur une instance Amazon EC2 P4d. L'inférence sur CPU utilisait ONNX, tandis que les vitesses sur GPU ont été testées avec TensorRT.
Cas d'utilisation et recommandations#
Le choix entre YOLOv8 et RT-DETR dépend de tes exigences spécifiques, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.
Quand choisir YOLOv8#
YOLOv8 est un choix judicieux pour :
- Déploiement polyvalent multi-tâches : Les projets nécessitant un modèle éprouvé pour la détection, la segmentation, la classification et l’estimation de pose au sein de l’écosystème Ultralytics.
- Systèmes de production établis : Les environnements de production existants déjà construits sur l’architecture YOLOv8, avec des pipelines de déploiement stables et éprouvés.
- Large soutien de la communauté et de l’écosystème : Les applications qui bénéficient des nombreux tutoriels, intégrations tierces et ressources communautaires actives de YOLOv8.
Quand choisir RT-DETR#
RT-DETR est recommandé pour :
- Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
- Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
- Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
L'avantage Ultralytics#
Choisir un modèle ne se résume pas aux métriques brutes ; l'écosystème logiciel associé est essentiel à la productivité des développeurs. L'écosystème Ultralytics est réputé pour sa facilité d'utilisation et fournit une API Python unifiée qui simplifie l'ensemble du cycle de vie du machine learning.
De la gestion des jeux de données à l'entraînement distribué, Ultralytics masque la complexité du code passe-partout. Les développeurs bénéficient de poids préentraînés facilement accessibles et d'une intégration fluide avec des plateformes comme Hugging Face et des outils de supervision. Cet écosystème bien entretenu garantit un développement actif, des mises à jour fréquentes et un solide soutien de la communauté.
De plus, l'efficacité de l'entraînement est une caractéristique emblématique des modèles YOLO d'Ultralytics. Ils sont fortement optimisés pour une convergence rapide et une empreinte mémoire réduite pendant le processus d'entraînement, ce qui accélère considérablement les cycles d'expérimentation par rapport aux détecteurs basés sur des Transformers comme RTDETRv2.
Et maintenant : la puissance de YOLO26#
Bien que YOLOv8 reste un modèle très performant, les développeurs à la recherche des toutes dernières avancées devraient envisager de passer à YOLO26, sorti en janvier 2026. YOLO26 redéfinit l'état de l'art grâce à plusieurs innovations majeures :
- Conception de bout en bout sans NMS : YOLO26 élimine le post-traitement de suppression des non-maxima (NMS), ce qui permet d'accélérer les workflows de déploiement et de les rendre plus déterministes.
- Suppression de DFL : La suppression de la fonction de perte focale de distribution rationalise le modèle et améliore sa compatibilité avec les appareils edge et basse consommation.
- Optimiseur MuSGD : En intégrant des innovations issues de l'entraînement des LLM, l'optimiseur MuSGD garantit des entraînements plus stables et une convergence plus rapide.
- Inférence sur CPU jusqu'à 43 % plus rapide : Optimisé en profondeur pour les environnements dépourvus de GPU dédiés.
- ProgLoss + STAL : Ces fonctions de perte avancées améliorent sensiblement la reconnaissance des petits objets, un aspect essentiel pour l'imagerie aérienne et la robotique.
Parmi les autres alternatives modernes à explorer dans la gamme Ultralytics figure YOLO11, qui offre de solides performances pour les projets existants, même si YOLO26 est recommandé pour tous les nouveaux déploiements.
Exemple de code : entraînement et inférence#
La simplicité de l'API Ultralytics te permet de charger, d'entraîner et de déployer des modèles en seulement quelques lignes de code Python. Vérifie que PyTorch est installé avant d'exécuter l'exemple suivant.
from ultralytics import YOLO
# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")
# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()
# Export seamlessly for edge deployment
export_path = model.export(format="onnx")Ultralytics prend en charge les exportations en un clic vers de nombreux formats, notamment ONNX, TensorRT et CoreML, ce qui simplifie les options de déploiement des modèles sur différentes architectures matérielles.
Conclusion#
YOLOv8 et RTDETRv2 offrent tous deux des capacités convaincantes pour la détection d'objets en temps réel. RTDETRv2 démontre la puissance des Transformers pour capturer le contexte global, ce qui le rend adapté aux tâches complexes de raisonnement spatial lorsque la vitesse d'inférence et la surcharge mémoire ne sont pas les principales contraintes.
Cependant, pour les développeurs qui privilégient un équilibre exceptionnel entre vitesse, précision et efficacité des ressources, les modèles YOLO d'Ultralytics restent le meilleur choix. La légèreté de YOLOv8, associée à sa facilité d'utilisation inégalée, à sa polyvalence dans de nombreuses tâches de vision et à un écosystème open source dynamique, en fait la solution de référence pour les environnements de production évolutifs. Pour ceux qui recherchent les meilleures performances possibles sur les appareils edge, le nouveau YOLO26 offre une efficacité sans NMS inégalée et continue de dominer le secteur.