YOLOv8 vs RTDETRv2#
Le domaine de la vision par ordinateur évolue constamment, de nouvelles architectures repoussant les limites de la détection d’objets en temps réel. Deux modèles remarqués ont suscité un vif intérêt : Ultralytics YOLOv8 et RTDETRv2 de Baidu. Ce guide propose une comparaison technique complète de ces deux modèles puissants, en examinant leurs architectures, leurs métriques de performance et leurs scénarios de déploiement idéaux.
Présentation de YOLOv8#
Ultralytics YOLOv8 marque une étape importante dans la famille de modèles YOLO (Tu ne regardes qu’une seule fois). Il s’appuie sur des années de recherche fondamentale pour offrir une vitesse, une précision et une simplicité d’utilisation exceptionnelles pour un large éventail de tâches.
Caractéristiques principales :
- Auteurs : Glenn Jocher, Ayush Chaurasia et Jing Qiu
- Organisation : Ultralytics
- Date : 10 janvier 2023
- GitHub : Dépôt Ultralytics
- Documentation : Documentation de YOLOv8
Architecture et points forts#
YOLOv8 introduit une architecture rationalisée qui optimise à la fois l’extraction des caractéristiques et la régression des boîtes englobantes. Ce détecteur sans ancres simplifie la tête de prédiction et réduit le nombre d’ajustements d’hyperparamètres nécessaires pendant l’entraînement. Cette architecture garantit un excellent équilibre des performances entre vitesse d’inférence et précision moyenne (mAP), ce qui la rend particulièrement adaptée au déploiement dans le monde réel, sur des appareils périphériques comme sur des serveurs cloud.
De plus, les besoins en mémoire de YOLOv8 pendant l’entraînement sont nettement inférieurs à ceux des architectures basées sur Transformer. Les développeurs peuvent ainsi entraîner des modèles sur des GPU grand public standard sans rencontrer d’erreurs de mémoire insuffisante.
Polyvalence#
L’une des principales forces de YOLOv8 réside dans sa polyvalence native. Alors que de nombreux modèles se concentrent uniquement sur les boîtes englobantes, YOLOv8 prend en charge d’emblée la détection d’objets, la segmentation d’instances, la classification d’images, l’estimation de pose et la détection de boîtes englobantes orientées (OBB).
Présentation de RTDETRv2#
RTDETRv2 (version 2 du Transformer de détection en temps réel) s’appuie sur le RT-DETR original et vise à appliquer les puissants mécanismes d’attention des Vision Transformers à la détection d’objets en temps réel.
Caractéristiques principales :
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Arxiv : 2407.17140
- GitHub : Dépôt RT-DETR
- Docs : Lisez-moi de RTDETRv2
Architecture et points forts#
RTDETRv2 s’appuie sur une architecture hybride qui associe un backbone de réseau neuronal convolutif (CNN) à une structure encodeur-décodeur Transformer. Le modèle peut ainsi saisir des relations spatiales complexes et le contexte global grâce aux mécanismes d’auto-attention. En utilisant un ensemble de stratégies d’entraînement « bag-of-freebies », RTDETRv2 obtient des scores mAP compétitifs sur des jeux de données d’évaluation standards comme le jeu de données COCO.
Points faibles#
Malgré sa grande précision, la nature de RTDETRv2, basé sur Transformer, entraîne une consommation mémoire plus élevée et des temps d’entraînement plus longs que les architectures CNN pures. Les Transformers nécessitent intrinsèquement davantage de mémoire vidéo, ce qui complique leur entraînement sur du matériel soumis à des contraintes de ressources. De plus, si RTDETRv2 est performant en détection, il ne possède pas la polyvalence multitâche — pose et segmentation, par exemple — inhérente à l’écosystème Ultralytics.
Comparaison des performances#
Lors de l’évaluation de modèles destinés à la production, le compromis entre taille du modèle, vitesse d’inférence et précision est essentiel. Le tableau ci-dessous compare directement les variantes de YOLOv8 et RTDETRv2.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Cas d’utilisation et recommandations#
Le choix entre YOLOv8 et RT-DETR dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLOv8#
YOLOv8 est un bon choix pour :
- Déploiement polyvalent multi-tâches : les projets qui nécessitent un modèle éprouvé pour la détection, la segmentation, la classification et l’estimation de pose dans l’écosystème Ultralytics.
- Systèmes de production établis : les environnements de production existants déjà basés sur l’architecture YOLOv8 et dotés de pipelines de déploiement stables et bien testés.
- Large soutien de la communauté et de l’écosystème : les applications qui tirent parti des nombreux tutoriels, intégrations tierces et ressources communautaires actives de YOLOv8.
Quand choisir RT-DETR#
RT-DETR est recommandé pour :
- Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
- Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
- Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
L’avantage Ultralytics#
Le choix d’un modèle ne se limite pas aux métriques brutes ; l’écosystème logiciel qui l’entoure est crucial pour la productivité des développeurs. L’écosystème Ultralytics est réputé pour sa facilité d’utilisation et fournit une API Python unifiée qui simplifie tout le cycle de vie du machine learning.
De la gestion des jeux de données à l’entraînement distribué, Ultralytics masque la complexité du code passe-partout. Les développeurs bénéficient de poids préentraînés facilement accessibles et d’une intégration transparente avec des plateformes comme Hugging Face et des outils de supervision. Cet écosystème bien entretenu garantit un développement actif, des mises à jour fréquentes et un soutien solide de la communauté.
De plus, l’efficacité de l’entraînement est une caractéristique des modèles Ultralytics YOLO. Ils sont très optimisés pour converger rapidement et réduire l’empreinte mémoire pendant le processus d’entraînement, ce qui accélère considérablement les cycles d’expérimentation par rapport aux détecteurs basés sur Transformer comme RTDETRv2.
Perspectives : la puissance de YOLO26#
Bien que YOLOv8 reste un modèle de premier plan, les développeurs qui recherchent la toute dernière technologie devraient envisager de passer à YOLO26, lancé en janvier 2026. YOLO26 redéfinit l’état de l’art grâce à plusieurs innovations révolutionnaires :
- Conception de bout en bout sans NMS : la tête optionnelle one-to-one de YOLO26 (
nms=False) élimine le post-traitement par suppression des maxima non locaux (NMS), ce qui accélère et rend plus déterministes les processus de déploiement. - Suppression de DFL : la suppression de la perte focale de distribution simplifie le modèle et améliore sa compatibilité avec les appareils en périphérie et à faible consommation.
- Optimiseur MuSGD : en intégrant des innovations issues de l’entraînement des LLM, l’optimiseur MuSGD garantit des entraînements plus stables et une convergence plus rapide.
- Inférence CPU jusqu’à 43 % plus rapide : fortement optimisé pour les environnements sans GPU dédié.
- ProgLoss + STAL : la perte progressive et l’assignation d’étiquettes sensible aux petits objets améliorent notablement la reconnaissance des petits objets, une capacité essentielle pour l’imagerie aérienne et la robotique.
Parmi les autres solutions modernes de la gamme Ultralytics à découvrir, YOLO11 offre des performances solides pour les projets existants, même si YOLO26 est recommandé pour tous les nouveaux déploiements.
Exemple de code : entraînement et inférence#
La simplicité de l’API Ultralytics te permet de charger, d’entraîner et de déployer des modèles en quelques lignes de code Python. Vérifie que PyTorch est installé avant d’exécuter l’exemple suivant.
from ultralytics import YOLO
# Charger un petit modèle YOLOv8 préentraîné
model = YOLO("yolov8s.pt")
# Entraîner le modèle sur ton jeu de données personnalisé
# L’entraînement économe en mémoire permet d’utiliser des tailles de lot plus importantes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Exécuter l’inférence sur une image de test
results = model("https://ultralytics.com/images/bus.jpg")
# Afficher les résultats
results[0].show()
# Exporte facilement pour un déploiement en périphérie
export_path = model.export(format="onnx")Ultralytics prend en charge l’exportation en un clic vers de nombreux formats, notamment ONNX, TensorRT et CoreML, ce qui simplifie les options de déploiement des modèles sur différentes architectures matérielles.
Conclusion#
YOLOv8 et RTDETRv2 offrent tous deux des fonctionnalités intéressantes pour la détection d’objets en temps réel. RTDETRv2 démontre la puissance des Transformers pour saisir le contexte global, ce qui le rend adapté aux tâches complexes de raisonnement spatial lorsque la vitesse d’inférence et la surcharge mémoire ne sont pas les principales contraintes.
Cependant, pour les développeurs qui privilégient un équilibre remarquable entre vitesse, précision et efficacité des ressources, les modèles Ultralytics YOLO restent le meilleur choix. La légèreté de YOLOv8, associée à sa facilité d’utilisation inégalée, à sa polyvalence pour différentes tâches de vision et à un écosystème open source dynamique, en fait la solution de référence pour les environnements de production évolutifs. Pour ceux qui recherchent les meilleures performances en périphérie, YOLO26, récemment lancé, offre une efficacité sans NMS inégalée et reste à la pointe du secteur.