RTDETRv2 et YOLOv9#
Le domaine de la vision par ordinateur a vu émerger une divergence fascinante entre les philosophies architecturales, principalement entre les réseaux neuronaux convolutifs (CNN) et les modèles basés sur Transformer. En comparant RTDETRv2 et YOLOv9, les développeurs évaluent essentiellement les compromis entre les mécanismes d’attention globale et les informations de gradient programmables. Les deux modèles représentent le summum de leurs paradigmes respectifs et repoussent les limites de la détection d’objets en temps réel.
Présentation des modèles#
RTDETRv2 : Real-Time Detection Transformer#
Développé par des chercheurs de Baidu, RTDETRv2 s’appuie sur le RT-DETR d’origine en lui ajoutant une approche « Bag-of-Freebies » pour améliorer le modèle Real-Time Detection Transformer de base. Il s’attaque au goulot d’étranglement traditionnel des Transformers — la vitesse d’inférence — afin de les rendre viables pour les applications en temps réel.
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Liens : Arxiv, GitHub
Une caractéristique déterminante de RTDETRv2 est sa conception native de bout en bout sans NMS. En supprimant complètement la suppression non maximale (NMS) lors du post-traitement, le modèle stabilise la latence d’inférence et simplifie le pipeline de déploiement. Le mécanisme d’attention globale permet au modèle d’exceller dans la compréhension de scènes complexes et de foules denses, puisqu’il évalue simultanément le contexte de l’image entière.
YOLOv9 : informations de gradient programmables#
YOLOv9, une architecture basée sur CNN particulièrement efficace, s’attaque au problème de goulot d’étranglement de l’information inhérent aux réseaux neuronaux profonds. Il introduit Programmable Gradient Information (PGI) et le réseau Generalized Efficient Layer Aggregation Network (GELAN).
- Auteurs : Chien-Yao Wang et Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica
- Date : 21 février 2024
- Liens : Arxiv, GitHub
YOLOv9 repose sur les fondements éprouvés du réseau neuronal convolutif, mais maximise l’efficacité des paramètres. En préservant les informations essentielles pendant la propagation avant, il garantit des mises à jour fiables des poids, ce qui donne un modèle extrêmement léger et très précis. Toutefois, contrairement à RTDETRv2, YOLOv9 dépend toujours du post-traitement NMS standard.
Performances et efficacité des ressources#
Lors de l’évaluation de ces modèles en vue de leur mise en production, il est essentiel de trouver un équilibre entre la précision moyenne (mAP) et le coût de calcul. Le tableau ci-dessous illustre leurs performances sur le jeu de données MS COCO.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Besoins en mémoire et efficacité de l’entraînement#
Les Transformers comme RTDETRv2 sont réputés pour leur forte consommation de mémoire pendant l’entraînement ; ils nécessitent souvent beaucoup de mémoire CUDA et des entraînements plus longs pour converger pleinement. À l’inverse, les architectures CNN comme YOLOv9 et les autres modèles Ultralytics YOLO consomment beaucoup moins de mémoire, ce qui permet aux développeurs d’utiliser des tailles de lot plus importantes sur du matériel grand public.
Pour optimiser l’utilisation du matériel, pense à utiliser la plateforme Ultralytics afin de simplifier l’entraînement dans le cloud. Elle gère automatiquement la configuration de l’environnement et le choix optimal de la taille de lot.
Les atouts d’Ultralytics : écosystème et facilité d’utilisation#
L’étude de dépôts autonomes, comme les pages GitHub officielles de RTDETRv2 ou YOLOv9, peut être très instructive, mais les environnements de production exigent stabilité, facilité d’utilisation et écosystème bien entretenu. L’intégration de ces modèles via l’API Python Ultralytics offre une expérience développeur fluide.
API unifiée et polyvalence#
Le framework Ultralytics masque les complexités du chargement des données, des augmentations et de l’entraînement distribué. De plus, alors que RTDETRv2 d’origine se concentre exclusivement sur la détection, l’écosystème Ultralytics permet aux utilisateurs de passer facilement de la détection d’objets à la segmentation d’instances et à l’estimation de pose.
from ultralytics import RTDETR, YOLO
# Entraîner un modèle YOLOv9 sur des données personnalisées
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)
# Passe facilement à RT-DETR pour évaluer des scènes complexes
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")
# Exporte vers des formats prêts pour la production comme TensorRT
model_yolo.export(format="engine")Grâce à une documentation complète, au suivi automatique des expériences et à des capacités d’export fluides vers des formats comme ONNX, TensorRT et OpenVINO, Ultralytics réduit considérablement le délai entre le prototypage et la mise en production.
Cas d’utilisation idéaux#
Les points forts de RTDETRv2#
Grâce à son mécanisme d’attention globale, RTDETRv2 est particulièrement performant pour le traitement côté serveur et dans les environnements où le contexte global est primordial. Il excelle dans les domaines suivants :
- Imagerie médicale : repérer des anomalies subtiles pour lesquelles le contexte environnant est essentiel.
- Surveillance aérienne : repérer de petits objets dans des séquences de drone haute résolution sans les biais spatiaux des convolutions CNN traditionnelles.
- Analyse des foules denses : suivre des personnes dans des situations où les occultations importantes perturbent généralement les modèles basés sur des ancres.
Les points forts de YOLOv9#
YOLOv9 excelle dans les déploiements en périphérie soumis à des contraintes de ressources. Son efficacité de calcul en fait un choix idéal pour :
- Robotique : la navigation en temps réel et l’évitement d’obstacles, qui nécessitent une latence minimale.
- IoT pour les villes intelligentes : déployer le modèle sur des appareils en périphérie comme le NVIDIA Jetson pour surveiller la circulation.
- Inspection industrielle : le contrôle qualité sur les chaînes de montage à grande vitesse, qui nécessite une fréquence d’images élevée (FPS).
L’avenir : voici Ultralytics YOLO26#
YOLOv9 et RTDETRv2 représentent des avancées majeures, mais le paysage a rapidement évolué. Pour les déploiements modernes, le tout nouveau Ultralytics YOLO26 représente la synergie ultime entre les deux philosophies architecturales.
En réunissant les meilleurs aspects des transformers et des CNN, YOLO26 établit une nouvelle référence :
- Conception de bout en bout sans NMS : comme RTDETRv2, YOLO26 prend en charge nativement l’inférence de bout en bout et évite le post-traitement NMS grâce à
nms=False, pour des pipelines de déploiement plus rapides, plus simples et hautement prévisibles. - Optimiseur MuSGD : inspiré des techniques d’entraînement des grands modèles de langage (LLM), comme Kimi K2 de Moonshot AI, YOLO26 utilise une approche hybride combinant SGD et Muon. Cela apporte à la vision par ordinateur une stabilité d’entraînement inégalée et une convergence rapide.
- Inférence CPU jusqu’à 43 % plus rapide : contrairement aux transformers lourds, YOLO26 est fortement optimisé pour l’informatique en périphérie et les appareils dépourvus de GPU.
- Suppression de DFL : la suppression de Distribution Focal Loss simplifie considérablement le graphe du modèle et garantit un export sans accroc vers les appareils en périphérie à faible consommation et les unités de traitement neuronal intégrées (NPU).
- ProgLoss + STAL : ces fonctions de perte améliorées renforcent considérablement la reconnaissance des petits objets, une caractéristique essentielle pour l’IoT et les jeux de données aériens.
Pour les équipes qui souhaitent lancer un nouveau projet de vision par ordinateur, nous recommandons vivement d’évaluer YOLO26. Il offre l’élégance facultative d’un transformer sans NMS, avec la vitesse fulgurante et l’efficacité d’entraînement d’une architecture YOLO hautement optimisée.
Résumé#
Le choix entre RTDETRv2 et YOLOv9 dépend essentiellement du matériel de déploiement et des besoins spécifiques en matière de précision. RTDETRv2 offre une précision de pointe et une bonne prise en compte du contexte pour les applications reposant sur des serveurs, tandis que YOLOv9 se distingue par son efficacité sur les appareils en périphérie.
Toutefois, en s’appuyant sur l’écosystème mature d’Ultralytics, les développeurs peuvent facilement expérimenter avec YOLOv9 et le RT-DETR d’origine. De plus, avec l’arrivée de modèles plus récents comme YOLO11 et le modèle YOLO26 nativement de bout en bout, il n’a jamais été aussi facile de trouver le juste équilibre entre une inférence rapide, la prise en charge de tâches variées et une faible consommation de mémoire.