RTDETRv2 vs YOLOv9#
Le domaine de la vision par ordinateur a connu une divergence fascinante entre les philosophies architecturales, principalement entre les réseaux neuronaux convolutifs (CNN) et les modèles fondés sur les transformers. En comparant RTDETRv2 et YOLOv9, les développeurs évaluent essentiellement les compromis entre les mécanismes d’attention globale et les informations de gradient programmables. Les deux modèles représentent le sommet de leurs paradigmes respectifs et repoussent les limites de la détection d’objets en temps réel.
Introduction aux modèles#
RTDETRv2 : Transformer de détection en temps réel#
Développé par des chercheurs de Baidu, RTDETRv2 s’appuie sur le RT-DETR original en introduisant un « Bag-of-Freebies » pour améliorer le Transformer de détection en temps réel de référence. Il s’attaque au goulot d’étranglement traditionnel des transformers — la vitesse d’inférence — afin de les rendre adaptés aux applications en temps réel.
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Liens : Arxiv, GitHub
Une caractéristique déterminante de RTDETRv2 est sa conception native de bout en bout, sans NMS. En supprimant complètement la suppression des non-maxima (NMS) lors du post-traitement, le modèle stabilise la latence d’inférence et simplifie le pipeline de déploiement. Le mécanisme d’attention globale permet au modèle d’exceller dans la compréhension de scènes complexes et des foules denses, car il évalue simultanément le contexte de l’image entière.
YOLOv9 : informations de gradient programmables#
YOLOv9, une architecture très efficace fondée sur un CNN, s’attaque au problème du goulot d’étranglement de l’information inhérent aux réseaux neuronaux profonds. Il introduit les informations de gradient programmables (PGI) et le réseau d’agrégation de couches efficace généralisé (GELAN).
- Auteurs : Chien-Yao Wang et Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica
- Date : 21 février 2024
- Liens : Arxiv, GitHub
YOLOv9 repose sur les bases éprouvées du réseau neuronal convolutif, tout en maximisant l’efficacité des paramètres. En conservant les informations essentielles lors du processus de propagation vers l’avant, il garantit des mises à jour fiables des poids, ce qui produit un modèle extrêmement léger et pourtant très précis. Toutefois, contrairement à RTDETRv2, YOLOv9 utilise toujours le post-traitement NMS standard.
Performances et efficacité des ressources#
Lors de l’évaluation de ces modèles pour la production, il est essentiel de trouver un équilibre entre la précision moyenne (mAP) et le coût de calcul. Le tableau ci-dessous illustre leurs performances sur le jeu de données MS COCO.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Besoins en mémoire et efficacité d'entraînement#
Les transformers comme RTDETRv2 sont réputés pour leur forte consommation de mémoire pendant l’entraînement et nécessitent souvent une quantité importante de mémoire CUDA ainsi que des cycles d’entraînement plus longs pour converger complètement. À l’inverse, les architectures CNN comme YOLOv9 et les autres modèles Ultralytics YOLO utilisent nettement moins de mémoire, ce qui permet aux développeurs de s’entraîner avec des tailles de lot plus importantes sur du matériel grand public.
Pour maximiser l’utilisation du matériel, envisage d’utiliser l’Ultralytics Platform afin de rationaliser l’entraînement dans le cloud. Elle gère automatiquement la configuration de l’environnement et le dimensionnement optimal des lots.
L'avantage Ultralytics : écosystème et facilité d'utilisation#
Même si l’étude de dépôts autonomes comme les pages GitHub officielles de RTDETRv2 ou de YOLOv9 peut être très instructive, les environnements de production exigent stabilité, simplicité d’utilisation et écosystème bien maintenu. L’intégration de ces modèles via l’API Python d’Ultralytics offre une expérience développeur fluide.
API unifiée et polyvalence#
Le framework Ultralytics masque les complexités liées au chargement des données, aux augmentations et à l’entraînement distribué. De plus, tandis que le RTDETRv2 original se concentre strictement sur la détection, l’écosystème Ultralytics permet de passer facilement de la détection d’objets à la segmentation d’instances et à l’estimation de pose.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model on custom data
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)
# Easily switch to RT-DETR for complex scene evaluation
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")
# Export to production-ready formats like TensorRT
model_yolo.export(format="engine")Grâce à une documentation complète, au suivi automatique des expériences et à des fonctionnalités d’export fluides vers des formats comme ONNX, TensorRT et OpenVINO, Ultralytics réduit considérablement le délai entre le prototype et la production.
Cas d’utilisation idéaux#
Domaines d’excellence de RTDETRv2#
Grâce à son mécanisme d’attention globale, RTDETRv2 est particulièrement performant pour le traitement côté serveur et dans les environnements où le contexte global est primordial. Il excelle dans les domaines suivants :
- Imagerie médicale : identification d’anomalies subtiles pour lesquelles le contexte environnant est essentiel.
- Surveillance aérienne : détection de petits objets dans des images haute résolution prises par drone, sans les biais spatiaux des convolutions CNN traditionnelles.
- Analyse des foules denses : suivi d’individus lorsque les occultations importantes perturbent généralement les modèles fondés sur des ancres.
Domaines d’excellence de YOLOv9#
YOLOv9 est idéal pour les déploiements edge soumis à des contraintes de ressources. Son efficacité de calcul le rend particulièrement adapté aux domaines suivants :
- Robotique : navigation en temps réel et évitement d’obstacles nécessitant une latence minimale.
- IoT pour les villes intelligentes : déploiement sur des appareils edge comme le NVIDIA Jetson pour la surveillance du trafic.
- Inspection industrielle : contrôle qualité à grande vitesse sur les chaînes d’assemblage, nécessitant une fréquence d’images élevée (FPS).
L’avenir : voici Ultralytics YOLO26#
Bien que YOLOv9 et RTDETRv2 représentent d’immenses progrès, le paysage a évolué rapidement. Pour les déploiements modernes, le Ultralytics YOLO26 récemment publié représente la synergie ultime de ces deux philosophies architecturales.
En combinant les meilleurs aspects des transformers et des CNN, YOLO26 établit une nouvelle référence :
- Conception de bout en bout sans NMS : comme RTDETRv2, YOLO26 est nativement de bout en bout et élimine complètement le post-traitement NMS pour des pipelines de déploiement plus rapides, plus simples et hautement prévisibles.
- Optimiseur MuSGD : inspiré des techniques d’entraînement des grands modèles de langage (LLM), comme celles de Kimi K2 de Moonshot AI, YOLO26 utilise une combinaison de SGD et de Muon. Cela apporte à la vision par ordinateur une stabilité d’entraînement inégalée et une convergence rapide.
- Jusqu’à 43 % d’inférence plus rapide sur CPU : contrairement aux transformers lourds, YOLO26 est fortement optimisé pour l’edge computing et les appareils dépourvus de GPU.
- Suppression de DFL : la suppression de Distribution Focal Loss simplifie considérablement le graphe du modèle, garantissant un export fiable vers les appareils edge basse consommation et les unités de traitement neuronal (NPU) intégrées.
- ProgLoss + STAL : ces fonctions de perte améliorées renforcent considérablement la reconnaissance des petits objets, une fonctionnalité essentielle pour les jeux de données IoT et aériens.
Pour les équipes qui souhaitent démarrer un nouveau projet de vision par ordinateur, nous recommandons vivement d’évaluer YOLO26. Il offre l’élégance sans NMS d’un transformer, ainsi que la vitesse fulgurante et l’efficacité d’entraînement d’une architecture YOLO hautement optimisée.
Résumé#
Le choix entre RTDETRv2 et YOLOv9 dépend principalement de ton matériel de déploiement et de tes besoins spécifiques en matière de précision. RTDETRv2 offre une précision et une compréhension du contexte à la pointe de la technologie pour les applications adossées à un serveur, tandis que YOLOv9 fournit une efficacité exceptionnelle sur les appareils edge.
Toutefois, en tirant parti de l’écosystème Ultralytics mature, les développeurs peuvent expérimenter facilement les deux modèles. De plus, avec l’introduction de modèles plus récents comme YOLO11 et le YOLO26 nativement de bout en bout, il n’a jamais été aussi facile de trouver le juste équilibre entre inférence à grande vitesse, prise en charge polyvalente des tâches et faible consommation mémoire.