RTDETRv2 vs EfficientDet#
Choisir l’architecture de réseau neuronal optimale est une décision déterminante pour tout projet de vision par ordinateur. Cette comparaison technique complète examine deux modèles influents de détection d’objets : RTDETRv2, un détecteur Transformer de pointe, et EfficientDet, un réseau neuronal convolutif hautement évolutif. Nous évaluerons leurs architectures distinctes, leurs métriques de performance, leurs méthodologies d’entraînement et leurs scénarios de déploiement idéaux pour t’aider à prendre des décisions fondées sur les données pour tes pipelines d’IA.
RTDETRv2 : le Transformer de détection en temps réel#
S’appuyant sur le succès du RT-DETR original, RTDETRv2 affine le paradigme de la détection d’objets basée sur les Transformers. En optimisant les structures de l’encodeur et du décodeur, il offre une grande précision tout en maintenant des vitesses d’inférence en temps réel, comblant ainsi efficacement le fossé entre les CNN traditionnels et les Transformers pour la vision.
Détails du modèle
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Liens : Arxiv, GitHub, Documentation
Architecture et principaux atouts#
RTDETRv2 utilise une architecture hybride qui associe un puissant backbone CNN (souvent ResNet ou HGNet) à un décodeur Transformer efficace. La caractéristique la plus marquante de RTDETRv2 est sa capacité native à contourner la suppression non maximale (NMS). Les détecteurs traditionnels ont besoin de NMS pour filtrer les boîtes englobantes en double, ce qui ajoute une latence d’inférence variable pendant le post-traitement. RTDETRv2 formule la détection comme un problème de prédiction directe d’ensembles et utilise un appariement biparti pour produire des prédictions uniques.
Ce modèle excelle dans les déploiements côté serveur où la mémoire GPU est abondante. Son mécanisme d’attention globale offre une perception contextuelle exceptionnelle, ce qui le rend particulièrement efficace pour séparer les objets qui se chevauchent dans des environnements denses et encombrés, comme les systèmes d’alarme de sécurité automatisés ou la surveillance de foules importantes.
Limites#
Bien qu’elles soient puissantes, les architectures Transformer nécessitent intrinsèquement davantage de mémoire CUDA pendant l’entraînement que les CNN standard. De plus, le réglage fin de RTDETRv2 peut nécessiter des temps de convergence prolongés avec les données d’entraînement, ce qui rend le prototypage rapide un peu plus gourmand en ressources.
EfficientDet : des CNN évolutifs et efficaces#
EfficientDet a introduit une famille de modèles de détection d’objets optimisés à la fois pour la précision et l’efficacité, sur un large éventail de contraintes de ressources. Il reste un exemple classique de conception évolutive en vision artificielle.
Détails du modèle
- Auteurs : Mingxing Tan, Ruoming Pang et Quoc V. Le
- Organisation : Google
- Date : 2019-11-20
- Liens : Arxiv, GitHub, Documentation
Architecture et principaux atouts#
L’innovation d’EfficientDet repose sur deux éléments clés : le réseau pyramidal de caractéristiques bidirectionnel (BiFPN) et une méthode de mise à l’échelle composée. BiFPN permet une extraction de caractéristiques multi-échelles simple et rapide en attribuant des poids apprenables à l’importance des différentes caractéristiques d’entrée, tout en appliquant à plusieurs reprises une fusion de caractéristiques multi-échelles ascendante et descendante. La méthode de mise à l’échelle composée ajuste simultanément et uniformément la résolution, la profondeur et la largeur du réseau.
Les modèles EfficientDet vont de l’ultraléger D0 au massif D7. Ils sont donc particulièrement polyvalents pour les déploiements d’IA en périphérie, où les développeurs doivent trouver un équilibre entre des budgets de calcul serrés et les exigences de précision, comme dans les premières applications de réalité augmentée mobiles.
Limites#
EfficientDet est une architecture ancienne qui s’appuie fortement sur les boîtes d’ancrage et le pipeline de post-traitement NMS traditionnel. La génération des ancres nécessite un réglage minutieux des hyperparamètres, et l’étape NMS peut ralentir le déploiement sur du matériel embarqué comme un Raspberry Pi. Il ne prend pas non plus en charge nativement des tâches modernes comme l’estimation de pose ou les boîtes englobantes orientées (OBB).
En savoir plus sur EfficientDet
Comparaison des performances et des métriques#
Pour comprendre précisément les compromis entre ces modèles, il faut analyser leur débit et l’efficacité de leurs paramètres. Le tableau ci-dessous compare la série moderne RTDETRv2 à la famille évolutive EfficientDet.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Comme indiqué ci-dessus, RTDETRv2 égale ou dépasse la précision moyenne moyenne (mAP) des modèles EfficientDet de taille similaire, tout en étant beaucoup plus rapide sur GPU (par exemple, 53,4 mAP en 9,76 ms pour RTDETRv2-l, contre 52,6 mAP en 89,29 ms pour EfficientDet-d6), grâce à l’utilisation intensive de son architecture Transformer pour améliorer la précision.
Cas d’utilisation et recommandations#
Le choix entre RT-DETR et EfficientDet dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir RT-DETR#
RT-DETR est un excellent choix pour :
- Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
- Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
- Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.
Quand choisir EfficientDet#
EfficientDet est recommandé pour :
- Pipelines Google Cloud et TPU : systèmes étroitement intégrés aux API Google Cloud Vision ou à l’infrastructure TPU, où EfficientDet bénéficie d’une optimisation native.
- Recherche sur la mise à l’échelle composée : évaluation comparative universitaire axée sur l’étude des effets d’une mise à l’échelle équilibrée de la profondeur, de la largeur et de la résolution du réseau.
- Déploiement mobile avec LiteRT : projets nécessitant spécifiquement l’exportation vers LiteRT (anciennement TensorFlow Lite) pour Android ou les appareils Linux embarqués.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
L’alternative Ultralytics : faire progresser l’état de l’art#
Bien que RTDETRv2 et EfficientDet présentent tous deux de solides atouts, le développement moderne de l’IA exige des frameworks offrant une expérience développeur fluide, en plus de performances de pointe. L’écosystème Ultralytics propose une approche nettement plus rationalisée des tâches de vision par ordinateur.
Si tu explores la détection de pointe, le tout nouveau Ultralytics YOLO26 réunit les meilleurs atouts des CNNs et des transformers.
YOLO26 propose une conception de bout en bout sans NMS (nms=False) en option, qui apporte à l’architecture YOLO ultra-efficace la simplicité de déploiement de RTDETRv2. Il introduit également l’optimiseur MuSGD, inspiré des innovations de l’entraînement des LLM, pour une stabilité d’entraînement supérieure. Grâce à la suppression de DFL (Distribution Focal Loss), qui simplifie l’exportation et améliore la compatibilité avec les appareils périphériques et à faible consommation, YOLO26 offre une inférence sur CPU jusqu’à 43 % plus rapide que les générations précédentes, ce qui en fait un excellent choix pour l’informatique en périphérie face à des modèles plus lourds. De plus, ProgLoss + STAL fournit des fonctions de perte améliorées, avec des progrès notables dans la reconnaissance des petits objets, essentielle pour l’IoT, la robotique et l’imagerie aérienne.
La simplicité d’utilisation du package Python Ultralytics est inégalée. Les développeurs peuvent entraîner, valider et exporter des modèles à l’aide d’une API intuitive qui évite le code passe-partout généralement requis par les dépôts de recherche.
from ultralytics import RTDETR
# Charger un modèle RT-DETR préentraîné depuis l’écosystème Ultralytics
model = RTDETR("rtdetr-l.pt")
# Entraîner le modèle sur le jeu de données COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exporter pour optimiser l’inférence sur TensorRT
model.export(format="engine")Les modèles Ultralytics prennent nativement en charge plusieurs tâches, dont la segmentation d’instances et la classification d’images, offrant ainsi une boîte à outils polyvalente adaptée aux besoins de nombreux secteurs. De plus, la suppression de Distribution Focal Loss (DFL) dans les modèles Ultralytics modernes simplifie le graphe de calcul et garantit une exportation plus fluide vers les NPU et TPU embarqués.
Pour faciliter l’annotation des données et la gestion des modèles, la plateforme Ultralytics fournit un environnement cloud complet qui permet de superviser l’ensemble du cycle de vie du machine learning, ce qui en fait le choix de premier plan pour déployer en production des solutions robustes de vision par ordinateur.