RTDETRv2 vs EfficientDet#
Choisir l'architecture de réseau neuronal optimale est une décision déterminante pour tout projet de vision par ordinateur. Cette comparaison technique complète examine en détail deux modèles influents de détection d'objets : RTDETRv2, un détecteur de pointe basé sur un Transformer, et EfficientDet, un réseau neuronal convolutif hautement évolutif. Nous évaluerons leurs architectures distinctes, leurs métriques de performance, leurs méthodes d'entraînement et leurs scénarios de déploiement idéaux afin de t'aider à prendre des décisions fondées sur les données pour tes pipelines d'IA.
RTDETRv2 : le Transformer de détection en temps réel#
S'appuyant sur le succès du RT-DETR original, RTDETRv2 perfectionne le paradigme de la détection d'objets basée sur un Transformer. En optimisant les structures de l'encodeur et du décodeur, il offre une grande précision tout en maintenant des vitesses d'inférence en temps réel, comblant ainsi efficacement l'écart entre les CNN traditionnels et les Transformers de vision.
Détails du modèle
- Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
- Organisation : Baidu
- Date : 2024-07-24
- Liens : Arxiv, GitHub, Documentation
Architecture et principaux atouts#
RTDETRv2 utilise une architecture hybride qui associe un puissant backbone CNN (souvent ResNet ou HGNet) à un décodeur Transformer efficace. La caractéristique la plus distinctive de RTDETRv2 est sa capacité native à contourner la suppression des non-maxima (NMS). Les détecteurs traditionnels nécessitent le NMS pour filtrer les boîtes englobantes dupliquées, ce qui ajoute une latence d'inférence variable lors du post-traitement. RTDETRv2 formule la détection comme un problème de prédiction directe d'un ensemble, en utilisant une mise en correspondance bipartite pour produire des prédictions uniques.
Ce modèle excelle dans les déploiements côté serveur, où la mémoire GPU est abondante. Son mécanisme d'attention globale lui confère une compréhension exceptionnelle du contexte, ce qui le rend particulièrement performant pour séparer des objets qui se chevauchent dans des environnements denses et encombrés, tels que les systèmes d'alarme de sécurité automatisés ou la surveillance de foules compactes.
Limites#
Bien qu'elles soient puissantes, les architectures Transformer nécessitent intrinsèquement davantage de mémoire CUDA lors de l'entraînement que les CNN standard. De plus, l'ajustement fin de RTDETRv2 peut nécessiter des temps de convergence plus longs pour les données d'entraînement, ce qui rend le prototypage rapide légèrement plus gourmand en ressources.
EfficientDet : des CNN évolutifs et efficaces#
EfficientDet a introduit une famille de modèles de détection d'objets optimisés à la fois pour la précision et l'efficacité, dans un large éventail de contraintes de ressources. Il reste un exemple classique de conception évolutive de la vision industrielle.
Détails du modèle
- Auteurs : Mingxing Tan, Ruoming Pang et Quoc V. Le
- Organisation : Google
- Date : 20/11/2019
- Liens : Arxiv, GitHub, Documentation
Architecture et principaux atouts#
L'innovation d'EfficientDet repose sur deux domaines clés : le réseau pyramidal de caractéristiques bidirectionnel (BiFPN) et une méthode de mise à l'échelle composée. BiFPN permet une extraction de caractéristiques multi-échelle simple et rapide en introduisant des poids apprenables pour déterminer l'importance des différentes caractéristiques d'entrée, tout en appliquant de manière répétée une fusion de caractéristiques multi-échelle descendante et ascendante. La méthode de mise à l'échelle composée ajuste uniformément et simultanément la résolution, la profondeur et la largeur du réseau.
Les modèles EfficientDet vont du D0 ultraléger au D7 massif. Ils sont ainsi très polyvalents pour les déploiements d'IA en périphérie, où les développeurs doivent trouver un équilibre entre des budgets de calcul serrés et les exigences de précision, comme dans les premières applications mobiles de réalité augmentée.
Limites#
EfficientDet est une architecture plus ancienne qui repose fortement sur les boîtes d'ancrage et le pipeline traditionnel de post-traitement NMS. Le processus de génération des ancres nécessite un réglage minutieux des hyperparamètres, et l'étape NMS peut devenir un goulot d'étranglement lors du déploiement sur du matériel embarqué comme un Raspberry Pi. Il ne prend pas non plus en charge nativement des tâches modernes comme l'estimation de pose ou les boîtes englobantes orientées (OBB).
Comparaison des performances et des métriques#
Pour comprendre les compromis exacts entre ces modèles, il faut analyser leur débit et l'efficacité de leurs paramètres. Le tableau ci-dessous présente une comparaison entre la série moderne RTDETRv2 et la famille EfficientDet évolutive.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Comme indiqué ci-dessus, RTDETRv2 atteint une précision moyenne (mAP) nettement supérieure avec un nombre de paramètres comparable à celui des modèles EfficientDet de milieu de gamme, en exploitant largement son architecture Transformer pour améliorer la précision.
Cas d'utilisation et recommandations#
Le choix entre RT-DETR et EfficientDet dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.
Quand choisir RT-DETR#
RT-DETR est un choix pertinent pour :
- Recherche sur la détection basée sur Transformer : Projets qui explorent les mécanismes d'attention et les architectures Transformer pour la détection d'objets de bout en bout sans NMS.
- Scénarios de haute précision avec une latence flexible : Applications où la précision de détection est prioritaire et où une latence d'inférence légèrement supérieure est acceptable.
- Détection de grands objets : Scènes contenant principalement des objets moyens à grands, où le mécanisme d'attention globale des Transformers offre un avantage naturel.
Quand choisir EfficientDet#
EfficientDet est recommandé pour :
- Pipelines Google Cloud et TPU : Les systèmes profondément intégrés aux API Google Cloud Vision ou à une infrastructure TPU, où EfficientDet bénéficie d’une optimisation native.
- Recherche sur la mise à l’échelle composée : Les évaluations universitaires axées sur l’étude des effets de la mise à l’échelle équilibrée de la profondeur, de la largeur et de la résolution des réseaux.
- Déploiement mobile via TFLite : Les projets qui nécessitent spécifiquement un export TensorFlow Lite pour Android ou les appareils Linux embarqués.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
L'alternative Ultralytics : faire progresser l'état de l'art#
Bien que RTDETRv2 et EfficientDet présentent tous deux de solides atouts, le développement moderne de l'IA exige des frameworks qui offrent une expérience développeur fluide, ainsi que des performances de pointe. L'écosystème Ultralytics propose une approche nettement plus rationalisée des tâches de vision par ordinateur.
Si tu explores la détection de pointe, le nouveau Ultralytics YOLO26 synthétise les meilleurs aspects des CNN et des Transformers.
YOLO26 met en œuvre une conception de bout en bout sans NMS, offrant la simplicité de déploiement de RTDETRv2 à l'architecture YOLO ultra-efficace. Il introduit également l'optimiseur MuSGD, inspiré des innovations en matière d'entraînement des LLM, pour une meilleure stabilité d'entraînement. Avec la suppression de DFL (suppression de la perte focale de distribution pour simplifier l'exportation et améliorer la compatibilité avec les appareils en périphérie et basse consommation), YOLO26 offre une inférence CPU jusqu'à 43 % plus rapide que les générations précédentes, ce qui en fait un choix exceptionnel pour l'informatique en périphérie par rapport aux modèles plus lourds. De plus, ProgLoss + STAL fournit des fonctions de perte améliorées, avec des progrès notables dans la reconnaissance des petits objets, essentielle pour l'IoT, la robotique et l'imagerie aérienne.
La simplicité d'utilisation offerte par le package Python Ultralytics est inégalée. Les développeurs peuvent entraîner, valider et exporter des modèles à l'aide d'une API intuitive qui masque le code standard généralement requis par les dépôts de recherche.
from ultralytics import RTDETR
# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export for optimized inference on TensorRT
model.export(format="engine")Les modèles Ultralytics prennent nativement en charge plusieurs tâches, notamment la segmentation d'instances et la classification d'images, fournissant une boîte à outils polyvalente pour répondre aux divers besoins des secteurs. De plus, la suppression de la perte focale de distribution (DFL) dans les modèles Ultralytics modernes simplifie le graphe de calcul, garantissant un export plus fluide vers les NPU et TPU embarqués.
Pour une annotation des données et une gestion des modèles fluides, la plateforme Ultralytics fournit un environnement cloud complet permettant de superviser l'ensemble du cycle de vie du machine learning, ce qui en fait le choix privilégié pour déployer des solutions de vision par ordinateur robustes en production.