YOLO Vision 2026 :

RTDETRv2 vs EfficientDet#

Sélectionner l'architecture de réseau de neurones optimale est un choix déterminant pour tout projet de computer vision. Cette comparaison technique complète décortique deux modèles de détection d'objets influents : RTDETRv2, un détecteur à base de Transformer de pointe, et EfficientDet, un réseau de neurones convolutionnel hautement évolutif. Nous évaluerons leurs architectures distinctes, leurs performance metrics, leurs méthodologies d'entraînement et leurs scénarios de déploiement idéaux pour t'aider à prendre des décisions fondées sur les données pour tes pipelines d'IA.

RTDETRv2 : Le Transformer de détection en temps réel#

S'appuyant sur le succès du RT-DETR original, RTDETRv2 affine le paradigme de object detection basé sur les Transformers. En optimisant les structures d'encodeur et de décodeur, il offre une haute précision tout en maintenant des vitesses d'inférence en temps réel, comblant ainsi efficacement le fossé entre les CNN traditionnels et les Vision Transformers.

Détails du modèle Auteurs : Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang et Yi Liu
Organisation : Baidu Date : 24-07-2024 Liens : Arxiv, GitHub, Docs

Architecture et points forts#

RTDETRv2 utilise une architecture hybride qui associe un puissant backbone CNN (souvent ResNet ou HGNet) à un décodeur Transformer efficace. La caractéristique la plus marquante de RTDETRv2 est sa capacité native à contourner la non-maximum suppression (NMS). Les détecteurs traditionnels nécessitent la NMS pour filtrer les boîtes englobantes en double, ce qui ajoute une inference latency variable lors du post-traitement. RTDETRv2 formule la détection comme un problème de prédiction directe d'ensembles, en utilisant l'appariement biparti pour générer des prédictions uniques.

Ce modèle excelle dans les déploiements côté serveur où la mémoire GPU est abondante. Son mécanisme d'attention globale offre une conscience contextuelle exceptionnelle, le rendant hautement apte à séparer les objets qui se chevauchent dans des environnements denses et encombrés tels que les security alarm systems automatisés ou la surveillance de foules denses.

Limites#

Bien que puissantes, les architectures de Transformers nécessitent intrinsèquement plus de mémoire CUDA pendant l'entraînement par rapport aux CNN standard. De plus, le fine-tuning de RTDETRv2 peut nécessiter des temps de convergence des training data prolongés, rendant le prototypage rapide légèrement plus gourmand en ressources.

En savoir plus sur RTDETRv2

EfficientDet : CNN évolutifs et efficaces#

EfficientDet a introduit une famille de modèles de détection d'objets optimisés à la fois pour la précision et l'efficacité à travers un large spectre de contraintes de ressources. Il reste un exemple classique de conception de machine vision évolutive.

Détails du modèle Auteurs : Mingxing Tan, Ruoming Pang et Quoc V. Le
Organisation : Google
Date : 20-11-2019
Links : Arxiv, GitHub, Docs

Architecture et points forts#

L'innovation derrière EfficientDet repose sur deux domaines clés : le Bi-directional Feature Pyramid Network (BiFPN) et une méthode de mise à l'échelle composée (compound scaling). Le BiFPN permet une feature extraction multi-échelle simple et rapide en introduisant des poids apprenables pour évaluer l'importance de différentes caractéristiques d'entrée, tout en appliquant de manière répétée une fusion de caractéristiques multi-échelle descendante et ascendante. La méthode de mise à l'échelle composée met à l'échelle uniformément la résolution, la profondeur et la largeur du réseau simultanément.

Les modèles EfficientDet vont du modèle ultra-léger D0 au modèle massif D7. Cela les rend extrêmement polyvalents pour les déploiements d'edge AI où les développeurs doivent concilier des budgets de calcul serrés avec des exigences de précision, tels que les premières applications mobiles d'augmented reality.

Limites#

EfficientDet est une architecture plus ancienne qui repose fortement sur les boîtes d'ancrage (anchor boxes) et le pipeline de post-traitement NMS traditionnel. Le processus de génération d'ancres nécessite un hyperparameter tuning minutieux, et l'étape de la NMS peut constituer un goulot d'étranglement pour le déploiement sur du matériel embarqué comme un Raspberry Pi. Il lui manque également un support natif pour les tâches modernes telles que la pose estimation ou les oriented bounding boxes (OBB).

En savoir plus sur EfficientDet

Comparaison des performances et des mesures#

Comprendre les compromis exacts entre ces modèles nécessite d'analyser leur débit et l'efficacité de leurs paramètres. Le tableau ci-dessous décrit comment la série moderne RTDETRv2 se compare à la famille évolutive EfficientDet.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Comme on peut le voir ci-dessus, RTDETRv2 atteint un mean Average Precision (mAP) significativement plus élevé pour des nombres de paramètres comparables à ceux des modèles EfficientDet de milieu de gamme, utilisant largement son architecture de Transformer pour accroître la précision.

Cas d'utilisation et recommandations#

Le choix entre RT-DETR et EfficientDet dépend des exigences spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d'écosystème.

Quand choisir RT-DETR#

RT-DETR est un choix solide pour :

  • Recherche sur la détection basée sur les Transformers : Projets explorant les mécanismes d'attention et les architectures de transformateurs pour la détection d'objets de bout en bout sans NMS.
  • Scénarios de haute précision avec latence flexible : Applications où la précision de détection est la priorité absolue et où une latence d'inférence légèrement plus élevée est acceptable.
  • Détection de grands objets : Scènes avec principalement des objets de taille moyenne à grande où le mécanisme d'attention globale des transformateurs offre un avantage naturel.

Quand choisir EfficientDet#

EfficientDet est recommandé pour :

  • Pipelines Google Cloud et TPU : Systèmes profondément intégrés aux API Google Cloud Vision ou à l'infrastructure TPU, où EfficientDet bénéficie d'une optimisation native.
  • Recherche sur le Compound Scaling : Analyse comparative académique axée sur l'étude des effets de l'équilibre entre la profondeur, la largeur et la résolution du réseau.
  • Déploiement mobile via TFLite : Les projets qui nécessitent spécifiquement une exportation TensorFlow Lite pour Android ou des appareils Linux embarqués.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre la meilleure combinaison de performance et d'expérience développeur :

  • Déploiement en périphérie sans NMS : Applications nécessitant une inférence cohérente et à faible latence sans la complexité du post-traitement par Non-Maximum Suppression.
  • Environnements CPU uniquement : Appareils sans accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 offre un avantage décisif.
  • Détection de petits objets : Les scénarios complexes tels que l'imagerie par drone aérien ou l'analyse par capteurs IoT où ProgLoss et STAL améliorent considérablement la précision sur les minuscules objets.

L'alternative Ultralytics : Faire progresser l'état de l'art#

Bien que RTDETRv2 et EfficientDet présentent tous deux de grands mérites, le développement d'IA moderne exige des frameworks qui offrent une developer experience fluide en plus de performances de pointe. L'Ultralytics ecosystem propose une approche nettement plus rationalisée pour les tâches de vision par ordinateur.

Si tu explores la détection de pointe, le nouveau Ultralytics YOLO26 synthétise les meilleurs aspects des CNN et des Transformers.

Pourquoi choisir YOLO26 ?

YOLO26 implémente une End-to-End NMS-Free Design, apportant la simplicité de déploiement de RTDETRv2 à l'architecture YOLO ultra-efficace. De plus, il introduit le MuSGD Optimizer—inspiré des innovations en matière d'entraînement de grands modèles de langage (LLM)—pour une stabilité d'entraînement supérieure. Avec la DFL Removal (suppression de la Distribution Focal Loss pour un export simplifié et une meilleure compatibilité avec les appareils de périphérie/basse consommation), YOLO26 affiche une inférence sur CPU jusqu'à 43 % plus rapide que les générations précédentes, ce an fait un choix exceptionnel pour l'edge computing par rapport aux modèles plus lourds. En outre, ProgLoss + STAL offre des fonctions de perte améliorées avec des améliorations notables dans la reconnaissance des petits objets, ce qui est critique pour l'IoT, la robotique et l'imagerie aérienne.

La facilité d'utilisation offerte par le Ultralytics Python package est inégalée. Les développeurs peuvent entraîner, valider et export models à l'aide d'une API intuitive qui abstrait le code passe-partout (boilerplate code) généralement requis par les dépôts de recherche.

from ultralytics import RTDETR

# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export for optimized inference on TensorRT
model.export(format="engine")

Les modèles Ultralytics prennent en charge nativement plusieurs tâches, notamment l'instance segmentation et l'image classification, offrant une boîte à outils polyvalente pour divers besoins industriels. De plus, la suppression de la Distribution Focal Loss (DFL) dans les modèles Ultralytics modernes simplifie le graphe de calcul, garantissant un export plus fluide vers les NPUs and TPUs embarqués.

Pour une data annotation et une gestion de modèles fluides, la Ultralytics Platform fournit un environnement cloud complet pour superviser l'ensemble du cycle de vie du machine learning, s'imposant comme le choix de premier plan pour déployer des solutions de vision par ordinateur robustes en production.

Commentaires