Ultralytics YOLO27 :
Get Started

EfficientDet ou RTDETRv2#

Choisir l’architecture optimale pour les projets de vision par ordinateur nécessite de s’orienter dans un vaste éventail de réseaux neuronaux. Ce guide propose une comparaison technique détaillée de deux approches distinctes : EfficientDet, une famille très évolutive de réseaux neuronaux convolutifs (CNN), et RTDETRv2, un modèle Transformer de pointe pour le temps réel. Nous évaluons leurs différences structurelles, leurs méthodes d’entraînement et leur adéquation au déploiement dans divers environnements matériels.

En comprenant les compromis entre l’efficacité des modèles existants et les capacités modernes des Transformers, les développeurs peuvent prendre des décisions éclairées. Nous verrons également comment les solutions modernes comme le nouveau Ultralytics YOLO26 comblent l’écart en offrant une vitesse, une précision et une simplicité d’utilisation inégalées.

Comprendre EfficientDet#

EfficientDet a révolutionné la détection d’objets en introduisant une approche rigoureuse de la mise à l’échelle des modèles.

Architecture et concepts fondamentaux#

À la base, EfficientDet utilise EfficientNet comme backbone et introduit le réseau pyramidal de caractéristiques bidirectionnel (BiFPN). BiFPN permet une fusion multi-échelle simple et rapide des caractéristiques en appliquant des poids apprenables pour déterminer l’importance des différentes caractéristiques d’entrée. Cette méthode est associée à une mise à l’échelle composée qui ajuste simultanément et uniformément la résolution, la profondeur et la largeur de tous les backbones, réseaux de caractéristiques et réseaux de prédiction des boîtes et des classes.

Atouts et limites#

Le principal atout d’EfficientDet est l’efficacité de ses paramètres. À sa sortie, des modèles comme EfficientDet-D0 atteignaient une précision supérieure avec moins de paramètres et de FLOPs que les versions précédentes de YOLO. Cela le rendait très intéressant dans les environnements soumis à des limites de calcul strictes.

Cependant, EfficientDet utilise la suppression non maximale standard (NMS) au post-traitement pour filtrer les boîtes englobantes qui se chevauchent, ce qui peut créer des goulots d’étranglement de latence dans les pipelines en temps réel. De plus, bien que le processus d’entraînement soit bien documenté, le réglage fin d’EfficientDet peut s’avérer fastidieux par rapport aux expériences développeur hautement optimisées des outils modernes.

En savoir plus sur EfficientDet

Prise en charge des anciennes versions

EfficientDet a ouvert la voie aux réseaux évolutifs, mais le déploiement de ces modèles sur des NPU modernes nécessite souvent une optimisation manuelle poussée. Pour simplifier les déploiements, les nouveaux modèles Ultralytics proposent une fonction d’exportation en un clic.

Découvrir RTDETRv2#

RTDETRv2 marque une évolution des architectures basées sur Transformer et s’éloigne du paradigme traditionnel des CNN à ancres.

Avancées des Transformers#

RTDETRv2 s’appuie sur le modèle de référence Real-Time Detection Transformer (RT-DETR). Il utilise des mécanismes d’attention globale qui permettent au modèle de comprendre le contexte complexe des scènes sans les contraintes localisées des convolutions standard. Son principal avantage architectural est sa conception nativement sans NMS. En prédisant directement les objets à partir de l’image d’entrée, il simplifie le pipeline d’inférence et évite le réglage heuristique nécessaire au post-traitement par NMS.

Points forts et points faibles#

RTDETRv2 excelle dans les environnements denses où les objets qui se chevauchent perturbent les CNN traditionnels. Il est très précis sur des jeux de données de référence comme COCO complexes.

Malgré leur précision, les modèles Transformer nécessitent naturellement beaucoup de mémoire. L’entraînement est nettement moins efficace : par rapport aux CNN, il faut beaucoup plus d’époques et une empreinte mémoire CUDA supérieure pour atteindre la convergence. RTDETRv2 convient donc moins aux développeurs disposant d’un budget cloud limité ou ayant besoin de prototyper rapidement.

En savoir plus sur RTDETRv2

Contraintes de mémoire des Transformers

L’entraînement de modèles Transformer comme RTDETRv2 nécessite généralement des GPU haut de gamme. Si tu rencontres des erreurs de mémoire insuffisante (OOM), envisage d’utiliser des modèles moins gourmands en mémoire pendant l’entraînement, comme la gamme Ultralytics YOLO.

Comparaison des performances sur benchmark#

Comprendre les indicateurs de performance bruts est essentiel pour choisir un modèle. Le tableau suivant compare EfficientDet et RTDETRv2 dans différentes tailles.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Cas d’utilisation et recommandations#

Le choix entre EfficientDet et RT-DETR dépend de tes exigences spécifiques, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.

Quand choisir EfficientDet#

EfficientDet est un bon choix pour :

  • Pipelines Google Cloud et TPU : systèmes étroitement intégrés aux API Google Cloud Vision ou à l’infrastructure TPU, où EfficientDet bénéficie d’une optimisation native.
  • Recherche sur la mise à l’échelle composée : évaluation comparative universitaire axée sur l’étude des effets d’une mise à l’échelle équilibrée de la profondeur, de la largeur et de la résolution du réseau.
  • Déploiement mobile avec LiteRT : projets nécessitant spécifiquement l’exportation vers LiteRT (anciennement TensorFlow Lite) pour Android ou les appareils Linux embarqués.

Quand choisir RT-DETR#

RT-DETR est recommandé pour :

  • Recherche sur la détection basée sur les Transformer : projets étudiant les mécanismes d’attention et les architectures Transformer pour la détection d’objets de bout en bout sans NMS.
  • Scénarios exigeant une grande précision et une latence flexible : applications où la précision de détection est prioritaire et où une latence d’inférence légèrement supérieure est acceptable.
  • Détection de grands objets : scènes composées principalement d’objets de taille moyenne à grande, pour lesquelles le mécanisme d’attention globale des Transformer offre un avantage naturel.

Quand choisir Ultralytics (YOLO26)#

Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :

  • Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
  • Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
  • Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.

L’avantage Ultralytics : présentation de YOLO26#

EfficientDet et RTDETRv2 ont marqué l’histoire de la vision par ordinateur, mais les environnements de production modernes exigent un équilibre parfait entre vitesse, précision et expérience développeur exceptionnelle. Le tout récent Ultralytics YOLO26 réunit les meilleurs aspects de ces architectures différentes.

YOLO26 se distingue en associant le flux de travail rationalisé de l’écosystème Ultralytics à des mécanismes internes révolutionnaires.

Pourquoi choisir YOLO26 plutôt que ses concurrents ?#

  • Conception de bout en bout sans NMS : s’inspirant de Transformers comme RTDETRv2, YOLO26 propose une tête de bout en bout optionnelle (nms=False) qui élimine le post-traitement par NMS et garantit des pipelines de déploiement plus rapides et simples, sans l’énorme surcharge en paramètres des Transformers purs.
  • Optimiseur MuSGD : inspiré des innovations dans l’entraînement des grands modèles de langage (comme Kimi K2 de Moonshot AI), YOLO26 utilise une approche hybride combinant SGD et Muon. Cela apporte une stabilité d’entraînement inédite et des taux de convergence nettement plus rapides que les longues phases d’entraînement requises par RTDETRv2.
  • Optimisé pour l’edge : avec une inférence CPU jusqu’à 43 % plus rapide, YOLO26 est conçu pour l’IA en périphérie. Il surpasse facilement les modèles Transformer lourds sur du matériel aux ressources limitées, comme les téléphones mobiles et les caméras intelligentes.
  • Suppression de DFL : la suppression de la perte focale de distribution simplifie le graphe du modèle et facilite les exportations fluides vers TensorRT et ONNX.
  • ProgLoss + STAL : ces fonctions de perte avancées améliorent nettement la reconnaissance des petits objets et résolvent un problème récurrent en imagerie aérienne et en robotique.
  • Polyvalence : contrairement à RTDETRv2, principalement axé sur la détection, YOLO26 prend nativement en charge la segmentation d’instances, la classification d’images, l’estimation de pose et les boîtes englobantes orientées (OBB), avec des améliorations propres à chaque tâche, comme RLE pour la pose et une fonction de perte d’angle spécialisée pour les OBB.
Écosystème intégré

Avec l’Ultralytics Platform, tu peux gérer tes jeux de données, entraîner dans le cloud des modèles comme YOLO26 ou YOLO11, puis les déployer facilement au moyen d’API flexibles.

La simplicité du code avec Ultralytics#

L’API Python d’Ultralytics, bien entretenue, simplifie considérablement l’entraînement et l’inférence des modèles. Les développeurs peuvent facilement comparer les performances des modèles ou lancer des scripts d’entraînement avec très peu de code passe-partout.

from ultralytics import YOLO

# Charger le modèle YOLO26 à la pointe de la technologie
model = YOLO("yolo26n.pt")

# Entraîner le modèle sur ton jeu de données personnalisé
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Exécuter l’inférence sur une image de test
predictions = model.predict("image.jpg")

Pour les équipes qui gèrent une infrastructure existante, l’acclamé Ultralytics YOLOv8 reste un choix stable et puissant, gage de la fiabilité à long terme de l’écosystème Ultralytics. Que tu exécutes des algorithmes complexes de suivi en temps réel ou une simple détection de défauts, passer à YOLO26 garantit un système pérenne, très précis et économe en mémoire.

Commentaires