YOLO11 vs EfficientDet#
Choisir le réseau neuronal optimal pour les projets de vision par ordinateur nécessite une bonne compréhension des architectures disponibles. Ce guide propose une comparaison technique approfondie entre Ultralytics YOLO11 et EfficientDet de Google. Nous examinerons leurs différences architecturales, leurs indicateurs de performance, l’efficacité de leur entraînement et leurs scénarios de déploiement idéaux afin de t’aider à prendre une décision éclairée pour tes charges de travail d’apprentissage automatique.
Présentation et caractéristiques des modèles#
Les deux modèles ont profondément marqué le domaine de l’apprentissage profond, bien qu’ils soient issus de philosophies de conception et d’époques différentes du développement de l’IA.
Détails sur YOLO11#
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : https://docs.ultralytics.com/models/yolo11
Présentation d’EfficientDet#
- Auteurs : Mingxing Tan, Ruoming Pang et Quoc V. Le
- Organisation : Google
- Date : 2019-11-20
- arXiv : https://arxiv.org/abs/1911.09070
- GitHub : https://github.com/google/automl/tree/master/efficientdet
- Documentation : https://github.com/google/automl/tree/master/efficientdet#readme
En savoir plus sur EfficientDet
Lorsqu’on travaille avec des modèles de vision par ordinateur, l’écosystème qui les entoure est tout aussi important que le modèle lui-même. L’écosystème Ultralytics offre une expérience de développement inégalée, avec une documentation complète, une communauté active et une exportation fluide vers des formats comme ONNX et TensorRT.
Innovations architecturales#
EfficientDet : BiFPN et mise à l’échelle composée#
Introduit fin 2019, EfficientDet visait à maximiser la précision tout en minimisant le coût de calcul. Il y parvient principalement grâce à deux mécanismes. Premièrement, il utilise un réseau de base EfficientNet, qui met à l’échelle de manière cohérente la profondeur, la largeur et la résolution. Deuxièmement, il a introduit le réseau pyramidal de caractéristiques bidirectionnel (BiFPN), qui permet une fusion de caractéristiques facile et rapide à plusieurs échelles.
Bien qu’EfficientDet ait été très efficace pour son époque, sa dépendance à la bibliothèque AutoML de TensorFlow peut le rendre rigide. Par rapport aux frameworks modernes et modulaires basés sur PyTorch, les chercheurs trouvent souvent difficiles l’élagage de modèles et les modifications personnalisées.
YOLO11 : extraction de caractéristiques améliorée et polyvalence#
YOLO11 marque une avancée majeure dans les architectures de détection d’objets. Il s’appuie sur les réussites de ses prédécesseurs et introduit des blocs C3k2 affinés ainsi qu’un module amélioré de mise en commun pyramidale spatiale. Ces améliorations permettent une extraction de caractéristiques supérieure, grâce à laquelle YOLO11 saisit des motifs visuels complexes avec une clarté exceptionnelle.
Un atout majeur de YOLO11 est sa polyvalence. Alors qu’EfficientDet est exclusivement un modèle de détection d’objets, YOLO11 prend nativement en charge la segmentation d’instances, la classification d’images, l’estimation de pose et les boîtes englobantes orientées (OBB). De plus, YOLO11 nécessite très peu de mémoire pendant l’entraînement comme pendant l’inférence, ce qui le rend nettement supérieur aux anciens modèles et aux transformers de vision volumineux lors du déploiement dans des environnements d’IA en périphérie aux ressources limitées.
Performances et benchmarks#
L’équilibre entre la précision, mesurée par la précision moyenne (mAP), et la vitesse d’inférence est le facteur déterminant pour les déploiements en conditions réelles. Le tableau ci-dessous présente les performances brutes des deux familles de modèles sur le jeu de données COCO standard.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Comme le montre le tableau, YOLO11 offre un excellent équilibre entre performances. YOLO11x atteint la meilleure précision globale (54,7 mAP), tandis que les variantes plus petites de YOLO11 dominent largement en vitesse d’inférence sur GPU (jusqu’à 1,5 ms sur un T4 avec TensorRT).
Efficacité de l’entraînement et écosystème#
La facilité d’utilisation est l’une des caractéristiques déterminantes des modèles Ultralytics. L’entraînement d’un modèle EfficientDet nécessite souvent de naviguer dans des configurations complexes de graphes TensorFlow et de gérer des chaînes de dépendances compliquées. À l’inverse, YOLO11 repose sur une base PyTorch moderne et épurée.
Grâce à cet écosystème bien entretenu, les développeurs peuvent installer le paquet, charger un modèle préentraîné et commencer à l’entraîner sur un jeu de données personnalisé en quelques lignes de code seulement.
Exemple de code Python#
Voici un exemple entièrement exécutable qui montre à quel point l’API Ultralytics est simple. Ce script télécharge un modèle YOLO11 préentraîné, l’entraîne et effectue une prédiction rapide.
from ultralytics import YOLO
# Initialise un modèle YOLO11 nano préentraîné
model = YOLO("yolo11n.pt")
# Entraîne efficacement le modèle avec le moteur PyTorch intégré
# L’entraînement est très efficace et nécessite moins de VRAM que les anciens modèles
results = model.train(data="coco8.yaml", epochs=10, imgsz=640, device="cpu")
# Lance l’inférence en temps réel sur une image d’exemple
prediction = model.predict("https://ultralytics.com/images/bus.jpg")
# Affiche les boîtes englobantes en sortie
prediction[0].show()Perspectives : l’avantage de YOLO26#
YOLO11 est particulièrement puissant, mais les équipes qui démarrent de nouveaux projets devraient sérieusement envisager Ultralytics YOLO26, lancé en janvier 2026. YOLO26 marque un changement de paradigme en matière de simplicité de déploiement et de performances en périphérie.
Principales innovations de YOLO26 :
- Conception de bout en bout sans NMS : une tête un-à-un facultative (
nms=False) ignore le post-traitement par suppression non maximale (NMS), ce qui assure à YOLO26 une latence constante et extrêmement faible, essentielle pour la robotique à grande vitesse et la conduite autonome. - Jusqu’à 43 % d’accélération de l’inférence sur CPU : YOLO26 est spécialement optimisé pour maximiser le débit sur les processeurs standard, pour les déploiements sans GPU dédié.
- Optimiseur MuSGD : inspiré de Kimi K2 de Moonshot AI, cet optimiseur hybride apporte à la vision par ordinateur la stabilité de l’entraînement des LLM et permet une convergence plus rapide.
- ProgLoss + STAL : ces fonctions de perte améliorées améliorent considérablement la reconnaissance des petits objets, souvent problématique dans l’analyse d’images satellite et les images prises par drone.
- Suppression de la DFL : l’abandon de la Distribution Focal Loss simplifie le processus d’exportation du modèle vers les appareils périphériques.
Cas d’utilisation et recommandations#
Le choix entre YOLO11 et EfficientDet dépend des exigences propres à ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLO11#
YOLO11 est un excellent choix pour :
- Déploiement en périphérie en production : applications commerciales sur des appareils comme Raspberry Pi ou NVIDIA Jetson, où la fiabilité et la maintenance active sont primordiales.
- Applications de vision multitâches : projets nécessitant la détection, la segmentation, l’estimation de pose et les OBB au sein d’un framework unifié.
- Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production à l’aide de l’API Python Ultralytics simplifiée.
Quand choisir EfficientDet#
EfficientDet est recommandé pour :
- Pipelines Google Cloud et TPU : systèmes étroitement intégrés aux API Google Cloud Vision ou à l’infrastructure TPU, où EfficientDet bénéficie d’une optimisation native.
- Recherche sur la mise à l’échelle composée : évaluation comparative universitaire axée sur l’étude des effets d’une mise à l’échelle équilibrée de la profondeur, de la largeur et de la résolution du réseau.
- Déploiement mobile avec LiteRT : projets nécessitant spécifiquement l’exportation vers LiteRT (anciennement TensorFlow Lite) pour Android ou les appareils Linux embarqués.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
Conclusion#
EfficientDet a été une architecture pionnière qui a démontré la viabilité de la mise à l’échelle composée pour la détection d’objets. Cependant, le rythme rapide de la recherche en IA a fait émerger des modèles tout simplement plus performants, plus faciles à intégrer et plus rapides à exécuter.
Grâce à ses solides capacités multitâches, à ses vitesses d’inférence GPU exceptionnelles et à ce qui est sans doute l’API la plus conviviale du secteur pour les développeurs, YOLO11 s’impose comme le choix évident pour les pipelines de vision modernes. Pour ceux qui visent la pointe absolue de la technologie — en particulier les déploiements privilégiant la périphérie — passer à YOLO26 offre la combinaison ultime d’une vitesse sans NMS et d’une précision inégalée.