YOLO11 vs EfficientDet#
Sélectionner le réseau neuronal optimal pour les projets de vision par ordinateur nécessite une compréhension approfondie des architectures disponibles. Ce guide propose une comparaison technique détaillée entre Ultralytics YOLO11 et EfficientDet de Google. Nous examinerons leurs différences architecturales, leurs métriques de performance, l’efficacité de leur entraînement et leurs scénarios de déploiement idéaux afin de t’aider à prendre une décision éclairée pour tes charges de travail de machine learning.
Contexte et spécifications des modèles#
Les deux modèles ont eu un impact significatif sur le domaine du deep learning, bien qu’ils soient issus de philosophies de conception et d’époques différentes du développement de l’IA.
Détails de YOLO11#
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : https://docs.ultralytics.com/models/yolo11
Détails d’EfficientDet#
- Auteurs : Mingxing Tan, Ruoming Pang et Quoc V. Le
- Organisation : Google
- Date : 20/11/2019
- Arxiv : https://arxiv.org/abs/1911.09070
- GitHub : https://github.com/google/automl/tree/master/efficientdet
- Documentation : https://github.com/google/automl/tree/master/efficientdet#readme
Lorsque tu travailles avec des modèles de vision par ordinateur, l’écosystème qui les entoure est tout aussi important que le modèle lui-même. L’écosystème Ultralytics offre une expérience développeur inégalée, avec une documentation complète, un support communautaire actif et des capacités d’export transparentes vers des formats comme ONNX et TensorRT.
Innovations architecturales#
EfficientDet : BiFPN et mise à l’échelle composée#
Introduit fin 2019, EfficientDet visait à maximiser la précision tout en minimisant le coût de calcul. Il y parvient principalement grâce à deux mécanismes. Premièrement, il utilise un backbone EfficientNet qui met à l’échelle conjointement la profondeur, la largeur et la résolution. Deuxièmement, il a introduit le réseau pyramidal de caractéristiques bidirectionnel (BiFPN), qui permet une fusion de caractéristiques multi-échelle simple et rapide.
Bien qu’EfficientDet ait été très efficace pour son époque, sa dépendance à la bibliothèque AutoML de TensorFlow peut le rendre rigide. Les chercheurs trouvent souvent l’élagage des modèles et les modifications personnalisées difficiles par rapport aux frameworks modernes et modulaires basés sur PyTorch.
YOLO11 : extraction améliorée des caractéristiques et polyvalence#
YOLO11 représente une avancée majeure dans les architectures de détection d’objets. Il s’appuie sur les succès de ses prédécesseurs en introduisant des blocs C3k2 perfectionnés et un module de Spatial Pyramid Pooling amélioré. Ces améliorations permettent une extraction de caractéristiques supérieure, ce qui permet à YOLO11 de capturer des motifs visuels complexes avec une clarté exceptionnelle.
Un avantage majeur de YOLO11 est sa polyvalence. Alors qu’EfficientDet est strictement un modèle de détection d’objets, YOLO11 prend nativement en charge la segmentation d’instances, la classification d’images, l’estimation de pose et les boîtes englobantes orientées (OBB). De plus, YOLO11 affiche des besoins en mémoire extrêmement faibles pendant l’entraînement comme pendant l’inférence, ce qui le rend largement supérieur aux anciens modèles et aux transformers de vision volumineux lors d’un déploiement dans des environnements d’IA en périphérie soumis à des contraintes de ressources.
Performances et benchmarks#
L’équilibre entre la précision, mesurée par la précision moyenne (mAP), et la vitesse d’inférence est le facteur décisif pour les déploiements réels. Le tableau ci-dessous illustre les performances brutes des deux familles de modèles sur le jeu de données COCO standard.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Comme indiqué, YOLO11 atteint un équilibre de performance très favorable. YOLO11x obtient la meilleure précision globale (54,7 mAP), tandis que les variantes plus petites de YOLO11 dominent nettement en vitesse d’inférence sur GPU (jusqu’à 1,5 ms sur un T4 avec TensorRT).
Efficacité de l’entraînement et écosystème#
L’une des caractéristiques déterminantes des modèles Ultralytics est leur facilité d’utilisation. L’entraînement d’un modèle EfficientDet nécessite souvent de parcourir des configurations complexes de graphes TensorFlow et de gérer des chaînes de dépendances sophistiquées. À l’inverse, YOLO11 repose sur une base PyTorch claire et résolument moderne.
Cet écosystème bien maintenu permet aux développeurs d’installer le package, de charger un modèle préentraîné et de commencer à l’entraîner sur un jeu de données personnalisé en seulement quelques lignes de code.
Exemple de code Python#
Voici un exemple entièrement exécutable qui illustre la simplicité de l’API Ultralytics. Ce script télécharge un modèle YOLO11 préentraîné, l’entraîne et exécute une prédiction rapide.
from ultralytics import YOLO
# Initialize a pretrained YOLO11 nano model
model = YOLO("yolo11n.pt")
# Train the model efficiently using the integrated PyTorch engine
# Training efficiency is high, requiring less VRAM than legacy models
results = model.train(data="coco8.yaml", epochs=10, imgsz=640, device="cpu")
# Run real-time inference on a sample image
prediction = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the output bounding boxes
prediction[0].show()Vers l’avenir : l’avantage de YOLO26#
Bien que YOLO11 soit exceptionnellement puissant, les équipes qui démarrent de nouveaux projets devraient sérieusement envisager Ultralytics YOLO26, sorti en janvier 2026. YOLO26 représente un changement de paradigme en matière de simplicité de déploiement et de performances en périphérie.
Les principales innovations de YOLO26 comprennent :
- Conception de bout en bout sans NMS : En éliminant la suppression des non-maxima (NMS) lors du post-traitement, YOLO26 garantit une latence constante et extrêmement faible, essentielle pour la robotique à haute vitesse et la conduite autonome.
- Jusqu’à 43 % d’inférence plus rapide sur CPU : Pour les déploiements dépourvus de GPU dédiés, YOLO26 est spécifiquement optimisé pour maximiser le débit sur les processeurs standard.
- Optimiseur MuSGD : Inspiré de Kimi K2 de Moonshot AI, cet optimiseur hybride apporte la stabilité de l’entraînement des LLM à la vision par ordinateur et permet une convergence plus rapide.
- ProgLoss + STAL : Ces fonctions de perte améliorées renforcent considérablement la reconnaissance des petits objets, qui constitue souvent un point sensible de l’analyse d’images satellite et des séquences filmées par drone.
- Suppression de DFL : La suppression de Distribution Focal Loss simplifie le processus d’exportation du modèle vers les appareils en périphérie.
Cas d'utilisation et recommandations#
Le choix entre YOLO11 et EfficientDet dépend de tes exigences spécifiques, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir YOLO11#
YOLO11 est un choix particulièrement adapté pour :
- Déploiement edge en production : applications commerciales sur des appareils tels que Raspberry Pi ou NVIDIA Jetson, pour lesquelles la fiabilité et la maintenance active sont primordiales.
- Applications de vision multitâches : projets nécessitant la détection, la segmentation, l'estimation de pose et les OBB dans un framework unifié unique.
- Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production grâce à l'API Python Ultralytics simplifiée.
Quand choisir EfficientDet#
EfficientDet est recommandé pour :
- Pipelines Google Cloud et TPU : Les systèmes profondément intégrés aux API Google Cloud Vision ou à une infrastructure TPU, où EfficientDet bénéficie d’une optimisation native.
- Recherche sur la mise à l’échelle composée : Les évaluations universitaires axées sur l’étude des effets de la mise à l’échelle équilibrée de la profondeur, de la largeur et de la résolution des réseaux.
- Déploiement mobile via TFLite : Les projets qui nécessitent spécifiquement un export TensorFlow Lite pour Android ou les appareils Linux embarqués.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur compromis entre performance et expérience développeur :
- Déploiement edge sans NMS : les applications nécessitant une inférence cohérente à faible latence, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d'accélération GPU dédiée, où l'inférence CPU jusqu'à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les scénarios difficiles comme les images aériennes prises par drone ou l'analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision sur les objets minuscules.
Conclusion#
EfficientDet a été une architecture pionnière qui a démontré la viabilité de la mise à l’échelle composée dans la détection d’objets. Cependant, le rythme rapide de la recherche en IA a fait émerger des modèles tout simplement plus performants, plus faciles à intégrer et plus rapides à exécuter.
Grâce à ses solides capacités multitâches, à ses vitesses d’inférence GPU exceptionnelles et à une API sans doute parmi les plus conviviales pour les développeurs du secteur, YOLO11 s’impose clairement pour les pipelines de vision modernes. Pour ceux qui visent la frontière absolue de la technologie, notamment les déploiements d’abord conçus pour la périphérie, passer à YOLO26 offre la combinaison ultime d’une vitesse sans NMS et d’une précision inégalée.