DAMO-YOLO vs EfficientDet#
L’évolution de la vision par ordinateur a donné naissance à de nombreuses architectures puissantes adaptées à divers besoins du monde réel. Certains frameworks privilégient une grande capacité de mise à l’échelle, tandis que d’autres se concentrent sur la vitesse d’inférence en temps réel. Dans cette comparaison technique, nous étudions DAMO-YOLO et EfficientDet, deux modèles très influents qui illustrent des approches distinctes de la détection d’objets. Nous analyserons leurs architectures, comparerons leurs performances de référence et verrons pourquoi le tout nouveau Ultralytics YOLO26 représente le choix optimal pour les déploiements modernes en production.
Présentation des architectures#
Les deux modèles ont été conçus pour résoudre le compromis entre efficacité et précision, mais ils s’appuient sur des mécanismes fondamentalement différents pour atteindre leurs objectifs.
DAMO-YOLO : la vitesse grâce à la recherche d’architecture neuronale#
Conçu pour repousser les limites de la détection en temps réel, DAMO-YOLO exploite des techniques de recherche automatisée afin de créer des réseaux très efficaces, adaptés aux environnements à faible latence.
Détails de DAMO-YOLO :
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : groupe Alibaba
- Date : 2022-11-23
- Arxiv : https://arxiv.org/abs/2211.15444v2
- GitHub : https://github.com/tinyvision/DAMO-YOLO
DAMO-YOLO s’articule autour d’un réseau de recherche d’architecture neuronale (NAS) qui optimise à la fois la vitesse et la précision. Il introduit RepGFPN (réseau pyramidal de caractéristiques généralisé reparamétré), qui améliore la fusion des caractéristiques tout en maintenant une vitesse d’inférence élevée. De plus, sa conception ZeroHead réduit au minimum la charge de calcul généralement associée aux têtes de détection. Le modèle tire également parti d’AlignedOTA (affectation optimale de transport alignée) et de l’amélioration par distillation, ce qui garantit que même les variantes les plus petites apprennent des représentations riches à partir de modèles plus grands.
EfficientDet : évolutivité grâce à la mise à l’échelle composée#
Contrairement à l’approche privilégiant la vitesse, EfficientDet met l’accent sur une évolutivité méthodique adaptée à différents budgets de calcul.
Détails d’EfficientDet :
- Auteurs : Mingxing Tan, Ruoming Pang et Quoc V. Le
- Organisation : Google Brain
- Date : 2019-11-20
- arXiv : https://arxiv.org/abs/1911.09070
- GitHub : https://github.com/google/automl/tree/master/efficientdet
EfficientDet introduit BiFPN (réseau pyramidal de caractéristiques bidirectionnel), qui facilite et accélère la fusion de caractéristiques à plusieurs échelles. Contrairement aux méthodes traditionnelles qui augmentent arbitrairement la taille des architectures en ajoutant des couches ou des canaux, EfficientDet utilise une méthode de mise à l’échelle composée qui ajuste uniformément et simultanément la résolution, la profondeur et la largeur du réseau dorsal, du réseau de caractéristiques et des réseaux de prédiction des boîtes et des classes. Le modèle atteint ainsi une précision de pointe sur du matériel haut de gamme, tout en proposant des variantes plus petites pour les environnements aux ressources limitées.
En savoir plus sur EfficientDet
Comparaison des performances et des métriques#
La comparaison côte à côte de ces modèles met en évidence le compromis entre précision pure et vitesse d’inférence. Le tableau ci-dessous présente les principales métriques de performance et montre comment les capacités d’inférence de DAMO-YOLO se comparent à celles de la famille de modèles EfficientDet.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Comme indiqué ci-dessus, EfficientDet-d7 atteint la meilleure précision globale, ce qui le rend adapté aux applications exigeantes dans le cloud. À l’inverse, la série DAMO-YOLO offre une précision très compétitive et une latence nettement inférieure sur GPU, ce qui en fait un meilleur candidat pour les déploiements en périphérie en temps réel.
Cas d’utilisation et recommandations#
Le choix entre DAMO-YOLO et EfficientDet dépend des exigences spécifiques de ton projet, des contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir DAMO-YOLO#
DAMO-YOLO est un excellent choix pour :
- Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
- Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
- Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.
Quand choisir EfficientDet#
EfficientDet est recommandé pour :
- Pipelines Google Cloud et TPU : systèmes étroitement intégrés aux API Google Cloud Vision ou à l’infrastructure TPU, où EfficientDet bénéficie d’une optimisation native.
- Recherche sur la mise à l’échelle composée : évaluation comparative universitaire axée sur l’étude des effets d’une mise à l’échelle équilibrée de la profondeur, de la largeur et de la résolution du réseau.
- Déploiement mobile avec LiteRT : projets nécessitant spécifiquement l’exportation vers LiteRT (anciennement TensorFlow Lite) pour Android ou les appareils Linux embarqués.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
La solution moderne : Ultralytics YOLO26#
Bien que DAMO-YOLO et EfficientDet représentent tous deux des jalons universitaires importants, le déploiement dans le monde réel exige souvent une approche plus équilibrée, riche en fonctionnalités et adaptée aux développeurs. C’est là qu’Ultralytics YOLO26 établit une nouvelle norme dans le secteur.
Sorti en janvier 2026, YOLO26 s’inscrit dans la lignée de ses prédécesseurs, notamment Ultralytics YOLO11 et YOLOv8, et change radicalement notre approche de la détection d’objets.
YOLO26 intègre une conception native de bout en bout sans NMS (nms=False). En éliminant la suppression non maximale (NMS) lors du post-traitement — un goulot d’étranglement qui pénalise les détecteurs d’objets depuis des années —, YOLO26 offre un pipeline de déploiement plus simple et beaucoup plus rapide, en particulier sur le matériel en périphérie.
Des performances et une polyvalence inégalées#
YOLO26 ne se contente pas d’améliorer la vitesse : il redéfinit la stabilité de l’entraînement et la précision. Il introduit l’optimiseur MuSGD, un hybride de SGD et de Muon inspiré des innovations en matière d’entraînement des LLM, qui permet une convergence nettement plus rapide et une efficacité d’entraînement supérieure. Contrairement aux solutions de remplacement lourdes fondées sur les Transformer, comme RT-DETR, YOLO26 nécessite très peu de mémoire et peut donc être entraîné sur du matériel grand public.
De plus, YOLO26 intègre ProgLoss + STAL, ce qui améliore considérablement la reconnaissance des petits objets, essentielle dans des cas d’usage comme les images aériennes prises par drone et la robotique. Pour optimiser le modèle en vue d’une utilisation sur des appareils basse consommation, YOLO26 abandonne la perte focale de distribution (DFL), ce qui permet d’accélérer l’inférence sur CPU jusqu’à 43 % par rapport aux générations précédentes.
Écosystème et facilité d'utilisation#
L’intégration complexe constitue l’un des principaux obstacles à l’utilisation de modèles comme EfficientDet. À l’inverse, la plateforme Ultralytics propose un écosystème de bout en bout bien maintenu. Grâce à une API unifiée, tu peux facilement passer de la détection à la segmentation d’instances, à la classification d’images, à l’estimation de pose et aux boîtes englobantes orientées (OBB).
Voici à quel point il est simple d’entraîner YOLO26 et d’exécuter l’inférence avec le package Python Ultralytics :
from ultralytics import YOLO
# Charger le modèle nano YOLO26 de pointe
model = YOLO("yolo26n.pt")
# Entraîner le modèle sur ton jeu de données personnalisé en utilisant un minimum de mémoire
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Exécuter une inférence ultra-rapide sans NMS
predictions = model.predict("https://ultralytics.com/images/bus.jpg", nms=False)Conclusion#
L’exploration de DAMO-YOLO face à EfficientDet permet de mieux comprendre les compromis entre recherche d’architecture neuronale et mise à l’échelle composée, mais les développeurs d’aujourd’hui ont besoin d’outils qui font le lien entre la recherche universitaire et les réalités de la mise en production.
Pour les développeurs qui privilégient la facilité d’utilisation, une communauté open source active et un équilibre sans compromis entre vitesse et précision, Ultralytics YOLO26 est le choix qui s’impose. Son architecture sans NMS, sa faible charge d’entraînement et son intégration transparente à l’écosystème Ultralytics en font le framework idéal pour ton prochain projet de vision par ordinateur.