DAMO-YOLO vs YOLOv7#
L’évolution rapide de la vision par ordinateur a donné naissance à des modèles de détection d’objets très efficaces, conçus pour équilibrer précision et coût de calcul. DAMO-YOLO et YOLOv7, deux modèles notables lancés en 2022, visent tous deux à repousser les limites des tâches de vision en temps réel, mais obtiennent leurs résultats grâce à des paradigmes architecturaux et des méthodes d’entraînement très différents.
Cette comparaison technique approfondie examine les approches distinctes des deux modèles, en étudiant leurs architectures, leur potentiel de déploiement et leurs métriques de performance, afin d’aider les ingénieurs en apprentissage automatique à choisir le bon outil pour leurs applications de vision par ordinateur.
Origines et métadonnées des modèles#
Avant d’entrer dans l’analyse technique approfondie, il est essentiel de replacer dans leur contexte les origines de ces deux modèles de vision par ordinateur.
DAMO-YOLO#
Développé par des chercheurs du groupe Alibaba, DAMO-YOLO a été conçu pour optimiser à la fois la vitesse et la précision au moyen de la recherche automatisée d’architecture et de la distillation.
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : groupe Alibaba
- Date : 23 novembre 2022
- Arxiv : 2211.15444v2
- GitHub : tinyvision/DAMO-YOLO
YOLOv7#
Présenté comme un modèle de pointe à la mi-2022, YOLOv7 a encore amélioré l’inférence en temps réel en introduisant des « avantages gratuits » entraînables sans augmenter les coûts de déploiement.
- Auteurs : Chien-Yao Wang, Alexey Bochkovskiy et Hong-Yuan Mark Liao
- Organisation : Institute of Information Science, Academia Sinica, Taïwan
- Date : 6 juillet 2022
- Arxiv : 2207.02696
- Documentation : Documentation de YOLOv7
Ultralytics ne publie pas de poids ni de fichiers YAML pour YOLOv7 ; il n’est donc pas possible d’entraîner YOLOv7 nativement avec le package Ultralytics. Les modèles YOLOv7 entraînés dans le dépôt amont peuvent être exportés vers ONNX ou TensorRT et utilisés pour l’inférence avec Ultralytics.
Innovations architecturales#
DAMO-YOLO : NAS et distillation#
DAMO-YOLO intègre plusieurs techniques de pointe axées sur une efficacité maximale :
- Backbones NAS : utilise la recherche d’architecture neuronale (NAS) pour concevoir automatiquement des backbones optimaux (MAE-NAS) adaptés aux environnements où la latence est critique.
- RepGFPN efficace : un réseau généralisé de pyramides de caractéristiques modifié qui améliore considérablement l’efficacité de la fusion des caractéristiques à plusieurs échelles.
- ZeroHead et AlignedOTA : intègre une tête de détection légère et une stratégie optimisée d’attribution des étiquettes (AlignedOTA) afin de réduire la charge de calcul.
- Amélioration par distillation : s’appuie largement sur la distillation des connaissances pendant l’entraînement pour améliorer les performances des variantes de modèles plus petites sans augmenter leur nombre de paramètres.
YOLOv7 : E-ELAN et avantages gratuits#
YOLOv7 adopte une approche d’ingénierie structurelle plus poussée, axée sur l’optimisation des chemins de gradient et des stratégies d’entraînement robustes.
- Architecture E-ELAN : le réseau étendu d’agrégation efficace des couches permet au modèle d’apprendre des caractéristiques plus variées en contrôlant les chemins de gradient les plus courts et les plus longs, pour garantir une convergence efficace de l’apprentissage.
- Mise à l’échelle du modèle : introduit une méthode de mise à l’échelle composée adaptée aux modèles basés sur la concaténation, qui ajuste simultanément la profondeur et la largeur pour préserver l’alignement structurel.
- Avantages gratuits entraînables : utilise des techniques comme les convolutions reparamétrées (RepConv) sans connexions d’identité et des stratégies dynamiques d’attribution des étiquettes, qui améliorent la précision pendant l’entraînement sans affecter la vitesse d’inférence.
Analyse des performances#
Lorsqu’on évalue la précision moyenne moyenne (mAP), la vitesse et l’efficacité, les deux modèles affichent des métriques impressionnantes, même s’ils ciblent des segments légèrement différents. YOLOv7 se concentre sur le déploiement GPU de haute précision, tandis que les structures de DAMO-YOLO issues de NAS visent un déploiement agressif à faible latence sur CPU et en périphérie.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Comme le montrent les métriques, DAMO-YOLO propose des variantes extrêmement légères (comme le modèle tiny avec seulement 8,5 M de paramètres), tandis que YOLOv7 atteint un pic de précision globale supérieur, YOLOv7x obtenant un impressionnant score de 53,1 mAP sur le jeu de données COCO.
Les avantages de l’écosystème Ultralytics#
Si l’architecture théorique est importante, l’écosystème détermine la praticité d’un modèle. Les modèles Ultralytics natifs, comme YOLO26, bénéficient d’un écosystème bien entretenu et d’une simplicité d’utilisation sans égal.
- Équilibre des performances : les modèles Ultralytics trouvent régulièrement un compromis optimal entre vitesse d’inférence et précision de détection, ce qui les rend idéaux pour les appareils en périphérie comme pour le déploiement de modèles dans le cloud.
- Besoins en mémoire : contrairement aux modèles plus lourds basés sur des Transformer, les modèles YOLO d’Ultralytics nécessitent peu de mémoire CUDA pendant l’entraînement. Cela permet d’utiliser des tailles de lot plus grandes et de simplifier l’entraînement, même sur du matériel grand public.
- Polyvalence : le framework Ultralytics va au-delà de la détection d’objets et prend en charge des tâches comme la segmentation d’instances et l’estimation de pose, offrant aux développeurs une boîte à outils complète de vision par ordinateur.
Le package Ultralytics te permet de passer facilement des jeux de données à un modèle entièrement entraîné en quelques minutes, grâce à des chargeurs de données hautement optimisés et à des poids préentraînés.
Exemple de code : exécuter YOLOv7 avec Ultralytics#
Après avoir converti un export ONNX amont de YOLOv7 comme indiqué dans les exemples d’utilisation de YOLOv7, tu peux l’exécuter avec l’API Python Ultralytics.
from ultralytics import YOLO
# Charger un modèle YOLOv7 ONNX converti pour Ultralytics
model = YOLO("yolov7-ultralytics.onnx", task="detect")
# Exécuter l’inférence
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)La nouvelle référence : découvrez YOLO26#
YOLOv7 et DAMO-YOLO ont représenté des avancées majeures en 2022, mais le domaine de l’IA visuelle évolue rapidement. Pour les équipes qui lancent de nouveaux projets aujourd’hui, le modèle recommandé est le dernier-né Ultralytics YOLO26, lancé en janvier 2026.
YOLO26 fait franchir une nouvelle génération de progrès aux performances et à la facilité d’utilisation, grâce à des innovations de pointe :
- Conception de bout en bout sans NMS : YOLO26 propose une tête native de bout en bout (
nms=False). En supprimant le post-traitement par suppression des boîtes non maximales (NMS), il simplifie et accélère la logique de déploiement — un changement de paradigme d’abord introduit par YOLOv10. - Solveur MuSGD : inspiré par des innovations issues des grands modèles de langage, comme Kimi K2 de Moonshot AI, YOLO26 utilise une combinaison de SGD et de Muon. Ce solveur garantit une dynamique d’entraînement très stable et des taux de convergence nettement plus rapides.
- Inférence sur CPU jusqu’à 43 % plus rapide : grâce à la suppression ciblée de Distribution Focal Loss (DFL) et à des améliorations structurelles majeures, YOLO26 est fortement optimisé pour le calcul en périphérie à faible consommation et surpasse les générations précédentes sur le matériel sans GPU.
- ProgLoss + STAL : intègre de nouvelles fonctions de perte avancées qui ciblent et améliorent explicitement la reconnaissance des petits objets, une capacité essentielle pour l’imagerie aérienne, la robotique et la surveillance de sécurité.
- Améliorations propres aux tâches : au-delà de la détection standard, YOLO26 propose des améliorations adaptées à diverses tâches, notamment le prototypage mult échelle pour la segmentation, RLE pour l’estimation de pose et des fonctions de perte angulaire spécifiques aux boîtes englobantes orientées (OBB).
Cas d’utilisation idéaux#
Le choix de la bonne architecture dépend entièrement de l’environnement de déploiement visé et des contraintes de ton projet.
Quand choisir DAMO-YOLO :
- Tu travailles dans des environnements en périphérie fortement contraints et limités en ressources, où le nombre brut de paramètres doit être extrêmement faible (par exemple, sur des microcontrôleurs).
- Tu utilises des pipelines d’apprentissage automatique automatisés spécialement intégrés aux services cloud propriétaires d’Alibaba.
Quand choisir YOLOv7 :
- Tu disposes déjà de pipelines GPU hérités optimisés pour l’inférence basée sur des ancres et de haute précision.
- Tu évolues dans des environnements où la précision en temps réel est primordiale, comme les véhicules autonomes à grande vitesse ou la robotique avancée.
Quand choisir YOLO26 (recommandé) :
- Tu développes une nouvelle application de vision par ordinateur à partir de zéro et tu as besoin de ce qui se fait de mieux, tant en matière de précision que de vitesse d’inférence sur CPU et en périphérie.
- Tu as besoin d’un déploiement rapide et fluide (par exemple, avec l’export vers CoreML ou TensorRT), sans avoir à gérer les contraintes des opérateurs NMS.
- Tu veux exploiter toutes les capacités de la plateforme Ultralytics pour l’entraînement dans le cloud, la gestion des jeux de données et le déploiement automatisé.
En tirant parti de l’écosystème robuste des modèles Ultralytics, les développeurs peuvent réduire considérablement le temps d’ingénierie tout en garantissant des performances prédictives de premier ordre dans leurs applications réelles.