DAMO-YOLO vs YOLO11#
Pour choisir une architecture de détection d’objets en temps réel pour ton prochain projet de vision par ordinateur, il est essentiel de comprendre les nuances entre les principaux modèles. Ce guide complet propose une analyse technique approfondie comparant DAMO-YOLO et Ultralytics YOLO11, et examine leurs architectures, leurs métriques de performance, leurs méthodes d’entraînement et leurs scénarios de déploiement idéaux en conditions réelles.
Détails de DAMO-YOLO :
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : groupe Alibaba
- Date : 2022-11-23
- Arxiv : 2211.15444v2
- GitHub : tinyvision/DAMO-YOLO
- Documentation : Documentation de DAMO-YOLO
Détails de YOLO11 :
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : ultralytics/ultralytics
- Documentation : Documentation YOLO11
Philosophie de conception architecturale#
L’architecture sous-jacente d’un modèle de détection d’objets détermine sa vitesse d’inférence, sa précision et son adaptabilité à différents environnements matériels.
DAMO-YOLO introduit plusieurs innovations issues de la recherche universitaire et s’appuie largement sur la recherche d’architecture neuronale (NAS) pour concevoir automatiquement son backbone. Il utilise un RepGFPN (réseau pyramidal généralisé de caractéristiques reparamétré) efficace pour améliorer la fusion des caractéristiques, ainsi qu’une conception ZeroHead qui réduit considérablement la taille de la lourde tête de prédiction souvent présente dans les architectures précédentes. Bien que cette approche fondée sur la NAS permette à DAMO-YOLO d’atteindre des niveaux d’efficacité spécifiques sur certains GPU, les architectures obtenues peuvent parfois manquer de la flexibilité nécessaire pour se généraliser facilement à divers appareils edge.
À l’inverse, YOLO11 s’appuie sur des années de recherche fondamentale pour proposer une architecture conçue manuellement et hautement optimisée. Il mise sur un backbone simplifié et un neck très efficace qui réduit les calculs redondants. L’un des principaux avantages de YOLO11 réside dans son efficacité en matière de paramètres, affinée au fil du temps : il offre une représentation riche des caractéristiques sans les besoins importants en VRAM typiques des modèles basés sur Transformer, comme RT-DETR. YOLO11 est ainsi particulièrement polyvalent et fonctionne sans difficulté sur des GPU grand public, des appareils mobiles et des accélérateurs edge spécialisés.
Performances et métriques#
Évaluer les performances nécessite d’aller au-delà de la précision globale et de tenir compte de l’équilibre entre vitesse, taille du modèle et charge de calcul (FLOPs).
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Comme le montre le tableau, YOLO11 offre un équilibre des performances très avantageux. La variante YOLO11s, par exemple, dépasse DAMO-YOLOs en précision tout en conservant un nombre de paramètres nettement inférieur. Cette réduction des besoins en mémoire se traduit directement par des coûts de déploiement plus faibles et de meilleures performances sur les appareils edge.
Méthodes d’entraînement et facilité d’utilisation#
Les développeurs consacrent la majeure partie de leur temps au pipeline d’entraînement, ce qui fait de son efficacité une préoccupation essentielle.
DAMO-YOLO utilise un processus d’entraînement en plusieurs étapes qui repose fortement sur la distillation des connaissances. Il utilise AlignedOTA (assignation par transport optimal) pour l’assignation des étiquettes et nécessite souvent d’entraîner un modèle « enseignant » plus grand afin d’en distiller les connaissances vers des modèles « élèves » plus petits. Cette méthode augmente considérablement l’empreinte mémoire CUDA ainsi que le temps de calcul global nécessaire pour atteindre une convergence optimale.
À l’inverse, l’écosystème Ultralytics masque la complexité de l’entraînement des modèles. YOLO11 est conçu pour être particulièrement facile à utiliser et dispose d’une API Python simplifiée ainsi que d’interfaces CLI complètes qui permettent aux ingénieurs de lancer l’entraînement sur des jeux de données personnalisés avec une seule commande. Le pipeline d’entraînement est conçu pour économiser les ressources et limiter les pics d’utilisation de la mémoire, de sorte que même les modèles les plus grands peuvent être entraînés sur du matériel standard.
L’entraînement d’un modèle Ultralytics ne nécessite aucun code passe-partout. Les pipelines intégrés de chargement des données, d’augmentation et de calcul de la fonction de perte sont entièrement optimisés dès l’installation.
Voici un exemple rapide qui montre à quel point il est simple d’entraîner et de déployer un modèle Ultralytics :
from ultralytics import YOLO
# Charger un petit modèle YOLO11 préentraîné
model = YOLO("yolo11s.pt")
# Entraîne facilement le modèle sur un jeu de données personnalisé
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Exporte le modèle entraîné au format ONNX pour un déploiement fluide
model.export(format="onnx")Applications en conditions réelles et polyvalence#
Le choix entre ces architectures dépend souvent de l’étendue des tâches requises par ton environnement de déploiement.
Quand DAMO-YOLO est-il adapté ?#
DAMO-YOLO est exclusivement un framework de détection d’objets. Il excelle dans les environnements de recherche universitaire où les équipes explorent la reparamétrisation ou reproduisent des expériences spécifiques de recherche d’architecture neuronale. Il peut également être déployé dans des environnements industriels soumis à de fortes contraintes, où un accélérateur GPU spécifique correspond parfaitement au backbone généré par NAS.
L’avantage Ultralytics#
Les modèles Ultralytics, dont YOLO11, brillent dans les applications commerciales en conditions réelles grâce à leur polyvalence inégalée et à leur écosystème bien entretenu. Contrairement à DAMO-YOLO, le framework Ultralytics prend en charge nativement plusieurs tâches. De la segmentation d’instances en imagerie médicale à l’estimation de pose pour l’analyse biomécanique dans le sport, une base de code unifiée permet de tout gérer.
Voici quelques secteurs qui utilisent YOLO11 :
- Agriculture intelligente : utiliser la détection d’objets pour surveiller la santé des cultures et automatiser les machines de récolte.
- Analyse du commerce de détail : mettre en œuvre une vidéosurveillance intelligente pour analyser le trafic des clients et automatiser la gestion des stocks.
- Logistique et chaîne d’approvisionnement : détecter à grande vitesse les codes-barres et les colis à l’aide de boîtes englobantes orientées (OBB) sur des tapis roulants rapides.
Cas d’utilisation et recommandations#
Le choix entre DAMO-YOLO et YOLO11 dépend des besoins spécifiques de ton projet, de tes contraintes de déploiement et de tes préférences en matière d’écosystème.
Quand choisir DAMO-YOLO#
DAMO-YOLO est un excellent choix pour :
- Analyse vidéo à haut débit : Traitement de flux vidéo à FPS élevé sur une infrastructure GPU NVIDIA fixe, lorsque le débit avec une taille de lot de 1 est le principal critère.
- Lignes de fabrication industrielle : Scénarios soumis à des contraintes strictes de latence GPU sur du matériel dédié, comme l’inspection qualité en temps réel sur les chaînes de montage.
- Recherche sur la recherche d’architectures neuronales : Étude des effets de la recherche automatisée d’architectures (MAE-NAS) et des backbones efficaces reparamétrés sur les performances de détection.
Quand choisir YOLO11#
YOLO11 est recommandé pour :
- Déploiement en périphérie en production : applications commerciales sur des appareils comme Raspberry Pi ou NVIDIA Jetson, où la fiabilité et la maintenance active sont primordiales.
- Applications de vision multitâches : projets nécessitant la détection, la segmentation, l’estimation de pose et les OBB au sein d’un framework unifié.
- Prototypage et déploiement rapides : équipes qui doivent passer rapidement de la collecte de données à la production à l’aide de l’API Python Ultralytics simplifiée.
Quand choisir Ultralytics (YOLO26)#
Pour la plupart des nouveaux projets, Ultralytics YOLO26 offre le meilleur équilibre entre performances et expérience développeur :
- Déploiement en périphérie sans NMS : les applications qui exigent des inférences à faible latence et constantes, sans la complexité du post-traitement par suppression non maximale.
- Environnements exclusivement CPU : les appareils dépourvus d’accélération GPU dédiée, où l’inférence CPU jusqu’à 43 % plus rapide de YOLO26 constitue un avantage décisif.
- Détection de petits objets : les situations difficiles, comme l’imagerie aérienne par drone ou l’analyse de capteurs IoT, où ProgLoss et STAL améliorent considérablement la précision pour les objets minuscules.
La nouvelle génération : présentation de YOLO26#
YOLO11 reste un choix puissant et fiable, mais le domaine de la vision par ordinateur évolue rapidement. Pour les développeurs qui lancent de nouveaux projets, le dernier modèle YOLO26 représente la nouvelle référence.
Sorti en janvier 2026, YOLO26 introduit plusieurs avancées majeures :
- Conception de bout en bout sans NMS : grâce à sa tête optionnelle à assignation un-à-un (
nms=False), YOLO26 ignore le post-traitement par suppression non maximale et garantit des temps d’inférence plus rapides et déterministes, tout en simplifiant considérablement les pipelines de déploiement. - Jusqu’à 43 % d’inférence CPU plus rapide : en supprimant la perte focale de distribution (DFL), le modèle convient particulièrement bien aux appareils edge et à faible consommation qui ne disposent pas de GPU dédié.
- Optimiseur MuSGD : intégrant des innovations issues de l’entraînement des LLM (inspirées par Moonshot AI), cet optimiseur hybride assure une convergence stable et rapide pendant l’entraînement.
- Fonctions de perte avancées : grâce à ProgLoss + STAL, YOLO26 améliore considérablement la reconnaissance des petits objets, une capacité essentielle pour l’imagerie aérienne et la robotique.
Conclusion#
DAMO-YOLO et YOLO11 ont tous deux contribué de manière importante aux progrès de la vision par ordinateur rapide et précise. DAMO-YOLO offre des pistes intéressantes sur la recherche d’architecture et la distillation, mais Ultralytics YOLO11 (ainsi que le révolutionnaire YOLO26) propose une expérience de développement supérieure.
Avec des besoins en mémoire réduits, une documentation complète, des capacités multitâches et une intégration à la puissante Ultralytics Platform, les modèles Ultralytics restent le premier choix des chercheurs et des ingénieurs d’entreprise qui souhaitent créer des solutions d’IA robustes et évolutives. Pour explorer d’autres architectures avancées, comparer YOLO26 et RT-DETR permet d’obtenir des informations supplémentaires sur les solutions de remplacement basées sur Transformer.