DAMO-YOLO vs PP-YOLOE+#
Dans le paysage très concurrentiel de la vision par ordinateur en temps réel, il est essentiel de choisir l’architecture optimale pour tes besoins de déploiement spécifiques. Ce guide propose une comparaison technique complète entre DAMO-YOLO et PP-YOLOE+, en analysant en profondeur leur architecture, leurs méthodes d’entraînement et leurs métriques de performance. Nous examinerons également comment ces modèles se comparent aux solutions de pointe, comme le tout nouveau Ultralytics YOLO26.
Présentation des modèles#
Les deux frameworks sont apparus en 2022 comme de puissantes solutions de remplacement pour les applications industrielles, en s’appuyant sur des techniques sophistiquées pour repousser les limites de la précision et de la vitesse d’inférence.
DAMO-YOLO#
Développé par le groupe Alibaba, DAMO-YOLO a introduit plusieurs techniques novatrices pour optimiser le compromis entre latence et précision, en s’appuyant largement sur des techniques de recherche automatisée et de fusion avancée de caractéristiques.
- Auteurs : Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang et Xiuyu Sun
- Organisation : Alibaba Group
- Date : 2022-11-23
- Arxiv : DAMO-YOLO : rapport sur la conception de la détection d’objets en temps réel
- GitHub : tinyvision/DAMO-YOLO
- Docs : README de DAMO-YOLO
DAMO-YOLO utilise une recherche d’architecture neuronale à entropie maximale (MAE-NAS) pour concevoir automatiquement des backbones optimisés pour l’efficacité matérielle. Il intègre également un RepGFPN efficace (réseau pyramidal généralisé de caractéristiques reparamétré) pour la fusion des caractéristiques dans le neck, ainsi qu’une architecture légère « ZeroHead ». En outre, il s’appuie largement sur des techniques de distillation pendant l’entraînement afin d’améliorer la capacité de représentation du modèle élève.
PP-YOLOE+#
Issu de l’équipe Baidu PaddlePaddle, PP-YOLOE+ est une mise à niveau incrémentale de l’architecture PP-YOLOE. Il mise sur le préentraînement à grande échelle et des fonctions de perte affinées pour offrir un mAP élevé, notamment au sein de son framework d’apprentissage profond natif.
- Auteurs : Auteurs de PaddlePaddle
- Organisation : Baidu
- Date : 2022-04-02
- Arxiv : PP-YOLOE : une version évoluée de YOLO
- GitHub : PaddlePaddle/PaddleDetection
- Docs : Configurations de PP-YOLOE+
PP-YOLOE+ utilise un backbone CSPRepResNet et une tête ET (tête efficace alignée sur les tâches). La version « plus » introduit une stratégie de préentraînement puissante sur le jeu de données Objects365, qui améliore considérablement sa capacité à généraliser à des environnements réels variés.
Comparaison des architectures#
La divergence entre les philosophies de conception de ces deux modèles a une forte influence sur leurs cas d’utilisation idéaux et leur compatibilité matérielle.
Fusion des caractéristiques et backbones#
Les backbones générés par MAE-NAS de DAMO-YOLO sont fortement adaptés aux appareils de périphérie et offrent souvent un rapport vitesse-nombre de paramètres avantageux. Toutefois, ces architectures personnalisées peuvent être rigides et difficiles à adapter à de nouvelles tâches comme la segmentation d’instances. Le neck RepGFPN améliore la fusion de caractéristiques à plusieurs échelles, mais ajoute de la complexité lors de l’étape d’exportation avec reparamétrage.
PP-YOLOE+ s’appuie sur CSPRepResNet, une architecture plus traditionnelle, mais très efficace. Bien que ce backbone nécessite davantage de paramètres que DAMO-YOLO pour une précision similaire, son entraînement est très stable et son intégration dans les pipelines existants est plus simple. Sa tête ET gère efficacement la classification et la régression, mais nécessite toujours des étapes de post-traitement comme la suppression non maximale (NMS).
DAMO-YOLO et PP-YOLOE+ nécessitent tous deux NMS pour le post-traitement des boîtes englobantes. Si la latence d’inférence est un facteur critique, envisage Ultralytics YOLO26, qui propose une conception native de bout en bout sans NMS grâce à sa tête facultative un-à-un (nms=False). Cette approche révolutionnaire élimine le post-traitement NMS pour accélérer le déploiement et simplifier le pipeline.
Analyse des performances et des indicateurs#
Pour évaluer ces modèles en vue d’une mise en production, il est essentiel de trouver le bon équilibre entre la précision (mAP), la vitesse d’inférence et le nombre de paramètres. Voici une comparaison directe de leurs principales variantes.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Comme le montre le tableau, DAMO-YOLO offre une meilleure précision aux échelles très petite (t) et petite (s), et DAMO-YOLOt affiche la latence TensorRT la plus faible sur T4 parmi les modèles présentés, grâce à ses backbones optimisés par NAS. En revanche, PP-YOLOE+ passe remarquablement bien aux catégories moyenne (m) et grande (l), où il atteint des scores mAP plus élevés, au prix d’une légère baisse de vitesse TensorRT sur T4.
Besoins en mémoire et efficacité de l’entraînement#
La dépendance de DAMO-YOLO à la distillation signifie qu’il faut souvent entraîner un modèle enseignant beaucoup plus grand avant d’entraîner le modèle élève plus petit. Cela augmente considérablement les besoins en mémoire CUDA et le budget de calcul global. PP-YOLOE+ simplifie le processus grâce à un entraînement standard en une seule étape, mais reste étroitement lié au framework PaddlePaddle, ce qui peut limiter la flexibilité des équipes habituées à PyTorch.
À l’inverse, le modèle moderne Ultralytics YOLO26 résout ces goulots d’étranglement. Grâce au nouvel optimiseur MuSGD — un hybride de SGD et de Muon inspiré des innovations en matière d’entraînement des LLM —, YOLO26 converge plus rapidement et s’entraîne de manière très stable, sans nécessiter de pipelines de distillation complexes. De plus, les modèles YOLO nécessitent généralement beaucoup moins de mémoire CUDA pendant l’entraînement que les détecteurs basés sur des Transformers, comme RT-DETR.
Applications concrètes et cas d'usage idéaux#
Quand utiliser DAMO-YOLO#
DAMO-YOLO est idéal pour l’inférence en périphérie à haut débit lorsque la latence est le principal goulot d’étranglement. Ses petites variantes excellent dans des environnements comme les systèmes de gestion du trafic ou la surveillance par drone élémentaire, à condition que ton équipe d’ingénierie dispose du temps nécessaire pour gérer ses processus complexes de distillation et de reparamétrage.
Quand utiliser PP-YOLOE+#
PP-YOLOE+ se démarque si tu es déjà très investi dans l’écosystème Baidu ou si tu exécutes des déploiements serveur à grande échelle. Son mAP impressionnant le rend adapté à l’analyse d’images médicales complexe ou à la détection dense de défauts de fabrication.
L’avantage Ultralytics#
Bien que DAMO-YOLO et PP-YOLOE+ offrent chacun des avantages spécifiques, les développeurs qui recherchent un maximum de polyvalence, de vitesse et de facilité d’utilisation se tournent régulièrement vers la plateforme Ultralytics.
Pour mettre à niveau ton pipeline de vision par ordinateur, Ultralytics YOLO26 offre une expérience de développement inégalée :
- Inférence CPU jusqu’à 43 % plus rapide : Grâce à la suppression complète de la perte focale de distribution (DFL), YOLO26 est remarquablement rapide sur les CPU de périphérie et les appareils IoT à faible consommation.
- Détection améliorée des petits objets : L’intégration des fonctions de perte ProgLoss et STAL améliore considérablement la reconnaissance des petits objets, un aspect essentiel pour l’imagerie aérienne.
- Grande polyvalence : Contrairement à PP-YOLOE+, qui se concentre strictement sur la détection, YOLO26 prend facilement en charge l’estimation de pose, les boîtes englobantes orientées (OBB) et la segmentation sémantique grâce à des améliorations architecturales spécifiques à chaque tâche.
Conclusion#
DAMO-YOLO et PP-YOLOE+ représentent des étapes importantes dans l’évolution de la détection d’objets sans ancres. DAMO-YOLO a repoussé les limites de la recherche d’architecture neuronale pour réduire la latence en périphérie, tandis que PP-YOLOE+ a démontré la puissance du préentraînement à grande échelle.
Cependant, pour les développeurs qui recherchent le meilleur équilibre entre vitesse, précision et simplicité de déploiement, le modèle Ultralytics YOLO26 est le choix évident. Son architecture sans NMS, son API Python robuste et son intégration fluide avec des outils comme Weights & Biases et TensorRT permettent à tes projets de passer facilement du prototype à la production.
Prêt à te lancer ? Consulte le guide de démarrage rapide Ultralytics ou compare d’autres modèles dans notre aperçu YOLO11 vs DAMO-YOLO.