YOLO11 vs PP-YOLOE+#
Choisir l’architecture de réseau neuronal optimale est essentiel pour déployer des applications de vision par ordinateur en production. Dans cette comparaison technique, nous examinons deux modèles de premier plan dans le domaine de la détection d’objets en temps réel : Ultralytics YOLO11 et PP-YOLOE+ de Baidu. Les deux architectures offrent des performances robustes, mais abordent très différemment les enjeux de précision, de vitesse d’inférence et d’écosystème de développement.
Le graphique interactif ci-dessous présente les limites de performance de ces modèles afin de t’aider à déterminer celui qui convient le mieux aux contraintes de ton matériel.
Origines des modèles et lignée technique#
Comprendre les origines et les philosophies de conception de ces modèles apporte un contexte précieux sur leurs atouts respectifs et leurs cas d’utilisation idéaux.
Détails sur YOLO11#
Développé par Ultralytics, YOLO11 est une version particulièrement aboutie de la série YOLO, qui privilégie l’équilibre entre une inférence rapide, une efficacité exceptionnelle en matière de paramètres et une grande simplicité d’utilisation. Il est largement reconnu pour ses capacités multitâches unifiées et son API Python conviviale pour les développeurs.
- Auteurs : Glenn Jocher et Jing Qiu
- Organisation : Ultralytics
- Date : 2024-09-27
- GitHub : https://github.com/ultralytics/ultralytics
- Documentation : Documentation YOLO11
Détails sur PP-YOLOE+#
PP-YOLOE+ est une version améliorée de PP-YOLOv2, construite sur le framework PaddlePaddle. Elle introduit des modifications architecturales, comme le backbone CSPRepResNet et l’apprentissage de l’alignement des tâches (TAL), afin de repousser les limites de la précision, en particulier sur les GPU haut de gamme.
- Auteurs : Auteurs de PaddlePaddle
- Organisation : Baidu
- Date : 2022-04-02
- Arxiv : https://arxiv.org/abs/2203.16250
- GitHub : https://github.com/PaddlePaddle/PaddleDetection/
- Documentation : Documentation de configuration de PP-YOLOE+
Différences architecturales#
Les architectures fondamentales de YOLO11 et PP-YOLOE+ reflètent leurs priorités différentes dans le domaine de la vision par ordinateur.
YOLO11 s’appuie sur un backbone hautement optimisé et une tête de détection sans ancres. Il utilise des blocs C3k2 et Spatial Pyramid Pooling - Fast (SPPF) pour extraire des caractéristiques à plusieurs échelles en limitant les coûts de calcul. Cette conception est particulièrement avantageuse pour réduire la latence d’inférence sur des appareils aux ressources limitées, comme les NPU de périphérie et les CPU mobiles. De plus, YOLO11 est conçu nativement pour l’apprentissage multitâche et prend en charge, dès l’installation, la segmentation d’instances, l’estimation de pose et la détection de boîtes englobantes orientées (OBB).
PP-YOLOE+ introduit le backbone CSPRepResNet et une tête efficace alignée sur les tâches (ET-head). Il utilise largement des techniques de reparamétrisation pour augmenter la capacité de représentation pendant l’entraînement, puis intègre ces paramètres dans des convolutions standard pour l’inférence. Bien que cela donne une précision moyenne moyenne (mAP) impressionnante, les modèles obtenus ont tendance à être plus lourds en nombre de paramètres et en empreinte mémoire. Ils conviennent donc mieux à un déploiement sur des GPU de serveur puissants qu’à des appareils de périphérie légers.
Si ton projet doit aller au-delà des boîtes englobantes standard, Ultralytics YOLO11 prend nativement en charge la segmentation, l’estimation de pose et la classification au sein de la même API, ce qui réduit considérablement le travail de développement par rapport à l’intégration de plusieurs dépôts distincts.
Performances et benchmarks#
Pour évaluer les performances, nous examinons la précision (mAP), la vitesse d’inférence sur différents matériels et l’efficacité du modèle (paramètres et FLOPs). Le tableau ci-dessous présente les métriques comparatives ; les valeurs les plus efficaces ou les plus élevées sont en gras.
| Modèle | taille (pixels) | mAPval 50-95 | Vitesse CPU ONNX (ms) | Vitesse T4 TensorRT10 (ms) | paramètres (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
Analyse#
YOLO11 présente un avantage net en matière d’équilibre des performances et d’efficacité des paramètres. Par exemple, YOLO11m atteint une mAP supérieure (51.5) à celle de PP-YOLOE+m (49.8), tout en utilisant moins de paramètres (20.1M contre 23.43M) et en offrant une inférence nettement plus rapide sur TensorRT (4.7ms contre 5.56ms). La légèreté des modèles YOLO11 se traduit naturellement par des besoins en mémoire plus faibles, tant pendant l’entraînement des modèles qu’au déploiement.
Écosystème d’entraînement et facilité d’utilisation#
La véritable valeur d’un modèle réside souvent dans la facilité avec laquelle les développeurs peuvent l’entraîner sur des jeux de données de vision par ordinateur personnalisés et le déployer en production.
L’avantage Ultralytics#
Ultralytics privilégie une expérience de développement fluide. L’entraînement de YOLO11 s’effectue au moyen d’une API Python simple ou de la CLI, qui masque le code passe-partout complexe. La plateforme Ultralytics va plus loin en proposant l’entraînement sans code, la gestion automatisée des jeux de données et l’exportation en un clic vers des formats comme ONNX, CoreML et TensorRT.
De plus, les modèles YOLO utilisent très efficacement la mémoire pendant l’entraînement. Ils évitent la forte consommation de VRAM courante avec les architectures basées sur Transformer ou les modèles lourdement reparamétrés, ce qui permet de les entraîner sur du matériel grand public.
from ultralytics import YOLO
# Charger un modèle YOLO11 préentraîné
model = YOLO("yolo11n.pt")
# Entraîner le modèle sur le jeu de données COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Effectuer une inférence sur une image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()Écosystème PP-YOLOE+#
PP-YOLOE+ s’inscrit dans l’écosystème PaddleDetection. Ce framework est puissant et étroitement intégré aux solutions industrielles de Baidu, mais il oblige les développeurs à adopter le framework d’apprentissage profond PaddlePaddle. Cela peut rendre la prise en main plus difficile pour les équipes qui utilisent déjà PyTorch comme standard. De plus, l’exportation des modèles PP-YOLOE+ vers des formats universels standard pour les appareils de périphérie peut nécessiter des étapes de conversion supplémentaires par rapport aux processus d’exportation natifs des workflows Ultralytics.
Cas d’utilisation idéaux#
Le choix entre ces modèles dépend de ton environnement de déploiement.
- Choisis YOLO11 pour un développement agile, l’informatique en périphérie et les applications mobiles. Sa vitesse d’inférence élevée, sa faible empreinte mémoire et ses nombreuses possibilités d’exportation en font un choix idéal pour des tâches comme la gestion des stocks en magasin en temps réel sur des CPU standard, l’analyse d’images aériennes prises par drone et les pipelines multitâches complexes.
- Choisis PP-YOLOE+ si l’ensemble de ton pipeline de production repose déjà largement sur l’écosystème PaddlePaddle ou si tu déploies le modèle sur des serveurs d’inférence dédiés haut de gamme, où les contraintes de mémoire et la compatibilité matérielle (en dehors du matériel optimisé pour Paddle) ne sont pas des préoccupations majeures.
La nouvelle génération : présentation de YOLO26#
YOLO11 reste extrêmement puissant, mais le domaine de l’IA évolue rapidement. Pour profiter des toutes dernières avancées en détection d’objets, Ultralytics a lancé le nouveau YOLO26. Sorti en janvier 2026, YOLO26 s’appuie sur les réussites de ses prédécesseurs pour offrir une efficacité et une précision sans précédent.
Principales innovations de YOLO26 :
- Conception de bout en bout sans NMS : la tête optionnelle un-à-un de YOLO26 (
nms=False) évite le post-traitement par suppression non maximale (NMS). Cela accélère considérablement l’inférence et simplifie la logique de déploiement ; cette avancée architecturale a été introduite pour la première fois dans YOLOv10. - Inférence CPU jusqu’à 43 % plus rapide : optimisée spécifiquement pour les appareils de périphérie sans GPU, elle garantit des performances en temps réel sur du matériel moins puissant.
- Optimiseur MuSGD : inspiré de la stabilité de l’entraînement des LLM, cet hybride de SGD et de Muon accélère la convergence et stabilise l’entraînement.
- ProgLoss + STAL : des fonctions de perte améliorées renforcent considérablement la reconnaissance des petits objets, essentielle pour les applications par drone et la vidéosurveillance.
- Suppression de DFL : la suppression de Distribution Focal Loss simplifie l’exportation des modèles et améliore considérablement leur compatibilité avec une vaste gamme d’appareils de périphérie.
Pour les nouveaux projets qui privilégient la vitesse, une exportation fluide et une précision maximale, nous recommandons vivement d’exploiter les capacités de YOLO26 via la plateforme Ultralytics.
Si tu évalues d’autres architectures, tu peux aussi comparer YOLO11 à RT-DETR ou découvrir comment l’ancien YOLOv8 se comporte dans les benchmarks actuels.