Ultralytics YOLO27 :

YOLO11 contre PP-YOLOE+#

Sélectionner l'architecture de réseau neuronal optimale est essentiel lors du déploiement d'applications de vision par ordinateur en production. Dans cette comparaison technique, nous examinons deux modèles majeurs dans le domaine de la détection d'objets en temps réel : Ultralytics YOLO11 et PP-YOLOE+ de Baidu. Les deux architectures offrent de solides performances, mais elles abordent très différemment les enjeux de précision, de vitesse d'inférence et d'écosystème pour les développeurs.

Le graphique interactif ci-dessous présente les limites de performance de ces modèles afin de t'aider à identifier celui qui convient le mieux aux contraintes de ton matériel.

Origines des modèles et filiation technique#

Comprendre les origines et les philosophies de conception de ces modèles fournit un contexte précieux pour cerner leurs forces respectives et leurs cas d'utilisation idéaux.

Détails de YOLO11#

Développé par Ultralytics, YOLO11 représente une version particulièrement aboutie de la série YOLO, qui privilégie un équilibre entre une inférence à haute vitesse, une efficacité extrême en matière de paramètres et une facilité d'utilisation inégalée. Il est largement reconnu pour ses capacités unifiées de traitement multitâche et son API Python conviviale pour les développeurs.

Détails sur PP-YOLOE+#

PP-YOLOE+ est une version évoluée de PP-YOLOv2, développée sur le framework PaddlePaddle. Elle introduit des changements architecturaux tels que le backbone CSPRepResNet et le Task Alignment Learning (TAL) afin de repousser les limites de la précision, en particulier sur les GPU haut de gamme.

En savoir plus sur PP-YOLOE+

Différences architecturales#

Les conceptions architecturales fondamentales de YOLO11 et de PP-YOLOE+ reflètent leurs priorités différentes dans le domaine de la vision par ordinateur.

YOLO11 repose sur un backbone hautement optimisé et une tête de détection sans ancres. Il utilise des blocs C3k2 et le Spatial Pyramid Pooling - Fast (SPPF) pour capturer des caractéristiques multi-échelles avec une surcharge de calcul minimale. Cette conception est particulièrement avantageuse pour réduire la latence d'inférence sur des appareils aux ressources limitées, tels que les NPU en périphérie et les CPU mobiles. De plus, YOLO11 est conçu nativement pour l'apprentissage multitâche et prend en charge, dès son installation, la segmentation d'instances, l'estimation de pose et la détection de boîtes englobantes orientées (OBB).

PP-YOLOE+ introduit le squelette CSPRepResNet et une tête alignée sur les tâches efficace (ET-head). Ce modèle utilise intensivement des techniques de reparamétrage pour accroître la capacité de représentation pendant l'entraînement tout en fusionnant ces paramètres dans des convolutions standard pour l'inférence. Bien que cela génère une précision moyenne (mAP) impressionnante, les modèles qui en résultent ont tendance à être plus lourds en termes de paramètres et d'empreinte mémoire, ce qui les rend mieux adaptés à un déploiement sur des serveurs GPU robustes plutôt que sur des appareils périphériques légers.

Polyvalence multitâche

Si ton projet nécessite d'aller au-delà des boîtes englobantes standard, Ultralytics YOLO11 offre une prise en charge native de la segmentation, de l'estimation de pose et de la classification au sein de la même API, ce qui réduit considérablement la charge de développement par rapport à l'intégration de plusieurs dépôts distincts.

Performances et benchmarks#

Pour évaluer les performances, nous examinons la précision (mAP), la vitesse d'inférence sur différents matériels et l'efficacité du modèle (paramètres et FLOPs). Le tableau ci-dessous met en évidence les métriques comparatives, les valeurs les plus efficaces ou les plus performantes apparaissant en gras.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Analyse#

YOLO11 présente un avantage clair en matière d'équilibre des performances et d'efficacité des paramètres. Par exemple, YOLO11m atteint une mAP supérieure (51.5) à celle de PP-YOLOE+m (49.8), tout en utilisant moins de paramètres (20.1M contre 23.43M) et en offrant des vitesses d'inférence nettement supérieures sur TensorRT (4.7ms contre 5.56ms). La légèreté inhérente aux modèles YOLO11 se traduit par des besoins en mémoire inférieurs, aussi bien pendant l'entraînement du modèle que lors de son déploiement.

Écosystème d’entraînement et facilité d’utilisation#

La véritable valeur d'un modèle réside souvent dans la facilité avec laquelle les développeurs peuvent l'entraîner sur des jeux de données de vision par ordinateur personnalisés et le déployer en production.

L'avantage Ultralytics#

Ultralytics donne la priorité à une expérience développeur rationalisée. L'entraînement de YOLO11 se gère via une API Python ou une CLI simple, qui masque le code complexe répétitif. La plateforme Ultralytics améliore encore cette expérience en proposant un entraînement sans code, une gestion automatisée des jeux de données et des exportations en un clic vers des formats tels que ONNX, CoreML et TensorRT.

De plus, les modèles YOLO sont hautement économes en mémoire lors de l'entraînement, évitant les surcharges massives de VRAM typiques des architectures basées sur les Transformers ou des modèles lourdement reparamétrés, permettant ainsi un entraînement sur du matériel grand public.

from ultralytics import YOLO

# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

Écosystème PP-YOLOE+#

PP-YOLOE+ fonctionne au sein de l'écosystème PaddleDetection. Bien que ce framework soit puissant et profondément intégré aux solutions industrielles de Baidu, il oblige les développeurs à adopter le framework d'apprentissage profond PaddlePaddle. Cela peut entraîner une courbe d'apprentissage plus raide pour les équipes déjà standardisées sur PyTorch. De plus, l'exportation des modèles PP-YOLOE+ vers des formats universels standard destinés aux appareils en périphérie peut nécessiter des étapes de conversion supplémentaires par rapport aux pipelines d'exportation natifs des workflows Ultralytics.

Cas d’utilisation idéaux#

Le choix entre ces modèles dépend de ton environnement de déploiement spécifique.

  • Choisis YOLO11 pour un développement agile, l'informatique en périphérie et les applications mobiles. Sa vitesse d'inférence élevée, sa faible empreinte mémoire et ses nombreuses possibilités d'exportation le rendent idéal pour des tâches telles que la gestion des stocks au détail en temps réel sur des CPU standard, l'analyse d'images aériennes prises par drone et les pipelines multitâches complexes.
  • Choisis PP-YOLOE+ si l'ensemble de ton pipeline de production repose déjà fortement sur l'écosystème PaddlePaddle ou si tu déploies le modèle sur des serveurs d'inférence dédiés haut de gamme, où les contraintes de mémoire et la compatibilité matérielle (en dehors du matériel optimisé de Paddle) ne sont pas des préoccupations prioritaires.

La prochaine génération : présentation de YOLO26#

Bien que YOLO11 reste extrêmement puissant, le domaine de l'IA évolue rapidement. Pour être à la pointe de la détection d'objets, Ultralytics a présenté le nouveau YOLO26. Lancé en janvier 2026, YOLO26 s'appuie sur les réussites de ses prédécesseurs pour offrir une efficacité et une précision sans précédent.

Principales innovations de YOLO26 :

  • Conception de bout en bout sans NMS : YOLO26 élimine nativement le post-traitement de suppression des non-maxima (NMS). Cela accélère considérablement l'inférence et simplifie la logique de déploiement, une avancée architecturale initiée pour la première fois dans YOLOv10.
  • Inférence CPU jusqu'à 43 % plus rapide : optimisée spécifiquement pour les appareils en périphérie dépourvus de GPU, elle garantit des performances en temps réel sur du matériel moins énergivore.
  • Optimiseur MuSGD : inspiré de la stabilité de l'entraînement des LLM, cet hybride de SGD et de Muon assure une convergence plus rapide et un entraînement plus stable.
  • ProgLoss + STAL : des fonctions de perte améliorées renforcent considérablement la reconnaissance des petits objets, ce qui est essentiel pour les applications de drones et la vidéosurveillance.
  • Suppression de DFL : la suppression de Distribution Focal Loss simplifie l'exportation des modèles et améliore considérablement la compatibilité avec un large éventail d'appareils en périphérie.

Pour les nouveaux projets qui privilégient la vitesse, l'exportation fluide et une précision maximale, nous te recommandons vivement d'exploiter les capacités de YOLO26 via la plateforme Ultralytics.

Si tu évalues d'autres architectures, tu peux également être intéressé par une comparaison entre YOLO11 et RT-DETR, ou par l'analyse des performances de l'ancien YOLOv8 dans les benchmarks modernes.

Commentaires