Ultralytics YOLO27 :

PP-YOLOE+ vs YOLOv7#

Lors de la conception de pipelines de vision par ordinateur, il est essentiel de sélectionner le modèle de détection d’objets approprié. Deux architectures majeures de 2022, PP-YOLOE+ et YOLOv7, ont introduit des avancées puissantes dans la détection d’objets en temps réel. Cette comparaison technique examine en profondeur leurs architectures, leurs méthodologies d’entraînement et leurs performances en conditions réelles afin de t’aider à prendre des décisions éclairées pour tes applications.

Présentation des modèles#

PP-YOLOE+ et YOLOv7 ont tous deux été conçus pour repousser les limites de la précision et de la vitesse, mais ils sont issus d’écosystèmes de développement et de philosophies de conception différents.

PP-YOLOE+#

Développé par les auteurs de PaddlePaddle chez Baidu, PP-YOLOE+ s’appuie sur le PP-YOLOv2 original. Il a été introduit pour fournir un détecteur d’objets efficace et très précis, optimisé pour l’écosystème PaddlePaddle.

En savoir plus sur PP-YOLOE+

YOLOv7#

Développé par Chien-Yao Wang, Alexey Bochkovskiy et Hong-Yuan Mark Liao, YOLOv7 a introduit les « trainable bag-of-freebies » afin d’établir de nouvelles références de pointe pour les détecteurs d’objets en temps réel au moment de sa sortie.

En savoir plus sur YOLOv7

Innovations architecturales#

Architecture de PP-YOLOE+#

PP-YOLOE+ repose largement sur un paradigme sans ancres, ce qui simplifie le processus de déploiement en éliminant la nécessité d’ajuster les boîtes d’ancrage pour les jeux de données personnalisés. Il intègre un puissant backbone RepResNet et un PAN de style CSPNet (réseau d’agrégation de chemins) pour une fusion efficace des caractéristiques multi-échelles. Il exploite également le concept d’apprentissage de l’alignement des tâches (TAL) afin d’aligner dynamiquement les tâches de classification et de localisation pendant l’entraînement, garantissant ainsi une grande précision pour diverses tâches de vision par ordinateur.

Architecture de YOLOv7#

YOLOv7 a adopté une approche différente en introduisant l’Extended Efficient Layer Aggregation Network (E-ELAN), ou réseau étendu d’agrégation efficace des couches. Cette architecture permet au réseau d’apprendre des caractéristiques plus diversifiées sans détruire le chemin de gradient d’origine, ce qui favorise une meilleure convergence. YOLOv7 utilise également largement la reparamétrisation du modèle, notamment les convolutions reparamétrées planifiées, qui fusionnent les couches de convolution pendant l’inférence afin d’accélérer l’exécution sans sacrifier la précision. Cela rend YOLOv7 particulièrement performant pour des tâches telles que le suivi multi-objets et les systèmes complexes de détection d’intrusion.

Différences entre les écosystèmes

Alors que PP-YOLOE+ est étroitement intégré au framework PaddlePaddle de Baidu, YOLOv7 a été conçu avec PyTorch, qui offre historiquement une communauté plus vaste et une compatibilité prête à l’emploi plus étendue avec des pipelines de déploiement comme ONNX et TensorRT.

Analyse des performances#

Lorsqu’on met en balance la vitesse, le nombre de paramètres et la précision (mAP), les modèles présentent des compromis différents selon la variante spécifique et le matériel cible. Tu trouveras ci-dessous une comparaison complète de leurs métriques.

Modèletaille
(pixels)
mAPval
50-95
Vitesse
CPU ONNX
(ms)
Vitesse
T4 TensorRT10
(ms)
paramètres
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Bien que le modèle PP-YOLOE+x atteigne une mAP légèrement supérieure, les variantes de YOLOv7 offrent un très bon rapport entre le nombre de paramètres et la précision. L’architecture YOLOv7 reste très appréciée pour le traitement GPU brut, lorsque l’optimisation TensorRT permet d’obtenir une latence exceptionnellement faible.

L'avantage Ultralytics#

Lors de l’entraînement et du déploiement de ces modèles, le framework que tu choisis est tout aussi important que le modèle lui-même. L’utilisation d’Ultralytics offre une expérience utilisateur simplifiée grâce à une API Python hautement unifiée qui facilite l’ensemble du cycle de vie du machine learning.

  • Écosystème bien entretenu : Les modèles Ultralytics YOLO bénéficient d’un écosystème constamment mis à jour, d’une documentation solide et d’une communauté active.
  • Besoins en mémoire : Ultralytics optimise fortement le chargement des données et les régimes d’entraînement. L’entraînement des modèles Ultralytics YOLO nécessite généralement beaucoup moins de mémoire CUDA que celui d’architectures lourdes basées sur des Transformer, ce qui permet aux développeurs d’utiliser de plus grandes tailles de lot sur du matériel grand public.
  • Efficacité de l’entraînement : Grâce à des stratégies d’augmentation des données robustes et à l’ajustement intégré des hyperparamètres, Ultralytics garantit une convergence rapide des modèles avec des poids préentraînés facilement disponibles.

Implémentation simple de l’API#

L’entraînement d’un modèle YOLOv7 avec Ultralytics ne nécessite que quelques lignes de code, en faisant complètement abstraction des scripts d’entraînement complexes :

from ultralytics import YOLO

# Load a pretrained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to TensorRT for deployment
model.export(format="engine", device=0)

La nouvelle référence : présentation de YOLO26#

Bien que PP-YOLOE+ et YOLOv7 soient des jalons de la détection d’objets, le paysage de l’IA évolue rapidement. Pour tout nouveau projet de vision par ordinateur, nous te recommandons vivement Ultralytics YOLO26. Sorti en janvier 2026, YOLO26 représente un bond en avant majeur pour l’IA de vision privilégiant l’edge.

Pourquoi YOLO26 surpasse les architectures plus anciennes :

  • Conception de bout en bout sans NMS : YOLO26 est nativement de bout en bout. En éliminant le post-traitement de suppression des non-maxima (NMS), il garantit une latence d’inférence prévisible et déterministe — une avancée observée pour la première fois dans YOLOv10.
  • Suppression de DFL : La suppression de Distribution Focal Loss simplifie le processus d’exportation et améliore considérablement la compatibilité avec les appareils edge à faible consommation.
  • Inférence CPU jusqu’à 43 % plus rapide : Pour les scénarios dépourvus de GPU dédiés, comme les capteurs IoT de villes intelligentes, YOLO26 est fortement optimisé pour fonctionner efficacement directement sur des CPU.
  • Optimiseur MuSGD : Inspiré de techniques avancées d’entraînement des LLM, comme Kimi K2 de Moonshot AI, YOLO26 utilise un hybride de SGD et de Muon pour un entraînement extrêmement stable et une convergence rapide.
  • ProgLoss + STAL : Ces fonctions de perte améliorées apportent des gains remarquables pour la détection de petits objets, ce qui est essentiel dans des cas d’utilisation tels que l’imagerie aérienne par drone et la détection de défauts de fabrication.

Cas d’utilisation idéaux et scénarios de déploiement#

Quand utiliser PP-YOLOE+#

PP-YOLOE+ est particulièrement performant lorsque tu es profondément intégré à l’écosystème Baidu et PaddlePaddle. Si ta cible de déploiement utilise du matériel spécialisé conçu pour les modèles Paddle, par exemple dans certains pipelines de fabrication asiatiques, PP-YOLOE+ offre une excellente précision et une intégration fluide. Il est très efficace pour l’automatisation de la fabrication industrielle.

Quand utiliser YOLOv7#

YOLOv7 reste un excellent choix pour l’inférence générique haute performance, en particulier lors d’un déploiement sur du matériel NVIDIA utilisant TensorRT. Son intégration à l’écosystème PyTorch le rend très polyvalent pour la recherche universitaire et les pipelines commerciaux personnalisés, comme la gestion des foules en temps réel ou les tâches complexes d’estimation de pose, où l’intégrité structurelle du réseau est primordiale.

Autres modèles à envisager#

Selon tes besoins précis, tu peux également envisager de comparer ces architectures à YOLO11 pour bénéficier d’une grande flexibilité prête pour la production, ou à RT-DETR si ton projet nécessite les avantages spécifiques des vision transformers par rapport aux réseaux convolutifs traditionnels.

Conclusion#

PP-YOLOE+ et YOLOv7 ont tous deux apporté des améliorations significatives au domaine de la détection d’objets en temps réel. Alors que PP-YOLOE+ excelle dans les environnements standardisés autour de PaddlePaddle, YOLOv7 offre une flexibilité et des performances remarquables grâce aux écosystèmes PyTorch et Ultralytics.

Cependant, à mesure que les solutions de vision par ordinateur continuent de progresser, il est essentiel d’utiliser des outils modernes. En adoptant Ultralytics Platform et des architectures de nouvelle génération comme YOLO26, les développeurs peuvent s’assurer que leurs applications restent à la pointe en matière de vitesse, de précision et de facilité d’utilisation.

Contributeurs

Commentaires