PP-YOLOE+ vs. YOLOv5#
Bei der Wahl des richtigen Deep-Learning-Frameworks für Computer Vision vergleichen Entwickler häufig die Fähigkeiten verschiedener Architekturen, um die ideale Balance aus Geschwindigkeit, Genauigkeit und einfacher Bereitstellung zu finden. In diesem ausführlichen Vergleich untersuchen wir die technischen Unterschiede zwischen PP-YOLOE+ und YOLOv5. Wenn du ihre Architekturen, Leistungskennzahlen und optimalen Bereitstellungsszenarien analysierst, kannst du eine fundierte Entscheidung für dein nächstes Projekt treffen – egal, ob es um Echtzeitrobotik, Edge-Bereitstellung oder cloudbasierte Videoanalyse geht.
Ursprung und Metadaten der Modelle#
Beide Modelle stammen von äußerst leistungsfähigen Entwicklungsteams, richten sich jedoch an leicht unterschiedliche Ökosysteme. Wenn du ihre Ursprünge kennst, kannst du ihre Architekturentscheidungen besser einordnen.
PP-YOLOE+ – Details:
- Autoren: PaddlePaddle-Autoren
- Organisation: Baidu
- Datum: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Dokumentation: PaddleDetection-README
YOLOv5-Details:
- Autoren: Glenn Jocher
- Organisation: Ultralytics
- Datum: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Dokumentation: https://docs.ultralytics.com/models/yolov5
Architekturvergleich#
PP-YOLOE+-Architektur#
PP-YOLOE+ ist eine Weiterentwicklung innerhalb des Baidu-Ökosystems und baut auf früheren Modellen wie PP-YOLOv2 auf. Das Modell führt einen stark optimierten CSPRepResNet-Backbone ein, der die Merkmalsextraktion durch die Kombination der Prinzipien von Cross-Stage-Partial-Netzwerken (CSP) mit Reparametrisierungstechniken verbessert. So kann das Modell während des Trainings eine hohe Genauigkeit beibehalten und zugleich in eine schlankere Architektur überführt werden, die eine schnellere Inferenz ermöglicht.
PP-YOLOE+ verwendet außerdem Task Alignment Learning (TAL) und einen Efficient Task-aligned Head (ET-Head). Diese Kombination soll die mangelnde Abstimmung zwischen Klassifizierungs- und Lokalisierungsaufgaben beheben, die bei dichten Objektdetektoren häufig einen Engpass darstellt. Die Architektur ist zwar beeindruckend, aber eng an das PaddlePaddle-Framework gebunden. Das kann für Teams, die sich auf andere gängige ML-Bibliotheken festgelegt haben, Integrationsprobleme verursachen.
YOLOv5-Architektur#
YOLOv5 hingegen wurde nativ mit PyTorch entwickelt, dem Industriestandard für akademische Forschung und den Einsatz in Unternehmen. Das Modell verwendet einen angepassten CSPDarknet53-Backbone, der für seinen hervorragenden Gradientenfluss und seine effiziente Parameterzahl bekannt ist.
Ein typisches Merkmal von YOLOv5 ist der AutoAnchor-Algorithmus, der vor dem Training die Größen der Ankerboxen dynamisch anhand deines benutzerdefinierten Datensatzes überprüft und anpasst. Dadurch entfällt die manuelle Abstimmung der Hyperparameter für Begrenzungsrahmen. Der Path-Aggregation-Network-Neck (PANet) des Modells sorgt für eine robuste Fusion von Merkmalen auf mehreren Skalen und eignet sich dadurch besonders gut zur Erkennung unterschiedlich großer Objekte.
Da YOLOv5 direkt auf PyTorch aufbaut, ist für den Export in optimierte Formate wie ONNX und TensorRT deutlich weniger Middleware-Konfiguration erforderlich als bei Modellen, die an lokale Frameworks gebunden sind.
Leistungsanalyse#
Für den Vergleich dieser Modelle muss man das Verhältnis zwischen der mittleren durchschnittlichen Präzision (mAP) und der Latenz betrachten. Die folgende Tabelle zeigt die Kennzahlen für verschiedene Modellgrößen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
PP-YOLOE+ erzielt bei größeren Varianten wie der X-Variante zwar äußerst konkurrenzfähige mAP-Werte, doch YOLOv5 bietet bei den kleineren Varianten eine höhere Geschwindigkeit und weniger Parameter. YOLOv5 Nano (YOLOv5n) benötigt nur 1,9 Millionen Parameter und eignet sich daher besonders gut für Edge-Geräte mit strengen Speicherbeschränkungen. Außerdem benötigt das Training von YOLO-Modellen üblicherweise weniger CUDA-Speicher als das Training umfangreicher Transformer-Alternativen wie RT-DETR.
Der Vorteil von Ultralytics#
Bei der Wahl einer Architektur sind reine Kennzahlen nur ein Teil der Gleichung. Das Entwicklererlebnis, die Unterstützung durch das Ökosystem und die Bereitstellungspipelines entscheiden häufig über den Erfolg eines Projekts in der Praxis. Hier überzeugen Ultralytics-Modelle.
Unübertroffene Benutzerfreundlichkeit#
Die Python-API von Ultralytics nimmt Entwicklern komplexen Boilerplate-Code ab. Du kannst das Training starten, die Leistung überprüfen und Modelle nahtlos bereitstellen. Die Dokumentation ist umfangreich und wird sorgfältig gepflegt; außerdem wird sie von einer großen globalen Open-Source-Community unterstützt.
Vielseitigkeit bei verschiedenen Aufgaben#
PP-YOLOE+ ist zwar ein spezialisierter Objektdetektor, doch mit dem Ultralytics-Ökosystem können Nutzer mehrere Computer-Vision-Aufgaben über eine einheitliche API lösen. Mit YOLOv5 und seinen Nachfolgern kannst du mühelos von herkömmlichen Begrenzungsrahmen zu Arbeitsabläufen für Bildsegmentierung und Klassifizierung wechseln.
Codebeispiel: YOLOv5 trainieren#
Für den Einstieg genügen wenige Codezeilen. Diese Einfachheit beschleunigt Forschungs- und Entwicklungszyklen erheblich.
from ultralytics import YOLO
# Ein vortrainiertes kleines YOLOv5-Modell laden
model = YOLO("yolov5su.pt") # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket
# Das Modell mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Schnelle Inferenz auf einem Bild ausführen
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()Anwendungsfälle in der Praxis#
Wann solltest du PP-YOLOE+ wählen? Wenn dein Unternehmen tief im Software-Stack von Baidu verankert ist oder stark auf spezialisierte Hardware angewiesen ist, die das PaddlePaddle-Framework voraussetzt, ist PP-YOLOE+ eine leistungsfähige Lösung. Das Modell wird häufig in spezialisierten Fertigungsabläufen in Asien eingesetzt, in denen ältere Paddle-Integrationen vorhanden sind.
Wann solltest du YOLOv5 wählen? Für die meisten internationalen Entwickler, Forschenden und Unternehmen ist YOLOv5 nach wie vor ein leistungsstarkes Modell. Dank der PyTorch-Basis ist es sofort mit Werkzeugen wie Weights & Biases zur Nachverfolgung kompatibel und lässt sich problemlos nach TensorRT exportieren, um NVIDIA-GPUs zu beschleunigen, oder nach CoreML für Apple-Geräte. Das Modell eignet sich für vielfältige Bereiche, von der Überwachung landwirtschaftlicher Nutzpflanzen bis zur Hochgeschwindigkeitsnavigation von Drohnen.
Die Zukunft der Objekterkennung: Ultralytics YOLO26#
YOLOv5 ist zwar ein legendäres Modell, doch die Computer Vision hat sich weiterentwickelt. Für alle neuen Entwicklungen empfehlen wir ausdrücklich den Wechsel zu YOLO26, das im Januar 2026 veröffentlicht wurde. YOLO26 ist nahtlos über die Ultralytics Platform verfügbar und definiert Effizienz völlig neu.
Wichtige Neuerungen in YOLO26:
- End-to-End-Design ohne NMS: Der optionale One-to-One-Head von YOLO26 (
nms=False) verzichtet vollständig auf die Nachverarbeitung mit Non-Maximum Suppression. Das verringert Schwankungen bei der Latenz und vereinfacht die Bereitstellungspipeline erheblich. - Bis zu 43 % schnellere CPU-Inferenz: Durch die gezielte Entfernung von Distribution Focal Loss (DFL) steigert YOLO26 die Geschwindigkeit auf Edge-Geräten ohne GPU deutlich.
- MuSGD-Optimierer: Dieser von führenden Large Language Models inspirierte Hybridoptimierer stabilisiert die Trainingsdynamik und ermöglicht eine deutlich schnellere Konvergenz auf benutzerdefinierten Datensätzen.
- Aufgabenspezifische Verbesserungen: Fortschrittliche Verlustfunktionen wie ProgLoss und STAL ermöglichen eine beispiellose Genauigkeit bei sehr kleinen Objekten. Das Modell unterstützt nativ die Erkennung orientierter Begrenzungsrahmen (OBB) für Luftaufnahmen.
Wenn du moderne Bildverarbeitungsmodelle untersuchst, könnte dich auch ein Vergleich mit der vorherigen Generation YOLO11 oder mit Transformer-basierten Ansätzen wie RT-DETR interessieren. Letztlich macht das robuste Ökosystem Ultralytics in Kombination mit modernsten Architekturverbesserungen zur ersten Wahl für aktuelle Computer-Vision-Aufgaben.