YOLOv5 vs. PP-YOLOE+#
Die Wahl der richtigen Architektur eines neuronalen Netzes ist für jedes moderne Bildverarbeitungsprojekt entscheidend. Wenn Entwickler und Forscher Modelle für die Objekterkennung in Echtzeit bewerten, geht es oft darum, Genauigkeit, Inferenzgeschwindigkeit und einfache Bereitstellung gegeneinander abzuwägen. Dieser technische Vergleich untersucht YOLOv5 und PP-YOLOE+ und beleuchtet ihre Architekturen, Leistungskennzahlen und Trainingsmethoden, damit du die optimale Lösung für deine Anwendung auswählen kannst.
Die Architekturen verstehen#
Beide Modelle haben die Entwicklung von Vision AI maßgeblich geprägt, gehen die Herausforderungen der Objekterkennung jedoch mit unterschiedlichen strukturellen Methoden und Abhängigkeiten von Frameworks an.
Ultralytics YOLOv5: Der Branchenstandard#
Das Mitte 2020 veröffentlichte Ultralytics YOLOv5 revolutionierte den Zugang zu hochmodernen Bildverarbeitungsmodellen. Da es nativ mit PyTorch entwickelt wurde, senkte es die Einstiegshürde für Python-Entwickler und ML-Ingenieure weltweit erheblich.
YOLOv5-Details:
- Autoren: Glenn Jocher
- Organisation: Ultralytics
- Datum: 2020-06-26
- GitHub: ultralytics/yolov5
- Dokumentation: YOLOv5-Dokumentation
YOLOv5 verwendet ein modifiziertes CSPDarknet-Backbone, das aussagekräftige Merkmalsrepräsentationen effizient erfasst und zugleich die Anzahl der Parameter gering hält. Es führte automatisch lernende Ankerboxen ein, die vor Beginn des Trainings die optimalen Ankerabmessungen für benutzerdefinierte Datensätze berechnen. Darüber hinaus verbessert die Integration der Mosaik-Datenerweiterung die Fähigkeit des Modells, kleinere Objekte zu erkennen und auf komplexe räumliche Zusammenhänge zu generalisieren.
Eine der größten Stärken von YOLOv5 ist seine enorme Vielseitigkeit. Anders als herkömmliche Objektdetektoren unterstützt die YOLOv5-Familie nahtlos Bildklassifizierung, Instanzsegmentierung und die Erkennung von Begrenzungsrahmen über eine einheitliche API. Die stark optimierte Architektur sorgt außerdem im Vergleich zu großen transformerbasierten Netzen für einen deutlich geringeren Speicherverbrauch beim Training und bei der Inferenz.
PP-YOLOE+: der Herausforderer auf Basis von PaddlePaddle#
PP-YOLOE+ wurde etwa zwei Jahre später vorgestellt und baut auf den Grundlagen früherer PP-YOLO-Versionen auf. Es wurde entwickelt, um die Leistungsfähigkeit des Deep-Learning-Frameworks von Baidu zu demonstrieren, und bietet mehrere architektonische Verbesserungen zur Steigerung der mittleren Average Precision.
PP-YOLOE+ – Details:
- Autoren: PaddlePaddle-Autoren
- Organisation: Baidu
- Datum: 2022-04-02
- ArXiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
- Dokumentation: PP-YOLOE+-README
PP-YOLOE+ basiert auf einem ankerfreien Ansatz und verwendet ein CSPRepResNet-Backbone. Zur Verbesserung der Präzision kommen eine leistungsstarke Technik namens Task Alignment Learning und ein Efficient Task-aligned Head zum Einsatz. PP-YOLOE+ erzielt zwar beeindruckende Genauigkeitswerte, seine größte Schwäche ist jedoch die strikte Abhängigkeit vom Framework PaddlePaddle. Das führt bei Forschungsteams und Unternehmen, die bereits stark in PyTorch- oder TensorFlow-Umgebungen investiert haben, oft zu einer steilen Lernkurve und Schwierigkeiten bei der Integration ins Ökosystem.
Leistung und Benchmarks#
Bei der Bewertung dieser Modelle für den Produktionseinsatz ist es entscheidend, die Kompromisse zwischen Präzision, Inferenzgeschwindigkeit und Anzahl der Parameter zu verstehen. Die folgende Tabelle enthält wichtige Leistungskennzahlen für verschiedene Modellgrößen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
PP-YOLOE+ erreicht zwar hohe Genauigkeitswerte, doch YOLOv5 erzielt bei jeder Modellgröße durchgehend eine schnellere TensorRT-Inferenz. Für Edge-Einsätze mit knappem Speicher bietet YOLOv5n eine unübertroffene Geschwindigkeit bei äußerst geringem Speicherbedarf.
Ultralytics-Modelle sind speziell auf effizientes Training ausgelegt. Im Vergleich zu großen Vision-Transformern wie RT-DETR benötigt YOLOv5 deutlich weniger CUDA-Speicher. Dadurch kannst du mit größeren Batch-Größen oder auf handelsüblicher Hardware trainieren.
Die Vorteile von Ultralytics: Ökosystem und Benutzerfreundlichkeit#
Der wahre Wert einer Architektur für maschinelles Lernen geht über reine Kennzahlen hinaus und umfasst die gesamte Entwicklererfahrung. Die Ultralytics Platform und die zugehörigen Open-Source-Werkzeuge bieten ein ausgereiftes, gut gepflegtes Ökosystem, das Entwicklungszyklen deutlich beschleunigt.
- Benutzerfreundlichkeit: Ultralytics nimmt dir komplexen Boilerplate-Code ab. Über eine intuitive Python API oder CLI kannst du Modelle trainieren, validieren und testen.
- Flexible Bereitstellung: Der Export von Modellen ist äußerst einfach. Mit einem einzigen Befehl kannst du deine trainierten YOLOv5-Gewichte in Formate wie ONNX, TensorRT oder OpenVINO konvertieren und so eine breite Kompatibilität mit Edge- und Cloud-Umgebungen sicherstellen.
- Aktive Community: Die engagierte Community sorgt für häufige Aktualisierungen, ausführliche Dokumentation und zuverlässige Lösungen für gängige Herausforderungen der Bildverarbeitung.
PP-YOLOE+ hingegen ist stark auf komplexe, für PaddleDetection spezifische Konfigurationsdateien angewiesen. Das kann schnelles Prototyping verlangsamen und die Integration in moderne MLOps-Pipelines erschweren.
Praktische Implementierungen und Codebeispiele#
Der Einstieg in Ultralytics ist bemerkenswert einfach. Hier ist ein vollständiges, ausführbares Beispiel, das zeigt, wie du ein vortrainiertes YOLOv5-Modell lädst, mit einem benutzerdefinierten Datensatz trainierst und die Ergebnisse exportierst:
from ultralytics import YOLO
# Ein vortrainiertes kleines YOLOv5-Modell laden
model = YOLO("yolov5su.pt") # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket
# Das Modell 50 Epochen lang mit dem COCO8-Datensatz trainieren
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Inferenz mit einem Beispielbild ausführen
predict_results = model("https://ultralytics.com/images/bus.jpg")
# Das optimierte Modell ins ONNX-Format exportieren
path = model.export(format="onnx")Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOv5 und PP-YOLOE+ hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Ökosystempräferenzen ab.
Wann du YOLOv5 wählen solltest#
YOLOv5 eignet sich besonders für:
- Bewährte Produktionssysteme: Bestehende Bereitstellungen, bei denen die lange Stabilitätsbilanz, die umfassende Dokumentation und die große Unterstützung durch die Community von YOLOv5 geschätzt werden.
- Training mit begrenzten Ressourcen: Umgebungen mit begrenzten GPU-Ressourcen, in denen die effiziente Trainingspipeline und der geringere Speicherbedarf von YOLOv5 von Vorteil sind.
- Umfangreiche Unterstützung von Exportformaten: Projekte, die eine Bereitstellung in vielen Formaten erfordern, darunter ONNX, TensorRT, CoreML und LiteRT.
Wann du PP-YOLOE+ wählen solltest#
PP-YOLOE+ empfiehlt sich für:
- Integration in das PaddlePaddle-Ökosystem: Unternehmen mit einer bestehenden Infrastruktur auf Basis des PaddlePaddle-Frameworks und der Werkzeuge von Baidu.
- Edge-Bereitstellung mit Paddle Lite: Bereitstellung auf Hardware mit hochoptimierten Inferenzkernen speziell für Paddle Lite oder die Paddle-Inferenz-Engine.
- Erkennung mit hoher Genauigkeit auf Servern: Szenarien, in denen höchste Erkennungsgenauigkeit auf leistungsstarken GPU-Servern gefragt ist und die Abhängigkeit von einem bestimmten Framework keine Rolle spielt.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Weitere hochmoderne Modelle, die du in Betracht ziehen solltest#
YOLOv5 ist zwar ein robustes und bewährtes Modell, doch die Bildverarbeitung entwickelt sich rasant weiter. Teams, die neue Projekte starten, empfehlen wir dringend, unsere neueren Architekturen zu erkunden.
Ultralytics YOLO26#
Das im Januar 2026 veröffentlichte YOLO26 ist der bisherige Höhepunkt unserer Forschung. Es bietet enorme Verbesserungen bei Genauigkeit und Geschwindigkeit. Zu den wichtigsten Innovationen gehören:
- End-to-End-Design ohne NMS: Aufbauend auf Konzepten aus YOLOv10 überspringt der optionale One-to-One-Head von YOLO26 (
nms=False) die Nachverarbeitung mit Non-Maximum Suppression (NMS). Dadurch sinkt die Latenz und die Bereitstellungslogik wird einfacher. - Wegfall von DFL: Durch den Verzicht auf Distribution Focal Loss erreicht YOLO26 eine bis zu 43 % schnellere CPU-Inferenz und eignet sich damit besonders gut für Edge-Geräte mit geringem Stromverbrauch.
- MuSGD-Optimierer: Diese von fortschrittlichen LLM-Trainingstechniken inspirierte Kombination aus SGD und Muon sorgt für äußerst stabile Trainingsläufe und schnellere Konvergenz.
- ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich – entscheidend für Drohnenaufnahmen und die intelligente Landwirtschaft.
Außerdem könntest du YOLO11 in Betracht ziehen. Das Modell bietet eine hervorragende Leistung und bildet eine äußerst zuverlässige Brücke zwischen älteren Systemen und den neuesten Möglichkeiten von YOLO26.
Anwendungsfälle in der Praxis#
Die Wahl zwischen YOLOv5 und PP-YOLOE+ hängt letztlich von deiner Bereitstellungsumgebung und den Projektbeschränkungen ab.
Ideale Einsatzbereiche für YOLOv5: Dank des geringen Ressourcenbedarfs und der enormen Benutzerfreundlichkeit ist YOLOv5 die erste Wahl für Edge AI. Das Modell eignet sich hervorragend für Anwendungen, die auf eingeschränkter Hardware hohe Bildraten erfordern, etwa Echtzeit-Robotik, die Integration in mobile Anwendungen und die Verkehrsüberwachung mit mehreren Kameras. Da es Instanzsegmentierung und Bildklassifizierung innerhalb desselben Frameworks unterstützt, ist es äußerst vielseitig.
Ideale Einsatzbereiche für PP-YOLOE+: PP-YOLOE+ eignet sich am besten für Szenarien, in denen höchste Genauigkeit bei statischen Bildern wichtiger ist als Echtzeitverarbeitung. Das Modell kommt vereinzelt in industriellen Prüfprozessen zum Einsatz, insbesondere in asiatischen Fertigungsbranchen mit vorhandenen technischen Systemen, die stark auf das Baidu- und PaddlePaddle-Ökosystem setzen.
Zusammenfassend lässt sich sagen: PP-YOLOE+ erzielt zwar starke Präzisionswerte, doch Ultralytics-YOLO-Modelle bieten eine unübertroffene Kombination aus ausgewogener Leistung, nahtloser Bereitstellung und entwicklerfreundlichem Design. Damit bringen sie Bildverarbeitungsprojekte erfolgreich von der Idee bis in die Produktion.