YOLOX im Vergleich zu PP-YOLOE+#
Bei der Entwicklung einer robusten Computer-Vision-Pipeline ist die Wahl des passenden Objekterkennungsmodells eine entscheidende Weichenstellung. Der Markt für Echtzeit-Objekterkennung ist hart umkämpft: Zahlreiche Architekturen streben die optimale Balance zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit an. In diesem technischen Vergleich bewerten wir zwei bedeutende Modelle: YOLOX und PP-YOLOE+. Durch die Untersuchung ihrer Architektur, Trainingsmethoden und Leistungskennzahlen möchten wir Entwicklerinnen, Entwicklern und Forschenden die nötigen Einblicke geben, um das passende Werkzeug für ihre Einsatzumgebung auszuwählen.
Architektonische Neuerungen und Design#
Beide Modelle wurden entwickelt, um konkrete Schwächen früherer YOLO-Versionen zu beheben, verfolgen jedoch grundlegend unterschiedliche Ansätze für den Kompromiss zwischen Geschwindigkeit und Genauigkeit.
YOLOX: Forschung und Industrie verbinden#
YOLOX wurde von Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun bei Megvii entwickelt und am 18. Juli 2021 veröffentlicht. Mit dem konsequent ankerfreien Design leitete das Modell einen bedeutenden Wandel in der YOLO-Familie ein. Die Grundlagen der Forschung findest du im offiziellen Arxiv-Artikel, den ursprünglichen Quellcode im YOLOX-GitHub-Repository.
YOLOX verwendet einen entkoppelten Kopf, der Klassifikations- und Regressionsaufgaben trennt und so die Konvergenz beim Training deutlich beschleunigt. Außerdem führte das Modell fortschrittliche Strategien zur Labelzuweisung wie SimOTA ein, mit denen positive Beispiele dynamisch zugewiesen werden. Dadurch ist das Modell besonders effizient in Edge-KI-Umgebungen, in denen die Rechenressourcen stark begrenzt sind.
PP-YOLOE+: leistungsstarke industrielle Erkennung#
PP-YOLOE+ wurde am 2. April 2022 von den Autorinnen und Autoren von PaddlePaddle bei Baidu vorgestellt und ist eine hochgradig optimierte Weiterentwicklung der PP-YOLO-Reihe. Wie in der Arxiv-Veröffentlichung beschrieben, ist PP-YOLOE+ eng in das Baidu-Ökosystem integriert und erfordert das PaddlePaddle-Framework. Die Modellkonfigurationen findest du im PaddleDetection-GitHub-Repository.
PP-YOLOE+ basiert auf einem leistungsstarken CSPRepResNet-Backbone und verwendet neben dem Efficient Task-aligned Head (ET-Head) auch Task Alignment Learning (TAL). Diese Architektur erzielt eine herausragende mittlere durchschnittliche Präzision (mAP) auf dem COCO-Datensatz. Damit eignet sie sich hervorragend für die industrielle Fehlererkennung und rechenintensive serverseitige Verarbeitung, bei der Genauigkeit wichtiger ist als ein möglichst geringer Abhängigkeitsumfang.
Leistungsbenchmarks#
Für die Bereitstellung ist es wichtig zu verstehen, wie sich diese Modelle bei unterschiedlichen Größen verhalten. Die folgende Tabelle zeigt wichtige Kennzahlen, darunter mAP und Inferenzgeschwindigkeiten nach dem Export nach TensorRT.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
PP-YOLOE+x erzielt zwar die höchste absolute Genauigkeit, doch YOLOX bietet besonders leichte Varianten (Nano und Tiny), die sich hervorragend für stromsparende Mikrocontroller und ältere Mobilgeräte eignen.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOX und PP-YOLOE+ hängt von den spezifischen Anforderungen deines Projekts, den Einschränkungen bei der Bereitstellung und deinen Präferenzen beim Ökosystem ab.
Wann du YOLOX wählen solltest#
YOLOX ist eine gute Wahl für:
- Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
- Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
- Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.
Wann du PP-YOLOE+ wählen solltest#
PP-YOLOE+ empfiehlt sich für:
- Integration in das PaddlePaddle-Ökosystem: Unternehmen mit einer bestehenden Infrastruktur auf Basis des PaddlePaddle-Frameworks und der Werkzeuge von Baidu.
- Edge-Bereitstellung mit Paddle Lite: Bereitstellung auf Hardware mit hochoptimierten Inferenzkernen speziell für Paddle Lite oder die Paddle-Inferenz-Engine.
- Erkennung mit hoher Genauigkeit auf Servern: Szenarien, in denen höchste Erkennungsgenauigkeit auf leistungsstarken GPU-Servern gefragt ist und die Abhängigkeit von einem bestimmten Framework keine Rolle spielt.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Der Vorteil von Ultralytics: YOLO26 im Überblick#
YOLOX und PP-YOLOE+ bieten jeweils besondere Vorteile. Die rasante Entwicklung der KI erfordert jedoch Werkzeuge, die modernste Genauigkeit mit herausragender Benutzerfreundlichkeit verbinden. Hier sind Ultralytics-Modelle und insbesondere das kürzlich veröffentlichte Ultralytics YOLO26 älteren Forschungs-Repositorys überlegen.
YOLO26 wurde im Januar 2026 veröffentlicht und setzt neue Maßstäbe für moderne Objekterkennung und weitere Aufgaben. Das Entwicklererlebnis ist Konkurrenz-Frameworks schlichtweg überlegen.
Warum Entwicklerinnen und Entwickler YOLO26 wählen#
- End-to-End-Design ohne NMS: Aufbauend auf Konzepten aus YOLOv10 unterstützt YOLO26 native End-to-End-Inferenz. Durch den Verzicht auf die Nachbearbeitung mit Nichtmaximalunterdrückung (NMS) dank eines optionalen One-to-One-Kopfs (
nms=False) erreicht das Modell eine äußerst gleichbleibende Latenz und vereinfacht Exportpipelines für Edge-Umgebungen erheblich. - Optimierung der nächsten Generation: Der MuSGD Optimizer, eine Kombination aus SGD und Muon, revolutioniert die Trainingsstabilität. Muon ist von LLM-Methoden wie Kimi K2 von Moonshot AI inspiriert. Das sorgt für eine schnellere Konvergenz. Darüber hinaus verbessert YOLO26 mithilfe von ProgLoss + STAL die Erkennung kleiner Objekte erheblich – eine entscheidende Fähigkeit für Anwendungen mit Luftbildern und Robotik.
- Unübertroffene Hardwareeffizienz: Durch den Wegfall von Distribution Focal Loss (DFL) vereinfacht YOLO26 seinen Erkennungskopf und den Exportgraphen. Das Modell bietet eine bis zu 43 % schnellere CPU-Inferenz und ist damit die optimale Wahl für Geräte ohne dedizierte GPU-Beschleunigung.
- Äußerst vielseitig: Im Gegensatz zu PP-YOLOE+, das sich ausschließlich auf die Erkennung konzentriert, unterstützt YOLO26 zahlreiche Aufgaben auf einer gemeinsamen Grundlage. Das Modell nutzt einen speziellen semantischen Segmentierungsverlust für die Instanzsegmentierung, Residual Log-Likelihood Estimation (RLE) für präzise Posenschätzung und fortschrittliche Winkelverlustverfahren für orientierte Begrenzungsrahmen (OBB).
Nahtlose Integration ins Ökosystem#
Ultralytics erspart dir den Aufwand komplexer Framework-Installationen. Mit der einheitlichen Python API oder der intuitiven Ultralytics Platform kannst du Modelle mit nur wenigen Codezeilen trainieren, validieren und exportieren.
from ultralytics import YOLO
# Das hochmoderne YOLO26-Small-Modell laden
model = YOLO("yolo26s.pt")
# Mit minimalem CUDA-Speicherbedarf auf einem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Mühelos Inferenz ausführen
predictions = model("https://ultralytics.com/images/bus.jpg")
# Nativ nach ONNX exportieren und die NMS-freie Architektur voll ausschöpfen
model.export(format="onnx", nms=False)Für Nutzer, die weitere robuste Architekturen im Ultralytics-Ökosystem evaluieren, bleibt YOLO11 eine äußerst zuverlässige Wahl für ältere Bereitstellungen, während der Transformer-basierte RT-DETR hervorragende Möglichkeiten für alle bietet, die nach auf Attention basierenden Lösungen suchen.
Zusammenfassung#
Die Wahl zwischen YOLOX und PP-YOLOE+ hängt oft von den Einschränkungen deines bevorzugten Frameworks ab – davon, ob du die Flexibilität von PyTorch oder eine tiefe Integration mit Baidus PaddlePaddle bevorzugst. Für Unternehmen, die ihre KI-Infrastruktur zukunftssicher aufstellen möchten, ist Ultralytics YOLO26 jedoch eine deutlich bessere Alternative. Mit optionaler NMS-freier Inferenz, geringem Speicherbedarf und vielseitiger Unterstützung verschiedenster Aufgaben ermöglicht YOLO26 Teams, Computer-Vision-Anwendungen schneller, intelligenter und effizienter denn je zu entwickeln.