YOLOX und YOLOv5#
Die Auswahl des richtigen Objekterkennungsmodells ist eine entscheidende Weichenstellung für den Erfolg jedes Computer-Vision-Projekts. Dieser Leitfaden bietet einen umfassenden technischen Vergleich zweier wegweisender Modelle im Bereich der KI: YOLOX von Megvii und Ultralytics YOLOv5. Durch die Analyse ihrer Architekturen, Leistungskennzahlen und Trainingsökosysteme möchten wir Entwicklerinnen, Entwicklern und Forschenden helfen, eine fundierte Entscheidung für ihre spezifischen Einsatzumgebungen zu treffen.
Einführung in die Modelle#
Beide Modelle entstanden in einer Phase rasanter Fortschritte bei der Objekterkennung in Echtzeit, verfolgten jedoch unterschiedliche Architekturkonzepte, um ihre Leistung zu erzielen.
YOLOX: ein ansatzfreier Ansatz#
YOLOX wurde am 18. Juli 2021 von den Forschenden Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun bei Megvii veröffentlicht und leitete einen bedeutenden Wandel ein, indem es sich von herkömmlichen Ankerboxen abwandte. YOLOX wurde in ihrem technischen Arxiv-Bericht dokumentiert und verband ein ankerfreies Design mit einem entkoppelten Kopf und der SimOTA-Strategie zur Labelzuweisung. Dieses Design sollte die Lücke zwischen akademischer Forschung und industrieller Anwendung schließen und starke Ergebnisse auf Standarddatensätzen erzielen.
YOLOv5: der Standard für produktive Computer Vision#
YOLOv5 wurde von Glenn Jocher entwickelt und am 26. Juni 2020 von Ultralytics veröffentlicht. Das Modell wurde schnell zum Industriestandard für den produktiven Einsatz von Computer Vision. Es basiert nativ auf dem PyTorch-Framework und machte modernste KI allgemein zugänglich: mit außergewöhnlicher Benutzerfreundlichkeit, sehr schnellem Training und einem ausgefeilten Repository. Die Architektur von YOLOv5 konzentrierte sich auf die optimale Balance aus Geschwindigkeit, Genauigkeit und einfacher Bereitstellung. Dadurch wurde das Modell für den Einsatz auf Edge-Geräten ebenso beliebt wie für umfangreiche Cloud-Bereitstellungen.
Architektonische Unterschiede#
Wenn du die grundlegenden technischen Unterschiede zwischen diesen Netzwerken verstehst, wird klar, warum sie sich bei verschiedenen Aufgaben unterschiedlich verhalten.
Ankerfrei oder ankerbasiert#
Der prägendste Unterschied ist der ankerfreie Mechanismus von YOLOX. Herkömmliche Modelle wie YOLOv5 verwenden vordefinierte Ankerboxen zur Vorhersage von Begrenzungsrahmen. Dafür muss der Trainingsdatensatz mithilfe einer Clusteranalyse untersucht werden, um optimale Ankergrößen zu bestimmen. YOLOX verzichtet darauf und sagt die Koordinaten der Begrenzungsrahmen direkt an jeder räumlichen Position voraus. Der ankerfreie Ansatz verringert zwar die Zahl der Entwurfsparameter und den Bedarf an heuristischer Abstimmung, doch der verfeinerte ankerbasierte Ansatz von YOLOv5 sorgt dank seiner automatischen Ankerfunktion von Anfang an für eine äußerst stabile und vorhersehbare Konvergenz beim Training.
Entkoppelter oder gekoppelter Kopf#
YOLOX verwendet einen entkoppelten Kopf: Klassifikation und Regression sind dabei auf getrennte Zweige des neuronalen Netzes aufgeteilt. Die Autorinnen und Autoren argumentierten, dass dadurch Konflikte zwischen dem Lernen räumlicher und semantischer Merkmale gelöst werden. YOLOv5 setzte dagegen in früheren Versionen auf einen hochgradig optimierten gekoppelten Kopf, der die Recheneffizienz maximierte und die Latenz bei der Inferenz verringerte – entscheidend für Edge-Computing in Echtzeit.
Strategie zur Labelzuweisung#
YOLOX verwendet SimOTA für die Labelzuweisung. Dabei wird die Zuordnung von Ground-Truth-Objekten zu Vorhersagen als Optimierungsproblem des optimalen Transports formuliert. Diese dynamische Zuweisung verbessert den Umgang mit dicht bevölkerten Szenen. YOLOv5 nutzt eine robuste, auf Formregeln basierende Zuweisung. So erhält die Verlustfunktion zuverlässig hochwertige positive Beispiele, was zur legendären Trainingsstabilität des Modells beiträgt.
Leistung und Benchmarks#
Der Kompromiss zwischen Geschwindigkeit und Genauigkeit ist der entscheidende Prüfstein für diese Architekturen. Die folgende Tabelle zeigt die Leistung verschiedener Modellgrößen auf Standard-Benchmarks.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
YOLOX erzielt konkurrenzfähige mAP-Werte, insbesondere bei den größeren Varianten. YOLOv5 ist jedoch über alle Modellgrößen hinweg bei der Inferenzgeschwindigkeit mit TensorRT bemerkenswert im Vorteil. Das Modell YOLOv5s bietet beispielsweise ein hervorragendes Verhältnis von Geschwindigkeit zu Genauigkeit und eignet sich damit besonders für Echtzeitanwendungen, bei denen jede Millisekunde zählt.
Der Ultralytics-Vorteil: Training und Benutzerfreundlichkeit#
Beim Übergang von der Forschung in den Produktiveinsatz ist das Ökosystem rund um ein Modell oft genauso wichtig wie das Modell selbst. Hier werden die Vorteile des Ultralytics-Ökosystems besonders deutlich.
Ein unkompliziertes Nutzungserlebnis#
YOLOv5 wird allgemein für sein Entwicklererlebnis gelobt, das den Einstieg erleichtert und schnelle Fortschritte ermöglicht. Mit der Ultralytics Python API und der CLI kannst du Modelle mit einzelnen Codezeilen laden, trainieren und bereitstellen. Im Gegensatz dazu erfordert der Einsatz von YOLOX aus dem Megvii-GitHub-Repository mehr manuelle Konfiguration von Umgebungsvariablen, komplexe Python-Pfadeinstellungen und eine steilere Lernkurve, wie sie für akademische Codebasen typisch ist.
Trainingseffizienz und Speicherbedarf#
Ultralytics-Modelle sind sorgfältig darauf ausgelegt, den Speicherbedarf beim Training zu minimieren. YOLOv5 benötigt deutlich weniger CUDA-Speicher als stark parametrisierte Transformer-Modelle wie RT-DETR oder nicht optimierte Forschungsmodelle. So können Entwicklerinnen und Entwickler auf handelsüblicher Hardware mit größeren Stapelgrößen trainieren und den iterativen Entwicklungszyklus beschleunigen.
Vielseitigkeit bei verschiedenen Aufgaben#
YOLOX ist ausschließlich ein Framework zur Objekterkennung. Das Ultralytics-Ökosystem hat YOLOv5 hingegen so weiterentwickelt, dass es mehrere Computer-Vision-Aufgaben unterstützt. Direkt nach der Installation kannst du mit exakt derselben API-Syntax Bildklassifizierung, Instanzsegmentierung und Objekterkennung durchführen.
Wenn du noch anspruchsvollere Aufgaben wie Posenschätzung oder die Erkennung orientierter Begrenzungsrahmen (OBB) benötigst, empfehlen wir dir ausdrücklich, auf die neueste Architektur Ultralytics YOLO26 umzusteigen. Sie unterstützt all diese Aufgaben nativ und bietet eine Genauigkeit auf dem neuesten Stand der Technik.
Codevergleich#
Der Unterschied bei der Benutzerfreundlichkeit zeigt sich am besten im Code.
Training mit YOLOv5:
from ultralytics import YOLO
# Ein vortrainiertes YOLOv5s-Modell laden
model = YOLO("yolov5su.pt") # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket
# Trainiere das Modell mit dem Beispieldatensatz COCO8
model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Eine Inferenz auf einem Bild ausführen
results = model("https://ultralytics.com/images/zidane.jpg")
# Ergebnisse anzeigen
results[0].show()Training mit YOLOX: (Erfordert das manuelle Klonen des Repositorys, die Installation über setup.py und komplexe CLI-Argumente)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oDer Ansatz von Ultralytics beseitigt unnötige Hürden, sodass du dich auf deinen Datensatz und die Anwendungslogik konzentrieren kannst, statt Konfigurationsdateien zu debuggen. Außerdem lassen sich deine Experimente dank integrierter Anbindungen an Weights & Biases und Comet ML mühelos nachverfolgen.
Ideale Anwendungsfälle und praktische Einsatzgebiete#
Die Wahl zwischen diesen Modellen hängt von der Betriebsumgebung deines Projekts ab.
Wo YOLOX seine Stärken ausspielt#
YOLOX ist weiterhin eine gute Wahl im akademischen Umfeld, wenn Forschende ausdrücklich ankerfreie Ansätze oder Strategien zur Labelzuweisung untersuchen. Das Modell eignet sich auch für Szenarien, in denen die Erkennung dicht bevölkerter Szenen oberste Priorität hat und die Geschwindigkeit bei der Bereitstellung am Netzwerkrand zweitrangig ist.
Wo YOLOv5 besonders überzeugt#
YOLOv5 ist der unbestrittene Spitzenreiter bei der praktischen Bereitstellung.
- Fertigung mit hoher Geschwindigkeit: Bei der Fehlererkennung am Fließband sorgt die minimale Inferenzlatenz von YOLOv5 auf Edge-GPUs dafür, dass Produkte geprüft werden, ohne das Band zu verlangsamen.
- Drohnen und Luftbilder: Dank seines geringen Speicherbedarfs kann YOLOv5 auf leichten Begleitcomputern in Drohnen eingesetzt werden, etwa zur Überwachung landwirtschaftlicher Flächen und zur Beobachtung von Wildtieren.
- Intelligenter Einzelhandel: Von automatisierten Kassen bis zur Bestandsverwaltung lässt sich YOLOv5 mühelos nach TensorRT und ONNX exportieren und so auf Tausenden von Ladenkameras bereitstellen.
Ein Blick in die Zukunft: Die Vorteile von YOLO26#
YOLOv5 ist ein legendäres Modell, doch die KI entwickelt sich rasant weiter. Wenn du heute ein neues Projekt startest, empfehlen wir dir dringend, dir die neueste Generation der Ultralytics-Modelle anzusehen.
Ultralytics YOLO26 wurde 2026 veröffentlicht und stellt einen gewaltigen Fortschritt dar. Das Modell verfügt über ein optionales End-to-End-Design ohne NMS (nms=False), das eine Nachbearbeitung mit Non-Maximum Suppression überflüssig macht und die Bereitstellungslogik erheblich vereinfacht. Durch den Verzicht auf Distribution Focal Loss (DFL) und den Einsatz des hochmodernen MuSGD Optimizer erreicht YOLO26 eine bis zu 43 % schnellere CPU-Inferenz als frühere Generationen und erzielt gleichzeitig eine höhere Genauigkeit. Besonders bei kleinen Objekten ist es dank des neuen ProgLoss + STAL (Progressive Loss and Small-Target-Aware Label Assignment) leistungsstark.
Ob du dich für die bewährte Zuverlässigkeit von YOLOv5 oder die Spitzenleistung von YOLO26 entscheidest: Die Ultralytics Platform bietet dir die besten verfügbaren Werkzeuge, um deine Computer-Vision-Lösungen nahtlos vom Konzept in den Produktiveinsatz zu überführen. In der umfassenden Ultralytics-Dokumentation erfährst du, wie du das volle Potenzial deiner KI-Pipeline ausschöpfen kannst.