YOLOX und YOLO11 im Vergleich#
Die Entwicklung der Computer Vision wurde maßgeblich durch die Suche nach Frameworks für die Echtzeit-Objekterkennung vorangetrieben, die hohe Genauigkeit mit schneller Inferenz verbinden. Zu den wichtigsten Meilensteinen auf diesem Weg zählen YOLOX und Ultralytics YOLO11. Beide Modelle haben das Fachgebiet wesentlich geprägt, unterscheiden sich jedoch deutlich in ihrer zugrunde liegenden Architektur, ihren Entwicklungsgrundsätzen und den Ökosystemen für Entwickler.
Dieser umfassende technische Vergleich untersucht die Architekturen, Leistungskennzahlen, Trainingsmethoden und idealen Einsatzszenarien der Modelle. So kannst du eine fundierte Entscheidung für dein nächstes KI-Projekt treffen.
Überblick über YOLOX#
YOLOX wurde am 18. Juli 2021 von den Forschenden Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun bei Megvii vorgestellt und bedeutete einen erheblichen Wandel für die YOLO-Reihe. Mit einem Design ohne Ankerboxen schloss das Modell erfolgreich die Lücke zwischen wissenschaftlicher Forschung und industrieller Anwendung.
Weitere technische Hintergründe findest du im ursprünglichen YOLOX-Arxiv-Paper.
Wichtige Architekturmerkmale#
YOLOX wandte sich von der herkömmlichen Erkennung mit Ankerboxen ab und setzte stattdessen auf einen entkoppelten Kopf und einen Mechanismus ohne Ankerboxen. Dadurch verringerte sich die Zahl der Entwurfsparameter und die Leistung des Modells verbesserte sich bei verschiedenen Benchmarks. Außerdem führte YOLOX fortschrittliche Strategien zur Labelzuweisung wie SimOTA ein, um das Training zu beschleunigen und die Konvergenz zu verbessern.
YOLOX erzielt für seine Zeit eine ausgezeichnete Genauigkeit, konzentriert sich jedoch hauptsächlich auf die Objekterkennung mit Begrenzungsrahmen und unterstützt andere komplexe Bildverarbeitungsaufgaben nicht standardmäßig.
Durch den Verzicht auf vordefinierte Ankerboxen verringerte YOLOX den heuristischen Anpassungsaufwand für verschiedene Datensätze erheblich. Damit ist das Modell eine gute Ausgangsbasis für die Forschung an Methoden ohne Ankerboxen.
Überblick über Ultralytics YOLO11#
YOLO11 wurde am 27. September 2024 von Glenn Jocher und Jing Qiu bei Ultralytics veröffentlicht. Das hochmoderne Modell definiert Vielseitigkeit und Benutzerfreundlichkeit in der Computer Vision neu. Aufbauend auf jahrelanger Grundlagenforschung bietet YOLO11 eine ausgereifte, produktionsreife Lösung, die sich für zahlreiche Aufgaben eignet.
Der Vorteil von Ultralytics#
YOLO11 ist nicht nur ein Objektdetektor, sondern ein einheitliches Framework für Instanzsegmentierung, Bildklassifizierung, Posenschätzung und die Erkennung mit orientierten Begrenzungsrahmen (OBB). Die hocheffiziente Architektur sorgt für ein ausgewogenes Verhältnis zwischen Geschwindigkeit, Parameteranzahl und Genauigkeit.
Darüber hinaus ist YOLO11 vollständig in die Ultralytics Platform integriert. Sie bietet ein optimiertes Ökosystem für die Datenannotation, das Modelltraining und die Bereitstellung.
Leistungs- und Metrikvergleich#
Beim Vergleich der Modelle wird das ausgewogene Leistungsverhältnis deutlich. In den meisten Größenkategorien erreicht YOLO11 im Vergleich zu den entsprechenden YOLOX-Modellen eine höhere mittlere durchschnittliche Präzision (mAP) bei deutlich weniger Parametern und FLOPs.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Wie die Ergebnisse zeigen, sind YOLO11-Modelle durchweg genauer als YOLOX und benötigen zugleich weniger Parameter. YOLO11m erreicht beispielsweise 51.5 mAP mit nur 20.1M Parametern, während YOLOXx mit 51.1 mAP eine ähnliche Genauigkeit erzielt, dafür aber ganze 99.1M Parameter benötigt. Dank dieses geringen Speicherbedarfs beim Training und bei der Inferenz eignet sich YOLO11 besonders gut für den Einsatz auf Edge-KI-Geräten. Dabei entfallen die hohen CUDA-Speicheranforderungen, die bei älteren oder Transformer-basierten Modellen wie RT-DETR üblich sind.
Ultralytics-Modelle benötigen beim Training deutlich weniger GPU-Speicher als YOLOX- und Transformer-Architekturen. So können Forschende leistungsfähige Modelle auf handelsüblicher Hardware trainieren.
Ökosystem und Benutzerfreundlichkeit#
Einer der auffälligsten Unterschiede zwischen den beiden Frameworks zeigt sich in der Entwicklererfahrung.
Für YOLOX müssen häufig Repositories geklont, komplexe Umgebungen eingerichtet und umfangreiche Befehlszeilenargumente verwendet werden, um Modelle zu trainieren und in Formate wie ONNX oder TensorRT zu exportieren.
Im deutlichen Gegensatz dazu bietet Ultralytics YOLO11 eine besonders einfache Python-API und CLI. Die Ultralytics-Bibliothek übernimmt Datenerweiterung, Hyperparameteroptimierung und den Export automatisch.
from ultralytics import YOLO
# Ein vortrainiertes YOLO11-Modell laden
model = YOLO("yolo11n.pt")
# Das Modell mühelos mit eigenen Daten trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Das trainierte Modell für eine optimierte Bereitstellung nach TensorRT exportieren
model.export(format="engine")Dieses umfassend gepflegte Ökosystem wird durch ausführliche Dokumentation und die nahtlose Integration mit Tools wie Weights & Biases für die Experimentverfolgung ergänzt.
Ideale Anwendungsfälle#
Die Entscheidung zwischen diesen Modellen hängt häufig von den Anforderungen der Bereitstellungsumgebung ab.
Wann du YOLOX verwenden solltest#
- Altsysteme: Wenn du über eine etablierte Pipeline verfügst, die ausdrücklich auf der ursprünglichen YOLOX-Codebasis oder den Objekterkennungsmethoden von Anfang 2021 aufbaut.
- Wissenschaftliche Vergleichswerte: Wenn du Forschung betreibst, bei der ein direkter Vergleich mit grundlegenden Architekturen ohne Ankerboxen aus dem Jahr 2021 erforderlich ist.
Wann du YOLO11 verwenden solltest#
- Produktive Anwendungen: Für kommerzielle Anwendungen im intelligenten Einzelhandel oder in Sicherheitsalarmanlagen, bei denen zuverlässiger, gepflegter Code und hohe Genauigkeit unverzichtbar sind.
- Pipelines für mehrere Aufgaben: Wenn ein Projekt die Objektverfolgung, Posenschätzung von Menschen und Instanzsegmentierung in einem einzigen, einheitlichen Framework erfordert.
- Edge-Geräte mit beschränkten Ressourcen: Dank der geringen Parameteranzahl und des hohen Durchsatzes eignet sich YOLO11 ideal für die Bereitstellung auf einem Raspberry Pi oder mobilen Edge-Knoten mit CoreML und NCNN.
Ausblick: Die Vorteile von YOLO26#
Während YOLO11 einen enormen Sprung gegenüber YOLOX darstellt, entwickelt sich die Computer Vision rasant weiter. Für Entwickler, die heute neue Projekte starten, ist Ultralytics YOLO26 die klare Empfehlung.
YOLO26 wurde im Januar 2026 veröffentlicht und baut auf der herausragenden Architektur von YOLO11 auf. Außerdem führt das Modell mehrere bahnbrechende Funktionen ein:
- End-to-End-Design ohne NMS: Der optionale One-to-One-Kopf von YOLO26 (
nms=False) macht die Nachbearbeitung durch Unterdrückung nicht maximaler Werte (NMS) überflüssig und ermöglicht so schnellere, einfachere Bereitstellungspipelines (ein Konzept, das erstmals in YOLOv10 untersucht wurde). - Bis zu 43 % schnellere CPU-Inferenz: Durch den Wegfall des Distribution Focal Loss (DFL) ist YOLO26 auf CPUs und stromsparenden Edge-Geräten wesentlich effizienter.
- MuSGD-Optimierer: Inspiriert von Innovationen beim Training großer Sprachmodelle durch Moonshot AI, sorgt der MuSGD-Optimierer für äußerst stabile Trainingsläufe und schnelle Konvergenz.
- Fortschrittliche Verlustfunktionen: Mit ProgLoss + STAL erzielt YOLO26 deutliche Verbesserungen bei der Erkennung kleiner Objekte, was für Drohnenaufnahmen und autonome Robotik entscheidend ist.
Für die große Mehrheit moderner Computer-Vision-Aufgaben bietet die Umstellung deiner Pipeline auf YOLO26 die bestmögliche Kombination aus Geschwindigkeit, Genauigkeit und einfacher Bereitstellung.