Ultralytics YOLO27:
Get Started

YOLOv10 vs. YOLOX#

Das Gebiet der Computer Vision wird durch rasante Fortschritte bei Architekturen zur Objekterkennung in Echtzeit vorangetrieben. Dieser ausführliche technische Vergleich beleuchtet zwei einflussreiche Modelle, die Effizienz und Architekturkonzepte weiterentwickelt haben: YOLOv10 und YOLOX. Durch die Untersuchung ihrer Architekturunterschiede, Leistungskennzahlen und Trainingsmethoden können Entwickler und Forschende fundierte Entscheidungen für den Einsatz robuster Bildverarbeitungssysteme treffen.

Hintergründe und Ursprünge der Modelle#

Die Ursprünge dieser Deep-Learning-Modelle zu verstehen, liefert wertvollen Kontext zu ihren Architekturzielen und den vorgesehenen Anwendungsfällen.

YOLOv10: NMS für echte End-to-End-Erkennung abschaffen#

YOLOv10 wurde entwickelt, um lang bestehende Latenzengpässe zu beseitigen, und führte einen nativen End-to-End-Ansatz für die YOLO-Familie ein.

Mehr über YOLOv10 erfahren

YOLOX: Die Lücke zwischen Forschung und Industrie schließen#

YOLOX entstand als anchor-free Variante des traditionellen YOLO-Designs. Das Modell bietet eine einfachere Methodik bei konkurrenzfähiger Leistung und wurde speziell entwickelt, um den Einsatz in der Industrie zu erleichtern.

Mehr über YOLOX erfahren

Architekturmerkmale und Innovationen#

Beide Frameworks weichen von traditionellen anchor-basierten Detektoren ab, lösen jedoch unterschiedliche Probleme in der Objekterkennungspipeline.

YOLOX-Architektur#

YOLOX brachte 2021 mehrere wichtige Neuerungen ins Ökosystem ein. Der wichtigste Beitrag war der Wechsel zu einem anchor-free Detektor. Durch den Verzicht auf vordefinierte Ankerboxen verringerte YOLOX die Anzahl der Entwurfsparameter und den erforderlichen heuristischen Abstimmungsaufwand für verschiedene Datensätze erheblich.

Darüber hinaus verwendet YOLOX einen entkoppelten Kopf, der Klassifikations- und Regressionsaufgaben voneinander trennt. Dadurch wurde der Konflikt zwischen den beiden Zielen gelöst und die Konvergenz während des Trainings deutlich beschleunigt. Außerdem kommt SimOTA für eine fortschrittliche Label-Zuweisung zum Einsatz, wodurch der Umgang mit dicht bevölkerten Szenen und Verdeckungen im COCO-Datensatz verbessert wird.

Vorteile anchor-freier Modelle

Anchor-freie Designs wie das von YOLOX eingeführte verringern den Aufwand für die Modellabstimmung erheblich. Entwickler müssen keine k-means-Clusteranalyse mehr auf benutzerdefinierten Datensätzen durchführen, um optimale Ankerboxgrößen festzulegen, und sparen dadurch wertvolle Vorbereitungszeit.

YOLOv10-Architektur#

YOLOX verbesserte zwar den Erkennungskopf, setzte bei der Inferenz aber weiterhin auf Non-Maximum Suppression (NMS), was zu schwankender Latenz führt. YOLOv10 setzte genau hier an und führte für das NMS-freie Training eine Strategie mit konsistenter doppelter Zuweisung ein. Während des Trainings werden sowohl One-to-many- als auch One-to-one-Label-Zuweisungen verwendet. Bei der Inferenz entfällt der One-to-many-Kopf jedoch vollständig, sodass saubere Vorhersagen ohne NMS-Nachbearbeitung ausgegeben werden.

YOLOv10 zeichnet sich außerdem durch ein ganzheitliches, auf Effizienz und Genauigkeit ausgerichtetes Modelldesign aus. Leichte Klassifikationsköpfe und ein räumlich-kanalweise entkoppeltes Downsampling verringern die Anzahl der Parameter und die FLOPs erheblich, ohne die Genauigkeit zu beeinträchtigen.

Leistungsvergleich#

Die Bewertung dieser Modelle auf Hardware wie der NVIDIA T4 GPU zeigt je nach Modellgröße unterschiedliche Vorteile. Die folgende Tabelle bietet einen umfassenden Vergleich.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Wie oben zu sehen ist, lässt sich YOLOv10 außergewöhnlich gut skalieren. Die Variante YOLOv10x erzielt die höchste Genauigkeit (54.4 mAP), während die Variante YOLOv10n dank der Integration von TensorRT die schnellste Inferenz bietet. Das ältere YOLOX-Nano-Modell hat dagegen den geringsten Gesamtplatzbedarf und eignet sich daher für stark eingeschränkte Umgebungen.

Trainingsmethoden und Ressourcenbedarf#

Bei der Implementierung von Modellen für den Produktiveinsatz sind das Trainingsökosystem und der Ressourcenbedarf ebenso entscheidend wie die reine Inferenzgeschwindigkeit.

YOLOX setzt häufig auf ältere Umgebungskonfigurationen, deren Verwaltung umständlich sein kann. Außerdem erfordert die ältere Codebasis mehr Boilerplate-Code für verteiltes Training mit mehreren GPUs oder Optimierungen mit gemischter Genauigkeit.

YOLOv10 lässt sich nahtlos in moderne PyTorch-Workflows integrieren, doch erst das Ultralytics-Ökosystem verändert die Entwicklererfahrung grundlegend. Ultralytics-Modelle zeichnen sich im Vergleich zu Transformer-basierten Architekturen wie RT-DETR durch einen deutlich geringeren CUDA-Speicherbedarf während des Trainings aus.

Codebeispiel: Vereinfachtes Training#

Mit der einheitlichen Ultralytics-API kannst du hochmoderne Modelle mit nur wenigen Zeilen Python-Code nahtlos trainieren. So entfällt das manuelle Kompilieren von C++-Operatoren oder die Arbeit mit komplizierten Konfigurationsdateien.

from ultralytics import YOLO

# Ein vortrainiertes YOLOv10-Modell initialisieren
model = YOLO("yolov10s.pt")

# Das Modell mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Die Leistung des Modells validieren
metrics = model.val()

# Das optimierte Modell ins ONNX-Format exportieren
model.export(format="onnx")

Diese einfache Syntax bietet sofortigen Zugriff auf automatische gemischte Genauigkeit, automatisierte Datenerweiterung und die Integration mit Tools wie Weights & Biases.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv10 und YOLOX hängt von deinen konkreten Projektanforderungen, Einsatzbeschränkungen und Präferenzen beim Ökosystem ab.

Wann du YOLOv10 wählen solltest#

YOLOv10 eignet sich besonders für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du YOLOX wählen solltest#

YOLOX empfiehlt sich für:

  • Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
  • Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
  • Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die Zukunft der Vision-KI: YOLO26 kommt#

YOLOv10 und YOLOX markieren wichtige Meilensteine, doch die Computer Vision entwickelt sich unaufhaltsam weiter. Für Entwickler, die heute neue Projekte starten, ist Ultralytics YOLO26 die klare Empfehlung.

Ultralytics YOLO26 wurde im Januar 2026 veröffentlicht und baut auf dem von YOLOv10 eingeführten grundlegenden Durchbruch des End-to-End-Designs ohne NMS auf. Das Modell wurde weiterentwickelt, um noch stabiler und schneller zu sein.

YOLO26 setzt mit mehreren bedeutenden Fortschritten neue Maßstäbe:

  • Bis zu 43 % schnellere CPU-Inferenz: Durch den gezielten Verzicht auf Distribution Focal Loss (DFL) erzielt YOLO26 eine deutlich höhere Leistung auf Edge-Geräten ohne GPUs.
  • MuSGD-Optimierer: Diese neuartige Kombination aus SGD und Muon orientiert sich an der Trainingsstabilität von LLMs und sorgt für schnellere Konvergenz und äußerst stabile Trainingsläufe.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich – ein entscheidender Faktor für Luftaufnahmen und IoT-Sensoren.
  • Unübertroffene Vielseitigkeit: Anders als YOLOX, das ausschließlich der Objekterkennung dient, unterstützt YOLO26 nativ Instanzsegmentierung, Posenschätzung, Bildklassifizierung und OBB-Erkennung in einer einzigen, einheitlichen Bibliothek.
Die Ultralytics Platform nutzen

Für den einfachsten Weg zum Produktiveinsatz können Entwickler die Ultralytics Platform verwenden, um Datensätze zu annotieren, YOLO26-Modelle in der Cloud zu trainieren und sie ohne erforderliche Einrichtung auf jedem Edge-Gerät bereitzustellen.

Anwendungen in der Praxis#

Die Wahl des passenden Modells entscheidet über den Erfolg realer Einsätze in den verschiedensten Branchen.

Hochgeschwindigkeits-Videoanalyse#

Für die Verarbeitung umfangreicher Videodatenströme, etwa zur Verkehrssteuerung in Smart Cities, bietet YOLOv10 dank der NMS-freien Nachbearbeitung einen erheblichen Vorteil. Durch den Wegfall des NMS-Engpasses bleibt die Latenz konstant niedrig, wodurch sich das Modell ideal mit Tracking-Algorithmen wie BoT-SORT kombinieren lässt.

Einsatz auf älteren Edge-Geräten#

In älteren akademischen Umgebungen oder älteren Android-Anwendungen, die stark auf reine Faltungsverfahren optimiert sind, können kleinere Modelle wie YOLOX-Tiny weiterhin für spezielle Anwendungsfälle geeignet sein, wenn die Nutzung älterer PyTorch-Umgebungen als vertretbarer Kompromiss gilt.

Moderne Edge- und IoT-Geräte#

Für den Einsatz auf Hardware der nächsten Generation, etwa in der Robotik, bei Drohnen und für die Analyse von Verkaufsregalen, ist YOLO26 die optimale Lösung. Dank der drastisch geringeren CPU-Latenz und der überlegenen Erkennung kleiner Objekte eignet sich das Modell besonders für autonome Navigation und eine detaillierte Bestandsverwaltung.

Weitere Vergleiche zur Erweiterung deines Deep-Learning-Werkzeugkastens zeigen, wie diese Modelle im Vergleich zu Alternativen wie dem flexiblen YOLO11 oder dem Transformer-basierten RT-DETR abschneiden.

Kommentare