Ultralytics YOLO27:
Get Started

YOLOv5 vs. YOLOX#

Die Entwicklung der Bildverarbeitung in Echtzeit ist von zahlreichen Meilensteinen geprägt, wobei verschiedene Architekturen die Grenzen von Geschwindigkeit und Genauigkeit verschieben. Zwei besonders einflussreiche Modelle in diesem Bereich sind YOLOv5 und YOLOX. Beide sind für ihre hohe Leistung bei der Objekterkennung bekannt, verfolgen jedoch grundlegend unterschiedliche Architekturansätze.

Dieser Leitfaden bietet eine ausführliche technische Analyse der beiden Modelle. Er vergleicht ihre Architekturen, Leistungskennzahlen, Trainingsmethoden und geeigneten Bereitstellungsszenarien, damit Entwickler und Forscher das passende Werkzeug für ihre Vision-AI-Projekte auswählen können.

Modellübersichten und architektonische Unterschiede#

Ultralytics YOLOv5#

Eingeführt von Ultralytics, wurde YOLOv5 dank seines außergewöhnlich ausgewogenen Verhältnisses von Leistung, Benutzerfreundlichkeit und Speichereffizienz schnell zum Industriestandard. YOLOv5 wurde nativ auf dem PyTorch-Framework aufgebaut und verwendet eine ankerbasierte Architektur. Das Modell stützt sich auf vordefinierte Begrenzungsrahmenformen, um Objektpositionen vorherzusagen, wodurch es sich besonders gut für standardmäßige Objekterkennungsaufgaben eignet.

Eine der größten Stärken von YOLOv5 ist sein gut gepflegtes Ökosystem. Es bietet eine umfangreiche Dokumentation, eine ausgesprochen einfache Python-API und eine native Integration mit der Ultralytics Platform. Dadurch können Entwickler nahtlos von der Beschriftung des Datensatzes über das Training bis zum Export in Formate wie ONNX und TensorRT wechseln.

Vorteile des Ökosystems

Ultralytics-YOLO-Modelle benötigen beim Training typischerweise deutlich weniger GPU-Speicher als komplexe Transformer-basierte Alternativen. Dieser geringe Speicherbedarf macht YOLOv5 für Forschende, die mit handelsüblicher Hardware arbeiten, besonders zugänglich.

Megvii YOLOX#

YOLOX wurde von Forschenden bei Megvii entwickelt und schlug einen anderen Weg ein: Das Modell führte ein anchor-freies Design in die YOLO-Familie ein. Durch den Verzicht auf Ankerrahmen vereinfacht YOLOX den Erkennungskopf und reduziert die Anzahl heuristischer Parameter, die während des Trainings manuell angepasst werden müssen, erheblich.

YOLOX verwendet außerdem einen entkoppelten Kopf, der Klassifizierungs- und Regressionsaufgaben auf verschiedene Netzwerkzweige verteilt, sowie die SimOTA-Strategie zur Labelzuweisung. Diese Neuerungen schließen die Lücke zwischen akademischer Forschung und industriellen Anwendungen und machen YOLOX besonders effektiv in Umgebungen mit stark variierenden Objektgrößen.

Mehr über YOLOX erfahren

Leistung und Metriken#

Bei der Bewertung von Computervisionsmodellen ist der Kompromiss zwischen der mittleren durchschnittlichen Präzision (mAP) und der Inferenzgeschwindigkeit entscheidend. Beide Modelle sind in verschiedenen Größen erhältlich (von Nano bis Extra-Large), um unterschiedlichen Hardwarebeschränkungen gerecht zu werden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

YOLOXx erreicht zwar eine etwas höhere Spitzenpräzision (51.1 mAP), YOLOv5 bietet jedoch eine wesentlich robustere und umfassender erprobte Bereitstellungspipeline für CPU- und GPU-Hardware. Die TensorRT-Geschwindigkeiten von YOLOv5 unterstreichen die umfassende Optimierung für Edge-Computing-Geräte und machen das Modell zu einer äußerst zuverlässigen Wahl für die Echtzeit-Videoanalyse.

Trainingsmethoden und Benutzerfreundlichkeit#

Die Entwicklererfahrung unterscheidet sich bei diesen beiden Architekturen erheblich.

Der YOLOX-Ansatz#

Für das Training von YOLOX musst du üblicherweise das ursprüngliche Repository klonen, bestimmte Abhängigkeiten verwalten und komplexe Befehlszeilenskripte ausführen. Das Modell unterstützt zwar fortgeschrittene Funktionen wie Training mit gemischter Genauigkeit und Setups mit mehreren Knoten über MegEngine, doch für Entwickler, die schnell Prototypen erstellen müssen, kann die Lernkurve steil sein.

Der Vorteil von Ultralytics#

Im Gegensatz dazu legt Ultralytics großen Wert auf eine besonders reibungslose Benutzererfahrung. Mit dem Python-Paket ultralytics können Entwickler ein Modell mit minimalem Boilerplate-Code laden, trainieren und validieren. Ultralytics übernimmt automatisch komplexe Datenerweiterungen, die Optimierung von Hyperparametern und die Anpassung der Lernrate.

from ultralytics import YOLO

# Ein vortrainiertes kleines YOLOv5-Modell laden
model = YOLO("yolov5su.pt")  # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket

# Das Modell mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Die Leistung des Modells validieren
metrics = model.val()

Darüber hinaus geht die Vielseitigkeit von YOLOv5 über die standardmäßige Objekterkennung hinaus und bietet robuste Unterstützung für Bildklassifizierung und Instanzsegmentierung innerhalb derselben einheitlichen API.

Vereinfachte Bereitstellung

Nach Abschluss des Trainings lässt sich ein YOLOv5-Modell mit einem einzigen Aufruf wie model.export(format="onnx") nach ONNX, CoreML, LiteRT oder OpenVINO exportieren. Dadurch entfallen Konvertierungsskripte von Drittanbietern, die bei forschungsorientierten Repositories oft erforderlich sind.

Anwendungen in der Praxis#

Die Wahl zwischen diesen Modellen hängt von deiner Bereitstellungsumgebung und deinen technischen Anforderungen ab:

  • Einzelhandel und Bestandsverwaltung: Für Anwendungen, die eine Produkterkennung in Echtzeit auf Edge-Geräten wie NVIDIA Jetson erfordern, eignet sich YOLOv5 besonders gut. Der geringe Speicherbedarf und die schnellen TensorRT-Inferenzgeschwindigkeiten ermöglichen die Verfolgung über mehrere Kameras hinweg, ohne dass Bilder verloren gehen.
  • Akademische Forschung und benutzerdefinierte Architekturen: YOLOX genießt in der Forschungsgemeinschaft hohes Ansehen. Der entkoppelte Kopf und das anchor-freie Design machen das Modell zu einer ausgezeichneten Grundlage für Ingenieure, die neue Strategien zur Labelzuweisung erproben möchten, oder für die Arbeit mit Datensätzen, bei denen herkömmliche Ankerrahmen nicht gut verallgemeinern.
  • KI in der Landwirtschaft: Bei Präzisionslandwirtschaftsaufgaben wie der Erkennung von Früchten oder der Identifizierung von Unkraut mithilfe von Drohnen ermöglicht das einfache Training und Bereitstellen von YOLOv5-Modellen über die Ultralytics Platform Fachleuten, KI-Lösungen umzusetzen, ohne über fundierte Kenntnisse im maschinellen Lernen verfügen zu müssen.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv5 und YOLOX hängt von den spezifischen Anforderungen deines Projekts, den Bereitstellungsbeschränkungen und deinen Präferenzen für das Ökosystem ab.

Wann du YOLOv5 wählen solltest#

YOLOv5 eignet sich besonders für:

  • Bewährte Produktionssysteme: Bestehende Bereitstellungen, bei denen die lange Stabilitätsbilanz, die umfassende Dokumentation und die große Unterstützung durch die Community von YOLOv5 geschätzt werden.
  • Training mit begrenzten Ressourcen: Umgebungen mit begrenzten GPU-Ressourcen, in denen die effiziente Trainingspipeline und der geringere Speicherbedarf von YOLOv5 von Vorteil sind.
  • Umfangreiche Unterstützung von Exportformaten: Projekte, die eine Bereitstellung in vielen Formaten erfordern, darunter ONNX, TensorRT, CoreML und LiteRT.

Wann du YOLOX wählen solltest#

YOLOX empfiehlt sich für:

  • Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
  • Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
  • Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die Zukunft der Vision-KI: YOLO26 kommt#

YOLOv5 und YOLOX haben sich zwar beide einen festen Platz in der Geschichte der Computervision gesichert, doch das Fachgebiet entwickelt sich rasant weiter. Entwicklern, die heute neue Projekte beginnen, empfiehlt Ultralytics dringend, sein neuestes Spitzenmodell YOLO26 zu erkunden.

YOLO26 wurde im Januar 2026 veröffentlicht und stellt einen enormen Fortschritt bei Leistung und Benutzerfreundlichkeit dar. Das Modell führt ein bahnbrechendes End-to-End-Design ohne NMS ein (ausgewählt mit nms=False), das die Nachverarbeitung durch Non-Maximum Suppression überflüssig macht. Dadurch werden Latenzschwankungen erheblich verringert und die Bereitstellungslogik auf Geräten mit geringem Stromverbrauch vereinfacht.

Darüber hinaus verwendet YOLO26 den neuartigen MuSGD-Optimierer – eine von Innovationen beim Training von LLMs inspirierte Kombination aus SGD und Muon –, die für äußerst stabile Konvergenz in kurzer Zeit sorgt. Dank DFL Removal (Distribution Focal Loss wird entfernt, um den Export zu vereinfachen und die Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch zu verbessern) erreicht YOLO26 eine bis zu 43 % schnellere CPU-Inferenz und festigt damit seine Position als ultimatives Modell für modernes Edge-Computing, Robotik und IoT-Anwendungen. Zusätzlich sorgen ProgLoss + STAL für verbesserte Verlustfunktionen und deutliche Fortschritte bei der Erkennung kleiner Objekte, was für IoT, Robotik und Luftbilder entscheidend ist. Wer sich für frühere Generationen interessiert, kann sich auch YOLO11 ansehen, doch YOLO26 ist unbestritten die modernste Wahl.

Fazit#

YOLOv5 und YOLOX bieten beide beeindruckende Funktionen zur Objekterkennung. YOLOX erweiterte 2021 die architektonischen Möglichkeiten, indem es bewies, dass anchor-freie Designs mit herkömmlichen Methoden konkurrieren und diese übertreffen können. YOLOv5 bleibt jedoch dank seiner unvergleichlichen Benutzerfreundlichkeit, seines umfangreichen Ökosystems und seines geringeren Speicherbedarfs beim Training eine führende Lösung.

Für die große Mehrheit kommerzieller Anwendungen bietet das Ultralytics-Ökosystem den schnellsten Weg von einem unverarbeiteten Datensatz zu einem produktiv eingesetzten Modell. Ob Entwickler das bewährte YOLOv5 verwenden oder auf das hochmoderne YOLO26 umsteigen – sie profitieren von einem Framework, das KI für die Bildverarbeitung zugänglich, effizient und leistungsstark macht.

Kommentare