Ultralytics YOLO27:
Get Started

YOLOX und YOLOv7#

Die Entwicklung der Echtzeit-Objekterkennung wurde durch kontinuierliche architektonische Durchbrüche vorangetrieben. Zwei wichtige Meilensteine auf diesem Weg sind YOLOX und YOLOv7. Beide Modelle wurden innerhalb eines Jahres veröffentlicht und führten neue Ansätze für die standardmäßige Objekterkennung ein. Dadurch verbesserten sie deutlich den Kompromiss zwischen Geschwindigkeit und Genauigkeit.

Diese Seite bietet eine ausführliche technische Analyse von YOLOX und YOLOv7. Sie vergleicht die Architekturen, Leistungskennzahlen und idealen Anwendungsfälle, damit Entwickler:innen das passende Werkzeug für ihre Computer-Vision-Bereitstellungen auswählen können.

YOLOX: Wegweisende anchor-freie Erkennung#

YOLOX wurde im Juli 2021 von Forschenden bei Megvii vorgestellt und bedeutete eine deutliche Abkehr von herkömmlichen anchor-basierten Designs. Durch die Verbindung akademischer Forschung mit industriellen Anwendungen vereinfachte YOLOX den Erkennungskopf und verbesserte die Gesamtleistung.

Wichtige Modelldetails:

Architektonische Innovationen#

YOLOX führte einen anchor-freien Ansatz ein, der die Anzahl der Entwurfsparameter und den erforderlichen heuristischen Anpassungsaufwand für benutzerdefinierte Datensätze deutlich reduzierte. Das Modell verwendet einen entkoppelten Kopf, der Klassifizierungs- und Regressionsaufgaben voneinander trennt und so Konvergenzgeschwindigkeit und Genauigkeit verbessert. Darüber hinaus setzte YOLOX fortschrittliche Strategien zur Datenerweiterung wie MixUp und Mosaic ein, um die Robustheit des Modells zu erhöhen.

Mehr über YOLOX erfahren

Vorteile anchor-freier Modelle

Durch den Verzicht auf Ankerboxen verringert YOLOX den Rechenaufwand für die Berechnung der Intersection over Union (IoU) zwischen Vorhersagen und tatsächlichen Annotationen während des Trainings. Dadurch sinkt der Bedarf an CUDA-Speicher, und das Training wird schneller.

YOLOv7: Trainierbare Sammlung kostenloser Verbesserungen#

YOLOv7 wurde im Juli 2022 von Forschenden am Institute of Information Science der Academia Sinica in Taiwan veröffentlicht und verschob die Grenzen der Echtzeit-Objekterkennung weiter. Das Modell führte das Konzept eines „trainierbaren Bündels kostenloser Verbesserungen“ ein und setzte bei seiner Veröffentlichung neue Maßstäbe auf dem MS-COCO-Datensatz.

Wichtige Modelldetails:

Architektonische Innovationen#

Die Architektur von YOLOv7 basiert auf dem Extended Efficient Layer Aggregation Network (E-ELAN), mit dem das Modell kontinuierlich vielfältigere Merkmale lernen kann, ohne den Gradientenpfad zu verschlechtern. Darüber hinaus nutzte YOLOv7 Techniken zur Neuparametrisierung des Modells. Dadurch lassen sich komplexe Trainingsnetzwerke mit mehreren Zweigen während der Inferenz in schnellere Netzwerke mit nur einem Pfad umwandeln.

Mehr über YOLOv7 erfahren

Leistungsvergleich#

Für den Einsatz in realen Anwendungen ist es wichtig, die Leistung dieser Modelle bei verschiedenen Größen zu verstehen. Die folgende Tabelle vergleicht die Standardkennzahlen unterschiedlicher Größen von YOLOX und YOLOv7.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Analyse#

  • Genauigkeit: YOLOv7 erzielt im Allgemeinen einen höheren mAP als vergleichbare YOLOX-Modelle. So erreicht YOLOv7x beispielsweise einen mAP von 53,1 gegenüber 51,1 bei YOLOXx.
  • Geschwindigkeit: Beide Modelle sind mit TensorRT stark auf die GPU-Ausführung optimiert. Die E-ELAN-Architektur von YOLOv7 bietet bei anspruchsvollen Anwendungen jedoch einen etwas höheren Durchsatz, während YOLOX auf kleineren Edge-Geräten eine ausgezeichnete Latenz beibehält.
  • Vielseitigkeit: YOLOv7 erweiterte sein Anwendungsspektrum über Begrenzungsrahmen hinaus und stellt nativ Gewichte für Instanzsegmentierung und Posenschätzung bereit. Damit ist das Modell vielseitiger als das grundlegende YOLOX-Repository.

Anwendungen in der Praxis#

Die Wahl zwischen diesen Modellen hängt oft von deiner konkreten Bereitstellungsumgebung ab.

Edge Computing und IoT#

Für ressourcenbeschränkte Edge-Geräte wie den Raspberry Pi oder ältere mobile Prozessoren sind YOLOX-Nano und YOLOX-Tiny besonders attraktiv. Dank der geringen Parameteranzahl und des anchor-freien Designs lassen sie sich in Umgebungen mit niedrigem Stromverbrauch leichter für Aufgaben wie einfache Bewegungsverfolgung oder intelligente Türklingeln einsetzen.

Videoanalyse mit hoher Detailtreue#

Für die Verarbeitung hochauflösender Videoströme bei der industriellen Fehlererkennung oder der Überwachung dichten Verkehrs ist YOLOv7 überlegen. Dank seiner robusten Merkmalsaggregation erzielt das Modell auch dann eine hohe Genauigkeit, wenn Objekte teilweise verdeckt sind oder stark unterschiedliche Größen haben.

Anwendungsfälle und Empfehlungen#

Ob du YOLOX oder YOLOv7 wählst, hängt von den spezifischen Anforderungen deines Projekts, den Bereitstellungsvorgaben und deinen Präferenzen beim Ökosystem ab.

Wann du YOLOX wählen solltest#

YOLOX ist eine gute Wahl für:

  • Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
  • Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
  • Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.

Wann du YOLOv7 wählen solltest#

YOLOv7 empfiehlt sich für:

  • Akademische Benchmarks: Reproduktion des Stands der Technik von 2022 oder Untersuchung der Auswirkungen von E-ELAN und Techniken mit trainierbaren Bündeln kostenloser Verbesserungen.
  • Reparametrisierungsforschung: Untersuchung geplanter reparametrisierter Faltungen und Strategien zur zusammengesetzten Modellskalierung.
  • Bestehende benutzerdefinierte Pipelines: Projekte mit stark angepassten Pipelines auf Basis der spezifischen YOLOv7-Architektur, die sich nicht ohne Weiteres umgestalten lassen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Der Vorteil von Ultralytics#

YOLOX und YOLOv7 sind zwar leistungsstarke Forschungsimplementierungen, doch der Wechsel von einem Forschungs-Repository zu einer skalierbaren Produktionsumgebung kann eine Herausforderung sein. Hier zeigt die Ultralytics Platform ihre Stärken.

Ultralytics-Modelle bieten eine einheitliche Python-API, die Modelltraining, Validierung und Bereitstellung als optimierte, standardisierte Aufgaben behandelt. So ersparst du dir den Aufwand, komplexe Abhängigkeiten von Drittanbietern oder benutzerdefinierte C++-Operatoren zu verwalten, wie sie bei älteren Architekturen häufig vorkommen.

Außerdem benötigen Ultralytics-YOLO-Modelle beim Training deutlich weniger CUDA-Speicher als Transformer-basierte Detektoren wie RT-DETR. So können Anwender:innen größere Batch-Größen nutzen, das Training stabilisieren und die Konvergenz bei benutzerdefinierten Datensätzen beschleunigen.

Unterstützte Integrationen

Ultralytics unterstützt nativ den Export von Modellen in branchenübliche Formate wie ONNX, OpenVINO und CoreML. Dafür genügt ein einziges Argument format, was den Bereitstellungsprozess für Modelle erheblich vereinfacht.

Codebeispiel: Training mit Ultralytics#

Das Ultralytics-Python-Paket kann YOLOv7-Checkpoints .pt nicht nativ trainieren oder ausführen (die YOLOv7-Dokumentation erklärt, wie du exportierte ONNX- oder TensorRT-Modelle ausführst). Neuere Architekturen wie YOLO26 lassen sich dagegen mit nur wenigen Codezeilen laden, trainieren und ausführen.

from ultralytics import YOLO

# Ein vortrainiertes YOLO26-Modell laden
model = YOLO("yolo26n.pt")

# Das Modell auf einem benutzerdefinierten Datensatz trainieren (z. B. COCO8)
# Die API übernimmt das Laden der Daten, die Datenerweiterung und die Speicherverwaltung automatisch
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Inferenz für ein Testbild ausführen
predictions = model("path/to/image.jpg")
predictions[0].show()

Die Zukunft: Ultralytics YOLO26#

YOLOv7 und YOLOX waren wichtige historische Meilensteine, doch der Stand der Technik entwickelt sich rasant weiter. Ultralytics YOLO26 wurde im Januar 2026 veröffentlicht und führt bahnbrechende Paradigmen ein, die frühere Modelle ablösen.

  • End-to-End-Design ohne NMS: Der optionale One-to-One-Kopf von YOLO26 (nms=False) überspringt die Nachbearbeitung durch Nicht-Maximum-Unterdrückung (NMS). Dadurch werden Latenzengpässe drastisch reduziert und deterministische Ausführungszeiten auf unterschiedlichen Hardwarekonfigurationen gewährleistet.
  • Bis zu 43 % schnellere CPU-Inferenz: Durch das Entfernen des Distribution Focal Loss (DFL) und die Optimierung der Netzwerktiefe ist YOLO26 gezielt für Edge-Geräte ohne dedizierte GPU-Hardware ausgelegt.
  • MuSGD-Optimierer: Inspiriert von fortschrittlichen Techniken zum Training großer Sprachmodelle (LLM), bietet der MuSGD-Optimierer – ein Hybrid aus SGD und Muon – eine außergewöhnliche Trainingsstabilität und schnellere Konvergenz.
  • Verbesserte Erkennung kleiner Objekte: Die Integration der Verlustfunktionen ProgLoss + STAL verbessert die Erkennung kleiner, weit entfernter Objekte erheblich – entscheidend für die Kartierung mit Drohnen und die Sicherheitsüberwachung.
  • Native Unterstützung verschiedener Aufgaben: YOLO26 unterstützt orientierte Begrenzungsrahmen (OBB), Instanzsegmentierung und Posenschätzung umfassend und nativ über dieselbe optimierte API.

Für alle Entwickler:innen, die heute ein neues Computer-Vision-Projekt beginnen, empfiehlt sich die Evaluierung von Ultralytics YOLO26 auf der Platform. So erzielst du die bestmögliche Balance aus Geschwindigkeit, Genauigkeit und einfacher Bereitstellung. Wenn du von früheren Generationen wie YOLO11 oder YOLOv8 wechselst, musst du lediglich die Modellzeichenfolge ändern, um sofort von den leistungsfähigeren Funktionen zu profitieren.

Mitwirkende

Kommentare