YOLOX im Vergleich zu RTDETRv2#
Die Auswahl der optimalen Architektur für Computer-Vision-Anwendungen erfordert eine sorgfältige Abwägung von Genauigkeit, Inferenzgeschwindigkeit und Umsetzbarkeit bei der Bereitstellung. In dieser umfassenden technischen Analyse untersuchen wir die grundlegenden Unterschiede zwischen YOLOX, einer äußerst erfolgreichen ankerfreien CNN-Architektur, und RTDETRv2, einem hochmodernen Transformer zur Echtzeitobjekterkennung.
Beide Modelle haben wesentlich zur Weiterentwicklung der Objekterkennung beigetragen. Entwicklerinnen und Entwickler, die produktionsreife Anwendungen erstellen, stellen jedoch oft fest, dass moderne Alternativen wie Ultralytics YOLO26 effizienteres Training, geringeren Speicherbedarf und ein robusteres Ökosystem für die Bereitstellung bieten.
YOLOX: die Lücke zwischen Forschung und Industrie schließen#
YOLOX entwickelte sich zu einer äußerst beliebten ankerfreien Variante der YOLO-Reihe. Mit seinem vereinfachten Design erzielte das Modell zum Zeitpunkt seiner Veröffentlichung beeindruckende Leistungssteigerungen.
- Autoren: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun
- Organisation: Megvii
- Datum: 18. Juli 2021
- Links: Arxiv, GitHub, Dokumentation
Architektonische Innovationen#
YOLOX führte die YOLO-Familie ankerfrei aus und kombinierte einen entkoppelten Kopf mit der fortschrittlichen SimOTA-Strategie zur Labelzuweisung. Durch den Wegfall von Ankerboxen verringerte die Architektur die Zahl der Entwurfsparameter deutlich und verbesserte die Generalisierungsfähigkeit über verschiedene Benchmark-Datensätze hinweg. Die leichten Varianten YOLOX-Nano und YOLOX-Tiny wurden zu beliebten Optionen für den Einsatz von Computer-Vision-Anwendungen auf Edge-Geräten.
YOLOX brachte zwar bemerkenswerte Fortschritte, doch die aufwendigen Augmentierungspipelines und älteren Nachbearbeitungsverfahren wie die herkömmliche NMS können im Vergleich zu nativ durchgängigen Modellen zu einer höheren Latenz führen.
RTDETRv2: Fortschritte bei Vision-Transformern in Echtzeit#
Aufbauend auf dem Fundament seines Vorgängers nutzt RTDETRv2 die Leistungsfähigkeit von Vision-Transformern (ViTs), um eine äußerst konkurrenzfähige Genauigkeit zu erzielen, ohne die Inferenzgeschwindigkeit in Echtzeit zu beeinträchtigen.
- Autoren: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang und Yi Liu
- Organisation: Baidu
- Datum: 2024-07-24
- Links: Arxiv, GitHub
Architektonische Innovationen#
RTDETRv2 gestaltet die Erkennungspipeline grundlegend neu: Die Transformer-Architektur umgeht nativ die Nichtmaximalunterdrückung (NMS). Möglich wird dies durch einen hybriden Encoder und eine IoU-bewusste Auswahl von Abfragen, wodurch die Initialisierung der Objektabfragen verbessert wird. Das Modell verarbeitet Merkmale auf mehreren Skalen effektiv und kann dadurch komplexe Details in anspruchsvollen Umgebungen erfassen, etwa bei der Erkennung von Verkehr in nächtlichen Videos.
Transformer benötigen jedoch von Natur aus viele Ressourcen. Das Training von RTDETRv2 beansprucht in der Regel deutlich mehr GPU-Speicher und Rechenzeit als CNN-basierte Alternativen. Dies kann für Teams mit strengen Budgetvorgaben oder häufigem Abstimmen von Modellen eine Hürde darstellen.
Tabelle zum Leistungsvergleich#
Für einen objektiven Vergleich dieser Architekturen untersuchen wir ihre Leistung auf dem COCO-Datensatz. Die folgende Tabelle zeigt die Kompromisse zwischen Genauigkeit (mAP), Parameteranzahl und Rechenaufwand.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2 erzielt zwar eine beeindruckende Genauigkeit, doch YOLOX hat bei Modellen mit wenigen Parametern weiterhin einen Vorteil, insbesondere mit seinen Nano- und Tiny-Varianten.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOX und RT-DETR hängt von den spezifischen Anforderungen deines Projekts, den Einschränkungen bei der Bereitstellung und deinen Präferenzen beim Ökosystem ab.
Wann du YOLOX wählen solltest#
YOLOX ist eine gute Wahl für:
- Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
- Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
- Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.
Wann du RT-DETR wählen solltest#
RT-DETR empfiehlt sich für:
- Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
- Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
- Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Der Vorteil von Ultralytics: YOLO26#
YOLOX und RTDETRv2 haben jeweils besondere Stärken. Das neu veröffentlichte Ultralytics YOLO26 setzt jedoch neue Maßstäbe im Bereich Computer Vision und überwindet die historischen Kompromisse zwischen Geschwindigkeit, Genauigkeit und einfacher Bereitstellung.
1. End-to-End-Architektur ohne NMS#
YOLO26 lässt sich von Transformer-Modellen inspirieren und behält zugleich die Effizienz von CNNs bei. Das Modell bietet ein optionales End-to-End-Design ohne NMS (nms=False). Durch den Wegfall der Nichtmaximalunterdrückung als Nachbearbeitungsschritt vereinfacht YOLO26 die Bereitstellungspipelines erheblich und gewährleistet eine gleichbleibende Inferenzlatenz auf verschiedenen Edge-Geräten – ohne den Aufwand einer komplexen Schwellenwertabstimmung.
2. Bis zu 43 % schnellere CPU-Inferenz#
Im Gegensatz zu Transformer-Architekturen wie RTDETRv2, die stark auf leistungsstarke GPUs angewiesen sind, ist YOLO26 speziell für Edge-Computing-Umgebungen optimiert. Durch den Wegfall von Distribution Focal Loss (DFL) vereinfacht YOLO26 den Modelleport und erreicht eine bis zu 43 % schnellere CPU-Inferenz. Damit eignet es sich ideal für die Integration in Geräte wie den Raspberry Pi oder handelsübliche Mobilgeräte.
3. Effizientes Training mit MuSGD#
Das Training von Transformer-Modellen führt oft zu übermäßigem CUDA-Speicherverbrauch und langen Trainingszeiten. YOLO26 führt den neuartigen MuSGD Optimizer ein – eine Kombination aus Stochastic Gradient Descent und dem von LLMs inspirierten Muon-Optimizer. Diese Neuerung ermöglicht ein außergewöhnlich stabiles Training und eine schnellere Konvergenz und senkt den Hardwarebedarf im Vergleich zu RTDETRv2 deutlich.
4. Unübertroffenes Ökosystem und vielseitige Einsatzmöglichkeiten#
Das Ultralytics-Ökosystem bietet Entwicklerinnen und Entwicklern eine intuitive, optimierte Arbeitsumgebung. Dank umfassender Dokumentation, einer aktiven Community und der cloudbasierten Ultralytics Platform war die Verwaltung des gesamten KI-Lebenszyklus noch nie so einfach. Darüber hinaus ist YOLO26 äußerst vielseitig. Während RTDETRv2 sich auf die Objekterkennung konzentriert, unterstützt YOLO26 nativ auch Instanzsegmentierung, Bildklassifizierung, Posenschätzung und Aufgaben zur Erkennung orientierter Begrenzungsrahmen (OBB). Dank des neuen ProgLoss + STAL (Progressive Loss and Small-Target-Aware Label Assignment) eignet sich YOLO26 außerdem hervorragend zur Erkennung kleiner Objekte – eine wichtige Fähigkeit für Luftbilder und die industrielle Fehlererkennung.
Nahtlose Integration mit Ultralytics#
Für die Bereitstellung von Modellen sollte man sich nicht mit komplexen, uneinheitlichen Codebasen herumschlagen müssen. Mit der Ultralytics Python API kannst du hochmoderne Modelle mit wenigen Codezeilen laden, trainieren und exportieren.
from ultralytics import YOLO
# Das neueste YOLO26-Nano-Modell laden, um eine optimale Leistung am Netzwerkrand zu erzielen
model = YOLO("yolo26n.pt")
# Das Modell mit minimalem Speicherbedarf auf deinem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Die Leistung des Modells validieren
metrics = model.val()
# Nahtlos für die Bereitstellung nach ONNX oder TensorRT exportieren
model.export(format="onnx")Mit Ultralytics umgehst du die komplizierte Konfiguration von Umgebungen, die typischerweise mit Forschungs-Repositorys verbunden ist, und verkürzt so die Zeit bis zur Markteinführung.
Fazit#
YOLOX und RTDETRv2 sind bedeutende Meilensteine in der Entwicklung der Echtzeitobjekterkennung. YOLOX bewies, dass hocheffiziente ankerfreie CNNs leistungsfähig sind, während RTDETRv2 Transformer erfolgreich an die Anforderungen der Echtzeitverarbeitung anpasste.
Für moderne Anwendungen – von Analysen im intelligenten Einzelhandel bis hin zu eingebetteter Robotik – bietet Ultralytics YOLO26 jedoch die überzeugende Lösung. Durch die Kombination von Inferenz ohne NMS mit unübertroffener CPU-Geschwindigkeit, geringerem Speicherbedarf und der zuverlässigen Unterstützung durch die Ultralytics Platform ermöglicht YOLO26 Entwicklerinnen und Entwicklern, die nächste Generation zuverlässiger, leistungsstarker Computer-Vision-Systeme zu entwickeln.