YOLOX und DAMO-YOLO#
Die Entwicklung der Echtzeit-Objekterkennung war von zahlreichen Paradigmenwechseln geprägt: von anchorbasierten zu anchorfreien Architekturen und von manuell entworfenen Backbones zur automatisierten neuronalen Architektursuche (NAS). In diesem umfassenden technischen Vergleich analysieren wir zwei wichtige Meilensteine dieser Entwicklung: YOLOX und DAMO-YOLO. Wir betrachten ihre architektonischen Innovationen, Trainingsmethoden und Kompromisse bei der Leistung und zeigen zugleich, wie das moderne Ultralytics YOLO26 heutigen Entwicklern eine unübertroffene Alternative bietet.
YOLOX: Wegweisend für den anchor-freien Ansatz#
YOLOX wurde am 18. Juli 2021 von Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun bei Megvii veröffentlicht und markierte einen entscheidenden Wendepunkt, indem es erfolgreich ein anchorfreies Design in die YOLO-Familie integrierte. Wie im ausführlichen technischen Bericht auf ArXiv beschrieben, sollte YOLOX die Lücke zwischen akademischer Forschung und industriellem Einsatz schließen.
Wichtige architektonische Innovationen#
YOLOX führte mehrere grundlegende strukturelle Veränderungen ein, die seine Vorgängermodelle deutlich verbesserten:
- Anchorfreier Mechanismus: YOLOX sagt den Mittelpunkt eines Objekts und die Abmessungen seiner Bounding Box direkt voraus. Dadurch verringerte sich die Anzahl der Designheuristiken, und die komplexen Prozesse zur Gruppierung von Ankern wurden vereinfacht. Das macht YOLOX für unterschiedliche Szenarien der Computer Vision besonders anpassungsfähig.
- Entkoppelter Kopf: Herkömmliche YOLO-Modelle verwendeten einen einzigen gekoppelten Kopf für Klassifizierung und Regression. YOLOX setzt einen entkoppelten Kopf ein, der Klassifizierung und Lokalisierung getrennt verarbeitet. Dadurch konvergiert das Modell deutlich schneller und erreicht eine höhere Genauigkeit.
- SimOTA-Labelzuweisung: Eine vereinfachte Version der optimalen Transportzuweisung (OTA) wurde verwendet, um positive Beispiele dynamisch zuzuweisen. Das verkürzte die Trainingszeit und beseitigte Mehrdeutigkeiten bei der Zuweisung anhand von Mittelpunkten.
Das Design des entkoppelten Kopfes von YOLOX beeinflusste nachfolgende Generationen von Objektdetektoren maßgeblich und wurde zu einem Standardmerkmal vieler moderner Modelle.
DAMO-YOLO: Automatisierte Architektursuche im großen Maßstab#
DAMO-YOLO wurde von Xianzhe Xu und einem Forscherteam bei der Alibaba Group entwickelt und am 23. November 2022 vorgestellt. Wie in ihrer ArXiv-Veröffentlichung ausführlich beschrieben, nutzte das Modell intensiv die neuronale Architektursuche (NAS), um die Pareto-Grenze zwischen Geschwindigkeit und Genauigkeit zu verschieben.
Wichtige architektonische Innovationen#
Die Strategie von DAMO-YOLO basierte auf der Automatisierung des Entwurfs effizienter Strukturen:
- MAE-NAS-Backbones: Mithilfe einer durch maximale Entropie gesteuerten Suche fand DAMO-YOLO hocheffiziente Backbones, die auf bestimmte Latenzbudgets zugeschnitten sind – besonders beim Export in Frameworks wie TensorRT.
- Effizientes RepGFPN: Ein umfangreiches Neck-Design, das die Merkmalsfusion über verschiedene räumliche Auflösungen hinweg deutlich verbessert. Das ist besonders nützlich für die Analyse von Luftbildern und die Erkennung von Objekten in unterschiedlichen Größen.
- ZeroHead: Ein vereinfachter Vorhersagekopf, der Rechenaufwand ohne Einbußen bei der mittleren Average Precision (mAP) des Modells reduziert.
- AlignedOTA und Destillation: Nutzt fortschrittliche Labelzuweisung und die Wissensdestillation zwischen Lehrermodell und Schülermodell, um die Leistung kleinerer Schülermodelle zu maximieren.
Leistungs- und Metrikvergleich#
Beim Vergleich dieser beiden Modelle müssen wir ihre Parameteranzahl, den erforderlichen FLOP-Aufwand und ihre Latenzprofile berücksichtigen. Die folgende Benchmark-Tabelle vergleicht YOLOX und DAMO-YOLO in verschiedenen Größen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Beide Modelle erzielen beeindruckende Ergebnisse, bringen jedoch auch Einschränkungen mit sich. YOLOX erfordert eine sorgfältige Abstimmung des entkoppelten Kopfes, während die starke Abhängigkeit von Destillation bei DAMO-YOLO das erneute Training mit benutzerdefinierten Datensätzen sehr ressourcenintensiv macht und große Mengen an GPU-Speicher erfordert.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOX und DAMO-YOLO hängt von deinen spezifischen Projektanforderungen, Bereitstellungseinschränkungen und Präferenzen bezüglich des Ökosystems ab.
Wann du YOLOX wählen solltest#
YOLOX ist eine gute Wahl für:
- Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
- Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
- Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.
Wann du DAMO-YOLO wählen solltest#
DAMO-YOLO eignet sich für:
- Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
- Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
- Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Der Vorteil von Ultralytics: YOLO26 im Überblick#
YOLOX und DAMO-YOLO waren wichtige Meilensteine in der Entwicklung. Moderne Entwickler brauchen jedoch eine Lösung, die modernste Genauigkeit mit beispielloser Benutzerfreundlichkeit verbindet. Hier verändert Ultralytics YOLO26 die Spielregeln. YOLO26 wurde im Januar 2026 veröffentlicht und baut auf dem Vermächtnis NMS-freier Modelle auf, um die optimale Balance aus Geschwindigkeit, Genauigkeit und Entwicklerfreundlichkeit zu bieten.
Warum YOLO26 wählen?#
Das integrierte Ultralytics-Ökosystem übertrifft fragmentierte akademische Repositorien mit folgenden Vorteilen:
- Durchgängiges NMS-freies Design: Der optionale One-to-One-Kopf von YOLO26 (
nms=False) macht die Non-Maximum Suppression (NMS) während der Inferenz überflüssig. Das ermöglicht äußerst schnelle, vorhersehbare Latenz – entscheidend für Edge-Bereitstellungen und autonome Fahrzeuge. - Wegfall von DFL: Durch den Wegfall von Distribution Focal Loss vereinfacht YOLO26 den Export auf Edge-Geräte und senkt den Speicherbedarf für ressourcenschonende Anwendungen erheblich.
- MuSGD-Optimierer: YOLO26 greift mit seinem hybriden SGD- und Muon-Optimierer auf Innovationen aus dem LLM-Training zurück und sorgt so für äußerst stabiles Training und sehr schnelle Konvergenz.
- Bis zu 43 % schnellere CPU-Inferenz: Dank tiefgreifender struktureller Optimierungen läuft YOLO26 auf CPUs extrem schnell – ganz ohne teure GPU-Hardware.
- Fortschrittliche Verlustfunktionen: Die Kombination aus ProgLoss und STAL verbessert die Erkennung kleiner Objekte deutlich und eignet sich daher ideal für Aufgaben wie Drohneninspektionen und die IoT-Überwachung.
- Vielseitigkeit: Anders als DAMO-YOLO, das ausschließlich ein Detektor ist, unterstützt YOLO26 nativ Instanzsegmentierung, Posenschätzung, Bildklassifizierung und die Erkennung von orientierten Bounding Boxes (OBB) in einem einzigen, einheitlichen Framework.
Mit der Ultralytics Python API musst du keine komplexen Destillationspipelines manuell konfigurieren und keine Hunderte Zeilen C++-Code schreiben, um dein Modell bereitzustellen.
from ultralytics import YOLO
# Das hochmoderne YOLO26-Nano-Modell laden
model = YOLO("yolo26n.pt")
# Das Modell mühelos auf einem benutzerdefinierten Datensatz trainieren
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Extrem schnelle, NMS-freie Inferenz ausführen
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Mit einem einzigen Befehl nach ONNX oder OpenVINO exportieren
model.export(format="openvino")Weitere Modelle, die du in Betracht ziehen kannst#
Das Computer-Vision-Ökosystem ist vielfältig. Je nach deinen spezifischen Anforderungen kannst du auch andere Architekturen erkunden, die vollständig vom Ultralytics-Ökosystem unterstützt werden:
- YOLO11: Der leistungsfähige Vorgänger von YOLO26, bekannt für seine Robustheit bei Einzelhandelsanalysen und der Qualitätskontrolle in der Fertigung.
- YOLOv8: Ein legendäres, äußerst stabiles anchorfreies Modell, das die breite Bereitstellung auf Edge-Geräten populär machte.
- RT-DETR: Ein von Baidu entwickelter Echtzeit-Transformer zur Objekterkennung, der eine hervorragende Alternative für Aufgaben mit großem Nutzen durch globale Attention-Mechanismen darstellt, allerdings einen höheren Speicherbedarf beim Training mit sich bringt.
Fazit#
YOLOX und DAMO-YOLO lieferten wichtige Beiträge zur Entwicklung des Deep Learning: YOLOX bestätigte den entkoppelten, anchorfreien Ansatz, und DAMO-YOLO demonstrierte das Potenzial der automatisierten Architektursuche. Für den produktiven Einsatz in der Praxis können die komplexen ursprünglichen Forschungs-Codebasen jedoch agile Teams ausbremsen.
Mit der umfassenden Ultralytics Platform können Entwickler diese Hürden umgehen. Dank des durchgängigen Designs von YOLO26, seiner höheren CPU-Geschwindigkeit und der ausführlichen Dokumentation ist es einfacher denn je, KI-Systeme für Bildverarbeitung auf dem neuesten Stand der Technik zu entwickeln. Ob du Infrastruktur für intelligente Städte, medizinische Diagnostik oder fortschrittliche Robotik entwickelst – Ultralytics bietet den effizientesten Weg von Rohdaten bis zum zuverlässigen Einsatz in der Praxis.