DAMO-YOLO vs. YOLOX#
Die Welt der Computer Vision in Echtzeit entwickelt sich ständig weiter. Zwei bemerkenswerte Meilensteine sind DAMO-YOLO und YOLOX, die jeweils eigene Innovationen für die schnelle und hochgenaue Objekterkennung mitbringen. Beide Modelle haben wesentlich zur Open-Source-Community beigetragen. Für Machine-Learning-Ingenieure ist es entscheidend, ihre Architekturunterschiede, Trainingsmethoden und idealen Bereitstellungsszenarien zu verstehen.
Dieser umfassende Leitfaden beleuchtet die technischen Feinheiten beider Modelle und zeigt, warum moderne Alternativen wie die Ultralytics-YOLO26-Plattform für heutige Produktionsumgebungen eine bessere Leistung und Benutzerfreundlichkeit bieten.
Modellübersicht#
DAMO-YOLO im Detail#
DAMO-YOLO wurde von einem Forschungsteam der Alibaba Group entwickelt und als hocheffiziente Methode zur Objekterkennung vorgestellt, die auf automatisierter Architekturerkennung basiert.
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
- Dokumentation: DAMO-YOLO-Dokumentation
Details zu YOLOX#
YOLOX wurde von Forschern bei Megvii entwickelt und sollte die Lücke zwischen Forschung und Industrie schließen. Dazu wurde die YOLO-Reihe auf ein ankerfreies Design umgestellt, das die Architektur erheblich vereinfachte und zugleich eine damals bessere Leistung erzielte.
- Autoren: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun
- Organisation: Megvii
- Datum: 2021-07-18
- Arxiv: https://arxiv.org/abs/2107.08430
- GitHub: https://github.com/Megvii-BaseDetection/YOLOX
- Dokumentation: YOLOX-Dokumentation
Architekturanalyse#
DAMO-YOLO-Architektur#
DAMO-YOLO setzt stark auf Neuronale Architektursuche (NAS). Zu den wichtigsten Komponenten gehören:
- MAE-NAS-Backbones: Nutzt eine von maximaler Entropie geleitete Suche, um Backbones zu finden, die ein optimales Gleichgewicht aus Inferenzgeschwindigkeit und Genauigkeit bieten.
- Effizientes RepGFPN: Ein aufwendiges Neck-Design für die Merkmalsfusion, das dem Modell hilft, über verschiedene Objektgrößen hinweg eine hohe Genauigkeit zu bewahren.
- ZeroHead: Ein vereinfachter, leichtgewichtiger Erkennungskopf, der den Rechenaufwand in den abschließenden Vorhersageschichten verringert.
YOLOX-Architektur#
YOLOX verfolgt einen anderen Ansatz und setzt auf strukturelle Einfachheit und ein ankerfreies Design:
- Ankerfreier Mechanismus: YOLOX sagt die Koordinaten der Begrenzungsrahmen direkt und ohne vordefinierte Anker voraus. Dadurch verringert sich die Anzahl der erforderlichen Designparameter und heuristischen Anpassungen.
- Entkoppelter Kopf: Klassifizierung und Regression werden auf getrennte Merkmalszweige aufgeteilt. Das verbessert die Konvergenzgeschwindigkeit und die Gesamtgenauigkeit.
- SimOTA-Labelzuweisung: Eine fortschrittliche Strategie zur Labelzuweisung, die positive Stichproben dynamisch den Ground-Truth-Objekten zuordnet und so die Trainingseffizienz verbessert.
DAMO-YOLO nutzt maschinengesteuerte NAS-Suchen, um optimale Architekturen unter strengen Einschränkungen zu finden. YOLOX hingegen setzt auf elegante, von Menschen entwickelte Vereinfachungen wie ankerfreie Köpfe, um die Objekterkennungspipeline zu optimieren.
Leistungsvergleich#
Um diese Modelle zu bewerten, müssen die mittlere durchschnittliche Präzision (mAP), die Inferenzgeschwindigkeit und die Parameterzahl betrachtet werden. Im Folgenden findest du eine detaillierte Vergleichstabelle mit Standard- und Leichtgewichtsvarianten beider Architekturen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
YOLOXx erzielt mit 51,1 zwar die höchste absolute mAP, doch DAMO-YOLOl erreicht mit 50,8 mAP ein äußerst konkurrenzfähiges Ergebnis. Dabei benötigt es weniger als halb so viele Parameter (42,1 Mio. gegenüber 99,1 Mio.) und führt TensorRT deutlich schneller aus.
Trainingsmethoden#
DAMO-YOLO trainieren#
DAMO-YOLO nutzt beim Training komplexe Destillationsverfahren zur Leistungssteigerung. Häufig wird zunächst ein großes „Teacher“-Modell trainiert, dessen Wissen anschließend an kleinere „Student“-Modelle weitergegeben wird. Das Modell verwendet außerdem AlignedOTA zur dynamischen Labelzuweisung. Dieses mehrstufige Training ist zwar sehr effektiv, erhöht aber den erforderlichen GPU-Rechenaufwand und Speicherbedarf erheblich.
YOLOX trainieren#
YOLOX setzt auf starke Datenaugmentierungen wie MixUp und Mosaic. Die Autoren stellten jedoch fest, dass sich die endgültige Genauigkeit deutlich steigern lässt, wenn diese starken Augmentierungen während der letzten 15 Epochen deaktiviert werden. So kann das Modell die Lücke zur Realität schließen.
Ideale Anwendungsfälle#
- DAMO-YOLO: Am besten geeignet für anspruchsvolle industrielle Bereitstellungen, bei denen serverseitige Destillationspipelines unterstützt werden können und die Zielhardware – etwa bestimmte NVIDIA-GPUs – direkt von der aufwendigen NAS-Architektur mit großem Neck profitiert.
- YOLOX: Ideal für Entwickler, die einen konsequent ankerfreien Ansatz suchen. Das extrem leichtgewichtige
YOLOXnanoeignet sich für ältere Android-Geräte, Edge Computing und stark eingeschränkte IoT-Sensoren, bei denen die Parameterzahl den entscheidenden Engpass darstellt.
Der Ultralytics-Vorteil: YOLO26 ist da#
DAMO-YOLO und YOLOX sind zwar wichtige Meilensteine, doch Entwickler benötigen heute umfassendere, vielseitigere und benutzerfreundlichere Lösungen. Hier kommen die Ultralytics-Plattform und das neu veröffentlichte Ultralytics YOLO26 ins Spiel.
YOLO26 wurde im Januar 2026 veröffentlicht und ist das uneingeschränkt empfohlene Modell für alle Aufgaben der Computer Vision. Es bringt eine Reihe bahnbrechender Neuerungen mit, die ältere Architekturen übertreffen:
- End-to-End-Design ohne NMS: Der optionale Eins-zu-eins-Kopf von YOLO26 (
nms=False) überspringt die Nachverarbeitung mit Non-Maximum Suppression (NMS). Dadurch wird die Bereitstellung deutlich einfacher und schneller, da die bei herkömmlichen Erkennungsköpfen üblichen Latenzengpässe entfallen. - Bis zu 43 % schnellere CPU-Inferenz: Durch die gezielte Entfernung von Distribution Focal Loss (DFL) und die Optimierung der Schichten erreicht YOLO26 auf CPUs und Edge-Hardware eine beispiellose Geschwindigkeit.
- MuSGD-Optimierer: Inspiriert von Trainingstechniken für große Sprachmodelle (LLM), führt YOLO26 den MuSGD-Optimierer ein, eine Kombination aus SGD und Muon. Das Ergebnis sind äußerst stabile Trainingsläufe und eine deutlich schnellere Konvergenz als bei den älteren Konfigurationen von YOLOX.
- ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich. Dadurch eignet sich YOLO26 besonders gut für Drohnenaufnahmen und Robotik.
- Vielseitigkeit: Anders als DAMO-YOLO, das ausschließlich der Objekterkennung dient, verarbeitet YOLO26 nativ und nahtlos Instanzsegmentierung, Posenschätzung, Klassifizierung und orientierte Begrenzungsrahmen (OBB) innerhalb desselben gut gepflegten Ökosystems.
Einfache Nutzung mit Ultralytics#
Die Ultralytics-Python-API vereinfacht die Entwicklungsarbeit. Für das Training eines hochmodernen YOLO26-Modells ist deutlich weniger Gerüstcode erforderlich, und die komplexen Destillationspipelines von DAMO-YOLO entfallen. Außerdem benötigen Ultralytics-Modelle beim Training außergewöhnlich wenig CUDA-Speicher – insbesondere im Vergleich zu großen transformerbasierten Modellen.
from ultralytics import YOLO
# Das neueste Nano-Modell Ultralytics YOLO26 laden
model = YOLO("yolo26n.pt")
# Das Modell mit einer einzigen Codezeile auf deinem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Schnelle Inferenz ohne NMS für ein Bild ausführen
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Exportiere nahtlos nach ONNX oder TensorRT
model.export(format="onnx")Mit der Ultralytics-Plattform kannst du Modelle automatisch annotieren, trainieren und auf Edge-Geräten bereitstellen. Die Plattform übernimmt für dich die gesamte Datenversionierung und Bereitstellung von GPU-Ressourcen in der Cloud.
Fazit#
Die Wahl zwischen DAMO-YOLO und YOLOX hängt von den jeweiligen Anforderungen ab: DAMO-YOLO bietet mithilfe von NAS auf bestimmten GPUs ein außergewöhnliches Verhältnis von Geschwindigkeit zu Genauigkeit, während YOLOX ein klares, ankerfreies Design bietet, das sich ideal für leichte Edge-Szenarien eignet.
Für Teams, die eine moderne, zukunftssichere Lösung mit einer aktiven Community suchen, ist die Architektur Ultralytics YOLO26 jedoch die klare Wahl. Die optionale Inferenz ohne NMS, die schnelle CPU-Inferenz und die einheitliche API für Erkennung, Segmentierung und Posenschätzung machen den reibungslosen Übergang von der Forschung zu einer robusten Produktion unvergleichlich einfach.
Wenn du weitere moderne Architekturen kennenlernen möchtest, empfehlen wir dir auch Ultralytics YOLO11 oder transformerbasierte Modelle wie RT-DETR, die in der umfassenden Ultralytics-Dokumentation verfügbar sind.