DAMO-YOLO vs. YOLOX#
Die Landschaft der Echtzeit-Computer-Vision entwickelt sich ständig weiter. Zwei bemerkenswerte Meilensteine auf diesem Weg sind DAMO-YOLO und YOLOX, die jeweils einzigartige Innovationen für die Objekterkennung mit hoher Geschwindigkeit und Genauigkeit bieten. Obwohl beide Modelle wesentlich zur Open-Source-Community beigetragen haben, ist es für Entwickler im Bereich maschinelles Lernen entscheidend, ihre architektonischen Unterschiede, Trainingsmethoden und idealen Einsatzszenarien zu verstehen.
Dieser umfassende Leitfaden untersucht die technischen Feinheiten beider Modelle und zeigt, warum moderne Alternativen wie die Plattform Ultralytics YOLO26 für heutige Produktionsumgebungen eine bessere Leistung und Benutzerfreundlichkeit bieten.
Modellübersichten#
Details zu DAMO-YOLO#
Entwickelt von einem Forschungsteam der Alibaba Group, wurde DAMO-YOLO als hocheffiziente Objekterkennungsmethode vorgestellt, die automatisierte Architektursuche nutzt.
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
- Dokumentation: DAMO-YOLO Documentation
Details zu YOLOX#
Erstellt von Forschern bei Megvii, zielte YOLOX darauf ab, die Kluft zwischen Forschungs- und Industriegemeinschaften zu überbrücken, indem die YOLO-Serie auf ein ankerfreies Design umgestellt wurde, was die Architektur drastisch vereinfachte und gleichzeitig eine bessere Leistung zu jener Zeit erzielte.
- Autoren: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun
- Organisation: Megvii
- Datum: 18.07.2021
- Arxiv: https://arxiv.org/abs/2107.08430
- GitHub: https://github.com/Megvii-BaseDetection/YOLOX
- Dokumentation: YOLOX-Dokumentation
Architekturanalyse#
DAMO-YOLO-Architektur#
DAMO-YOLO stützt sich stark auf die Suche nach neuronalen Architekturen (NAS). Zu den Kernkomponenten gehören:
- MAE-NAS-Backbones: Verwendet eine auf maximaler Entropie basierende gesteuerte Suche, um Backbones zu entdecken, die das optimale Verhältnis zwischen Inferenzgeschwindigkeit und Genauigkeit bieten.
- Efficient RepGFPN: Ein aufwendiges Design des Feature-Fusionsmoduls, das dabei hilft, eine hohe Genauigkeit bei unterschiedlichen Objektgrößen beizubehalten.
- ZeroHead: Ein vereinfachter, kompakter Erkennungskopf, der den Rechenaufwand in den abschließenden Vorhersageschichten reduziert.
YOLOX-Architektur#
YOLOX verfolgt einen anderen Ansatz und konzentriert sich auf strukturelle Einfachheit und ein anchor-freies Design:
- Anchor-Free Mechanism: Durch die direkte Vorhersage der Begrenzungsrahmenkoordinaten ohne vordefinierte Anker reduziert YOLOX die Anzahl der erforderlichen Entwurfsparameter und heuristischen Anpassungen.
- Decoupled Head: Trennt die Klassifizierungs- und Regressionsaufgaben in verschiedene Feature-Zweige auf, was die Konvergenzgeschwindigkeit und die Gesamtgenauigkeit verbessert.
- SimOTA Label Assignment: Eine fortschrittliche Strategie zur Zuweisung von Labels, die positive Beispiele dynamisch den Ground-Truth-Daten zuordnet und dadurch die Trainingseffizienz verbessert.
Während DAMO-YOLO maschinengesteuerte NAS-Suchen nutzt, um unter strengen Einschränkungen optimale Architekturen zu finden, setzt YOLOX auf elegante, von Menschen entwickelte Vereinfachungen wie anchor-freie Erkennungsköpfe, um die Pipeline zur Objekterkennung zu optimieren.
Leistungsvergleich#
Die Bewertung dieser Modelle erfordert einen Blick auf die mittlere durchschnittliche Präzision (mAP), die Inferenzgeschwindigkeiten und die Anzahl der Parameter. Die folgende Tabelle enthält einen detaillierten Vergleich der Standard- und Leichtbauvarianten beider Architekturen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
YOLOXx erreicht zwar mit 51,1 die höchste absolute mAP, DAMO-YOLOl bietet jedoch mit 50,8 mAP eine äußerst konkurrenzfähige Leistung, weniger als halb so vielen Parametern (42,1 Mio. gegenüber 99,1 Mio.) und einer deutlich schnelleren TensorRT-Ausführung.
Trainingsmethoden#
Training von DAMO-YOLO#
DAMO-YOLO nutzt während des Trainings eine komplexe Wissensdestillation. Häufig wird zunächst ein großes „Lehrer“-Modell trainiert und dessen Wissen auf kleinere „Schüler“-Modelle übertragen. Außerdem wird AlignedOTA für die dynamische Zuweisung von Labels eingesetzt. Dieser mehrstufige Trainingsprozess ist zwar äußerst effektiv, erhöht jedoch den erforderlichen GPU-Rechenaufwand sowie den Zeit- und Speicherbedarf erheblich.
Training von YOLOX#
YOLOX setzt auf starke Strategien zur Datenerweiterung wie MixUp und Mosaic. Die Autoren stellten jedoch fest, dass das Deaktivieren dieser starken Erweiterungen während der letzten 15 Epochen dem Modell ermöglicht, die Realitätslücke zu schließen und die abschließenden Genauigkeitsmetriken deutlich zu verbessern.
Ideale Anwendungsfälle#
- DAMO-YOLO: Am besten geeignet für anspruchsvolle industrielle Anwendungen, bei denen serverseitige Destillationspipelines unterstützt werden können und die Zielhardware, etwa bestimmte NVIDIA GPUs, direkt von seiner aufwendigen NAS-Architektur profitiert.
- YOLOX: Hervorragend geeignet für Entwickler, die einen vollständig anchor-freien Ansatz suchen. Das äußerst kompakte
YOLOXnanoist dadurch für ältere Android-Geräte, Edge Computing und stark begrenzte IoT-Sensoren geeignet, bei denen die Parameteranzahl der entscheidende Engpass ist.
Der Ultralytics-Vorteil: YOLO26#
Obwohl DAMO-YOLO und YOLOX wichtige Meilensteine darstellen, benötigen Entwickler heute umfassendere, vielseitigere und benutzerfreundlichere Lösungen. Hier kommen die Ultralytics Platform und die neu veröffentlichte Ultralytics YOLO26 ins Spiel.
YOLO26 wurde im Januar 2026 veröffentlicht und ist das derzeit empfohlene Modell für alle Aufgaben der Computer Vision. Es führt eine Reihe von Durchbrüchen ein, die ältere Architekturen übertreffen:
- End-to-End-NMS-freies Design: YOLO26 beseitigt die Nachbearbeitung durch Nicht-Maximum-Unterdrückung (NMS) nativ. Dadurch wird die Bereitstellung deutlich einfacher und schneller, da die für herkömmliche Erkennungsköpfe typischen Latenzengpässe entfallen.
- Bis zu 43 % schnellere CPU-Inferenz: Durch die gezielte Entfernung des Verteilungsfokusverlusts (DFL) und die Optimierung der Schichten erzielt YOLO26 beispiellose Geschwindigkeiten auf CPUs und Edge-Hardware.
- MuSGD-Optimierer: Inspiriert von Trainingstechniken für große Sprachmodelle (LLM) führt YOLO26 den MuSGD-Optimierer ein, eine Kombination aus SGD und Muon, die im Vergleich zu den herkömmlichen Konfigurationen in YOLOX für äußerst stabile Trainingsläufe und eine deutlich schnellere Konvergenz sorgt.
- ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich und machen YOLO26 für Drohnenaufnahmen und Robotik weitaus leistungsfähiger.
- Vielseitigkeit: Im Gegensatz zu DAMO-YOLO, das ausschließlich für die Objekterkennung vorgesehen ist, verarbeitet YOLO26 nativ auch Instanzsegmentierung, Posenschätzung, Klassifizierung und orientierte Begrenzungsrahmen (OBB) innerhalb desselben gut gepflegten Ökosystems.
Einfache Nutzung mit Ultralytics#
Die Ultralytics Python API vereinfacht die Entwicklererfahrung. Das Training eines modernen YOLO26-Modells erfordert deutlich weniger wiederkehrenden Code und vermeidet die komplexen Destillationspipelines von DAMO-YOLO. Darüber hinaus benötigen Ultralytics Modelle während des Trainings im Vergleich zu aufwendigen Modellen auf Transformer-Basis außergewöhnlich wenig CUDA-Speicher.
from ultralytics import YOLO
# Load the latest Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset with one line of code
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run fast, NMS-free inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")Mit der Ultralytics Platform kannst du Modelle automatisch annotieren, trainieren und für Edge-Geräte bereitstellen. Die Plattform übernimmt dabei die gesamte Datenversionierung und die Bereitstellung von Cloud-GPUs für dich.
Fazit#
Die Wahl zwischen DAMO-YOLO und YOLOX hängt von den jeweiligen Einschränkungen ab: DAMO-YOLO bietet über NAS auf bestimmten GPUs ein außergewöhnliches Verhältnis von Geschwindigkeit zu Genauigkeit, während YOLOX ein klares, anchor-freies Design für leichte Edge-Szenarien bereitstellt.
Für Teams, die jedoch eine moderne, zukunftssichere Lösung mit einer aktiven Community suchen, ist die Architektur Ultralytics YOLO26 die maßgebliche Wahl. Ihr NMS-freies Design, die schnelle CPU-Inferenz und die einheitliche API für Erkennungs-, Segmentierungs- und Posenschätzungsaufgaben machen sie unübertroffen, wenn der Übergang von der Forschung zu einer robusten realen Produktionsumgebung reibungslos gelingen soll.
Entwicklern, die weitere moderne Architekturen erkunden möchten, empfehlen wir außerdem Ultralytics YOLO11 oder Transformer-basierte Modelle wie RT-DETR, die in der umfassenden Ultralytics-Dokumentation verfügbar sind.