Ultralytics YOLO27:
Get Started

DAMO-YOLO vs. YOLO26#

Die Computer Vision entwickelt sich ständig weiter. Treibende Kraft ist der Bedarf an Architekturen, die hohe Genauigkeit mit Inferenz bei geringer Latenz verbinden. Dieser Vergleich beleuchtet die technischen Details von DAMO-YOLO und Ultralytics YOLO26 und untersucht ihre architektonischen Neuerungen, Trainingsmethoden und idealen Anwendungsfälle.

Ganz gleich, ob du Vision-Modelle auf Edge-Geräten bereitstellst oder Cloud-Pipelines mit hohem Durchsatz aufbaust: Die Unterschiede zwischen diesen Modellen zu kennen, ist entscheidend für fundierte Architekturentscheidungen bei der modernen KI-Entwicklung.

DAMO-YOLO: Neuronale Architektursuche im großen Maßstab#

DAMO-YOLO wurde von der Alibaba Group entwickelt und am 23. November 2022 veröffentlicht. Das von Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun entwickelte Modell konzentriert sich darauf, mithilfe der Neuronalen Architektursuche (NAS) effiziente Architekturen automatisiert zu finden.

Du kannst die ursprüngliche Forschungsarbeit im ArXiv-Artikel lesen oder den Quellcode im DAMO-YOLO-GitHub-Repository durchsuchen.

Wichtige Architekturmerkmale#

DAMO-YOLO führt mehrere technische Neuerungen ein, die die Grenzen der Objekterkennung in Echtzeit erweitern sollen:

  • MAE-NAS-Backbones: DAMO-YOLO nutzt eine Maximum-Entropie-gesteuerte Suche, um optimale Backbones zu finden. Dieser NAS-Ansatz ermittelt Architekturen, die Erkennungsgenauigkeit und Inferenzgeschwindigkeit auf bestimmter Hardware gezielt in Einklang bringen.
  • Efficient RepGFPN: Ein umfangreiches Neck-Design, das die Merkmalsfusion deutlich verbessert. Das ist besonders vorteilhaft bei der Analyse komplexer Szenen, wie sie in Luftaufnahmen vorkommen.
  • ZeroHead-Design: Ein stark vereinfachter Erkennungs-Head, der die Rechenkomplexität der abschließenden Vorhersageschichten minimiert.
  • AlignedOTA und Destillation: DAMO-YOLO setzt Aligned Optimal Transport Assignment (AlignedOTA) ein, um Mehrdeutigkeiten bei der Labelzuweisung aufzulösen. Hinzu kommt eine leistungsfähige Strategie zur Wissensdestillation, mit der größere Lehrermodelle die Genauigkeit kleinerer Schülermodelle verbessern.

Erfahre mehr über DAMO-YOLO

Der Vorteil von Ultralytics: YOLO26#

YOLO26, veröffentlicht am 14. Januar 2026 von Glenn Jocher und Jing Qiu bei Ultralytics, steht für zugängliche KI für die Bildverarbeitung mit Spitzenleistung. Aufbauend auf dem Erbe von YOLO11 und YOLOv10 wurde YOLO26 von Grund auf für Edge-Bereitstellungen, Vielseitigkeit bei mehreren Aufgaben und außergewöhnliche Benutzerfreundlichkeit entwickelt.

Neuerungen in YOLO26#

Ultralytics YOLO26 bietet mehrere wegweisende Funktionen, die es zur klaren Wahl für moderne Computer-Vision-Anwendungen machen:

  • End-to-End-Design ohne NMS: Der native One-to-One-Head von YOLO26 (nms=False) macht die Nachverarbeitung mit Non-Maximum Suppression (NMS) überflüssig. Dieser End-to-End-Ansatz, der erstmals mit YOLOv10 eingeführt wurde, vereinfacht Bereitstellungspipelines erheblich und gewährleistet eine deterministische Inferenz mit geringer Latenz.
  • Bis zu 43 % schnellere CPU-Inferenz: YOLO26 wurde architektonisch für Edge Computing optimiert und bietet auf Edge-Geräten und herkömmlichen CPUs außergewöhnliche Geschwindigkeit. Damit eignet es sich ideal für akkubetriebene IoT-Geräte.
  • MuSGD-Optimierer: Inspiriert vom LLM-Training, etwa von Kimi K2 von Moonshot AI, kombiniert YOLO26 SGD und Muon. Dadurch wird die Stabilität des Trainings großer Sprachmodelle auf die Computer Vision übertragen, was zu einer schnelleren und zuverlässigeren Konvergenz führt.
  • Verzicht auf DFL: Durch den Verzicht auf Distribution Focal Loss wird der Modellgraph vereinfacht. Das erleichtert den Export in Formate wie ONNX und TensorRT.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich – ein entscheidender Vorteil für den Drohnenbetrieb und die Landwirtschaft.
Aufgabenspezifische Verbesserungen

YOLO26 bietet spezialisierte Verbesserungen für mehrere Modalitäten: ein Multi-Scale-Proto für die Instanzsegmentierung, Residual Log-Likelihood Estimation (RLE) für die Posenschätzung und eine fortschrittliche Winkelfunktion, die Randprobleme bei der Erkennung orientierter Bounding Boxes (OBB) verringert.

Leistungsvergleich#

Bei der Bewertung dieser Modelle ist das Verhältnis zwischen Genauigkeit (mAP) und Recheneffizienz (Geschwindigkeit/FLOPs) entscheidend. Die folgende Tabelle zeigt, wie die Modelle beim branchenüblichen COCO-Datensatz abschneiden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Wie oben zu sehen ist, erreicht YOLO26 durchgängig eine höhere Genauigkeit mit deutlich weniger Parametern und FLOPs. Dadurch eignet sich die Architektur wesentlich besser für Training und Inferenz.

Trainingseffizienz und Benutzerfreundlichkeit#

Die Komplexität von DAMO-YOLO#

DAMO-YOLO erreicht zwar eine konkurrenzfähige Genauigkeit, seine Trainingsmethodik ist jedoch sehr komplex. Der Einsatz von Neuronaler Architektursuche (NAS) und aufwendiger Wissensdestillation bedeutet, dass das Training eines benutzerdefinierten Modells oft beträchtliche GPU-Ressourcen und Spezialwissen erfordert. Dieser mehrstufige Prozess – bei dem ein großes Lehrermodell trainiert wird, um Wissen auf ein kleineres Schülermodell zu übertragen – kann agile Entwicklungsteams ausbremsen, wenn sie schnell mit benutzerdefinierten Datensätzen experimentieren möchten.

Die optimierte Ultralytics-Erfahrung#

Ultralytics YOLO26 hingegen wurde für eine einfache Nutzung entwickelt, die vom Einstieg bis zu fortgeschrittenen Anwendungen reicht. Der gesamte Ablauf vom Training über die Validierung bis zur Bereitstellung ist hinter einer übersichtlichen, einheitlichen Python API und CLI abstrahiert. Außerdem benötigt YOLO26 beim Training deutlich weniger CUDA-Speicher als transformerbasierte Modelle wie RT-DETR. So können Forschende hochmoderne Modelle auf handelsüblicher Hardware trainieren.

Dieses Beispiel zeigt, wie einfach sich ein YOLO26-Modell mit dem Ultralytics SDK trainieren, auswerten und exportieren lässt:

from ultralytics import YOLO

# Das neueste YOLO26-Nano-Modell laden
model = YOLO("yolo26n.pt")

# Das Modell 50 Epochen lang mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Werte die Leistung des Modells auf dem Validierungsdatensatz aus
metrics = model.val()

# Inferenz mit einem Beispielbild ausführen
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Das Modell zur Bereitstellung ins ONNX-Format exportieren
model.export(format="onnx")

Für Teams, die eine Umgebung ohne Programmierung bevorzugen, bietet die Ultralytics Platform eine intuitive Oberfläche zur Annotation von Datensätzen, zum cloudbasierten Training und zur nahtlosen Bereitstellung.

Anwendungen in der Praxis#

Die Wahl der passenden Architektur hängt stark von der vorgesehenen Bereitstellungsumgebung und den Hardwarebeschränkungen ab.

Industrielle Qualitätskontrolle#

Für die Hochgeschwindigkeitsautomatisierung in der Fertigung kann DAMO-YOLO auf dedizierter GPU-Hardware gute Ergebnisse liefern. Für moderne Montagelinien ist YOLO26 jedoch die bevorzugte Wahl. Sein End-to-End-Design ohne NMS gewährleistet eine deterministische Latenz ohne Schwankungen. Das ist entscheidend, wenn visuelle Daten in Echtzeit mit Roboterantrieben synchronisiert werden müssen.

Edge-KI und Mobilgeräte#

Computer Vision auf akkubetriebenen Geräten erfordert höchste Effizienz. DAMO-YOLO setzt auf spezielle RepGFPN-Necks, während YOLO26n (Nano) gezielt für Edge Computing optimiert wurde. Durch den Verzicht auf DFL und die 43 % schnellere CPU-Inferenz ist das Modell die ideale Lösung für intelligente Kameras, mobile Anwendungen und Sicherheitsalarmsysteme.

Anforderungen bei Projekten mit mehreren Aufgaben#

Wenn ein Projekt mehr als reine Objekterkennung erfordert – etwa die Analyse von Spielerbewegungen im Sport mithilfe der Posenschätzung oder die Ermittlung präziser Pixelgrenzen durch Instanzsegmentierung –, unterstützt YOLO26 all diese Aufgaben nativ in einer einheitlichen Codebasis. DAMO-YOLO ist strikt auf die Erkennung von Bounding Boxes beschränkt.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen DAMO-YOLO und YOLO26 hängt von den konkreten Anforderungen deines Projekts, den Bereitstellungsbeschränkungen und deinen Präferenzen für das Ökosystem ab.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO eignet sich besonders für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.

Wann du YOLO26 wählen solltest#

YOLO26 wird empfohlen für:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Fazit#

Beide Architekturen sind bedeutende Errungenschaften auf dem Gebiet des Deep Learning. DAMO-YOLO bietet einen faszinierenden Einblick in das Potenzial der Neuronalen Architektursuche und von Destillationsverfahren, die auf bestimmte Hardware-Benchmarks zugeschnitten sind.

Für Entwickler, Forschende und Unternehmen, die eine produktionsreife Lösung suchen, ist Ultralytics YOLO26 jedoch die bessere Wahl. Die Kombination aus einem End-to-End-Design ohne NMS, erheblich schnellerer CPU-Inferenz, Vielseitigkeit für mehrere Aufgaben und der Integration in das gut gepflegte Ultralytics-Ökosystem macht YOLO26 zum robustesten und praktischsten Werkzeug, um reale Herausforderungen der Computer Vision zu bewältigen.

Wer weitere Modelle im Ultralytics-Ökosystem kennenlernen möchte, findet eine umfassende Dokumentation zu YOLO11, YOLOv8 und dem transformerbasierten RT-DETR.

Kommentare