Ultralytics YOLO27:

DAMO-YOLO vs. YOLO26#

Die Computer-Vision-Landschaft entwickelt sich ständig weiter, angetrieben vom Bedarf an Architekturen, die hohe Genauigkeit mit Inferenz bei geringer Latenz verbinden. Dieser Vergleich beleuchtet die technischen Feinheiten von DAMO-YOLO und Ultralytics YOLO26 und untersucht ihre architektonischen Innovationen, Trainingsmethoden und idealen Einsatzbereiche.

Unabhängig davon, ob du Bildverarbeitungsmodelle auf Edge-Geräten bereitstellst oder Cloud-Pipelines mit hohem Durchsatz entwickelst: Das Verständnis der Unterschiede zwischen diesen Modellen ist entscheidend, um fundierte Architekturentscheidungen in der modernen KI-Entwicklung zu treffen.

DAMO-YOLO: Neuronale Architektursuche im großen Maßstab#

DAMO-YOLO, entwickelt von der Alibaba Group, wurde am 23. November 2022 veröffentlicht. Das von Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun entwickelte Modell konzentriert sich stark auf die automatisierte Suche nach effizienten Architekturen mithilfe der Suche nach neuronalen Architekturen (NAS).

Du kannst die ursprüngliche Forschung in ihrem ArXiv-Artikel nachlesen oder den Quellcode im DAMO-YOLO-GitHub-Repository erkunden.

Wichtige Architekturmerkmale#

DAMO-YOLO führt mehrere technische Innovationen ein, die die Grenzen der Objekterkennung in Echtzeit erweitern sollen:

  • MAE-NAS-Backbones: DAMO-YOLO nutzt eine durch maximale Entropie gesteuerte Suche, um optimale Backbones zu finden. Dieser NAS-Ansatz ermittelt Architekturen, die Erkennungsgenauigkeit und Inferenzgeschwindigkeit auf spezifischer Hardware strikt ausgleichen.
  • Efficient RepGFPN: Ein umfangreiches Neck-Design, das die Merkmalsfusion deutlich verbessert und besonders bei der Analyse komplexer Szenen wie in Luftaufnahmen von Vorteil ist.
  • ZeroHead-Design: Ein stark vereinfachter Erkennungskopf, der die Rechenkomplexität der abschließenden Vorhersageschichten minimiert.
  • AlignedOTA und Distillation: DAMO-YOLO verwendet die Zuordnung mittels optimalem Transport (AlignedOTA), um Mehrdeutigkeiten bei der Label-Zuordnung aufzulösen, kombiniert mit einer robusten Wissensdestillation, um die Genauigkeit kleinerer Schülermodelle mithilfe größerer Lehrernetzwerke zu steigern.

Erfahre mehr über DAMO-YOLO

Der Ultralytics-Vorteil: YOLO26#

Veröffentlicht am 14. Januar 2026 von Glenn Jocher und Jing Qiu bei Ultralytics, repräsentiert YOLO26 den Gipfel zugänglicher, leistungsstarker Vision-KI. Auf dem Erbe von YOLO11 und YOLOv10 aufbauend, ist YOLO26 von Grund auf für den Edge-First-Einsatz, Multitask-Vielseitigkeit und unvergleichliche Benutzerfreundlichkeit konzipiert.

Innovationen von YOLO26#

Ultralytics YOLO26 führt mehrere wegweisende Funktionen ein, die es zur maßgeblichen Wahl für moderne Computer-Vision-Anwendungen machen:

  • End-to-End-Design ohne NMS: YOLO26 eliminiert die Nachbearbeitung durch die Unterdrückung nicht maximaler Werte (NMS) nativ. Dieser erstmals in YOLOv10 eingeführte End-to-End-Ansatz vereinfacht Bereitstellungspipelines erheblich und gewährleistet eine deterministische Inferenz mit geringer Latenz.
  • Bis zu 43 % schnellere CPU-Inferenz: YOLO26 ist architektonisch für Edge Computing optimiert und liefert außergewöhnliche Geschwindigkeit auf Edge-Geräten und herkömmlichen CPUs, wodurch es sich ideal für batteriebetriebene IoT-Geräte eignet.
  • MuSGD-Optimierer: Inspiriert vom Training großer Sprachmodelle (wie bei Kimi K2 von Moonshot AI) kombiniert YOLO26 SGD und Muon zu einem hybriden Verfahren. Dadurch wird die Stabilität beim Training großer Sprachmodelle auf Computer Vision übertragen, was zu einer schnelleren und zuverlässigeren Konvergenz führt.
  • Entfernung von DFL: Durch die Entfernung von Distribution Focal Loss wird der Modellgraph vereinfacht, was einen reibungslosen Export in Formate wie ONNX und TensorRT ermöglicht.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich – eine entscheidende Funktion für Drohnenanwendungen und die Landwirtschaft.
Aufgabenspezifische Verbesserungen

YOLO26 umfasst spezialisierte Verbesserungen für mehrere Modalitäten: ein Protomodul mit mehreren Maßstäben für die Instanzsegmentierung, Residual-Log-Likelihood-Schätzung (RLE) für die Posenschätzung und einen fortschrittlichen Winkelfehler zur Verringerung von Randproblemen bei der Erkennung orientierter Begrenzungsboxen (OBB).

Leistungsvergleich#

Bei der Bewertung dieser Modelle ist das Verhältnis zwischen Genauigkeit (mAP) und Recheneffizienz (Geschwindigkeit/FLOPs) entscheidend. Die folgende Tabelle zeigt, wie diese Modelle anhand des branchenüblichen COCO-Datensatzes abschneiden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Wie oben zu sehen ist, liefert YOLO26 durchgehend eine höhere Genauigkeit mit deutlich weniger Parametern und FLOPs, was zu einer wesentlich effizienteren Architektur für Training und Inferenz führt.

Trainingseffizienz und Benutzerfreundlichkeit#

Die Komplexität von DAMO-YOLO#

DAMO-YOLO erreicht zwar eine konkurrenzfähige Genauigkeit, seine Trainingsmethodik ist jedoch äußerst komplex. Die Abhängigkeit von der Suche nach neuronalen Architekturen (NAS) und umfangreicher Wissensdestillation bedeutet, dass das Training eines benutzerdefinierten Modells häufig erhebliche GPU-Ressourcen und spezielles Fachwissen erfordert. Dieser mehrstufige Prozess – zunächst wird ein großes Lehrermodell trainiert, um anschließend Wissen in ein kleineres Schülermodell zu übertragen – kann agile Entwicklungsteams ausbremsen, die schnell mit benutzerdefinierten Datensätzen iterieren möchten.

Die optimierte Ultralytics-Erfahrung#

Ultralytics YOLO26 ist dagegen auf eine unkomplizierte Nutzung vom Einstieg bis zum Expertenniveau ausgelegt. Der gesamte Lebenszyklus von Training, Validierung und Bereitstellung wird über eine klare, einheitliche Python-API und CLI abstrahiert. Darüber hinaus benötigt YOLO26 beim Training deutlich weniger CUDA-Speicher als Transformer-basierte Modelle wie RT-DETR, sodass Forschende hochmoderne Modelle auf Hardware für Endverbraucher trainieren können.

Hier siehst du, wie einfach du ein YOLO26-Modell mit dem Ultralytics SDK trainieren, evaluieren und exportieren kannst:

from ultralytics import YOLO

# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Evaluate the model's performance on the validation set
metrics = model.val()

# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export the model to ONNX format for deployment
model.export(format="onnx")

Für Teams, die eine Umgebung ohne Code bevorzugen, bietet die Ultralytics Platform eine intuitive Oberfläche für die Annotation von Datensätzen, Cloud-Training und eine nahtlose Bereitstellung.

Anwendungen in der Praxis#

Die Wahl der richtigen Architektur hängt maßgeblich von der vorgesehenen Bereitstellungsumgebung und den Hardwarebeschränkungen ab.

Industrielle Qualitätskontrolle#

Für die Hochgeschwindigkeits-Fertigungsautomatisierung kann DAMO-YOLO auf dedizierter GPU-Hardware gute Leistungen erbringen. YOLO26 ist jedoch die bevorzugte Wahl für moderne Montagelinien. Sein End-to-End-Design ohne NMS gewährleistet eine deterministische Latenz ohne Schwankungen – unerlässlich, wenn visuelle Daten in Echtzeit mit Roboteraktoren synchronisiert werden.

Edge-KI und mobile Geräte#

Die Bereitstellung von Computer Vision auf batteriebetriebenen Geräten erfordert höchste Effizienz. Während DAMO-YOLO auf speziellen RepGFPN-Necks beruht, ist YOLO26n (Nano) speziell für Edge Computing optimiert. Die Entfernung von DFL und die 43 % schnellere CPU-Inferenz machen es zur optimalen Lösung für intelligente Kameras, mobile Anwendungen und Sicherheitsalarmsysteme.

Projektanforderungen für mehrere Aufgaben#

Wenn ein Projekt mehr als nur Objekterkennung erfordert – etwa die Analyse der Bewegungsabläufe von Spielern im Sport mithilfe von Posenschätzung oder die Ermittlung exakter Pixelgrenzen durch Instanzsegmentierung –, bietet YOLO26 native Unterstützung für all diese Aufgaben innerhalb einer einzigen, einheitlichen Codebasis. DAMO-YOLO ist strikt auf die Erkennung von Begrenzungsboxen beschränkt.

Anwendungsfälle und Empfehlungen#

Die Entscheidung zwischen DAMO-YOLO und YOLO26 hängt von deinen spezifischen Projektanforderungen, Bereitstellungsbeschränkungen und Präferenzen beim Ökosystem ab.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO ist eine gute Wahl für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 die wichtigste Kennzahl ist.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, beispielsweise die Qualitätsprüfung in Echtzeit an Montagelinien.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter reparametrisierter Backbones auf die Erkennungsleistung.

Wann du YOLO26 wählen solltest#

YOLO26 wird empfohlen für:

  • Edge-Bereitstellungen ohne NMS: Anwendungen, die eine konsistente Inferenz mit geringer Latenz ohne die Komplexität der Nachverarbeitung zur Nichtmaximalunterdrückung erfordern.
  • Umgebungen ausschließlich mit CPU: Geräte ohne dedizierte GPU-Beschleunigung, bei denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftaufnahmen mit Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei winzigen Objekten deutlich steigern.

Fazit#

Beide Architekturen stellen bedeutende Errungenschaften im Bereich des Deep Learning dar. DAMO-YOLO bietet einen faszinierenden Einblick in die Leistungsfähigkeit der Suche nach neuronalen Architekturen und von Destillationstechniken, die auf bestimmte Hardware-Benchmarks zugeschnitten sind.

Für Entwickler, Forscher und Unternehmen, die eine produktionsreife Lösung suchen, sticht Ultralytics YOLO26 jedoch als die überlegene Wahl hervor. Seine Kombination aus einem End-to-End-NMS-freien Design, massiven CPU-Inferenzgewinnen, Multitask-Vielseitigkeit und der Integration in das gut gewartete Ultralytics-Ökosystem macht Ultralytics YOLO26 zum robustesten und praktischsten Werkzeug zur Bewältigung realer Computer-Vision-Herausforderungen heute.

Für Nutzer, die weitere Modelle aus dem Ultralytics-Ökosystem erkunden möchten, steht eine umfassende Dokumentation zu YOLO11, YOLOv8 und dem Transformer-basierten RT-DETR zur Verfügung.

Kommentare