Ultralytics YOLO27:
Get Started

YOLOv8 vs. DAMO-YOLO#

Die Computer-Vision-Landschaft entwickelt sich ständig weiter. Neue Architekturen verschieben die Grenzen dessen, was auf Edge-Geräten und in großen Cloud-Clustern möglich ist. In diesem ausführlichen technischen Vergleich untersuchen wir zwei bedeutende Echtzeitmodelle zur Objekterkennung: YOLOv8 und DAMO-YOLO. Durch den Vergleich ihrer Architekturen, Leistungskennzahlen und Trainingsmethoden können ML-Ingenieure fundierte Entscheidungen für ihre Bereitstellungspipelines treffen.

Hintergründe und Ursprünge der Modelle#

Beide Modelle wurden etwa zur gleichen Zeit vorgestellt, gehen jedoch auf unterschiedliche Designphilosophien und Forschungsziele zurück.

Details zu YOLOv8#

DAMO-YOLO im Detail#

Erfahre mehr über DAMO-YOLO

Architektonische Innovationen#

YOLOv8: Vielseitiges anchor-freies Design#

Ultralytics YOLOv8 führte wesentliche Verbesserungen gegenüber seinen Vorgängern ein und festigte damit seinen Ruf als äußerst zuverlässiges Modell auf dem neuesten Stand der Technik. Das Modell verfügt über einen anchor-freien Erkennungs-Head, der die Zahl der Bounding-Box-Vorhersagen verringert und die Inferenz beschleunigt. Die Architektur nutzt einen entkoppelten Head, der Klassifikations- und Regressionsaufgaben trennt und so genauere Vorhersagen von Bounding Boxes ermöglicht.

Darüber hinaus setzt YOLOv8 neben dem CIoU-Verlust Distribution Focal Loss (DFL) ein. Dadurch kann das Modell Objektgrenzen genauer lokalisieren, insbesondere bei kleineren oder teilweise verdeckten Objekten. Das schlanke Backbone ist sowohl für den Einsatz auf GPUs als auch auf CPUs stark optimiert.

DAMO-YOLO verfolgt einen anderen Ansatz und stützt sich stark auf die automatisierte Suche nach neuronalen Architekturen (NAS), um sein Backbone automatisch zu entwerfen. Das Alibaba-Team führte „MAE-NAS“ ein, um Strukturen mit einem optimalen Verhältnis von Latenz und Genauigkeit speziell für die Beschleunigung mit TensorRT zu finden.

Das Modell umfasst ein RepGFPN (parametrisiertes verallgemeinertes Merkmals-Pyramidennetzwerk) zur effizienten Zusammenführung von Merkmalen sowie ein „ZeroHead“-Design, das den Rechenaufwand des Erkennungs-Heads minimiert. Beim Training nutzt es AlignedOTA für die Labelzuweisung und stützt sich stark auf einen komplexen Prozess zur Wissensdestillation. Dafür ist ein größeres Lehrermodell erforderlich, das das Zielmodell als Schüler anleitet.

Trainingsaufwand

DAMO-YOLO erzielt mithilfe von NAS und Destillation zwar beeindruckende Latenzwerte, benötigt beim Training jedoch deutlich mehr CUDA-Speicher und Rechenzeit als die stark optimierte einstufige Trainingspipeline von YOLOv8.

Leistung und Metriken#

Bei der Bereitstellung von Computer-Vision-Modellen in der Produktion ist eine ausgewogene Kombination aus Genauigkeit (mAP) und Inferenzgeschwindigkeit entscheidend. Die folgende Tabelle veranschaulicht die Leistung beider Modelle in verschiedenen Größen.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

YOLOv8 bietet eine außergewöhnlich ausgewogene Leistung. Das Modell YOLOv8n (Nano) benötigt nur 3,2 Millionen Parameter gegenüber 8,5 Millionen beim DAMO-YOLOt und eignet sich dadurch deutlich besser für Mobilgeräte oder Umgebungen mit strengen Speicherbeschränkungen. Darüber hinaus bietet YOLOv8 eine größere Auswahl an Modellgrößen, die bis zum hochpräzisen Modell YOLOv8x für cloudbasierte Arbeitslasten reicht.

Entwicklererfahrung und Ökosystem#

Benutzerfreundlichkeit und Trainingseffizienz#

Ein wesentlicher Unterschied liegt in der Benutzererfahrung. Das Ultralytics-Ökosystem ist auf effiziente Entwicklungsabläufe ausgelegt. Für das Training eines benutzerdefinierten YOLOv8-Modells wird nur wenig Speicher benötigt. Das Training lässt sich über eine einheitliche Python-API oder eine Befehlszeilenschnittstelle ausführen.

Um das durch Destillation erweiterte Training von DAMO-YOLO nachzubilden, muss man sich hingegen häufig mit komplexen Konfigurationsdateien auseinandersetzen und mehrstufige Lehrer-Schüler-Experimente nachverfolgen.

Hier siehst du, wie einfach sich YOLOv8 mit Python trainieren, validieren und exportieren lässt:

from ultralytics import YOLO

# Lade ein vortrainiertes YOLOv8-Nano-Modell
model = YOLO("yolov8n.pt")

# Das Modell mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="cpu")

# Das trainierte Modell ins ONNX-Format exportieren
path = model.export(format="onnx")

Vielseitigkeit bei Computer-Vision-Aufgaben#

DAMO-YOLO wurde ausschließlich für die Objekterkennung mithilfe von Bounding Boxes entwickelt. Die YOLOv8-Architektur unterstützt dagegen nativ mehrere Aufgaben. Entwickler können einfach die Modellgewichte austauschen, um Instanzsegmentierung, Bildklassifizierung und Posenschätzung durchzuführen, ohne die zugrunde liegende Bereitstellungs-Codebasis zu ändern. Diese Vielseitigkeit macht Ultralytics-Modelle für komplexe Anwendungen deutlich praktischer.

Anwendungsfälle in der Praxis#

Wann du YOLOv8 einsetzen solltest#

Dank der Kombination aus Geschwindigkeit, Genauigkeit und einfacher Bereitstellung eignet sich YOLOv8 ideal für:

  • Analysen im intelligenten Einzelhandel: Kundenverhalten mithilfe von Objektverfolgung überwachen oder Bestandsprüfungen automatisieren.
  • Agrarrobotik: Dank der zuverlässigen Leistung auf unterschiedlicher Hardware lassen sich Pflanzen oder Schädlinge in Echtzeit erkennen.
  • Medizinische Diagnostik: Mithilfe der Instanzsegmentierung Auffälligkeiten in medizinischen Bildern schnell und präzise erfassen.
  • Bereitstellung auf Edge-Geräten: Dank der nahtlosen Integration mit Exportformaten wie OpenVINO und CoreML kann YOLOv8 seine Stärken auf Geräten mit begrenzten Ressourcen ausspielen.

Wann du DAMO-YOLO einsetzen solltest#

DAMO-YOLO kann in speziellen Anwendungsfällen nützlich sein, insbesondere:

  • Akademische NAS-Forschung: Für Teams, die Reparametrisierung oder Methoden zum automatisierten Entwurf von Architekturen untersuchen.
  • Ausschließlich GPU-gebundene Pipelines: Anwendungen, die nur auf bestimmter NVIDIA-Hardware laufen und bei denen die NAS-Strukturen stark auf die Ausführungsgrenzen von TensorRT optimiert wurden.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv8 und DAMO-YOLO hängt von den spezifischen Anforderungen deines Projekts, den Bereitstellungsbedingungen und deinen Präferenzen beim Ökosystem ab.

Wann du YOLOv8 wählen solltest#

YOLOv8 ist eine gute Wahl für:

  • Vielseitige Bereitstellung für mehrere Aufgaben: Projekte, die ein bewährtes Modell für Erkennung, Segmentierung, Klassifizierung und Posenschätzung innerhalb des Ultralytics-Ökosystems benötigen.
  • Etablierte Produktivsysteme: Bestehende Produktivumgebungen, die bereits auf der YOLOv8-Architektur und stabilen, umfassend getesteten Bereitstellungspipelines basieren.
  • Umfangreiche Unterstützung durch Community und Ökosystem: Anwendungen, die von den zahlreichen YOLOv8-Anleitungen, Integrationen von Drittanbietern und aktiven Community-Ressourcen profitieren.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO eignet sich für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Ein Blick in die Zukunft: Neuere Ultralytics-Modelle#

YOLOv8 bleibt ein äußerst zuverlässiges Arbeitstier, doch die Computer Vision entwickelt sich rasant weiter. Du solltest auch neuere Generationen in Betracht ziehen:

YOLO26: Die neueste Generation, Ultralytics YOLO26, läutet einen Paradigmenwechsel ein. Das Modell bietet ein natives End-to-End-Design ohne NMS (nms=False), das die durch die Nachbearbeitung mit Nichtmaximalunterdrückung verursachten Latenzengpässe beseitigt. Dank des neuen MuSGD-Optimierers (einer Kombination aus SGD und Muon) sowie der spezialisierten Verlustfunktionen ProgLoss + STAL ermöglicht YOLO26 bemerkenswert stabiles Training und eine deutlich bessere Erkennung kleiner Objekte. Durch die Entfernung von DFL (Distribution Focal Loss entfällt für einen einfacheren Export und eine bessere Kompatibilität mit Edge-Geräten und Geräten mit geringem Energieverbrauch) ermöglichen architektonische Anpassungen eine bis zu 43 % schnellere CPU-Inferenz im Vergleich zu früheren Generationen. Damit ist das Modell die definitive Wahl für modernes Edge Computing.

YOLO11: Eine weitere ausgezeichnete Alternative: Ultralytics YOLO11 bietet kleinere architektonische Verbesserungen gegenüber YOLOv8 und ist in der Community weiterhin ein zuverlässiges und weit verbreitetes Modell.

Optimiere deinen Arbeitsablauf

Möchtest du deine Modelle vom Prototyp in die Produktion überführen? Nutze die Ultralytics Platform, um Datensätze automatisch zu annotieren, Experimente nachzuverfolgen und Modelle nahtlos in der Cloud oder auf Edge-Geräten bereitzustellen.

DAMO-YOLO bietet zwar interessante wissenschaftliche Einblicke in die Architektursuche, doch Ultralytics-Modelle stellen ein deutlich ausgereifteres, vielseitigeres und entwicklerfreundlicheres Ökosystem bereit. Ganz gleich, ob du bei der bewährten Stabilität von YOLOv8 bleibst oder auf die blitzschnelle Architektur von YOLO26 ohne NMS umsteigst: Die Ultralytics-Modellpalette bleibt die erste Wahl für Bildverarbeitung mit Echtzeitanforderungen.

Kommentare