YOLOv8 im Vergleich zu DAMO-YOLO#
Das Umfeld der Computer Vision entwickelt sich ständig weiter, wobei neue Architekturen die Grenzen des Machbaren auf Edge-Geräten und in umfangreichen Cloud-Clustern verschieben. In dieser technischen Analyse vergleichen wir zwei bedeutende Echtzeitmodelle zur Objekterkennung: YOLOv8 und DAMO-YOLO. Durch die Untersuchung ihrer Architekturen, Leistungskennzahlen und Trainingsmethoden können ML-Ingenieure fundierte Entscheidungen für ihre Bereitstellungspipelines treffen.
Hintergrund und Ursprünge der Modelle#
Beide Modelle wurden ungefähr zur gleichen Zeit vorgestellt, basieren jedoch auf unterschiedlichen Designphilosophien und Forschungszielen.
Details zu YOLOv8#
- Autoren: Glenn Jocher, Ayush Chaurasia und Jing Qiu
- Organisation: Ultralytics
- Datum: 10.01.2023
- GitHub: Ultralytics GitHub-Repository
- Doku: Offizielle Dokumentation für YOLOv8
Details zu DAMO-YOLO#
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: Forschungspapier zu DAMO-YOLO
- GitHub: GitHub-Repository von DAMO-YOLO
Architektonische Innovationen#
YOLOv8: Vielseitiges ankerfreies Design#
Ultralytics YOLOv8 brachte bedeutende Verbesserungen gegenüber seinen Vorgängern und festigte seinen Status als äußerst zuverlässiges Spitzenmodell. Es verfügt über einen ankerfreien Erkennungskopf, der die Anzahl der Boxvorhersagen reduziert und die Inferenz beschleunigt. Die Architektur verwendet einen entkoppelten Kopf, der die Aufgaben Objektheit, Klassifizierung und Regression voneinander trennt, was zu genaueren Vorhersagen für Begrenzungsboxen führt.
Darüber hinaus implementiert YOLOv8 Distribution Focal Loss (DFL) zusammen mit dem CIoU-Verlust und verbessert dadurch die Fähigkeit des Modells, Objektgrenzen präzise zu lokalisieren, insbesondere bei kleineren oder verdeckten Objekten. Sein schlankes Rückgrat ist sowohl für die Ausführung auf GPU als auch auf CPU stark optimiert.
DAMO-YOLO: Angetrieben durch Architektursuche#
DAMO-YOLO verfolgt einen anderen Ansatz und stützt sich stark auf die Neuronale Architektursuche (NAS), um sein Rückgrat automatisch zu entwerfen. Das Alibaba-Team führte „MAE-NAS“ ein, um Strukturen zu finden, die speziell unter TensorRT-Beschleunigung ein optimales Verhältnis zwischen Latenz und Genauigkeit bieten.
Das Modell verwendet ein RepGFPN (reparametrisiertes generalisiertes Feature-Pyramid-Netzwerk) für eine effiziente Zusammenführung von Merkmalen sowie ein „ZeroHead“-Design, um den Rechenaufwand des Erkennungskopfs zu minimieren. Während des Trainings nutzt es AlignedOTA für die Zuweisung von Labels und stützt sich stark auf einen komplexen Prozess zur Wissensdestillation, der ein größeres Lehrermodell zur Überwachung des Ziel-Schülermodells erfordert.
Obwohl DAMO-YOLO durch NAS und Destillation beeindruckende Latenzwerte erreicht, erfordert das Training im Vergleich zur hochoptimierten einstufigen Trainingspipeline von YOLOv8 deutlich mehr CUDA-Speicher und Rechenzeit.
Leistung und Metriken#
Bei der Bereitstellung von Computer-Vision-Modellen in Produktionsumgebungen ist es entscheidend, Genauigkeit (mAP) und Inferenzgeschwindigkeit auszubalancieren. Die folgende Tabelle veranschaulicht die Leistung beider Modelle in verschiedenen Größen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
YOLOv8 bietet ein außergewöhnlich ausgewogenes Leistungsverhältnis. Das YOLOv8n-Modell (Nano) benötigt im Vergleich zu den 8,5 Millionen Parametern von DAMO-YOLOt nur 3,2 Millionen Parameter und eignet sich damit wesentlich besser für mobile Geräte oder Umgebungen mit strengen Speicheranforderungen. Darüber hinaus bietet YOLOv8 eine größere Auswahl an Größen und lässt sich bis zum äußerst präzisen YOLOv8x für cloudbasierte Workloads skalieren.
Entwicklererfahrung und Ökosystem#
Benutzerfreundlichkeit und Trainingseffizienz#
Einer der größten Unterschiede liegt in der Benutzererfahrung. Das Ultralytics-Ökosystem ist auf eine hohe Entwicklungsgeschwindigkeit ausgelegt. Das Training eines benutzerdefinierten YOLOv8-Modells benötigt sehr wenig Speicher und kann über eine einheitliche Python-API oder eine Befehlszeilenschnittstelle ausgeführt werden.
Die Reproduktion des durch Destillation erweiterten Trainings von DAMO-YOLO erfordert dagegen häufig die Arbeit mit komplexen Konfigurationsdateien und die Verwaltung einer mehrstufigen Versuchsverfolgung zwischen Lehrer- und Schülermodell.
Hier siehst du ein Beispiel dafür, wie einfach sich YOLOv8 mit Python trainieren, validieren und exportieren lässt:
from ultralytics import YOLO
# Load a pre-trained YOLOv8 nano model
model = YOLO("yolov8n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="cpu")
# Export the trained model to ONNX format
path = model.export(format="onnx")Vielseitigkeit über verschiedene Bildverarbeitungsaufgaben hinweg#
DAMO-YOLO wurde ausschließlich für die Objekterkennung mit Begrenzungsboxen entwickelt. Die YOLOv8-Architektur unterstützt dagegen nativ mehrere Aufgaben. Durch einfaches Austauschen der Modellgewichte können Entwickler Instanzsegmentierung, Bildklassifizierung und Posenschätzung durchführen, ohne ihren zugrunde liegenden Bereitstellungscode zu ändern. Diese Vielseitigkeit macht Ultralytics-Modelle für komplexe Anwendungen deutlich praktischer.
Praxisnahe Anwendungsfälle#
Wann du YOLOv8 verwenden solltest#
Die Kombination aus Geschwindigkeit, Genauigkeit und einfacher Bereitstellung macht YOLOv8 ideal für:
- Intelligente Einzelhandelsanalyse: Durchführung von Objektverfolgung, um das Kundenverhalten zu überwachen oder Bestandsprüfungen zu automatisieren.
- Landwirtschaftliche Robotik: Nutzung der starken Leistung auf verschiedenster Hardware, um Nutzpflanzen oder Schädlinge in Echtzeit zu identifizieren.
- Medizinische Diagnostik: Verwendung der Instanzsegmentierung, um Auffälligkeiten in medizinischen Aufnahmen schnell und präzise zu erfassen.
- Edge-Bereitstellungen: Die nahtlose Integration in Exportformate wie OpenVINO und CoreML ermöglicht es YOLOv8, seine Stärken auf Geräten mit begrenzten Ressourcen auszuspielen.
Wann du DAMO-YOLO verwenden solltest#
DAMO-YOLO kann in speziellen Szenarien Vorteile bieten, insbesondere bei:
- Akademische NAS-Forschung: Für Teams, die sich mit Re-Parameterisierung oder automatisierten Architekturentwurfsmethoden befassen.
- Strikt GPU-gebundenen Pipelines: Anwendungen, die ausschließlich auf bestimmter NVIDIA-Hardware ausgeführt werden und bei denen die NAS-Strukturen stark für die Ausführungsgrenzen von TensorRT optimiert wurden.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOv8 und DAMO-YOLO hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Präferenzen beim Ökosystem ab.
Wann du YOLOv8 wählen solltest#
YOLOv8 ist eine gute Wahl für:
- Vielseitige Bereitstellung für mehrere Aufgaben: Projekte, die ein bewährtes Modell für Erkennung, Segmentierung, Klassifizierung und Posenschätzung innerhalb des Ultralytics-Ökosystems erfordern.
- Etablierte Produktionssysteme: Bestehende Produktionsumgebungen, die bereits auf der YOLOv8-Architektur basieren und über stabile, gründlich getestete Bereitstellungspipelines verfügen.
- Breite Unterstützung durch Community und Ökosystem: Anwendungen, die von den umfangreichen Tutorials, Integrationen von Drittanbietern und aktiven Community-Ressourcen von YOLOv8 profitieren.
Wann du DAMO-YOLO wählen solltest#
DAMO-YOLO wird empfohlen für:
- Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 die wichtigste Kennzahl ist.
- Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, beispielsweise die Qualitätsprüfung in Echtzeit an Montagelinien.
- Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter reparametrisierter Backbones auf die Erkennungsleistung.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklerfreundlichkeit:
- Edge-Bereitstellungen ohne NMS: Anwendungen, die eine konsistente Inferenz mit geringer Latenz ohne die Komplexität der Nachverarbeitung zur Nichtmaximalunterdrückung erfordern.
- Umgebungen ausschließlich mit CPU: Geräte ohne dedizierte GPU-Beschleunigung, bei denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftaufnahmen mit Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei winzigen Objekten deutlich steigern.
Ausblick: Neuere Ultralytics-Modelle#
YOLOv8 bleibt zwar ein äußerst zuverlässiges Arbeitspferd, doch das Gebiet der Computer Vision entwickelt sich rasant. Du solltest auch neuere Generationen in Betracht ziehen:
YOLO26: Die neueste Generation, Ultralytics YOLO26, stellt einen Paradigmenwechsel dar. Das Modell führt ein natives End-to-End-Design ohne NMS ein und beseitigt damit vollständig die durch die Nachverarbeitung mit Nicht-Maximum-Unterdrückung verursachten Latenzengpässe. Dank des neuen MuSGD-Optimierers (einer Kombination aus SGD und Muon) sowie der spezialisierten Verlustfunktionen ProgLoss + STAL erreicht YOLO26 ein bemerkenswert stabiles Training und eine deutlich bessere Erkennung kleiner Objekte. Durch die Entfernung von DFL (Distribution Focal Loss wurde entfernt, um den Export zu vereinfachen und die Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch zu verbessern) ermöglichen architektonische Anpassungen eine bis zu 43 % schnellere CPU-Inferenz im Vergleich zu früheren Generationen. Damit ist das Modell die maßgebliche Wahl für modernes Edge Computing.
YOLO11: Eine weitere hervorragende Alternative: Ultralytics YOLO11 bietet schrittweise architektonische Verbesserungen gegenüber YOLOv8 und bleibt ein robustes, in der Community vielfach eingesetztes Modell.
Möchtest du deine Modelle vom Prototyp bis in die Produktion bringen? Nutze die Ultralytics Platform, um Datensätze automatisch zu annotieren, Experimente zu verfolgen und Modelle nahtlos in der Cloud oder auf Edge-Geräten bereitzustellen.
Zusammenfassend bietet DAMO-YOLO zwar interessante akademische Einblicke in die Architektursuche, doch Ultralytics-Modelle verfügen über ein deutlich ausgereifteres, vielseitigeres und entwicklerfreundlicheres Ökosystem. Unabhängig davon, ob du bei der bewährten Stabilität von YOLOv8 bleibst oder auf die rasend schnelle Architektur von YOLO26 ohne NMS wechselst, bleibt die Ultralytics-Suite die erste Wahl für Echtzeit-Vision-KI.