Ultralytics YOLO27:
Get Started

YOLOv5 vs. DAMO-YOLO#

Die Entwicklung der Echtzeit-Bildverarbeitung schreitet kontinuierlich voran. Forscher und Ingenieure suchen nach dem optimalen Gleichgewicht zwischen Genauigkeit, Geschwindigkeit und Benutzerfreundlichkeit. Zwei bedeutende Modelle, die diesen Weg geprägt haben, sind Ultralytics YOLOv5 und DAMO-YOLO von Alibaba.

Dieser Leitfaden bietet eine ausführliche technische Analyse ihrer Architekturen, Leistungskennzahlen und Trainingsmethoden, damit du das richtige Modell für deine nächste Bereitstellung auswählen kannst.

Hintergrund der Modelle#

Bevor wir uns mit den technischen Einzelheiten befassen, ist es wichtig, die Ursprünge und grundlegenden Designprinzipien dieser einflussreichen Bildverarbeitungsmodelle zu verstehen.

Ultralytics YOLOv5#

YOLOv5 wurde von Glenn Jocher und dem Team von Ultralytics entwickelt und ist seit seiner Veröffentlichung zum Industriestandard geworden. Das Modell basiert nativ auf dem Framework PyTorch und bot von Anfang an eine unkomplizierte Entwicklererfahrung sowie zuverlässige Bereitstellungsmöglichkeiten.

DAMO-YOLO#

DAMO-YOLO wurde von Forschern der Alibaba Group entwickelt und konzentriert sich stark auf die Suche nach neuronalen Architekturen (NAS) sowie fortschrittliche Destillationsverfahren. Das Modell erweitert die theoretischen Grenzen der hardwarespezifischen Leistung und richtet sich besonders an Forschungs- und Edge-Umgebungen, die eine umfassende Abstimmung erfordern.

Erfahre mehr über DAMO-YOLO

Architektonische Innovationen#

Beide Modelle nutzen besondere Strukturkonzepte, um ihre Echtzeitleistung zu erzielen, gehen dabei jedoch sehr unterschiedlich vor.

YOLOv5: Stabilität und Vielseitigkeit#

YOLOv5 verwendet ein modifiziertes CSP-Backbone (Cross Stage Partial) in Kombination mit einem PANet-Hals (Path Aggregation Network). Diese Struktur ist äußerst effizient und minimiert den CUDA-Speicherverbrauch sowohl beim Training als auch bei der Inferenz.

Eine der größten Stärken von YOLOv5 ist seine Vielseitigkeit bei unterschiedlichen Aufgaben. Über die Vorhersage von Begrenzungsrahmen hinaus bietet das Modell spezielle Architekturen für Bildsegmentierung und Bildklassifizierung. So können Entwickler ihre Bildverarbeitungspipelines auf ein einziges, einheitliches Framework ausrichten.

Die zentrale Innovation von DAMO-YOLO ist das MAE-NAS-Backbone. Mithilfe einer Suche auf Basis maximaler Entropie entdeckte das Alibaba-Team Backbones, die Erkennungsgenauigkeit und Inferenzgeschwindigkeit dynamisch in Einklang bringen.

Darüber hinaus bietet das Modell den Efficient RepGFPN-Hals für eine verbesserte Merkmalsfusion – besonders nützlich bei komplexen Maßstabsvariationen, wie sie häufig bei der Analyse von Satellitenbildern auftreten. Das ZeroHead-Design vereinfacht die abschließenden Vorhersageschichten, um die Latenz zu reduzieren. Die komplexe Generierung der Struktur kann die Architektur jedoch starr und für benutzerdefinierte Anwendungen schwerer anpassbar machen.

Speicheranforderungen

Transformerbasierte Architekturen haben oft mit einem hohen VRAM-Verbrauch zu kämpfen. YOLOv5 und DAMO-YOLO setzen beide auf effiziente Faltungsarchitekturen, um den Speicherbedarf gering zu halten. Ultralytics-Modelle sind jedoch besonders für handelsübliche GPUs optimiert und dadurch für unabhängige Forscher und Start-ups deutlich zugänglicher.

Leistung und Metriken#

Bei der Bewertung von Objektdetektoren für Echtzeitanwendungen müssen mAP (mittlere durchschnittliche Präzision), Inferenzgeschwindigkeit und Modellgröße gemeinsam betrachtet werden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

DAMO-YOLO erzielt bei bestimmten Parameterzahlen zwar sehr konkurrenzfähige mAP-Werte, doch YOLOv5 erreicht durchgehend herausragende TensorRT-Geschwindigkeiten und weist in den Nano- und Small-Konfigurationen äußerst wenige Parameter auf. Dieses ausgewogene Verhältnis sorgt dafür, dass YOLOv5 in unterschiedlichsten Edge-Umgebungen effizient läuft.

Trainingseffizienz und Ökosystem#

Die theoretische Genauigkeit eines Modells ist nur dann von Bedeutung, wenn es sich auch praktisch einsetzen lässt. Genau hier unterscheiden sich die Modelle erheblich.

Die Komplexität der Destillation#

DAMO-YOLO setzt stark auf ein mehrstufiges Trainingsverfahren. Dabei werden die AlignedOTA-Labelzuweisung und ein Teacher-Student-Verfahren zur Wissensdestillation kombiniert. So lässt sich zwar die Leistung des Student-Modells maximieren, dafür muss zunächst ein sehr großes Teacher-Modell trainiert werden. Das erhöht Rechenzeit, Energiekosten und Hardwarebedarf erheblich und wird so zum Engpass für agile ML-Teams.

Der Vorteil von Ultralytics: einfache Bedienung#

Das Ultralytics-Ökosystem hingegen ist weltweit für seine intuitiven APIs und seine Trainingseffizienz bekannt. Dank aktiver Weiterentwicklung und einer riesigen Open-Source-Community können Entwickler Modelle nahtlos trainieren, validieren und bereitstellen.

from ultralytics import YOLO

# Vortrainiertes YOLOv5-Modell laden
model = YOLO("yolov5su.pt")  # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket

# Trainiere mühelos mit einem benutzerdefinierten Datensatz
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Für die Bereitstellung ins ONNX-Format exportieren
model.export(format="onnx")

Ultralytics bietet außerdem integrierte Unterstützung für die Versuchsverfolgung mit Tools wie Weights & Biases und Comet ML und ermöglicht so einen reibungslosen Arbeitsablauf.

Anwendungsfälle in der Praxis#

  • YOLOv5 eignet sich hervorragend für dynamische Produktionsumgebungen. Dank des unkomplizierten Exports ist es die erste Wahl für intelligente Einzelhandelsanalysen, die Fehlererkennung in der Hochgeschwindigkeitsfertigung und die Integration in mobile Anwendungen über CoreML.
  • DAMO-YOLO eignet sich besonders für anspruchsvolle akademische Leistungsvergleiche und Szenarien mit umfangreichen Rechenressourcen, in denen lange, destillierte Trainingsläufe minimale mAP-Verbesserungen für bestimmte, festgelegte Hardwareziele erzielen sollen.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv5 und DAMO-YOLO hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Ökosystempräferenzen ab.

Wann du YOLOv5 wählen solltest#

YOLOv5 eignet sich besonders für:

  • Bewährte Produktionssysteme: Bestehende Bereitstellungen, bei denen die lange Stabilitätsbilanz, die umfassende Dokumentation und die große Unterstützung durch die Community von YOLOv5 geschätzt werden.
  • Training mit begrenzten Ressourcen: Umgebungen mit begrenzten GPU-Ressourcen, in denen die effiziente Trainingspipeline und der geringere Speicherbedarf von YOLOv5 von Vorteil sind.
  • Umfangreiche Unterstützung von Exportformaten: Projekte, die eine Bereitstellung in vielen Formaten erfordern, darunter ONNX, TensorRT, CoreML und LiteRT.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO eignet sich für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die nächste Entwicklungsstufe: YOLO26#

Wenn du ein neues Projekt startest, solltest du unbedingt auch die Zukunft im Blick haben. Ultralytics YOLO26 baut auf dem beeindruckenden Fundament von YOLOv5 auf und integriert bahnbrechende Neuerungen, die den neuesten Stand der Vision AI neu definieren.

Warum auf YOLO26 aktualisieren?

YOLO26 wurde mit großem Beifall aufgenommen und ist nativ End-to-End. Das Modell bietet ein End-to-End-Design ohne NMS (nms=False), das die Nachverarbeitung mit Non-Maximum Suppression überspringt und so eine deutlich schnellere und einfachere Bereitstellung ermöglicht.

Zu den wichtigsten Innovationen in YOLO26 gehören:

  • MuSGD-Optimierer: Diese von Innovationen beim Training von LLMs inspirierte Kombination aus SGD und Muon sorgt für äußerst stabiles Training und schnelle Konvergenz.
  • Bis zu 43 % schnellere CPU-Inferenz: Das Modell ist stark für Edge Computing optimiert und eignet sich daher ideal für IoT-Geräte ohne dedizierte GPUs.
  • ProgLoss + STAL: Fortschrittliche Verlustfunktionen, die die Erkennung kleiner Objekte deutlich verbessern – entscheidend für Luftaufnahmen von Drohnen und die Robotik.
  • Aufgabenspezifische Verbesserungen: Von einem speziellen Winkelfehler für orientierte Begrenzungsrahmen (OBB) bis hin zur Residual Log-Likelihood Estimation (RLE) für präzise Posenschätzung – YOLO26 bewältigt komplexe Anwendungsbereiche mühelos.

Fazit#

YOLOv5 und DAMO-YOLO haben sich beide einen festen Platz in der Geschichte der Objekterkennung gesichert. DAMO-YOLO ist weiterhin ein faszinierendes Beispiel für die Suche nach neuronalen Architekturen und Wissensdestillation. Für Unternehmen, die jedoch ein gut gepflegtes Ökosystem, einfache Bedienung und einen schnellen Weg in die Produktion priorisieren, sind Ultralytics-Modelle unübertroffen.

Wir empfehlen dir dringend, die Ultralytics Platform zum Annotieren, Trainieren und Bereitstellen der nächsten Modellgenerationen wie YOLO26 zu nutzen. So bleibt deine Bildverarbeitungspipeline zukunftssicher, schnell und bemerkenswert genau.

Weiterführende Lektüre#

  • Entdecke den transformerbasierten RT-DETR für Anwendungen, bei denen hohe Genauigkeit gefragt ist.
  • Erfahre mehr über das Modell der vorherigen Generation YOLO11.
  • Erfahre, wie du Bereitstellungen mit OpenVINO optimierst.

Kommentare