Ultralytics YOLO27:
Get Started

YOLOv9 im Vergleich zu DAMO-YOLO#

Die rasante Entwicklung der Computer Vision hat eine Reihe leistungsstarker Architekturen hervorgebracht, die auf unterschiedliche Bereitstellungsbeschränkungen und Genauigkeitsanforderungen zugeschnitten sind. Zwei bemerkenswerte Modelle in diesem Bereich sind YOLOv9, bekannt für den zuverlässigen Umgang mit Informationsengpässen, und DAMO-YOLO, dessen Schwerpunkt auf der Suche nach neuronalen Architekturen (NAS) und effizienten Merkmals-Pyramiden liegt.

Dieser Leitfaden bietet einen ausführlichen technischen Vergleich von YOLOv9 und DAMO-YOLO und beleuchtet ihre architektonischen Unterschiede, Trainingsmethoden und idealen Bereitstellungsszenarien. Außerdem untersuchen wir, wie das Ultralytics-Ökosystem einen nahtlosen Weg von der Entwicklung bis zum Produktiveinsatz ermöglicht und warum moderne Modelle wie YOLO26 zum empfohlenen Standard für neue Projekte geworden sind.

Architekturanalyse#

Wer die grundlegenden Mechanismen der einzelnen Modelle versteht, erkennt, warum sie bei verschiedenen Kennzahlen unterschiedlich abschneiden.

YOLOv9: Programmierbare Gradienteninformationen#

YOLOv9 wurde entwickelt, um den Informationsverlust zu verhindern, der beim Durchfluss von Daten durch tiefe neuronale Netze entsteht.

  • Autoren: Chien-Yao Wang, Hong-Yuan Mark Liao
  • Organisation: Institute of Information Science, Academia Sinica, Taiwan
  • Datum: 21. Februar 2024
  • Links: Arxiv, GitHub, Dokumentation

Mehr über YOLOv9 erfahren

YOLOv9 führt die programmierbare Gradienteninformation (PGI) und das verallgemeinerte Netzwerk zur effizienten Layer-Aggregation (GELAN) ein. PGI stellt sicher, dass wichtige räumliche und semantische Informationen bei der Vorwärtsverarbeitung erhalten bleiben und verhindert so die Verschlechterung der für die Aktualisierung der Gewichte verwendeten Gradienten. GELAN ergänzt dies durch die Maximierung der Parametereffizienz und ermöglicht dem Modell, mit weniger FLOPs als viele herkömmliche CNNs eine mittlere durchschnittliche Präzision (mAP) auf dem neuesten Stand der Technik zu erreichen.

DAMO-YOLO: Effizienz durch NAS#

DAMO-YOLO wurde von der Alibaba Group entwickelt und verfolgt einen anderen Ansatz: Mithilfe einer automatisierten Architektursuche wird die optimale Balance zwischen Geschwindigkeit und Genauigkeit ermittelt.

  • Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
  • Organisation: Alibaba Group
  • Datum: 23. November 2022
  • Links: Arxiv, GitHub

Erfahre mehr über DAMO-YOLO

DAMO-YOLO nutzt ein MAE-NAS-Backbone (Maximum Entropy Neural Architecture Search), um automatisch effiziente Netzwerkstrukturen zu generieren. Für eine zuverlässige Merkmalsfusion verwendet es ein RepGFPN (reparametrisiertes allgemeines Merkmals-Pyramidennetzwerk) sowie ein „ZeroHead“-Design, um den Rechenaufwand des Erkennungskopfs zu minimieren. Zusätzlich kommen AlignedOTA zur Labelzuweisung und Wissensdestillation zum Einsatz, um die Leistung kleinerer Varianten zu steigern.

Die Rolle von NAS in der Computer Vision

Die Suche nach neuronalen Architekturen (NAS) automatisiert den Entwurf künstlicher neuronaler Netze. Sie kann zwar hocheffiziente Modelle wie DAMO-YOLO hervorbringen, erfordert aber oft enorme Rechenressourcen, um den Architekturraum zu durchsuchen. Damit unterscheidet sie sich von der stärker deterministischen Entwurfsphilosophie von Modellen wie YOLOv9.

Leistungs- und Metrikvergleich#

Bei der Auswahl eines Modells zur Objekterkennung ist es entscheidend, Genauigkeit, Geschwindigkeit und Rechenaufwand gegeneinander abzuwägen.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Analyse#

  • Genauigkeit im Verhältnis zur Parameterzahl: YOLOv9 bietet in der Regel ein besseres Verhältnis von Parameterzahl zu Genauigkeit. So erreicht YOLOv9c mit 25,5 Mio. Parametern eine mAP von 53,0 %, während DAMO-YOLOl eine mAP von 50,8 % erzielt, dafür aber deutlich mehr Parameter (42,1 Mio.) benötigt.
  • Inferenzgeschwindigkeit: Die Architektur von DAMO-YOLO ermöglicht auf T4-GPUs konkurrenzfähige TensorRT-Inferenzgeschwindigkeiten und ist in den mittleren Größenklassen etwas schneller als YOLOv9. Die Effizienz von YOLOv9 bei den FLOPs und der Parameterzahl führt jedoch zu einer außergewöhnlichen GPU-Speichereffizienz.
  • Speicherbedarf: Ultralytics-YOLO-Modelle, darunter YOLOv9, benötigen beim Training und bei der Inferenz in der Regel weniger Speicher als komplexe, durch NAS generierte Modelle oder große Transformer-Architekturen. Dadurch lassen sie sich auch auf leistungsschwacher Edge-Hardware problemlos einsetzen.

Die Vorteile des Ultralytics-Ökosystems#

Theoretische Kennzahlen sind zwar wichtig, doch die praktische Umsetzung entscheidet maßgeblich über den Projekterfolg. Hier haben die Ultralytics Platform und ihr umfassendes Softwareökosystem gegenüber eigenständigen Repositories wie DAMO-YOLO die Nase vorn.

Benutzerfreundlichkeit und Trainingseffizienz#

Für das Training eines benutzerdefinierten YOLOv9-Modells ist kaum Boilerplate-Code nötig. Die Ultralytics Python API nimmt dir komplexe Prozesse wie Datenerweiterung, verteiltes Training und Hardwareoptimierung ab.

from ultralytics import YOLO

# Ein vortrainiertes YOLOv9-Modell laden
model = YOLO("yolov9c.pt")

# Das Modell mit deinem eigenen Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Die Modellleistung validieren
metrics = model.val()

# Für den Produktionseinsatz exportieren
model.export(format="onnx")

Im Gegensatz dazu musst du bei DAMO-YOLO oft starre Konfigurationsdateien und komplexe Abhängigkeitsketten durchlaufen, die speziell auf die einzigartige Trainingspipeline zugeschnitten sind. Das führt zu einer steileren Lernkurve.

Vielseitigkeit bei verschiedenen Aufgaben#

Ein Markenzeichen der Ultralytics-Modelle ist ihre Vielseitigkeit. Über die standardmäßige Erkennung von Begrenzungsrahmen hinaus unterstützt das Ultralytics-Framework nahtlos Aufgaben wie Instanzsegmentierung, Posenschätzung, Bildklassifizierung und die Erkennung orientierter Begrenzungsrahmen (OBB). DAMO-YOLO ist ausschließlich für die 2D-Objekterkennung optimiert und erfordert erhebliche Anpassungen, um sich für andere visuelle Aufgabenbereiche zu eignen.

Export für Edge-Geräte

Ultralytics vereinfacht die Bereitstellung, indem ein Modell-Export mit einem Klick in Formate wie TensorRT, OpenVINO und CoreML angeboten wird. So wird unabhängig von deiner Zielhardware maximale Leistung sichergestellt.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv9 und DAMO-YOLO hängt von deinen konkreten Projektanforderungen, Bereitstellungseinschränkungen und Ökosystempräferenzen ab.

Wann du YOLOv9 wählen solltest#

YOLOv9 ist eine gute Wahl für:

  • Forschung zu Informationsengpässen: Akademische Projekte, die programmierbare Gradienteninformationen (PGI) und Architekturen mit effizienten, verallgemeinerten Schichtaggregationsnetzwerken (GELAN) untersuchen.
  • Studien zur Optimierung des Gradientenflusses: Forschung, die darauf abzielt, Informationsverluste in tiefen Netzwerkschichten während des Trainings zu verstehen und zu verringern.
  • Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Vergleichsmaßstab für Architekturvergleiche benötigt wird.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO eignet sich für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die Zukunft: der Wechsel zu YOLO26#

YOLOv9 und DAMO-YOLO waren zwar wichtige Meilensteine ihrer Zeit, doch die moderne Computer Vision hat sich hin zu nativen End-to-End-Architekturen entwickelt. Für jede Neuentwicklung ist YOLO26 der empfohlene Standard.

YOLO26 wurde 2026 veröffentlicht und baut auf den Erfolgen seiner Vorgänger auf. Das Modell bietet sowohl eine höhere Genauigkeit als auch eine einfachere Bereitstellung.

Wichtige Neuerungen in YOLO26#

  • End-to-End-Design ohne NMS: Der optionale One-to-One-Head von YOLO26 (nms=False) macht die Nachverarbeitung mit Nicht-Maximum-Unterdrückung (NMS) vollständig überflüssig. Dadurch entsteht eine optimierte, von Grund auf als End-to-End konzipierte Bereitstellungspipeline – ein Durchbruch, der erstmals in YOLOv10 eingeführt wurde.
  • Entfernung von DFL: Distribution Focal Loss wurde entfernt, um den Export zu vereinfachen und die Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch zu verbessern.
  • Bis zu 43 % schnellere CPU-Inferenz: Durch die Entfernung von DFL und die Optimierung der zentralen Faltungen eignet sich YOLO26 besonders für Edge-Computing-Szenarien ohne dedizierte GPUs.
  • MuSGD-Optimierer: Inspiriert von Innovationen beim Training von LLMs nutzt YOLO26 eine Kombination aus SGD und Muon (MuSGD), um stabilere Trainingsläufe und deutlich kürzere Konvergenzzeiten zu ermöglichen.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich. Damit eignet sich YOLO26 ideal für Luftaufnahmen aus großer Höhe und IoT-Geräte.

Wenn du für dein nächstes Projekt gerade YOLO11 oder YOLOv8 untersuchst, stellt ein Upgrade auf YOLO26 sicher, dass du das am stärksten optimierte, hochmoderne Vision-KI-Framework nutzt, das derzeit verfügbar ist.

Zusammenfassung#

Die Wahl des passenden Modells hängt von deinen konkreten betrieblichen Rahmenbedingungen ab:

  • DAMO-YOLO bietet einen faszinierenden Einblick in die NAS-gesteuerte Optimierung und erreicht konkurrenzfähige Geschwindigkeiten auf ganz bestimmten Hardwareprofilen, auf denen seine RepGFPN-Architektur ihre Stärken ausspielt.
  • YOLOv9 ist eine ausgezeichnete Wahl für Forschende, die feine visuelle Details erhalten möchten. Die PGI-Architektur verhindert dabei Informationsverluste in tiefen Netzwerken.
  • Ultralytics YOLO26 ist die klare Wahl für moderne Anwendungen in Unternehmen und der Forschung. Die unübertroffene Benutzerfreundlichkeit, die NMS-freie Architektur und die hochmodernen Optimierungen des MuSGD-Trainings machen das Modell zur zuverlässigsten, genauesten und am einfachsten bereitzustellenden Lösung im Bereich Computer Vision.

Kommentare