Ultralytics YOLO27:

YOLOv9 vs. DAMO-YOLO#

Die rasante Entwicklung des maschinellen Sehens hat eine Vielzahl leistungsfähiger Architekturen hervorgebracht, die auf unterschiedliche Bereitstellungsbedingungen und Genauigkeitsanforderungen zugeschnitten sind. Zwei bemerkenswerte Vertreter in diesem Bereich sind YOLOv9, das für seinen robusten Umgang mit Informationsengpässen bekannt ist, und DAMO-YOLO, dessen Schwerpunkt stark auf der Suche nach neuronalen Architekturen (NAS) und effizienten Merkmალspyramiden liegt.

Dieser Leitfaden bietet einen detaillierten technischen Vergleich von YOLOv9 und DAMO-YOLO und beleuchtet ihre architektonischen Unterschiede, Trainingsmethoden und idealen Einsatzszenarien. Außerdem untersuchen wir, wie das Ultralytics-Ökosystem einen nahtlosen Weg von der Entwicklung bis zur Produktion ermöglicht und warum moderne Modelle wie YOLO26 zum empfohlenen Standard für neue Projekte geworden sind.

Detaillierte Betrachtung der Architektur#

Ein Verständnis der grundlegenden Mechanismen hinter den einzelnen Modellen zeigt, warum sie bei verschiedenen Metriken unterschiedlich abschneiden.

YOLOv9: Programmierbare Gradienteninformationen#

YOLOv9 wurde entwickelt, um den Informationsverlust direkt zu beheben, der auftritt, wenn Daten tiefe neuronale Netze durchlaufen.

  • Autoren: Chien-Yao Wang, Hong-Yuan Mark Liao
  • Organisation: Institute of Information Science, Academia Sinica, Taiwan
  • Datum: 21. Februar 2024
  • Links: Arxiv, GitHub, Dokumentation

Erfahre mehr über YOLOv9

YOLOv9 führt programmierbare Gradienteninformationen (PGI) und das generalisierte Netzwerk zur effizienten Schichtaggregation (GELAN) ein. PGI stellt sicher, dass wichtige räumliche und semantische Informationen während des Feedforward-Prozesses erhalten bleiben, und verhindert so die Verschlechterung der für Gewichtsaktualisierungen verwendeten Gradienten. GELAN ergänzt dies durch Maximierung der Parametereffizienz, sodass das Modell mit weniger FLOPs als viele herkömmliche CNNs eine aktuelle mittlere durchschnittliche Präzision (mAP) erreicht.

DAMO-YOLO: Effizienz durch NAS#

DAMO-YOLO wurde von der Alibaba Group entwickelt und verfolgt einen anderen Ansatz: Durch die Nutzung einer automatisierten Architektursuche wird das optimale Gleichgewicht zwischen Geschwindigkeit und Genauigkeit ermittelt.

  • Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
  • Organisation: Alibaba Group
  • Datum: 23. November 2022
  • Links: Arxiv, GitHub

Erfahre mehr über DAMO-YOLO

DAMO-YOLO setzt auf ein MAE-NAS-Backbone (Maximum Entropy Neural Architecture Search), um effiziente Netzwerkstrukturen automatisch zu generieren. Das Modell nutzt ein RepGFPN (Reparameterized Generalized Feature Pyramid Network) für eine robuste Feature-Fusion und ein „ZeroHead“-Design, um die Rechenlast des Detektionskopfes zu minimieren. Darüber hinaus integriert DAMO-YOLO AlignedOTA für die Label-Zuordnung und Wissensdestillation, um die Leistung kleinerer Varianten zu steigern.

Die Rolle von NAS im maschinellen Sehen

Die Suche nach neuronalen Architekturen (NAS) automatisiert den Entwurf künstlicher neuronaler Netze. Sie kann zwar äußerst effiziente Modelle wie DAMO-YOLO hervorbringen, erfordert jedoch häufig enorme Rechenressourcen, um den Architekturra​​um zu durchsuchen, und steht damit im Gegensatz zur stärker deterministischen Designphilosophie von Modellen wie YOLOv9.

Vergleich von Leistung und Metriken#

Bei der Auswahl eines Objekterkennungsmodells ist es entscheidend, Genauigkeit, Geschwindigkeit und Rechenaufwand auszubalancieren.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Analyse#

  • Genauigkeit vs. Parameter: YOLOv9 weist im Allgemeinen ein überlegenes Verhältnis von Parameteranzahl zu Genauigkeit auf. Beispielsweise erreicht YOLOv9c eine mAP von 53,0 % mit 25,3 Mio. Parametern, während DAMO-YOLOl eine mAP von 50,8 % erreicht, dafür aber deutlich mehr Parameter (42,1 Mio.) benötigt.
  • Inferenzgeschwindigkeit: Die Architektur von DAMO-YOLO bietet auf T4-GPUs konkurrenzfähige TensorRT-Inferenzgeschwindigkeiten und ist in den mittleren Größenklassen geringfügig schneller als YOLOv9. Die Effizienz von YOLOv9 bei FLOPs und Parameteranzahl führt jedoch zu einer außergewöhnlichen Effizienz des GPU-Speichers.
  • Speicheranforderungen: Ultralytics YOLO-Modelle, einschließlich YOLOv9, weisen sowohl beim Training als auch bei der Inferenz typischerweise einen geringeren Speicherverbrauch auf als komplexe, durch NAS erzeugte Modelle oder umfangreiche Transformer-Architekturen. Dadurch eignen sie sich besonders gut für die Bereitstellung auf ressourcenbeschränkter Edge-Hardware.

Der Ökosystemvorteil von Ultralytics#

Während theoretische Metriken wichtig sind, bestimmt die praktische Umsetzung maßgeblich den Erfolg eines Projekts. Hier übertreffen die Ultralytics-Plattform und ihr umfassendes Softwareökosystem eigenständige Repositories wie DAMO-YOLO deutlich.

Benutzerfreundlichkeit und Trainingseffizienz#

Das Training eines benutzerdefinierten YOLOv9-Modells erfordert nur minimalen Boilerplate-Code. Die Ultralytics Python API abstrahiert komplexe Prozesse wie Datenerweiterung, verteiltes Training und Hardwareoptimierung.

from ultralytics import YOLO

# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate model performance
metrics = model.val()

# Export for production deployment
model.export(format="onnx")

Die Nutzung von DAMO-YOLO erfordert dagegen häufig den Umgang mit starren Konfigurationsdateien und komplexen, auf die spezielle Trainingspipeline zugeschnittenen Abhängigkeiten, was zu einer steileren Lernkurve führt.

Vielseitigkeit über verschiedene Aufgaben hinweg#

Ein Markenzeichen der Ultralytics-Modelle ist ihre inhärente Vielseitigkeit. Über die standardmäßige Erkennung von Begrenzungsrahmen hinaus unterstützt das Ultralytics-Framework nahtlos Aufgaben wie Instanzsegmentierung, Posenschätzung, Bildklassifizierung und die Erkennung orientierter Begrenzungsrahmen (OBB). DAMO-YOLO ist strikt für die 2D-Objekterkennung optimiert und erfordert eine umfassende Neuentwicklung, um an andere visuelle Anwendungsbereiche angepasst zu werden.

Export auf Edge-Geräte

Ultralytics vereinfacht die Bereitstellungspipeline durch den Ein-Klick-Export von Modellen in Formate wie TensorRT, OpenVINO und CoreML und gewährleistet so unabhängig von der Zielhardware maximale Leistung.

Anwendungsfälle und Empfehlungen#

Die Entscheidung zwischen YOLOv9 und DAMO-YOLO hängt von deinen spezifischen Projektanforderungen, Bereitstellungsbedingungen und Präferenzen für das Ökosystem ab.

Wann du YOLOv9 wählen solltest#

YOLOv9 ist eine gute Wahl für:

  • Forschung zu Informationsengpässen: Akademische Projekte zur Untersuchung der Architekturen für programmierbare Gradienteninformationen (PGI) und des generalisierten effizienten Netzwerks zur Layer-Aggregation (GELAN).
  • Untersuchungen zur Optimierung des Gradientenflusses: Forschung mit Schwerpunkt auf dem Verständnis und der Verringerung von Informationsverlusten in tiefen Netzwerkschichten während des Trainings.
  • Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Referenz für Architekturvergleiche benötigt wird.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO wird empfohlen für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 die wichtigste Kennzahl ist.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, beispielsweise die Qualitätsprüfung in Echtzeit an Montagelinien.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter reparametrisierter Backbones auf die Erkennungsleistung.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklerfreundlichkeit:

  • Edge-Bereitstellungen ohne NMS: Anwendungen, die eine konsistente Inferenz mit geringer Latenz ohne die Komplexität der Nachverarbeitung zur Nichtmaximalunterdrückung erfordern.
  • Umgebungen ausschließlich mit CPU: Geräte ohne dedizierte GPU-Beschleunigung, bei denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftaufnahmen mit Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei winzigen Objekten deutlich steigern.

Die Zukunft: Der Wechsel zu YOLO26#

YOLOv9 und DAMO-YOLO stellen zwar wichtige Meilensteine der Vergangenheit dar, doch das moderne maschinelle Sehen hat sich hin zu nativ durchgängigen Architekturen entwickelt. Für jede Neuentwicklung ist YOLO26 der empfohlene Standard.

YOLO26 wurde 2026 veröffentlicht und baut auf den Erfolgen seiner Vorgänger auf. Das Modell bietet sowohl bei der Genauigkeit als auch bei der Einfachheit der Bereitstellung einen deutlichen Fortschritt.

Wichtige Innovationen von YOLO26#

  • Durchgängiges Design ohne NMS: YOLO26 entfernt die Nachverarbeitung durch die Unterdrückung nicht-maximaler Werte (NMS) vollständig. Dadurch entsteht eine optimierte, nativ durchgängige Bereitstellungspipeline – ein Durchbruch, der erstmals in YOLOv10 umgesetzt wurde.
  • Entfernung von DFL: Der Verteilungs-Fokussierungsverlust wurde entfernt, um den Export zu vereinfachen und die Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch zu verbessern.
  • Bis zu 43 % schnellere CPU-Inferenz: Durch die Entfernung komplexer Nachverarbeitung und die Optimierung grundlegender Faltungsoperationen eignet sich YOLO26 besonders für Edge-Computing-Szenarien ohne dedizierte GPUs.
  • MuSGD-Optimierer: Inspiriert von Innovationen beim Training von LLMs verwendet YOLO26 eine Kombination aus SGD und Muon (MuSGD), um stabilere Trainingsläufe und deutlich schnellere Konvergenzzeiten zu gewährleisten.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte erheblich und machen YOLO26 ideal für Luftaufnahmen aus großer Höhe und IoT-Geräte.

Wenn du für dein nächstes Projekt derzeit YOLO11 oder YOLOv8 untersuchst, stellt ein Upgrade auf YOLO26 sicher, dass du das am stärksten optimierte, hochmoderne Framework für visuelle KI verwendest, das heute verfügbar ist.

Zusammenfassung#

Die Wahl des richtigen Modells hängt von deinen spezifischen betrieblichen Rahmenbedingungen ab:

  • DAMO-YOLO bietet einen faszinierenden Einblick in die durch NAS gesteuerte Optimierung und liefert konkurrenzfähige Geschwindigkeiten für sehr spezifische Hardwareprofile, bei denen seine RepGFPN-Architektur ihre Stärken ausspielt.
  • YOLOv9 ist eine ausgezeichnete Wahl für Forschende, die sich auf den Erhalt feingranularer visueller Details konzentrieren und dabei seine PGI-Architektur nutzen, um Informationsverluste in tiefen Netzwerken zu verhindern.
  • Ultralytics YOLO26 ist die maßgebliche Wahl für moderne Anwendungen in Unternehmen und Forschung. Seine beispiellose Benutzerfreundlichkeit, die Architektur ohne NMS und die hochmodernen Trainingsoptimierungen mit MuSGD machen es zum zuverlässigsten, genauesten und am einfachsten bereitzustellenden Modell im Bereich des maschinellen Sehens.

Kommentare