DAMO-YOLO vs. YOLOv9#
Die Echtzeit-Objekterkennung entwickelt sich in rasantem Tempo weiter. Entwicklungsteams und Forschende streben nach dem optimalen Verhältnis von Genauigkeit, Inferenzgeschwindigkeit und Recheneffizienz. Dabei sind zwei bemerkenswerte Architekturen aus der Forschung hervorgegangen: DAMO-YOLO und YOLOv9. Beide Modelle führen wichtige architektonische Neuerungen ein, die die Grenzen des Machbaren in der Computer Vision verschieben sollen.
Dieser ausführliche technische Leitfaden analysiert die beiden Modelle eingehend und vergleicht ihre einzigartigen Architekturansätze, Trainingsmethoden und Einsatzmöglichkeiten in der Praxis. Außerdem untersuchen wir, welche entscheidende Rolle das umfassendere Softwareökosystem bei der modernen KI-Entwicklung spielt, und zeigen die Vorteile integrierter Plattformen wie der Ultralytics Platform und neuerer Modellgenerationen wie YOLO26.
Zusammenfassung: Die richtige Architektur auswählen#
Beide Modelle sind wichtige Meilensteine der Deep-Learning-Forschung, richten sich jedoch an leicht unterschiedliche Ansätze für die Bereitstellung.
DAMO-YOLO überzeugt in Umgebungen, in denen sich durch umfangreiche Suche nach neuronalen Architekturen (NAS) bestimmte Leistungsprofile optimieren lassen. Dadurch ist das Modell für maßgeschneiderte Edge-Bereitstellungen interessant. YOLOv9 konzentriert sich dagegen vor allem darauf, Informationsengpässe beim Deep Learning zu beheben, und erzielt eine außergewöhnlich hohe Parametereffizienz.
Für produktionsreife Bereitstellungen empfehlen Entwicklungsteams jedoch durchweg, das einheitliche Ultralytics-Ökosystem zu nutzen. Für neue Projekte bietet das neueste Modell YOLO26 das Beste aus beiden Welten: modernste Genauigkeit und ein optionales End-to-End-Design, das komplexe Nachbearbeitung überflüssig macht.
DAMO-YOLO und YOLOv9 sind leistungsstarke akademische Modelle, doch für ihren produktiven Einsatz ist häufig umfangreiche individuelle Entwicklungsarbeit nötig. Mit Ultralytics YOLO26 erhältst du Zugriff auf modernste Leistung und eine optimierte, wartbare API.
Technische Daten und Urheberschaft#
Die Herkunft und der Entwicklungsschwerpunkt dieser Modelle liefern wichtigen Kontext zu ihren jeweiligen Stärken.
DAMO-YOLO#
DAMO-YOLO wurde von Forschenden der Alibaba Group entwickelt und konzentriert sich stark auf die automatisierte Architekturgenerierung und effiziente Merkmalsfusion.
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Veröffentlichungsdatum: 23. November 2022
- Arxiv-Artikel: Forschungsarbeit zu DAMO-YOLO
- Offizielles GitHub: Repository tinyvision/DAMO-YOLO
- Dokumentation: DAMO-YOLO-README
YOLOv9#
YOLOv9 wurde als Lösung für den Informationsverlust in tiefen Faltungsnetzen eingeführt und lotet während des Trainings die theoretischen Grenzen der Gradientenerhaltung aus.
- Autoren: Chien-Yao Wang und Hong-Yuan Mark Liao
- Organisation: Institut für Informationswissenschaft, Academia Sinica, Taiwan
- Veröffentlichungsdatum: 21. Februar 2024
- Arxiv-Artikel: Forschungsarbeit zu YOLOv9
- Offizielles GitHub: Repository WongKinYiu/yolov9
- Dokumentation: Ultralytics-Dokumentation zu YOLOv9
Architektonische Innovationen#
DAMO-YOLO: angetrieben durch die Suche nach neuronalen Architekturen#
DAMO-YOLO zeichnet sich durch stark angepasste, maschinell generierte Komponenten aus. Sein Backbone wird mithilfe der Suche nach neuronalen Architekturen (NAS) generiert und ist speziell auf Inferenz mit geringer Latenz auf unterschiedlicher Hardware ausgelegt.
Die Architektur verfügt über ein effizientes RepGFPN (rekonfiguriertes verallgemeinertes Merkmals-Pyramidennetzwerk) zur Merkmalsfusion. Es verbessert die Mehrskalen-Objekterkennung, ohne den Rechenaufwand übermäßig zu erhöhen. Außerdem vereinfacht das Modell mit dem ZeroHead-Design den Erkennungskopf und nutzt AlignedOTA für die Labelzuweisung. Hinzu kommt ein ausgefeiltes Verfahren zur Destillationsverbesserung während des Trainings. Diese Techniken ermöglichen zwar eine schnelle Inferenz, doch das mehrstufige Destillationsverfahren erfordert häufig viel VRAM und längere Trainingszeiten.
YOLOv9: Den Informationsengpass beheben#
YOLOv9 geht ein grundlegendes Problem tiefer Netze an: den allmählichen Verlust von Informationen aus den Eingabedaten, während diese aufeinanderfolgende Schichten durchlaufen.
Um dem entgegenzuwirken, führten die Autoren Programmierbare Gradienteninformation (PGI) ein, ein Framework für zusätzliche Überwachung, das wichtige Details für tiefe Schichten bewahren und hochzuverlässige Gradienten für die Aktualisierung der Gewichte erzeugen soll. Dazu gehört die GELAN-Architektur (Generalized Efficient Layer Aggregation Network). GELAN optimiert die Parametereffizienz, indem die Stärken von CSPNet und ELAN kombiniert werden. So wird der Informationsfluss maximiert und gleichzeitig die Anzahl der Gleitkommaoperationen (FLOPs) strikt minimiert.
Leistungsanalyse und Metriken#
Bei der Leistungsbewertung zeigen beide Modelle auf Standard-Benchmarks wie COCO eine hohe mittlere durchschnittliche Präzision (mAP). YOLOv9 erreicht bei vergleichbarer Parameterzahl eine höhere Genauigkeit und insgesamt die höchste absolute Genauigkeit. Dabei nutzt YOLOv9 seine PGI-Architektur, um auch bei schwierigen Datensätzen eine hohe Wiedergabetreue zu gewährleisten.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Wie oben zu sehen ist, erreicht YOLOv9-E die höchste Genauigkeit, während die kleineren DAMO-YOLO- und YOLOv9-Varianten dank TensorRT-Optimierungen weiterhin äußerst konkurrenzfähige Inferenzgeschwindigkeiten erzielen.
Trainingsmethoden und Ökosystem#
Eine leistungsfähige Architektur ist zwar wichtig, doch für den Praxiseinsatz sind auch die Benutzerfreundlichkeit und die Trainingseffizienz entscheidend, die durch das Ökosystem eines Modells geprägt werden.
Bei DAMO-YOLO ist häufig Knowledge Distillation erforderlich. Dabei muss zunächst ein aufwendiges „Lehrermodell“ trainiert werden, bevor Wissen auf das gewünschte „Schülermodell“ übertragen werden kann. Dieser traditionelle Forschungsansatz erhöht den Speicherbedarf und die Dauer der Trainingszyklen erheblich. Auch das ursprüngliche YOLOv9-Repository erfordert die Arbeit mit komplexen Konfigurationsdateien, was eine agile Entwicklung verlangsamen kann.
Die Integration von Modellen in die Ultralytics Platform verändert die Entwicklererfahrung grundlegend. Das Ultralytics-Python-Paket nimmt dir wiederkehrenden Code ab, sodass Teams Datenerweiterung, Hyperparameteroptimierung und den Modellexport mühelos bewältigen können.
Anwendungen und Anwendungsfälle in der Praxis#
Je nach Ressourcenbedarf und Genauigkeitsprofil eignen sich verschiedene Architekturen besonders gut für bestimmte Branchen.
- DAMO-YOLO für Edge AI: Dank seiner durch NAS optimierten Backbones wird DAMO-YOLO häufig für eingebettete Systeme untersucht, bei denen eine hardwarespezifische Reparametrisierung zwingend erforderlich ist, etwa bei der kundenspezifischen Bereitstellung auf ASICs in der grundlegenden Qualitätskontrolle in der Fertigung.
- YOLOv9 für präzise Analysen: Dank seiner hohen Parametereffizienz und der durch PGI ermöglichten Erhaltung der Gradienten eignet sich YOLOv9 hervorragend für Szenarien mit vielen Objekten, etwa für die Analyse von Luftbildern oder die Verfolgung winziger Objekte in stark frequentierten Einzelhandelsumgebungen.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen DAMO-YOLO und YOLOv9 hängt von den konkreten Anforderungen deines Projekts, den Einschränkungen bei der Bereitstellung und deinen Präferenzen für das Ökosystem ab.
Wann du DAMO-YOLO wählen solltest#
DAMO-YOLO eignet sich besonders für:
- Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
- Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
- Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.
Wann du YOLOv9 wählen solltest#
YOLOv9 empfiehlt sich für:
- Forschung zu Informationsengpässen: Akademische Projekte, die programmierbare Gradienteninformationen (PGI) und Architekturen mit effizienten, verallgemeinerten Schichtaggregationsnetzwerken (GELAN) untersuchen.
- Studien zur Optimierung des Gradientenflusses: Forschung, die darauf abzielt, Informationsverluste in tiefen Netzwerkschichten während des Trainings zu verstehen und zu verringern.
- Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Vergleichsmaßstab für Architekturvergleiche benötigt wird.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Der Ultralytics-Vorteil: Der nächste Schritt zu YOLO26#
Für Nutzer, die ältere Architekturen vergleichen, bietet der Wechsel zum modernen Ultralytics-Ökosystem – insbesondere zu den neuesten YOLO26-Modellen – einen unvergleichlichen Vorteil.
YOLO26 verändert die Bereitstellung grundlegend durch sein End-to-End-Design ohne NMS. Sein optionaler One-to-one-Head (nms=False) macht die Nachverarbeitung durch Non-Maximum Suppression (NMS) überflüssig und ermöglicht schnellere, deutlich einfachere Bereitstellungsarchitekturen. Zusammen mit dem Wegfall von Distribution Focal Loss (DFL) bietet YOLO26 eine bessere Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch.
Darüber hinaus umfasst YOLO26 den innovativen MuSGD-Optimierer, eine Hybridlösung aus Stochastic Gradient Descent und Muon-Optimierungen, die von Neuerungen beim Training großer Sprachmodelle inspiriert ist. Dadurch konvergiert das Training sehr stabil und benötigt im Vergleich zu Transformer-lastigen Alternativen bemerkenswert wenig Speicher.
Dank der intuitiven Ultralytics API kannst du ein hochmodernes YOLO26-Modell mit integrierter Experimentverfolgung in nur wenigen Zeilen Python trainieren.
from ultralytics import YOLO
# Das neueste YOLO26-Modell laden
model = YOLO("yolo26n.pt")
# Effizient mit deinem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Das trainierte Modell ins ONNX-Format exportieren
model.export(format="onnx")Ob du fortgeschrittene Instanzsegmentierung, hochpräzise Posenschätzung oder die Erkennung mit herkömmlichen Begrenzungsrahmen benötigst – die Vielseitigkeit des Ultralytics-Frameworks sorgt dafür, dass dein Team weniger Zeit mit der Konfiguration von Deep-Learning-Umgebungen und mehr Zeit mit der Bereitstellung robuster KI-Lösungen verbringt. Mit aufgabenspezifischen Verbesserungen wie ProgLoss + STAL für eine bessere Erkennung kleiner Objekte ist YOLO26 die erste Wahl für die nächste Generation von Bildverarbeitungsanwendungen.