DAMO-YOLO vs. EfficientDet#
Die Entwicklung der Computer Vision hat eine Reihe leistungsfähiger Architekturen hervorgebracht, die auf unterschiedliche Anforderungen der realen Welt zugeschnitten sind. Während einige Frameworks massive Skalierbarkeit priorisieren, konzentrieren sich andere stark auf die Inferenzgeschwindigkeit in Echtzeit. In diesem technischen Vergleich untersuchen wir DAMO-YOLO und EfficientDet, zwei einflussreiche Modelle, die unterschiedliche Ansätze zur Lösung des Problems der Objekterkennung veranschaulichen. Wir analysieren ihre Architekturen, vergleichen ihre Benchmark-Ergebnisse und untersuchen abschließend, warum das neu veröffentlichte Ultralytics YOLO26 die optimale Wahl für moderne Produktionsumgebungen darstellt.
Architekturüberblick#
Beide Modelle wurden entwickelt, um den Zielkonflikt zwischen Effizienz und Genauigkeit zu bewältigen, setzen dafür jedoch grundlegend unterschiedliche Mechanismen ein.
DAMO-YOLO: Geschwindigkeit durch die Suche nach neuronalen Architekturen#
DAMO-YOLO wurde entwickelt, um die Grenzen der Echtzeitobjekterkennung zu erweitern, und nutzt automatisierte Suchverfahren, um hocheffiziente Netzwerke für Umgebungen mit geringer Latenz zu erstellen.
Details zu DAMO-YOLO:
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
DAMO-YOLO basiert auf einem Backbone mit Neural Architecture Search (NAS), der sowohl auf Geschwindigkeit als auch auf Genauigkeit optimiert ist. Das Modell führt RepGFPN (Reparameterized Generalized Feature Pyramid Network) ein, das die Merkmalsfusion verbessert und gleichzeitig hohe Inferenzgeschwindigkeiten beibehält. Darüber hinaus reduziert das ZeroHead-Design den Rechenaufwand, der typischerweise mit Erkennungsköpfen verbunden ist. Das Modell profitiert außerdem von AlignedOTA (Aligned Optimal Transport Assignment) und einer verbesserten Distillation, sodass selbst die kleinsten Varianten umfangreiche Repräsentationen von größeren Modellen lernen.
EfficientDet: Skalierbarkeit durch zusammengesetzte Skalierung#
Im Gegensatz zum geschwindigkeitsorientierten Ansatz konzentriert sich EfficientDet auf eine systematische Skalierbarkeit über verschiedene Rechenbudgets hinweg.
Details zu EfficientDet:
- Autoren: Mingxing Tan, Ruoming Pang und Quoc V. Le
- Organisation: Google Brain
- Datum: 20.11.2019
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
EfficientDet führt BiFPN (Bidirectional Feature Pyramid Network) ein, das eine einfache und schnelle Fusion von Merkmalen auf mehreren Maßstabsebenen ermöglicht. Anders als herkömmliche Verfahren, die Architekturen durch das willkürliche Hinzufügen von Schichten oder Kanälen vergrößern, verwendet EfficientDet eine Methode zur zusammengesetzten Skalierung, bei der Auflösung, Tiefe und Breite des Backbones, des Merkmalsnetzwerks sowie der Netzwerke für Box- und Klassenprognosen gleichzeitig einheitlich skaliert werden. Dadurch erreicht das Modell auf leistungsstarker Hardware eine Genauigkeit auf dem Stand der Technik und bietet zugleich kleinere Varianten für Umgebungen mit begrenzten Ressourcen.
Erfahre mehr über EfficientDet
Vergleich von Leistung und Metriken#
Beim direkten Vergleich dieser Modelle wird der Zielkonflikt zwischen maximaler Genauigkeit und Inferenzgeschwindigkeit deutlich. Die folgende Tabelle zeigt wichtige Leistungskennzahlen und veranschaulicht, wie sich die Inferenzfähigkeiten von DAMO-YOLO im Vergleich zur EfficientDet-Modellfamilie schlagen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Wie oben zu sehen ist, erreicht EfficientDet-d7 die höchste Gesamtgenauigkeit und eignet sich damit für anspruchsvolle cloudbasierte Anwendungen. Die DAMO-YOLO-Reihe bietet dagegen eine äußerst konkurrenzfähige Genauigkeit bei deutlich geringerer Latenz auf GPU-Hardware und ist damit ein besserer Kandidat für Echtzeitanwendungen am Edge.
Anwendungsfälle und Empfehlungen#
Die Entscheidung zwischen DAMO-YOLO und EfficientDet hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Präferenzen hinsichtlich des Ökosystems ab.
Wann du DAMO-YOLO wählen solltest#
DAMO-YOLO ist eine gute Wahl für:
- Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 die wichtigste Kennzahl ist.
- Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, beispielsweise die Qualitätsprüfung in Echtzeit an Montagelinien.
- Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter reparametrisierter Backbones auf die Erkennungsleistung.
Wann du EfficientDet wählen solltest#
EfficientDet wird empfohlen für:
- Google-Cloud- und TPU-Pipelines: Systeme, die eng in Google Cloud Vision APIs oder TPU-Infrastrukturen integriert sind, in denen EfficientDet nativ optimiert ist.
- Forschung zur zusammengesetzten Skalierung: Akademische Benchmarks, die sich auf die Untersuchung der Auswirkungen einer ausgewogenen Skalierung von Netzwerktiefe, -breite und Auflösung konzentrieren.
- Mobile Bereitstellung über TFLite: Projekte, die ausdrücklich den Export nach TensorFlow Lite für Android- oder Embedded-Linux-Geräte benötigen.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklerfreundlichkeit:
- Edge-Bereitstellungen ohne NMS: Anwendungen, die eine konsistente Inferenz mit geringer Latenz ohne die Komplexität der Nachverarbeitung zur Nichtmaximalunterdrückung erfordern.
- Umgebungen ausschließlich mit CPU: Geräte ohne dedizierte GPU-Beschleunigung, bei denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftaufnahmen mit Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei winzigen Objekten deutlich steigern.
Die moderne Alternative: Ultralytics YOLO26#
Obwohl DAMO-YOLO und EfficientDet bedeutende akademische Meilensteine darstellen, erfordert die praktische Bereitstellung häufig einen ausgewogeneren, funktionsreicheren und entwicklerfreundlicheren Ansatz. Genau hier setzt Ultralytics YOLO26 einen neuen Industriestandard.
YOLO26 wurde im Januar 2026 veröffentlicht und baut auf dem Vermächtnis seiner Vorgänger auf, darunter Ultralytics YOLO11 und YOLOv8, und ermöglicht einen grundlegenden Wandel bei der Herangehensweise an die Objekterkennung.
YOLO26 verfügt über ein natives NMS-freies End-to-End-Design. Durch den Verzicht auf die Nicht-Maximum-Unterdrückung (NMS) während der Nachbearbeitung – einen Engpass, der Objekterkenner seit Jahren beeinträchtigt – bietet YOLO26 eine einfachere und deutlich schnellere Bereitstellungspipeline, insbesondere auf Edge-Hardware.
Unübertroffene Leistung und Vielseitigkeit#
YOLO26 verbessert nicht nur die Geschwindigkeit, sondern definiert auch Trainingsstabilität und Genauigkeit neu. Das Modell führt den MuSGD-Optimierer ein, eine von Innovationen beim Training von LLMs inspirierte Kombination aus SGD und Muon, die zu deutlich schnelleren Konvergenzraten und einer höheren Trainingseffizienz führt. Anders als umfangreiche Transformer-basierte Alternativen wie RT-DETR benötigt YOLO26 äußerst wenig Speicher und kann dadurch auf Hardware für Endverbraucher trainiert werden.
Darüber hinaus integriert YOLO26 ProgLoss + STAL und verbessert dadurch die Erkennung kleiner Objekte erheblich, was für Anwendungsfälle wie Luftaufnahmen mit Drohnen und Robotik entscheidend ist. Zur Optimierung für Geräte mit geringem Energieverbrauch wurde Distribution Focal Loss (DFL) aus YOLO26 entfernt, wodurch im Vergleich zu früheren Generationen eine bis zu 43 % schnellere CPU-Inferenz erreicht wird.
Ökosystem und Benutzerfreundlichkeit#
Eine der größten Herausforderungen bei Modellen wie EfficientDet ist der komplexe Integrationsprozess. Im Gegensatz dazu bietet die Ultralytics Platform ein gut gepflegtes End-to-End-Ökosystem. Über eine einheitliche API kannst du problemlos zwischen Erkennung, Instanzsegmentierung, Posenschätzung, Bildklassifizierung und orientierten Begrenzungsrahmen (OBB) wechseln.
So einfach ist es, mit dem Ultralytics Python-Paket YOLO26 zu trainieren und Inferenz auszuführen:
from ultralytics import YOLO
# Load the state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset with minimal memory footprint
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run ultra-fast NMS-free inference
predictions = model.predict("image.jpg")Fazit#
Die Untersuchung von DAMO-YOLO vs. EfficientDet bietet zwar wertvolle Einblicke in die Zielkonflikte zwischen Neural Architecture Search und zusammengesetzter Skalierung, moderne Entwickler benötigen jedoch Werkzeuge, die die Lücke zwischen akademischer Forschung und den Anforderungen der Produktion schließen.
Für Entwickler, die Wert auf Benutzerfreundlichkeit, eine aktive Open-Source-Community und ein ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit ohne Kompromisse legen, ist Ultralytics YOLO26 die maßgebliche Wahl. Die NMS-freie Architektur, der geringe Trainingsaufwand und die nahtlose Integration in das umfassende Ultralytics-Ökosystem machen es zum optimalen Framework für dein nächstes Computer-Vision-Projekt.