YOLOv7 und DAMO-YOLO im Vergleich#
Die Echtzeit-Objekterkennung entwickelt sich ständig weiter. Forschende und Ingenieure suchen nach dem optimalen Gleichgewicht zwischen Geschwindigkeit und Genauigkeit. In diesem technischen Vergleich sehen wir uns zwei bemerkenswerte Architekturen aus dem Jahr 2022 genauer an: YOLOv7 und DAMO-YOLO. Beide Modelle führten in der Computer-Vision-Community neue Konzepte ein und gingen dabei unterschiedliche Herausforderungen beim Modelltraining, Architekturdesign und der Bereitstellung an.
Hintergrund und technische Details der Modelle#
Bevor wir uns mit den Architekturen befassen, ist es wichtig, die Ursprünge der beiden Modelle zu verstehen. Beide wurden von führenden Forschungsgruppen entwickelt und führten fortschrittliche Methoden ein, um die Grenzen der Echtzeit-Objekterkennung zu erweitern.
YOLOv7-Details#
Als Weiterentwicklung der YOLO-Familie führte YOLOv7 das Konzept trainierbarer „Bag-of-Freebies“ ein, um die Genauigkeit deutlich zu verbessern, ohne die Inferenzkosten zu erhöhen.
- Autoren: Chien-Yao Wang, Alexey Bochkovskiy und Hong-Yuan Mark Liao
- Organisation: Institut für Informationswissenschaft, Academia Sinica, Taiwan
- Datum: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- Dokumentation: https://docs.ultralytics.com/models/yolov7
DAMO-YOLO im Detail#
DAMO-YOLO wurde von Forschenden der Alibaba Group entwickelt. Der Schwerpunkt lag auf der Suche nach neuronalen Architekturen (NAS) und fortschrittlicher Wissensdestillation, um hocheffiziente Modelle für verschiedene Hardware zu erstellen.
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
Architektonische Innovationen#
YOLOv7: Analyse von Gradientenpfaden und Reparametrisierung#
YOLOv7 setzt stark auf Extended Efficient Layer Aggregation Networks (E-ELAN). Die Autoren entwickelten E-ELAN durch die Analyse der Gradientenpfade des Netzwerks. So wird sichergestellt, dass das Netzwerk kontinuierlich lernen kann, ohne den ursprünglichen Gradientenpfad zu beeinträchtigen. Außerdem nutzt YOLOv7 bei der Inferenz die Modellreparametrisierung effektiv und führt Ebenen nahtlos zusammen, um die FLOPs zu verringern und die Ausführung zu beschleunigen. Dadurch eignet sich das Modell hervorragend für die Echtzeit-Inferenz auf modernen GPUs.
DAMO-YOLO: Suche nach neuronalen Architekturen und RepGFPN#
DAMO-YOLO verfolgt einen anderen Ansatz und nutzt intensiv die Suche nach neuronalen Architekturen (NAS) unter Latenzbeschränkungen. Das Framework MAE-NAS ermittelt optimale Backbones für bestimmte Hardware, beispielsweise Mobilgeräte oder spezielle Edge-Beschleuniger. Für den Neck kommt ein effizientes RepGFPN (reparametrisiertes, generalisiertes Feature-Pyramid-Netzwerk) zum Einsatz. Das ZeroHead-Design verringert die Rechenlast der Vorhersageköpfe.
YOLOv7 setzt auf starke inhärente Architekturoptimierungen, während DAMO-YOLO stark von einem komplexen, mehrstufigen Wissensdestillationsverfahren abhängt. Dafür muss ein großes Lehrermodell trainiert werden, um Wissen in ein kleineres Schülermodell zu übertragen. Das kann in der Trainingsphase rechenintensiv sein.
Leistungs- und Metrikvergleich#
Beim Vergleich dieser Modelle solltest du unbedingt mAP (mittlere durchschnittliche Präzision), Inferenzgeschwindigkeit und Modellkomplexität berücksichtigen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Die Tabelle oben zeigt, dass YOLOv7 auch bei hohen Genauigkeitsanforderungen gut skaliert (YOLOv7x), während DAMO-YOLO hochoptimierte winzige Modelle für Umgebungen mit begrenzten Ressourcen bietet.
Trainingseffizienz und Speicherbedarf#
Ein wichtiger Unterschied zwischen den beiden Architekturen liegt in ihren Trainingsmethoden. Da DAMO-YOLO auf Destillation setzt, erfordert das Training eines neuen Modells von Grund auf oder die Feinabstimmung mit einem benutzerdefinierten Computer-Vision-Datensatz oft deutlich mehr VRAM und GPU-Rechenzeit.
Im Gegensatz dazu sind nativ vom Ultralytics-Ökosystem unterstützte Modelle wie YOLOv8 und spätere Versionen stark auf einen geringeren Speicherbedarf optimiert. Entwickler können damit auf handelsüblicher Hardware größere Stapelgrößen verwenden, ohne dass der Speicher ausgeht. Das vereinfacht die Versuchsverfolgung und den Iterationsprozess.
Der Vorteil von Ultralytics#
YOLOv7 und DAMO-YOLO bieten zwar beide überzeugende Funktionen, doch die Bereitstellung von Modellen im Ultralytics-Ökosystem sorgt für ein unvergleichliches Entwicklungserlebnis.
- Einfache Bedienung: Das Ultralytics-Python-Paket bietet eine einheitliche, unkomplizierte API. Du kannst schnell zwischen Modellarchitekturen wechseln, Trainingsschleifen starten oder mit wenigen Codezeilen Inferenz ausführen.
- Gut gepflegtes Ökosystem: Ultralytics veröffentlicht regelmäßig Aktualisierungen und gewährleistet so native Kompatibilität mit den neuesten PyTorch-Versionen und CUDA-Treibern. Außerdem wird der Export von Modellen in Formate wie ONNX, TensorRT und OpenVINO vereinfacht.
- Vielseitigkeit: Anders als DAMO-YOLO, das ausschließlich der Objekterkennung dient, unterstützt das Ultralytics-Ökosystem von Haus aus vielfältige Aufgaben. Modelle der Ultralytics-Familie können herkömmliche Begrenzungsrahmen erkennen sowie Posenschätzung, Instanzsegmentierung und orientierte Begrenzungsrahmen (OBB) ausführen.
Codebeispiel: Schnell loslegen#
So einfach kannst du Ultralytics-Modelle laden, trainieren und für Inferenz verwenden:
from ultralytics import YOLO
# Ein vortrainiertes YOLO26-Modell laden (native YOLOv7-Gewichte werden von Ultralytics nicht unterstützt)
model = YOLO("yolo26n.pt")
# Das Modell mit automatischer Verwaltung der Hyperparameter auf dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Eine Inferenz auf einem Bild ausführen
predictions = model("https://ultralytics.com/images/bus.jpg")
# Für die Bereitstellung ins ONNX-Format exportieren
model.export(format="onnx")Mit Ultralytics exportierst du trainierte Gewichte in verschiedene hardwarebeschleunigte Formate wie TensorRT oder CoreML mit nur einem Argument im Exportbefehl. So sparst du dir stundenlange Arbeit an komplexen Skriptkonfigurationen.
Die nächste Generation: YOLO26#
YOLOv7 ist zwar nach wie vor eine leistungsstarke ältere Architektur, doch das Forschungsgebiet hat sich rasch weiterentwickelt. Für neue Bereitstellungen gilt Ultralytics YOLO26 (veröffentlicht im Januar 2026) als empfohlener Standard und übertrifft frühere Generationen bei nahezu allen Messwerten.
- End-to-End-Design ohne NMS: YOLO26, erstmals mit YOLOv10 eingeführt, kann mit seinem optionalen One-to-One-Kopf (
nms=False) auf die Nachverarbeitung durch Non-Maximum Suppression (NMS) verzichten. Das sorgt für deterministische Inferenz mit extrem niedriger Latenz, die für Robotik und Technologien für autonomes Fahren entscheidend ist. - MuSGD-Optimierer: Dieser hybride Optimierer, inspiriert von fortschrittlichen LLM-Trainingstechniken wie Kimi K2 von Moonshot AI, kombiniert SGD und Muon. So sorgt er über verschiedene Datensätze hinweg für äußerst stabiles Training und schnellere Konvergenz.
- Bis zu 43 % schnellere CPU-Inferenz: Durch den gezielten Verzicht auf Distribution Focal Loss (DFL) steigert YOLO26 die Leistung auf Edge-Computing-Plattformen und CPUs erheblich.
- ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich. Dadurch eignet sich YOLO26 besonders für Luftbilder und detaillierte Überwachung.
Ideale Anwendungsfälle#
Wann du DAMO-YOLO wählen solltest#
- Akademische Forschung zu NAS: Wenn sich deine Organisation intensiv mit der Erforschung von Methoden zur Suche nach neuronalen Architekturen befasst.
- Äußerst strenge Latenzvorgaben bei spezieller Hardware: Wenn du über die Ressourcen verfügst, umfassende NAS-Suchen durchzuführen, um ein maßgeschneidertes Backbone für einen speziellen KI-Beschleunigerchip zu finden.
Wann du YOLOv7 wählen solltest#
- Bestehende GPU-Pipelines: Für Teams, die bestehende Produktionspipelines betreuen, welche auf leistungsstarker NVIDIA-Hardware umfassend für die spezielle E-ELAN-Architektur von YOLOv7 optimiert wurden.
Warum du zu modernen Ultralytics-Modellen wechseln solltest (YOLO11 / YOLO26)#
Für die meisten Unternehmensanwendungen – von Einzelhandelsanalysen und intelligenter Fertigung bis hin zum Gesundheitswesen – sind moderne Ultralytics-Modelle unübertroffen. Die Integration mit der Ultralytics Platform bietet eine vollständige ML-Pipeline mit einfacher Bedienung, hervorragender Dokumentation, starker Unterstützung durch die Community und Vielseitigkeit für mehrere Aufgaben. Ob du den Lagerbestand auf einem Raspberry Pi verfolgst oder umfangreiche Analysen in der Cloud ausführst: Modelle wie YOLO26 bieten die ideale Leistungsbalance für die Zukunft der Computer Vision.