DAMO-YOLO und YOLOv6-3.0#
Die rasante Entwicklung der Computer Vision hat hochspezialisierte Architekturen für industrielle Anwendungen hervorgebracht. Zwei Schwergewichte zeichnen sich durch ihren Fokus auf Echtzeit-Leistung und effiziente Bereitstellung aus: DAMO-YOLO und YOLOv6-3.0. Diese Seite bietet einen eingehenden technischen Vergleich ihrer Architekturen, Leistungskennzahlen und Trainingsmethoden, damit du die passende Bereitstellung wählen kannst.
DAMO-YOLO: Neuronale Architektursuche trifft auf Objekterkennung#
DAMO-YOLO wurde von Forschern der Alibaba Group entwickelt und führt einen neuartigen Ansatz für die YOLO-Familie ein, indem die neuronale Architektursuche (NAS) umfassend in das Design des Backbones integriert wird.
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
Architektonische Innovationen#
DAMO-YOLO verwendet ein durch NAS optimiertes Backbone namens MAE-NAS, das automatisch nach optimalen Netzwerkstrukturen unter bestimmten Latenzbeschränkungen sucht. So lässt sich das Modell effizient an verschiedene Hardwareprofile anpassen. Zur verbesserten Merkmalsfusion nutzt die Architektur ein effizientes RepGFPN (parametrisiertes verallgemeinertes Merkmals-Pyramidennetzwerk), das die Darstellung auf mehreren Skalen deutlich verbessert.
Darüber hinaus führt das Modell ein „ZeroHead“-Design ein. Durch das Entfernen komplexer Strukturen mit mehreren Zweigen im Erkennungskopf bleiben räumliche Informationen besser erhalten, während der Rechenaufwand sinkt. Die Trainingsmethode nutzt außerdem AlignedOTA (zugewiesener optimaler Transport mit Ausrichtung) und eine robuste Wissensdestillation, sodass kleinere Schülermodelle von größeren Lehrernetzwerken lernen können.
Die Wissensdestillation verhilft DAMO-YOLO zwar zu hoher Genauigkeit, erfordert aber eine mehrstufige Trainingspipeline. Dadurch steigt der benötigte GPU-Rechenaufwand im Vergleich zum Training standardmäßiger einstufiger Modelle erheblich.
YOLOv6-3.0: Maximaler industrieller Durchsatz#
YOLOv6-3.0, entwickelt von der Meituan Vision AI Department, wird ausdrücklich als industrieller Objektdetektor bezeichnet und wurde speziell dafür konzipiert, den Durchsatz auf NVIDIA-Hardware zu maximieren.
- Autoren: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu und Xiangxiang Chu
- Organisation: Meituan
- Datum: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Wichtige Funktionen und Verbesserungen#
YOLOv6-3.0 basiert auf dem hardwarefreundlichen EfficientRep-Backbone und ist besonders schnell, wenn auf modernen GPUs Optimierungen wie TensorRT zum Einsatz kommen. In Version 3.0 integriert das Netzwerk ein bidirektionales Konkatenationsmodul (BiC), um die Lokalisierung unterschiedlich großer Objekte zu verbessern.
Ein weiteres herausragendes Merkmal ist die Strategie des ankerunterstützten Trainings (AAT). AAT vereint beim Training die Stabilität von ankerbasierten Detektoren mit der Inferenzgeschwindigkeit eines ankerfreien Designs. Dieser hybride Ansatz ermöglicht eine ausgezeichnete Konvergenz, ohne die Bereitstellungslatenz zu erhöhen. Damit eignet er sich besonders für die Verarbeitung riesiger Videodatenströme in der Smart-City-Analyse und an automatisierten Kassensystemen.
Leistungsvergleich#
Bei der Bewertung dieser Modelle für die Echtzeitinferenz ist es entscheidend, Parameterzahl, FLOPs und Genauigkeit gegeneinander abzuwägen. Im Folgenden findest du einen ausführlichen Leistungsvergleich.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
DAMO-YOLO hat in der kleinen Modellklasse einen leichten Vorsprung (46,0 mAP gegenüber 45,0 mAP). YOLOv6-3.0 lässt sich jedoch besser skalieren und liegt in den mittleren und großen Modellklassen vorn. Gleichzeitig hat das Nano-Modell von YOLOv6-3.0 die mit Abstand geringste Parameterzahl.
Wenn deine Hardwareumgebung umfangreiche automatisierte Suchen zur Anpassung des Backbones ermöglicht, ist der NAS-Ansatz von DAMO-YOLO sehr effektiv. Wenn du dich dagegen ausschließlich auf standardisierte GPU-Beschleunigung wie T4 oder A100 verlässt, erzielen die EfficientRep-Strukturen von YOLOv6 oft eine höhere reine Bildrate in FPS.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen DAMO-YOLO und YOLOv6 hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Präferenzen für das jeweilige Ökosystem ab.
Wann du DAMO-YOLO wählen solltest#
DAMO-YOLO eignet sich besonders für:
- Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
- Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
- Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.
Wann du YOLOv6 wählen solltest#
YOLOv6 empfiehlt sich für:
- Bereitstellung auf industrielle Hardware: Szenarien, in denen das hardwarebewusste Design und die effiziente Reparametrisierung des Modells eine optimierte Leistung auf bestimmter Zielhardware ermöglichen.
- Schnelle einstufige Erkennung: Anwendungen, bei denen die reine Inferenzgeschwindigkeit auf der GPU für die Echtzeit-Videoverarbeitung in kontrollierten Umgebungen entscheidend ist.
- Integration in das Meituan-Ökosystem: Teams, die bereits mit dem Technologie-Stack und der Bereitstellungsinfrastruktur von Meituan arbeiten.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Der Vorteil von Ultralytics: YOLO26 im Überblick#
DAMO-YOLO und YOLOv6-3.0 sind zwar beide leistungsfähige Modelle, doch ihre fragmentierten Ökosysteme, die Beschränkung auf einzelne Aufgaben und die komplexen Bereitstellungspipelines sind Nachteile. Für moderne Entwicklungsteams bieten Ultralytics-Modelle eine deutlich bessere Entwicklererfahrung, die im bahnbrechenden YOLO26 gipfelt.
Das im Januar 2026 veröffentlichte YOLO26 setzt neue Maßstäbe für Bereitstellungen am Edge und in der Cloud und optimiert insbesondere den Speicherbedarf sowie die Recheneffizienz.
Warum YOLO26 wählen?#
- End-to-End-Design ohne NMS: Aufbauend auf Konzepten aus YOLOv10 unterstützt YOLO26 native End-to-End-Inferenz, die dank eines optionalen Kopfes mit Eins-zu-eins-Zuordnung (
nms=False) die Nachverarbeitung durch Non-Maximum Suppression überspringt. Das vereinfacht den Bereitstellungscode erheblich und verringert die Schwankungen der Inferenzlatenz auf allen Edge-Geräten. - Überlegene Optimierung: YOLO26 verwendet den MuSGD Optimizer, eine Kombination aus SGD und Muon, die von großen Sprachmodellen inspiriert ist. Das ermöglicht äußerst stabile Trainingsläufe und eine schnellere Konvergenz.
- Vielseitigkeit bei der Hardware: Durch den Wegfall von DFL (Distribution Focal Loss) werden die Ausgabeköpfe vereinfacht, was die Kompatibilität mit Edge-Geräten verbessert. Tatsächlich erzielt YOLO26 eine bis zu 43 % schnellere CPU-Inferenz und ist damit YOLOv6 bei mobilen oder IoT-Edge-Umgebungen deutlich überlegen.
- Höhere Genauigkeit: Durch ProgLoss + STAL verbessert YOLO26 die Erkennung kleiner Objekte erheblich und ist damit die optimale Wahl für Luftbilder und die Fehlerprüfung.
- Unübertroffene Vielseitigkeit: Anders als Industriemodelle, die nur Begrenzungsrahmen erkennen, unterstützt die YOLO26-Familie mehrere Aufgaben, darunter Bildklassifizierung, Instanzsegmentierung, Posenschätzung und gedrehte Begrenzungsrahmen (OBB).
Nahtloses Arbeiten im Ökosystem#
Die Ultralytics Platform verändert den gesamten Lebenszyklus des maschinellen Lernens. Das Modelltraining ist keine mühsame, mehrstufige Destillation mehr. Dank automatischer Datenerweiterung, einheitlicher Abstimmung der Hyperparameter und Exporten mit nur einem Klick in Formate wie ONNX, OpenVINO und CoreML gelangst du in Stunden statt Wochen vom Datensatz zur Produktion.
Außerdem sind Ultralytics-Modelle für ihre Speichereffizienz bekannt. So umgehen sie die enormen VRAM-Engpässe, die Transformer-Architekturen wie RT-DETR plagen.
Schnellstart: Codebeispiel#
Das Training und die Inferenz mit einem Ultralytics-Modell wie YOLO26 sind denkbar einfach. Das folgende Python-Skript zeigt, wie du mit nur wenigen Codezeilen sofort trainieren, Inferenz ausführen und exportieren kannst:
from ultralytics import YOLO
# Das äußerst effiziente Nano-Modell YOLO26 laden
model = YOLO("yolo26n.pt")
# Das Modell nahtlos mit deinem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Inferenz mit einem Beispielbild ausführen
prediction = model("https://ultralytics.com/images/bus.jpg")
# Für maximalen GPU-Durchsatz nach TensorRT exportieren
model.export(format="engine", dynamic=True)Fazit#
DAMO-YOLO und YOLOv6-3.0 sind beeindruckende technische Leistungen, die die Grenzen der industriellen Objekterkennung erweitern. Es handelt sich jedoch um hochspezialisierte Werkzeuge, die oft komplexe Setups und starre Hardwarevorgaben erfordern.
Für Entwickler und Forscher, die eine optimale Balance zwischen Leistung und Effizienz, Unterstützung mehrerer Aufgaben und ein aktiv gepflegtes Ökosystem benötigen, ist Ultralytics YOLO26 unübertroffen. Durch die Verbindung von LLM-inspirierten Optimierern mit einer klaren Architektur, die Inferenz ohne NMS unterstützt, vereinfacht YOLO26 die Bereitstellung von KI und bietet zugleich modernste Genauigkeit in Edge- und Cloud-Umgebungen.
Wenn du Modelle für ein neues Computer-Vision-Projekt bewertest, empfehlen wir dir, die Möglichkeiten des Ultralytics-YOLO-Ökosystems zu erkunden. Für ein vollständiges Bild der Entwicklung von KI für Echtzeit-Bildverarbeitung lohnt sich möglicherweise auch ein Vergleich mit anderen Architekturen wie EfficientDet oder früheren Meilensteinen wie YOLO11.