YOLO11 und DAMO-YOLO im Vergleich#
Die Wahl der optimalen Architektur ist ein entscheidender Schritt in jedem Computer-Vision-Projekt. Dieser technische Leitfaden vergleicht zwei leistungsstarke Objekterkennungsmodelle umfassend: Ultralytics YOLO11 und DAMO-YOLO. Wir betrachten ihre architektonischen Neuerungen, Trainingsansätze und Praxistauglichkeit, damit du das richtige Werkzeug für deine Bereitstellungsanforderungen auswählen kannst.
Modellübersicht#
Ultralytics YOLO11#
YOLO11, entwickelt vom Ultralytics-Team, ist eine stark verfeinerte Weiterentwicklung der YOLO-Familie, bei der sowohl Genauigkeit als auch Effizienz umfassend optimiert wurden. Das Modell richtet sich an Forschende und Ingenieure, die ein einheitliches, produktionsreifes Ökosystem suchen, das von der Datensatzverwaltung bis zur Bereitstellung auf Edge-Geräten reicht.
- Autoren: Glenn Jocher und Jing Qiu
- Organisation: Ultralytics
- Datum: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Dokumentation: https://docs.ultralytics.com/models/yolo11
YOLO11 überzeugt durch seine Vielseitigkeit. Während sich viele herkömmliche Modelle ausschließlich auf Begrenzungsboxen konzentrieren, unterstützt YOLO11 nativ Objekterkennung, Instanzsegmentierung, Bildklassifizierung und Posenschätzung. Dank dieser Multitasking-Fähigkeiten können Entwickler ihre KI-Pipelines für visuelle Daten in einem einzigen, aktiv gepflegten Framework zusammenführen.
DAMO-YOLO#
DAMO-YOLO wurde von Forschenden der Alibaba Group entwickelt. Das Modell nutzt die Suche nach neuronalen Architekturen (NAS), um hocheffiziente Backbones zu finden, die auf Echtzeitinferenz mit GPUs und anderen Beschleunigern zugeschnitten sind.
- Autoren: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang und Xiuyu Sun
- Organisation: Alibaba Group
- Datum: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
- Dokumentation: https://github.com/tinyvision/DAMO-YOLO/blob/master/README.md
Die Grundidee von DAMO-YOLO beruht auf Reparametrisierung und automatisierter Suche. Mithilfe von MAE-NAS (Maximum Entropy Neural Architecture Search) entwickelten die Autoren ein maßgeschneidertes Backbone, das die Inferenzgeschwindigkeit auf spezialisierter Hardware deutlich steigert. Außerdem kommen ein stark optimierter Neck namens Efficient RepGFPN und eine vereinfachte ZeroHead-Struktur zum Einsatz, um die Latenz zu verringern.
Beim Vergleich von YOLO11 und DAMO-YOLO lohnt sich auch ein Blick auf das neuere Ultralytics YOLO26. Das Modell bietet native End-to-End-Inferenz ohne NMS und erreicht bis zu 43 % höhere CPU-Geschwindigkeiten. Du kannst dir auch Vergleiche mit YOLOX oder YOLOv8 ansehen.
Vergleich von Leistung und Architektur#
Beim Einsatz von Edge-KI-Anwendungen ist es wichtig, die Leistungskompromisse zu verstehen. Die folgende Tabelle zeigt wichtige Messwerte wie die mittlere durchschnittliche Präzision (mAP), die Latenz und den Rechenaufwand.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Architekturanalyse#
YOLO11 basiert auf einem hocheffizienten, speziell entwickelten Backbone, das die Anzahl der Parameter und die Repräsentationskapazität optimal ausbalanciert. Das Modell ist für den Einsatz auf unterschiedlichster Hardware optimiert und zeichnet sich sowohl beim Training als auch bei der Inferenz durch einen geringen CUDA-Speicherbedarf aus. Damit ist es eine hervorragende Wahl für handelsübliche Hardware und IoT-Geräte mit begrenzten Ressourcen.
Die mit MAE-NAS erzeugten Backbones von DAMO-YOLO sind dagegen genau auf GPU-Umgebungen mit hohem Datendurchsatz abgestimmt. Der Efficient RepGFPN (Generalized Feature Pyramid Network) kombiniert mehrere Skalen besonders intensiv. Reparametrisierung beschleunigt zwar die Inferenz, kann die Bereitstellung jedoch erschweren, wenn dein Hardware-Stack diese Operationen nicht ausdrücklich unterstützt.
Benutzerfreundlichkeit und Trainingseffizienz#
Bei der Planung des Entwicklungsaufwands ist die Benutzerfreundlichkeit eines Modells genauso wichtig wie seine reinen Benchmarkwerte.
YOLO11 wurde mit besonderem Augenmerk auf die Zugänglichkeit für Entwickler entwickelt. Das umfassende Paket ultralytics übernimmt die aufwendige Verarbeitung von Datensätzen, die Datenerweiterung und die Optimierung von Hyperparametern. Der Export in Produktionsformate wie ONNX, TensorRT und OpenVINO erfordert nur einen einzigen Befehl.
from ultralytics import YOLO
# Ein YOLO11-Objekterkennungsmodell initialisieren
model = YOLO("yolo11s.pt")
# Das Modell mit gemischter Genauigkeit auf COCO8 trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Das trainierte Modell für die Bereitstellung auf Edge-Geräten nach TensorRT exportieren
model.export(format="engine", device=0)DAMO-YOLO stammt aus einem stark akademisch und wissenschaftlich geprägten Umfeld und ist daher schwieriger zu erlernen. Um die höchstmögliche Genauigkeit zu erreichen, sind häufig komplexe Wissensdestillations-Pipelines nötig. Das bedeutet, dass du zunächst ein großes „Lehrermodell“ trainierst und dessen Wissen anschließend an ein kleineres „Schülermodell“ weitergibst. Dadurch steigt der erforderliche GPU-Rechenaufwand und die gesamte Trainingsdauer erheblich gegenüber den schlanken Trainingsabläufen der Ultralytics-Modelle.
Anwendungsfälle und Empfehlungen#
Ob YOLO11 oder DAMO-YOLO besser geeignet ist, hängt von den konkreten Anforderungen deines Projekts, den Bereitstellungsbeschränkungen und deinen Präferenzen beim Ökosystem ab.
Wann du YOLO11 wählen solltest#
YOLO11 eignet sich besonders für:
- Bereitstellung auf Edge-Geräten im Produktionseinsatz: Kommerzielle Anwendungen auf Geräten wie Raspberry Pi oder NVIDIA Jetson, bei denen Zuverlässigkeit und aktive Wartung entscheidend sind.
- Vision-Anwendungen mit mehreren Aufgaben: Projekte, die Objekterkennung, Segmentierung, Posenschätzung und OBB innerhalb eines einheitlichen Frameworks erfordern.
- Schnelle Prototypentwicklung und Bereitstellung: Teams, die mithilfe der optimierten Ultralytics-Python-API schnell von der Datenerfassung zum Produktionseinsatz gelangen müssen.
Wann du DAMO-YOLO wählen solltest#
DAMO-YOLO eignet sich für:
- Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
- Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
- Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Anwendungen und Anwendungsfälle in der Praxis#
Autonome Systeme und Drohnen#
Für Luftbildaufnahmen und den Einsatz auf UAVs bietet YOLO11 ein besonders ausgewogenes Verhältnis von Leistung und Aufwand. Die Erkennung kleiner Objekte ist bei der Drohnenanalyse eine große Herausforderung, doch YOLO11 verarbeitet unterschiedliche Größen direkt ab Werk. Dank des geringen Speicherbedarfs können die Nano- und Small-Varianten von YOLO11 zudem direkt auf leichten Edge-CPUs oder an der Drohne montierten NPUs ausgeführt werden.
Industrielle Automatisierung und Qualitätskontrolle#
In intelligenten Fabriken ist eine geringe Latenz entscheidend. DAMO-YOLO bietet zwar dank seines RepGFPN-Necks eine hohe Inferenzgeschwindigkeit auf leistungsstarken Server-GPUs, doch die starre Integration kann überdimensioniert sein. Für die automatisierte Qualitätskontrolle ist YOLO11 oft die bessere Alternative: Das Modell bietet einfache Tracking-APIs und lässt sich nahtlos von der reinen Detektion auf Aufgaben der Erkennung orientierter Begrenzungsboxen (OBB) umstellen, wenn Defekte anhand abgewinkelter Begrenzungen erkannt werden müssen.
Intelligente Gesundheitsversorgung und medizinische Bildgebung#
Datensätze für die medizinische Bildgebung sind oft relativ klein, weshalb sich eine Überanpassung nur schwer vermeiden lässt. Die aktiven Datenerweiterungstechniken und die standardmäßigen Transfer-Learning-Pipelines aus dem gut gepflegten Ökosystem von Ultralytics helfen Ärzten und Entwicklern, zuverlässige Modelle zur Tumorerkennung bereitzustellen. Dank der großen Community werden Probleme in komplexen Bereichen wie dem Gesundheitswesen schnell gelöst.
Wenn du eine neue Anwendung von Grund auf entwickelst, solltest du YOLO26 in Betracht ziehen. Das Anfang 2026 veröffentlichte Modell nutzt den MuSGD-Optimierer und ProgLoss-Funktionen, erzielt eine außergewöhnliche Genauigkeit bei sehr kleinen Objekten und bietet einen nativen End-to-End-Inferenzmodus ohne NMS (nms=False).
DAMO-YOLO ist zwar weiterhin ein leistungsstarkes Beispiel für die Suche nach neuronalen Architekturen, doch für praktische Computer-Vision-Aufgaben empfehlen sich vor allem YOLO11 und die erweiterte Ultralytics-Produktfamilie. Sie bieten schnelle Bereitstellung, einfache Bedienung für Entwickler und erstklassige Multitasking-Leistung.