Ultralytics YOLO27:
Get Started

DAMO-YOLO im Vergleich zu YOLOv7#

Die rasante Entwicklung der Bildverarbeitung hat äußerst effiziente Objekterkennungsmodelle hervorgebracht, die Präzision und Rechenaufwand in Einklang bringen sollen. Zwei bemerkenswerte Modelle, die 2022 vorgestellt wurden, sind DAMO-YOLO und YOLOv7. Beide sollen die Grenzen von Echtzeit-Bildverarbeitungsaufgaben verschieben, erzielen ihre Ergebnisse jedoch mit grundverschiedenen Architekturkonzepten und Trainingsmethoden.

Dieser umfassende technische Vergleich untersucht die unterschiedlichen Ansätze beider Modelle. Architektur, Einsatzpotenzial und Leistungskennzahlen werden beleuchtet, damit Fachleute für maschinelles Lernen das richtige Werkzeug für ihre konkreten Anwendungen der Bildverarbeitung auswählen können.

Ursprung und Metadaten der Modelle#

Bevor wir uns der detaillierten technischen Analyse widmen, sollten wir zunächst die Entstehungsgeschichte dieser beiden Bildverarbeitungsmodelle einordnen.

DAMO-YOLO#

DAMO-YOLO wurde von Forschenden der Alibaba Group entwickelt, um Geschwindigkeit und Genauigkeit mithilfe automatisierter Architektursuche und Destillation zu optimieren.

Mehr über DAMO-YOLO erfahren

YOLOv7#

YOLOv7 wurde Mitte 2022 als damals führendes Modell veröffentlicht und verbesserte die Echtzeit-Inferenz durch trainierbare „kostenlose Verbesserungen“, ohne die Bereitstellungskosten zu erhöhen.

Mehr über YOLOv7 erfahren

Ultralytics-Unterstützung

Ultralytics veröffentlicht keine YOLOv7-Gewichte oder YAML-Dateien. Daher kann YOLOv7 nicht nativ mit dem Ultralytics-Paket trainiert werden. Im ursprünglichen Repository trainierte YOLOv7-Modelle können nach ONNX oder TensorRT exportiert und mit Ultralytics für die Inferenz ausgeführt werden.

Architektonische Innovationen#

DAMO-YOLO: NAS und Destillation#

DAMO-YOLO umfasst mehrere hochmoderne Techniken, die auf maximale Effizienz ausgelegt sind:

  • NAS-Backbones: Nutzt die Suche nach neuronalen Architekturen (NAS), um automatisch optimale Backbones (MAE-NAS) für Umgebungen mit hohen Anforderungen an die Latenz zu entwerfen.
  • Effizientes RepGFPN: Ein modifiziertes verallgemeinertes Merkmals-Pyramidennetzwerk, das die Effizienz der Merkmalsfusion über mehrere Skalen hinweg deutlich verbessert.
  • ZeroHead und AlignedOTA: Umfasst einen schlanken Erkennungskopf und eine optimierte Labelzuweisungsstrategie (AlignedOTA), um den Rechenaufwand zu verringern.
  • Verbesserung durch Destillation: Nutzt beim Training umfassend Wissensdestillation, um die Leistung kleinerer Modellvarianten zu steigern, ohne ihre Parameterzahl zu erhöhen.

YOLOv7: E-ELAN und kostenlose Verbesserungen#

YOLOv7 verfolgt einen stärker auf die Struktur ausgerichteten technischen Ansatz, bei dem die Optimierung der Gradientenpfade und robuste Trainingsstrategien im Mittelpunkt stehen.

  • E-ELAN-Architektur: Das erweiterte effiziente Schichtaggregationsnetzwerk ermöglicht dem Modell, vielfältigere Merkmale zu erlernen, indem die kürzesten und längsten Gradientenpfade kontrolliert werden. So wird ein effektiver Lernfortschritt sichergestellt.
  • Modellskalierung: Führt eine zusammengesetzte Skalierungsmethode für Modelle ein, die auf Verkettung beruhen. Dabei werden Tiefe und Breite gleichzeitig skaliert, um die strukturelle Ausrichtung zu gewährleisten.
  • Trainierbare kostenlose Verbesserungen: Nutzt Techniken wie reparametrisierte Faltungen (RepConv) ohne Identitätsverbindungen und dynamische Strategien zur Labelzuweisung. Dadurch wird die Genauigkeit während des Trainings erhöht, ohne die Inferenzgeschwindigkeit zu beeinträchtigen.

Leistungsanalyse#

Beim Vergleich der mittleren durchschnittlichen Präzision (mAP), der Geschwindigkeit und der Effizienz erzielen beide Modelle beeindruckende Werte, richten sich jedoch an etwas unterschiedliche Anwendungsbereiche. YOLOv7 konzentriert sich stark auf eine hochpräzise Bereitstellung auf GPUs, während die von NAS abgeleiteten Strukturen von DAMO-YOLO auf eine besonders niedrige Latenz bei der Bereitstellung auf CPUs und Edge-Geräten abzielen.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Wie die Kennzahlen zeigen, bietet DAMO-YOLO zwar extrem kompakte Varianten, etwa das Tiny-Modell mit nur 8,5 Millionen Parametern, doch YOLOv7 erzielt insgesamt eine höhere maximale Genauigkeit. YOLOv7x erreicht auf dem COCO-Datensatz beeindruckende 53,1 mAP.

Die Vorteile des Ultralytics-Ökosystems#

Auch wenn die Architektur in der Theorie wichtig ist, entscheidet das Ökosystem über die Praxistauglichkeit eines Modells. Native Ultralytics-Modelle wie YOLO26 profitieren von einem gut gepflegten Ökosystem und einer unübertroffenen Benutzerfreundlichkeit.

  • Ausgewogene Leistung: Ultralytics-Modelle bieten durchgehend einen optimalen Kompromiss zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit. Dadurch eignen sie sich sowohl für Edge-Geräte als auch für die cloudbasierte Modellbereitstellung.
  • Speicherbedarf: Anders als umfangreichere Transformer-Modelle benötigen Ultralytics-YOLO-Modelle während des Trainings nur wenig CUDA-Speicher. Dadurch sind größere Batchgrößen möglich, was den Trainingsprozess selbst auf handelsüblicher Hardware effizienter macht.
  • Vielseitigkeit: Das Ultralytics-Framework unterstützt neben der Objekterkennung auch Aufgaben wie Instanzsegmentierung und Posenschätzung und bietet Entwicklern damit ein umfassendes Werkzeugset für die Bildverarbeitung.
Trainingseffizienz

Mit dem Ultralytics-Paket kannst du in wenigen Minuten nahtlos vom Datensatz zum vollständig trainierten Modell gelangen. Dabei kommen hochoptimierte Datenlader und vortrainierte Gewichte zum Einsatz.

Codebeispiel: YOLOv7 mit Ultralytics ausführen#

Nachdem du einen YOLOv7-ONNX-Export wie in den YOLOv7-Anwendungsbeispielen beschrieben konvertiert hast, kannst du ihn mit der Ultralytics-Python-API ausführen.

from ultralytics import YOLO

# Ein für Ultralytics konvertiertes YOLOv7-ONNX-Modell laden
model = YOLO("yolov7-ultralytics.onnx", task="detect")

# Inferenz ausführen
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

Der neue Standard: YOLO26#

YOLOv7 und DAMO-YOLO waren 2022 wichtige Durchbrüche, doch die Bildverarbeitung mit KI entwickelt sich rasant weiter. Für Teams, die heute neue Projekte beginnen, wird das hochmoderne Ultralytics YOLO26 empfohlen, das im Januar 2026 veröffentlicht wurde.

YOLO26 stellt eine neue Leistungsgeneration dar und bietet eine bessere Benutzerfreundlichkeit. Dafür wurden hochmoderne Neuerungen integriert:

  • End-to-End-Design ohne NMS: YOLO26 bietet einen nativen End-to-End-Head (nms=False). Da die Nachverarbeitung durch Non-Maximum Suppression (NMS) entfällt, ermöglicht das Modell eine schnellere und einfachere Bereitstellungslogik – ein Paradigmenwechsel, den YOLOv10 erstmals eingeführt hat.
  • MuSGD-Optimierer: Inspiriert von Neuerungen bei großen Sprachmodellen wie Kimi K2 von Moonshot AI, kombiniert YOLO26 SGD und Muon. Dieser Optimierer sorgt für eine äußerst stabile Trainingsdynamik und eine deutlich schnellere Konvergenz.
  • Bis zu 43 % schnellere Inferenz auf CPUs: Durch den gezielten Wegfall von Distribution Focal Loss (DFL) und umfassende strukturelle Verbesserungen ist YOLO26 stark auf Edge Computing mit geringem Stromverbrauch optimiert und übertrifft frühere Generationen auf Hardware ohne GPU.
  • ProgLoss + STAL: Umfasst neue, fortgeschrittene Verlustfunktionen, die gezielt die Erkennung kleiner Objekte verbessern. Diese Fähigkeit ist für Anwendungen mit Luftbildern, in der Robotik und bei der Sicherheitsüberwachung entscheidend.
  • Aufgabenspezifische Verbesserungen: Neben der Standarderkennung bietet YOLO26 gezielte Verbesserungen für verschiedene Aufgaben, darunter Prototyping mit mehreren Skalen für die Segmentierung, RLE für die Posenschätzung und spezielle Winkelfunktionen für orientierte Begrenzungsrahmen (OBB).

Ideale Anwendungsfälle#

Die Wahl der richtigen Architektur hängt vollständig von der Zielumgebung für die Bereitstellung und den Projektbeschränkungen ab.

Wann DAMO-YOLO die richtige Wahl ist:

  • Du arbeitest in stark eingeschränkten Edge-Umgebungen mit begrenzten Ressourcen, in denen die reine Parameterzahl äußerst niedrig sein muss (z. B. bei Mikrocontrollern).
  • Du nutzt automatisierte Pipelines für maschinelles Lernen, die speziell in die proprietären Cloud-Dienste von Alibaba integriert sind.

Wann YOLOv7 die richtige Wahl ist:

  • Du hast ältere GPU-Pipelines, die bereits für ankerbasierte Inferenz mit hoher Genauigkeit optimiert sind.
  • Du arbeitest in Umgebungen, in denen Genauigkeit in Echtzeit von größter Bedeutung ist, etwa bei Hochgeschwindigkeits-autonomen Fahrzeugen oder fortschrittlicher Robotik.

Wann du YOLO26 wählen solltest (empfohlen):

  • Du entwickelst eine neue Computer-Vision-Anwendung von Grund auf und benötigst sowohl bei der Präzision als auch bei der Inferenzgeschwindigkeit auf CPU und Edge-Geräten den absoluten Spitzenstandard.
  • Du benötigst eine schnelle, nahtlose Bereitstellung (etwa durch den Export nach CoreML oder TensorRT), ohne dich mit Einschränkungen von NMS-Operatoren befassen zu müssen.
  • Du möchtest die Möglichkeiten der Ultralytics Platform für Cloud-Training, Datensatzverwaltung und automatisierte Bereitstellung voll ausschöpfen.

Mit dem robusten Ökosystem der Ultralytics-Modelle können Entwickler den Entwicklungsaufwand drastisch reduzieren und gleichzeitig eine erstklassige Vorhersageleistung für reale Anwendungen erzielen.

Kommentare