Ultralytics YOLO27:
Get Started

RTDETRv2 im Vergleich zu DAMO-YOLO#

Die Bildverarbeitung entwickelt sich ständig weiter. Forschende und Entwickler arbeiten daran, Modelle zu entwickeln, die Geschwindigkeit, Genauigkeit und Effizienz optimal vereinen. Zwei prominente Architekturen in diesem Bereich sind RTDETRv2 von Baidu und DAMO-YOLO von Alibaba Group. Beide Modelle erweitern die Möglichkeiten der Echtzeit-Objekterkennung, verfolgen dabei jedoch grundlegend unterschiedliche Architekturansätze, um ihre beeindruckenden Ergebnisse zu erzielen.

In diesem technischen Vergleich sehen wir uns die Architekturen, Trainingsmethoden und Möglichkeiten für den Praxiseinsatz genauer an. Außerdem vergleichen wir diese Modelle mit dem umfassenderen Ökosystem, insbesondere der hochoptimierten Ultralytics Platform und der hochmodernen YOLO26-Architektur.

Architektonische Innovationen#

Für Entwickler im Bereich maschinelles Lernen, die das richtige Werkzeug für den Produktionseinsatz auswählen müssen, ist es entscheidend, die Funktionsweise dieser Modelle zu verstehen.

RTDETRv2: der Transformer-Ansatz#

Aufbauend auf dem Erfolg des ursprünglichen RT-DETR nutzt RTDETRv2 einen hybriden Encoder und einen Transformer-Decoder. Dank dieses Aufbaus kann das Modell den globalen Kontext besonders effektiv verarbeiten und überlappende Objekte in dicht besetzten Szenen außergewöhnlich gut unterscheiden. Der wichtigste Vorteil dieser Architektur ist ihr nativer Verzicht auf NMS (Non-Maximum Suppression). Da der NMS-Nachbearbeitungsschritt entfällt, vereinfacht RTDETRv2 die Inferenzpipeline und sorgt bei unterschiedlichen Hardwarekonfigurationen für eine stabilere Latenz.

Erfahre mehr über RTDETRv2

DAMO-YOLO: höhere CNN-Effizienz#

DAMO-YOLO bleibt dagegen der äußerst erfolgreichen CNN-basierten YOLO-Modellfamilie treu, führt aber mehrere bahnbrechende Verbesserungen ein. Das Modell nutzt Neuralarchitektursuche (NAS), um sein Backbone zu optimieren und eine maximale Effizienz bei der Merkmalsextraktion zu gewährleisten. Außerdem kommen ein effizientes RepGFPN (parametrisiertes generalisiertes Merkmalsnetzwerk in Pyramidenform) und ein ZeroHead-Design sowie AlignedOTA und Verfahren zur Verbesserung der Destillation zum Einsatz. Diese Neuerungen ermöglichen DAMO-YOLO eine schnelle Inferenz bei gleichzeitig sehr wettbewerbsfähigem mAPval-Wert.

Mehr über DAMO-YOLO erfahren

Unterschiede in der Architektur

RTDETRv2 setzt auf Aufmerksamkeitsmechanismen, um den globalen Merkmalskontext ohne NMS zu erfassen. DAMO-YOLO maximiert dagegen mit NAS und fortgeschrittener Destillation die Effizienz herkömmlicher CNNs. Dafür ist eine standardmäßige Nachbearbeitung erforderlich, die Architektur bietet jedoch auf bestimmter Hardware deutliche Geschwindigkeitsvorteile.

Leistungs- und Metrikvergleich#

Bei der Bewertung von Modellen für den Einsatz sind Leistungskennzahlen wie die mittlere durchschnittliche Präzision (mAP), die Inferenzgeschwindigkeit und die Parameterzahl entscheidend. Unten findest du einen detaillierten Vergleich der beiden Modellfamilien.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Analyse der Ergebnisse#

Wie die Tabelle zeigt, erzielt RTDETRv2-x mit einem mAPval von 54,3 die höchste Genauigkeit. Das belegt die Stärke der Transformer-Architektur bei anspruchsvollen Validierungen mit dem COCO-Datensatz. Dafür benötigt das Modell allerdings deutlich mehr Parameter (76M) und FLOPs.

DAMO-YOLOt (Tiny) ist dagegen außergewöhnlich leichtgewichtig und benötigt nur 8,5M Parameter. Dadurch eignet es sich besonders für Umgebungen, in denen der CUDA-Speicher stark begrenzt ist. Für ältere Edge-Geräte bietet DAMO-YOLO in der Regel einen guten Kompromiss zwischen Geschwindigkeit und Genauigkeit.

Ökosystem, Benutzerfreundlichkeit und der Vorteil von Ultralytics#

Unabhängige Repositories wie das offizielle RT-DETR-GitHub-Repository und das DAMO-YOLO-GitHub-Repository stellen zwar den Rohcode zum Trainieren dieser Modelle bereit, doch für die Integration in Produktionspipelines sind oft umfangreicher Boilerplate-Code und manuelle Optimierungen erforderlich.

Hier vereinfacht das Ultralytics-Ökosystem die Entwicklererfahrung erheblich. Ultralytics integriert Transformer-Detektoren wie das ursprüngliche RT-DETR direkt in eine einheitliche API. So kannst du Modelle mit einer einzigen Codezeile trainieren, validieren und exportieren. Außerdem benötigen Ultralytics-Modelle beim Training bekanntermaßen weniger Speicher als umfangreiche, eigenständige Transformer-Repositories.

Codebeispiel: nahtlose Integration#

So einfach kannst du die Ultralytics-Python-Bibliothek für die Inferenz nutzen. Die API bleibt gleich, egal ob du ein Transformer-Modell oder ein hochmodernes CNN verwendest.

from ultralytics import RTDETR, YOLO

# Ein RT-DETR-Modell für das Verständnis komplexer Szenen laden
model_rtdetr = RTDETR("rtdetr-l.pt")

# Das neueste Ultralytics YOLO26-Modell für optimale Leistung am Edge laden
model_yolo26 = YOLO("yolo26n.pt")

# Ganz einfach eine Beispielbild-Inferenz ausführen
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Ergebnisse anzeigen
results_yolo[0].show()
Modelle für den Produktionseinsatz exportieren

Mit der Ultralytics API kannst du deine trainierten Modelle ganz einfach mit einem einzigen Befehl model.export(format="engine") in Formate wie TensorRT, ONNX oder CoreML exportieren und so den Aufwand für die Bereitstellung drastisch reduzieren.

Ideale Anwendungsfälle#

Die Wahl zwischen diesen Architekturen hängt ganz von deinen konkreten Projektanforderungen ab:

  • RTDETRv2 eignet sich besonders für die serverseitige Verarbeitung mit reichlich VRAM. Dank seines Verständnisses des globalen Kontexts ist das Modell ideal für medizinische Bildgebung und die Analyse dichter Menschenmengen, in denen häufig Verdeckungen auftreten.
  • DAMO-YOLO eignet sich besonders für IoT-Anwendungen mit eingebetteten Systemen und schnelle industrielle Inspektionslinien, bei denen eine geringe Parameterzahl und eine hohe FPS-Rate zwingend erforderlich sind.

Die Zukunft: Ultralytics YOLO26#

RTDETRv2 und DAMO-YOLO haben beide ihre Stärken, doch die Bildverarbeitung entwickelt sich rasant weiter. Für neue Projekte steht das neueste Ultralytics YOLO26 für die optimale Verbindung aus Geschwindigkeit, Genauigkeit und Benutzerfreundlichkeit für Entwickler.

YOLO26 nutzt ein End-to-End-Design ohne NMS und bietet damit den wichtigsten Vorteil von Transformern, ohne deren enormen Rechenaufwand mitzubringen. Der innovative MuSGD-Optimierer – inspiriert vom Training großer Sprachmodelle (Large Language Model) – sorgt für eine stabile und schnelle Konvergenz. Dank des Weglassens von DFL (Distribution Focal Loss wird entfernt, um den Export zu vereinfachen und die Kompatibilität mit Edge- und Geräten mit geringem Energieverbrauch zu verbessern) erzielt YOLO26 außerdem eine bis zu 43 % schnellere CPU-Inferenz und ist damit unangefochten führend beim Edge Computing. Zusätzlich verbessert ProgLoss + STAL die Verlustfunktionen und steigert insbesondere die Erkennung kleiner Objekte – ein entscheidender Faktor für IoT, Robotik und Luftbilder.

Anders als Modelle, die ausschließlich auf Begrenzungsrahmen beschränkt sind, bietet die YOLO26-Familie eine unvergleichliche Vielseitigkeit. Sie unterstützt Aufgaben von der Instanzsegmentierung und Posenschätzung bis hin zu orientierten Begrenzungsrahmen (OBB). Alles lässt sich nahtlos über die intuitive Ultralytics Platform verwalten.

Modelldetails und Referenzen#

RTDETRv2#

  • Autoren: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang und Yi Liu
  • Organisation: Baidu
  • Datum: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub: RT-DETR-Repository

DAMO-YOLO#

Wenn du weitere Vergleiche ansehen möchtest, findest du in unseren Leitfäden zu RTDETRv2 im Vergleich zu YOLO11 und DAMO-YOLO im Vergleich zu YOLOv8 heraus, wie diese Modelle im Vergleich zu früheren Generationen der Ultralytics-Familie abschneiden.

Kommentare