Ultralytics YOLO27:
Get Started

RTDETRv2 vs. YOLOv9#

In der Computer Vision haben sich die Ansätze für Architekturen auf faszinierende Weise auseinanderentwickelt, vor allem bei Convolutional Neural Networks (CNNs) und Transformer-basierten Modellen. Beim Vergleich von RTDETRv2 und YOLOv9 bewerten Entwicklerinnen und Entwickler im Wesentlichen die Kompromisse zwischen globalen Aufmerksamkeitsmechanismen und programmierbaren Gradienteninformationen. Beide Modelle stehen für den Höhepunkt ihrer jeweiligen Ansätze und verschieben die Grenzen der Objekterkennung in Echtzeit.

Einführung in die Modelle#

RTDETRv2: Real-Time Detection Transformer#

RTDETRv2 wurde von Forschenden bei Baidu entwickelt und baut auf dem ursprünglichen RT-DETR auf. Ein „Bag-of-Freebies“-Ansatz verbessert den grundlegenden Real-Time Detection Transformer. Das Modell überwindet den traditionellen Engpass von Transformern – die Inferenzgeschwindigkeit – und macht sie so für Echtzeitanwendungen geeignet.

  • Autoren: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang und Yi Liu
  • Organisation: Baidu
  • Datum: 2024-07-24
  • Links: Arxiv, GitHub

Ein wesentliches Merkmal von RTDETRv2 ist das native durchgängige Design ohne NMS. Durch den vollständigen Verzicht auf die Unterdrückung nicht maximaler Werte (NMS) bei der Nachverarbeitung stabilisiert das Modell die Inferenzlatenz und vereinfacht die Bereitstellungspipeline. Der globale Aufmerksamkeitsmechanismus ermöglicht es dem Modell, komplexe Szenen und große Menschenmengen besonders gut zu erfassen, da es den gesamten Bildkontext gleichzeitig auswertet.

Erfahre mehr über RTDETRv2

YOLOv9: Programmierbare Gradienteninformationen#

YOLOv9 ist eine hocheffiziente CNN-basierte Architektur, die das Informationsengpassproblem tiefer neuronaler Netze angeht. Das Modell führt programmierbare Gradienteninformationen (PGI) und das verallgemeinerte effiziente Layer-Aggregationsnetzwerk (GELAN) ein.

YOLOv9 baut auf den bewährten Grundlagen des Convolutional Neural Network auf, maximiert aber die Parametereffizienz. Indem wichtige Informationen während der Vorwärtsverarbeitung erhalten bleiben, ermöglicht das Modell zuverlässige Gewichtsaktualisierungen und erzielt so eine äußerst leichte und zugleich sehr genaue Architektur. Anders als RTDETRv2 verwendet YOLOv9 jedoch weiterhin die standardmäßige NMS-Nachverarbeitung.

Mehr über YOLOv9 erfahren

Leistung und Ressourceneffizienz#

Bei der Bewertung dieser Modelle für den Produktionseinsatz ist es entscheidend, die mittlere durchschnittliche Präzision (mAP) gegen den Rechenaufwand abzuwägen. Die folgende Tabelle zeigt ihre Leistung auf dem MS-COCO-Datensatz.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Speicherbedarf und Trainingseffizienz#

Transformer wie RTDETRv2 benötigen beim Training bekanntermaßen viel Speicher. Häufig sind umfangreicher CUDA-Speicher und längere Trainingsläufe erforderlich, bis das Modell vollständig konvergiert. CNN-Architekturen wie YOLOv9 und andere Ultralytics-YOLO-Modelle verbrauchen dagegen deutlich weniger Speicher. So können Entwicklerinnen und Entwickler mit größeren Stapelgrößen auf Hardware für den Privatgebrauch trainieren.

Effizientes Training

Um die Hardware optimal zu nutzen, kannst du mit der Ultralytics Platform dein Cloud-Training effizient organisieren. Die Plattform richtet die Umgebung automatisch ein und ermittelt die optimale Stapelgröße.

Die Vorteile von Ultralytics: Ökosystem und Benutzerfreundlichkeit#

Die Recherche in eigenständigen Repositories, etwa auf den offiziellen GitHub-Seiten von RTDETRv2 oder YOLOv9, kann sehr lehrreich sein. Für den Produktionseinsatz sind jedoch Stabilität, Benutzerfreundlichkeit und ein gut gepflegtes Ökosystem entscheidend. Die Integration dieser Modelle über die Ultralytics-Python-API bietet ein nahtloses Entwicklererlebnis.

Einheitliche API und Vielseitigkeit#

Das Ultralytics-Framework nimmt dir die Komplexität des Ladens von Daten, der Datenerweiterung und des verteilten Trainings ab. Während das ursprüngliche RTDETRv2 ausschließlich auf Erkennung ausgerichtet ist, kannst du mit dem Ultralytics-Ökosystem problemlos zwischen Objekterkennung, Instanzsegmentierung und Posenschätzung wechseln.

from ultralytics import RTDETR, YOLO

# Ein YOLOv9-Modell mit eigenen Daten trainieren
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# Einfach zu RT-DETR wechseln, um komplexe Szenen auszuwerten
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# In produktionsreife Formate wie TensorRT exportieren
model_yolo.export(format="engine")

Dank ausführlicher Dokumentation, automatischer Experimenterfassung und nahtloser Exportmöglichkeiten in Formate wie ONNX, TensorRT und OpenVINO verkürzt Ultralytics die Zeit vom Prototyp bis zum Produktionseinsatz erheblich.

Ideale Anwendungsfälle#

Die Stärken von RTDETRv2#

Dank seines globalen Aufmerksamkeitsmechanismus ist RTDETRv2 besonders leistungsfähig bei der serverseitigen Verarbeitung und in Umgebungen, in denen globaler Kontext entscheidend ist. Das Modell eignet sich besonders für:

  • Medizinische Bildgebung: Erkennung subtiler Anomalien, bei denen der umgebende Kontext entscheidend ist.
  • Luftüberwachung: Erkennung kleiner Objekte in hochauflösenden Drohnenaufnahmen ohne die räumlichen Verzerrungen herkömmlicher CNN-Faltungen.
  • Analyse dicht gedrängter Menschenmengen: Verfolgung einzelner Personen, bei der starke Verdeckungen ankerbasierte Modelle normalerweise vor Probleme stellen.

Die Stärken von YOLOv9#

YOLOv9 ist besonders stark bei Edge-Deployments mit begrenzten Ressourcen. Dank seiner Recheneffizienz eignet es sich ideal für:

  • Robotik: Echtzeitnavigation und Hindernisvermeidung, wenn minimale Latenz erforderlich ist.
  • Smart-City-IoT: Einsatz auf Edge-Geräten wie NVIDIA Jetson zur Verkehrsüberwachung.
  • Industrielle Inspektion: Qualitätskontrolle an Hochgeschwindigkeitsfertigungsstraßen, für die eine hohe Bildrate (FPS) erforderlich ist.

Die Zukunft: Ultralytics YOLO26 kommt#

YOLOv9 und RTDETRv2 markieren zwar große Fortschritte, doch die Entwicklung ist rasant weitergegangen. Für moderne Deployments steht das neu veröffentlichte Ultralytics YOLO26 für die ideale Verbindung beider Architekturansätze.

YOLO26 vereint die Stärken von Transformern und CNNs und setzt damit einen neuen Standard:

  • End-to-End-Design ohne NMS: Wie RTDETRv2 unterstützt YOLO26 native End-to-End-Inferenz und überspringt die NMS-Nachverarbeitung mit nms=False. So werden Deployment-Pipelines schneller, einfacher und besser vorhersehbar.
  • MuSGD-Optimierer: Inspiriert von Trainingsverfahren für große Sprachmodelle (LLMs), etwa Kimi K2 von Moonshot AI, nutzt YOLO26 eine Kombination aus SGD und Muon. Das sorgt für außergewöhnliche Trainingsstabilität und schnelle Konvergenz in der Computer Vision.
  • Bis zu 43 % schnellere CPU-Inferenz: Im Gegensatz zu rechenintensiven Transformern ist YOLO26 stark für Edge-Computing und Geräte ohne GPUs optimiert.
  • Entfernung von DFL: Durch den Wegfall von Distribution Focal Loss wird der Modellgraph erheblich vereinfacht. Das gewährleistet einen zuverlässigen Export auf Edge-Geräte mit geringem Stromverbrauch und eingebettete neuronale Verarbeitungseinheiten (NPUs).
  • ProgLoss + STAL: Diese verbesserten Verlustfunktionen steigern die Erkennung kleiner Objekte deutlich – eine wichtige Eigenschaft für IoT- und Luftbilddatensätze.

Teams, die ein neues Computer-Vision-Projekt starten möchten, empfehlen wir ausdrücklich, YOLO26 zu evaluieren. Das Modell verbindet die optionale NMS-freie Eleganz eines Transformers mit der enormen Geschwindigkeit und Trainingseffizienz einer stark optimierten YOLO-Architektur.

Zusammenfassung#

Die Wahl zwischen RTDETRv2 und YOLOv9 hängt vor allem von deiner Deployment-Hardware und den konkreten Genauigkeitsanforderungen ab. RTDETRv2 bietet Genauigkeit auf dem neuesten Stand der Technik und ein gutes Kontextverständnis für servergestützte Anwendungen, während YOLOv9 eine außergewöhnliche Effizienz auf Edge-Geräten erreicht.

Dank des ausgereiften Ultralytics-Ökosystems können Entwickler jedoch mühelos sowohl YOLOv9 als auch das ursprüngliche RT-DETR ausprobieren. Mit der Einführung neuerer Modelle wie YOLO11 und des nativ End-to-End-fähigen YOLO26 war es noch nie so einfach, die ideale Balance zwischen schneller Inferenz, vielseitiger Aufgabenunterstützung und geringem Speicherverbrauch zu finden.

Kommentare