YOLOv9 und RTDETRv2#
Die Landschaft der Echtzeit-Objekterkennung hat sich in den vergangenen Jahren grundlegend verändert. Zwei unterschiedliche Architekturansätze haben sich durchgesetzt: hochoptimierte Faltungsnetzwerke (CNNs) und Echtzeit-Detektions-Transformer (DETRs). YOLOv9 und RTDETRv2 stehen für die Spitzenleistungen dieser beiden Ansätze.
Dieser umfassende Leitfaden vergleicht die beiden leistungsstarken Modelle, untersucht ihre Architekturinnovationen und Leistungskennzahlen sowie ideale Einsatzszenarien, damit du das passende Modell für deine Computer-Vision-Pipeline auswählen kannst.
Zusammenfassung#
Beide Modelle erzielen Ergebnisse auf dem neuesten Stand der Technik, eignen sich jedoch für leicht unterschiedliche Einsatzbedingungen und Entwicklungsökosysteme.
- Wähle YOLOv9, wenn: Du eine besonders effiziente Parameternutzung und schnelle Inferenz auf Edge-Geräten benötigst. YOLOv9 lotet die theoretischen Grenzen der Effizienz von CNNs aus und eignet sich damit ideal für Umgebungen mit stark begrenzten Rechenressourcen.
- Wähle RTDETRv2, wenn: Du das differenzierte Kontextverständnis von Transformern benötigst, insbesondere bei Szenen mit starken Verdeckungen oder komplexen Objektbeziehungen, und über die Hardware für eine etwas umfangreichere Architektur verfügst.
- Wähle YOLO26 (empfohlen), wenn: Du das Beste aus beiden Welten möchtest. Als neueste Modellgeneration auf der Ultralytics Platform bietet YOLO26 ein optionales End-to-End-Design ohne NMS (
nms=False, ähnlich wie bei DETR-Modellen, aber deutlich schneller). Dadurch entfallen Engpässe bei der Nachverarbeitung und die CPU-Inferenz ist bis zu 43 % schneller als bei früheren Modellgenerationen.
Technische Daten und Urheberschaft#
Die Ursprünge und die Entwurfsziele dieser Modelle liefern wichtigen Kontext für ihre Architekturentscheidungen.
YOLOv9#
- Autoren: Chien-Yao Wang und Hong-Yuan Mark Liao
- Organisation: Institute of Information Science, Academia Sinica
- Datum: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- Autoren: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang und Yi Liu
- Organisation: Baidu
- Datum: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Architektonische Innovationen#
YOLOv9: Den Informationsengpass beheben#
YOLOv9 führt zwei wichtige Neuerungen ein, die den Informationsverlust beim Durchlaufen tiefer neuronaler Netze verhindern sollen:
- Programmierbare Gradienteninformation (PGI): Dieses Framework für zusätzliche Supervision stellt sicher, dass zuverlässige Gradienten zur Aktualisierung der Netzwerkgewichte erzeugt werden. So bleiben wichtige Merkmalsinformationen selbst in sehr tiefen Netzwerkschichten erhalten.
- Verallgemeinertes Netzwerk zur effizienten Layer-Aggregation (GELAN): Eine neuartige Architektur, die die Stärken von CSPNet und ELAN vereint. GELAN optimiert die Parametereffizienz und ermöglicht YOLOv9 so eine höhere Genauigkeit bei weniger FLOPs als herkömmliche CNNs.
RTDETRv2: Leistungsfähigere Transformer für Echtzeitanwendungen#
Aufbauend auf dem Erfolg des ursprünglichen RT-DETR nutzt RTDETRv2 eine Transformer-basierte Architektur, die von sich aus ohne Non-Maximum-Unterdrückung (NMS) auskommt. Zu den Verbesserungen gehören:
- Strategie kostenloser Verbesserungen: Die Version 2 umfasst fortschrittliche Trainingstechniken und Datenerweiterungen, die die Genauigkeit deutlich steigern, ohne die Inferenzlatenz zu erhöhen.
- Effizienter hybrider Encoder: Durch die Verarbeitung von Merkmalen verschiedener Maßstäbe mittels eines entkoppelten Aufmerksamkeitsmechanismus innerhalb und zwischen den Maßstäben bewältigt RTDETRv2 effizient den traditionell hohen Rechenaufwand von Vision Transformers.
Während RTDETRv2 Transformer für eine Erkennung ohne NMS nutzt, erreicht die neue YOLO26-Architektur dies mit einem optionalen One-to-one-Head (nms=False) innerhalb einer stark optimierten CNN-Struktur. So ermöglicht sie eine ebenso unkomplizierte Bereitstellung, aber mit deutlich höherer Inferenzgeschwindigkeit auf Edge-Geräten.
Leistungsvergleich#
Bei der Bewertung von Modellen für den Produktiveinsatz ist der Kompromiss zwischen Genauigkeit und Rechenaufwand entscheidend. Die folgende Tabelle zeigt die Leistung verschiedener Modellgrößen anhand standardisierter Benchmarks.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Analyse#
Wie die Daten zeigen, hat YOLOv9 bei der Parametereffizienz einen klaren Vorteil. Das Modell YOLOv9c erreicht mit nur 25,5 Mio. Parametern beeindruckende 53,0 mAP und ist damit äußerst kompakt.
Im Gegensatz dazu ist RTDETRv2 bei mittelgroßen und großen Modellen ein starker Konkurrent. Dies geht jedoch mit einer höheren Parameterzahl und deutlich mehr FLOPs einher, wie es für Transformer-Modelle typisch ist. Dieser Architekturunterschied wirkt sich auch auf den Speicherbedarf aus: YOLO-Modelle benötigen beim Training und bei der Inferenz in der Regel deutlich weniger CUDA-Speicher als ihre Transformer-Pendants.
Der Vorteil von Ultralytics: Ökosystem und Vielseitigkeit#
Neben den reinen Architekturkennzahlen ist oft das Softwareökosystem entscheidend für den Erfolg eines KI-Projekts. Der Zugriff auf diese fortschrittlichen Modelle über die Ultralytics Python API bietet unvergleichliche Vorteile.
Einfacheres Training und Bereitstellen#
Für das Training eines Detection Transformers sind in der Regel komplexe Konfigurationsdateien und leistungsstarke GPUs erforderlich. Mit dem Ultralytics-Framework kannst du sowohl YOLOv9- als auch RT-DETR-Modelle mit derselben einfachen Syntax trainieren und von hocheffizienten Trainingsabläufen sowie leicht verfügbaren vortrainierten Gewichten profitieren.
from ultralytics import RTDETR, YOLO
# Ein YOLOv9-Modell trainieren
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Ein RTDETR-Modell mit genau derselben API trainieren
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Modelle nahtlos nach OpenVINO oder TensorRT exportieren
model_yolo.export(format="openvino")Unübertroffene Vielseitigkeit bei Aufgaben#
Eine wesentliche Einschränkung spezialisierter Modelle wie RTDETRv2 ist ihre Beschränkung auf die Erkennung von Begrenzungsrahmen. Im Gegensatz dazu unterstützt das breiter aufgestellte Ultralytics-Ökosystem mit Modellen wie YOLO11 und YOLOv8 ein breites Spektrum an Computer-Vision-Aufgaben. Dazu gehören die pixelgenaue Instanzsegmentierung, die skelettbasierte Posenschätzung, die Klassifizierung ganzer Bilder und die Erkennung orientierter Begrenzungsrahmen (OBB) in Luftaufnahmen.
Anwendungen in der Praxis#
Hochgeschwindigkeitsanalysen am Rand des Netzwerks#
Für Einzelhandelsumgebungen oder Fertigungslinien, in denen Produkte in Echtzeit auf Edge-Geräten erkannt werden müssen, ist YOLOv9 die bessere Wahl. Die GELAN-Architektur ermöglicht einen hohen Durchsatz auf leistungsschwacher Hardware wie der NVIDIA-Jetson-Serie. So wird eine automatisierte Qualitätskontrolle ohne nennenswerte Verzögerung möglich.
Analyse komplexer Szenen#
In Szenarien wie der Überwachung dicht gedrängter Menschenmengen oder komplexer Verkehrskreuzungen, an denen sich Objekte häufig gegenseitig verdecken, spielen die globalen Aufmerksamkeitsmechanismen von RTDETRv2 ihre Stärken aus. Da das Modell den gesamten Bildkontext von sich aus einbezieht, kann es Objekte auch dann zuverlässig verfolgen und erkennen, wenn sie teilweise verdeckt sind.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOv9 und RT-DETR hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Präferenzen beim Softwareökosystem ab.
Wann du YOLOv9 wählen solltest#
YOLOv9 ist eine gute Wahl für:
- Forschung zu Informationsengpässen: Akademische Projekte, die programmierbare Gradienteninformationen (PGI) und Architekturen mit effizienten, verallgemeinerten Schichtaggregationsnetzwerken (GELAN) untersuchen.
- Studien zur Optimierung des Gradientenflusses: Forschung, die darauf abzielt, Informationsverluste in tiefen Netzwerkschichten während des Trainings zu verstehen und zu verringern.
- Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Vergleichsmaßstab für Architekturvergleiche benötigt wird.
Wann du RT-DETR wählen solltest#
RT-DETR empfiehlt sich für:
- Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
- Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
- Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Die Zukunft: YOLO26 kommt#
YOLOv9 und RTDETRv2 sind zwar bedeutende Erfolge, doch das Feld der Computer Vision entwickelt sich rasant weiter. Für Entwickler, die neue Projekte starten möchten, ist YOLO26 die empfohlene Lösung auf dem neuesten Stand der Technik.
YOLO26 wurde 2026 veröffentlicht und vereint die besten Eigenschaften von CNNs und DETRs. Es bietet ein optionales End-to-End-Design ohne NMS (nms=False), das die NMS-Nachverarbeitung überflüssig macht – eine Technik, die erstmals in YOLOv10 eingeführt wurde. Außerdem verzichtet YOLO26 auf Distribution Focal Loss (DFL), um die Kompatibilität mit Edge-Geräten zu verbessern, und führt den revolutionären MuSGD-Optimierer ein. Dieser hybride Optimierer ist vom Training großer Sprachmodelle inspiriert (insbesondere von Kimi K2 von Moonshot AI) und sorgt für eine beispiellose Trainingsstabilität und schnellere Konvergenz.
YOLO26 kombiniert ProgLoss und STAL (Progressive Loss and Small-Target-Aware Label Assignment) für eine herausragende Erkennung kleiner Objekte und ermöglicht eine bis zu 43 % schnellere CPU-Inferenz. Damit festigt es seine Position als optimales Modell für moderne KI-Bereitstellungen.