RTDETRv2 vs. YOLO11#
Die Computer-Vision-Landschaft entwickelt sich ständig weiter. Neue Architekturen verschieben die Grenzen des Machbaren auf Edge-Geräten und Cloud-Servern. Zwei der derzeit wichtigsten Modelle im Bereich der Objekterkennung in Echtzeit sind RTDETRv2 und YOLO11. Beide Modelle bieten eine hervorragende Leistung, verfolgen jedoch grundlegend unterschiedliche Architekturansätze: den Transformer-basierten Ansatz und das hochoptimierte Convolutional Neural Network (CNN).
In diesem umfassenden technischen Vergleich betrachten wir die Architekturen, Leistungskennzahlen, Trainingsmethoden und idealen Anwendungsfälle beider Modelle. So kannst du eine fundierte Entscheidung für deine nächste Anwendung im Bereich künstliche Intelligenz treffen.
RTDETRv2: Der Transformer-basierte Herausforderer#
RTDETRv2 wurde als Weiterentwicklung des ursprünglichen Real-Time Detection Transformer eingeführt und nutzt Aufmerksamkeitsmechanismen zur Verarbeitung visueller Daten. Indem Bildausschnitte als Sequenzen behandelt werden, erfasst das Modell den Bildkontext ganzheitlich. Das ist besonders vorteilhaft, um stark überlappende Objekte in komplexen Szenen zu erkennen.
Modelldetails:
- Autoren: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang und Yi Liu
- Organisation: Baidu
- Datum: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR-Repository
- Dokumentation: RTDETRv2-Dokumentation
Stärken und Schwächen der Architektur#
Die wichtigste Neuerung von RTDETRv2 ist die durchgängige NMS-freie Architektur. Durch den Verzicht auf die Unterdrückung nicht maximaler Werte (NMS) wird die Nachverarbeitungspipeline vereinfacht. Außerdem wurde die Merkmalsextraktion über mehrere Maßstäbe im Vergleich zum ursprünglichen RT-DETR-Modell verbessert, sodass Objekte unterschiedlicher Größe besser erkannt werden.
Da RTDETRv2 auf Transformern basiert, benötigt es beim Training in der Regel deutlich mehr Speicher. Transformer konvergieren im Allgemeinen langsamer und benötigen erheblich mehr CUDA-Speicher als herkömmliche CNNs. Dadurch sind sie für Forschende mit Hardware für den Privatgebrauch oder für den Einsatz in ressourcenbeschränkten Edge-KI-Umgebungen weniger zugänglich.
Ultralytics YOLO11: Der Höhepunkt der CNN-Effizienz#
Aufbauend auf jahrelanger Grundlagenforschung veröffentlichte Ultralytics YOLO11 als großen Sprung in der Entwicklung der YOLO-Modelle. Die CNN-Architektur wurde weiterentwickelt, um eine beispiellose Geschwindigkeit und Genauigkeit zu erreichen. Dabei blieben die Flexibilität und das entwicklerfreundliche Ökosystem erhalten, die sich in der Community bewährt haben.
Modelldetails:
- Autoren: Glenn Jocher und Jing Qiu
- Organisation: Ultralytics
- Datum: 27. September 2024
- GitHub: Ultralytics-Repository
Der Vorteil von Ultralytics#
YOLO11 überzeugt durch seine ausgewogene Leistung. Das Modell bietet ein außergewöhnliches Verhältnis zwischen Geschwindigkeit und Genauigkeit und eignet sich dadurch für vielfältige Einsatzszenarien in der Praxis – von großen Clustern für Cloud-Computing bis hin zu leichten Mobilgeräten.
Ultralytics YOLO-Modelle sind außerdem für ihren geringeren Speicherverbrauch beim Training und bei der Inferenz bekannt. Anders als Transformer-Modelle, die den VRAM leicht vollständig belegen können, ermöglicht YOLO11 größere Stapelgrößen auf herkömmlichen GPUs. YOLO11 ist zudem nicht auf die reine Objekterkennung beschränkt, sondern äußerst vielseitig und bietet native Unterstützung für Instanzsegmentierung, Bildklassifizierung, Posenschätzung und orientierte Begrenzungsrahmen (OBB).
Leistungs- und Metrikvergleich#
Beim Vergleich der reinen Zahlen zeigt sich, dass RTDETRv2 zwar eine beeindruckende Genauigkeit erreicht, YOLO11 aber eine deutlich feinere Auswahl an Modellgrößen und höhere Inferenzgeschwindigkeiten bietet – insbesondere mit TensorRT.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Wie die Tabelle zeigt, erreicht das Modell YOLO11x einen höheren mAPval von 54,7 %, benötigt dabei weniger FLOPs (195,3B gegenüber 259B) und führt die Inferenz mit TensorRT schneller aus (11,3 ms gegenüber 15,03 ms) als die Variante RTDETRv2-x. Die Nano- und Small-Varianten von YOLO11 bieten besonders leichte Optionen für ressourcenbeschränkte Geräte wie den Raspberry Pi.
Ökosystem, Benutzerfreundlichkeit und Training#
Ultralytics-Modelle zeichnen sich vor allem durch ihre einfache Bedienung aus. Das Python-Paket ultralytics stellt eine einheitliche, intuitive API bereit, die aufwendige Aufgaben wie Datenerweiterung, verteiltes Training und den Modellexport übernimmt. Während das Forschungs-Repository von RTDETRv2 umfangreiche grundlegende Einrichtung und Konfiguration erfordert, bietet Ultralytics eine Pipeline, mit der du ganz einfach durchstarten kannst.
Das Ultralytics-Ökosystem ist so leistungsfähig, dass es RT-DETR-Modelle nativ neben YOLO-Modellen unterstützt. So kannst du das gut gepflegte Ökosystem von Ultralytics nutzen – einschließlich Integrationen mit Weights & Biases und Comet ML – und Experimente mühelos nachverfolgen.
from ultralytics import RTDETR, YOLO
# Ein RTDETR-Modell nahtlos über die Ultralytics-API laden
model_rtdetr = RTDETR("rtdetr-l.pt")
# Ein hochoptimiertes YOLO11-Modell laden
model_yolo = YOLO("yolo11n.pt")
# YOLO11 mit sehr geringem Speicherverbrauch trainieren
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Das trainierte YOLO-Modell ins ONNX-Format exportieren
model_yolo.export(format="onnx")Trainingseffizienz ist beim maschinellen Lernen entscheidend. Ultralytics-Modelle verwenden vortrainierte Gewichte und konvergieren schnell. Wenn du deine Datensätze, Trainingsläufe und Bereitstellungsendpunkte ohne Code verwalten möchtest, bietet die Ultralytics Platform eine integrierte MLOps-Erfahrung.
Anwendungen in der Praxis#
Die Wahl zwischen diesen Architekturen hängt oft von den konkreten Einschränkungen bei der Bereitstellung deines Projekts ab.
Stärken von RTDETRv2: Der Transformer-Backbone von RTDETRv2 eignet sich besonders für Szenarien mit zahlreichen, stark verdeckten Objekten, in denen der globale Kontext wichtig ist. Das Modell wird häufig in der akademischen Forschung und in Anwendungen untersucht, bei denen das Rechenbudget weniger wichtig ist als die Erfassung von Zusammenhängen durch Aufmerksamkeitsmechanismen.
Stärken von YOLO11: YOLO11 ist unbestritten die erste Wahl für praktische Anwendungen in der realen Welt. Der geringe Speicherbedarf und die extrem hohe Inferenzgeschwindigkeit machen das Modell ideal für:
- Intelligente Fertigung: Echtzeit-Fehlererkennung an Produktionslinien mit Industrie-PCs.
- Landwirtschaft: Einsatz auf Drohnen zur Überwachung des Erntezustands in Echtzeit und für automatisierte Ernte-Robotik.
- Einzelhandelsanalysen: Gleichzeitige Verarbeitung mehrerer Kamerastreams für das Warteschlangenmanagement und die Bestandsverfolgung – ganz ohne große Serverfarmen.
Anwendungsfälle und Empfehlungen#
Ob RT-DETR oder YOLO11 besser geeignet ist, hängt von den konkreten Projektanforderungen, den Einschränkungen bei der Bereitstellung und den Präferenzen für das Ökosystem ab.
Wann du RT-DETR wählen solltest#
RT-DETR eignet sich besonders für:
- Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
- Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
- Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.
Wann du YOLO11 wählen solltest#
YOLO11 wird empfohlen für:
- Bereitstellung auf Edge-Geräten im Produktionseinsatz: Kommerzielle Anwendungen auf Geräten wie Raspberry Pi oder NVIDIA Jetson, bei denen Zuverlässigkeit und aktive Wartung entscheidend sind.
- Vision-Anwendungen mit mehreren Aufgaben: Projekte, die Objekterkennung, Segmentierung, Posenschätzung und OBB innerhalb eines einheitlichen Frameworks erfordern.
- Schnelle Prototypentwicklung und Bereitstellung: Teams, die mithilfe der optimierten Ultralytics-Python-API schnell von der Datenerfassung zum Produktionseinsatz gelangen müssen.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Ausblick: YOLO26 kommt#
Wenn du ein neues Projekt startest, solltest du auch die nächste Generation der Computer Vision in Betracht ziehen: Ultralytics YOLO26. YOLO26 wurde im Januar 2026 veröffentlicht und vereint die besten Eigenschaften beider Ansätze. Das Modell führt einen optionalen End-to-End-Kopf ohne NMS ein (nms=False, erstmals in YOLOv10 eingesetzt), der wie RTDETRv2 auf die NMS-Nachverarbeitung verzichtet – und dabei die unübertroffene Geschwindigkeit eines CNN bietet.
YOLO26 verwendet den MuSGD-Optimierer, der von Innovationen beim Training großer Sprachmodelle inspiriert ist und eine äußerst stabile, schnelle Konvergenz ermöglicht. Durch den Wegfall des Distribution Focal Loss (DFL) erreicht das Modell eine um bis zu 43 % schnellere CPU-Inferenz. Die speziell entwickelten Verlustfunktionen ProgLoss + STAL verbessern die Erkennung kleiner Objekte erheblich. Damit ist YOLO26 die ideale Empfehlung für moderne Computer-Vision-Pipelines.
Ob du YOLO11 wegen seiner bewährten Vielseitigkeit, RTDETRv2 wegen seiner Aufmerksamkeitsmechanismen oder das hochmoderne YOLO26 für maximale Edge-Leistung wählst: Die Ultralytics-Dokumentation bietet alle Ressourcen, die du für erfolgreiche Computer-Vision-Projekte benötigst.