Ultralytics YOLO27:
Get Started

YOLOv8 vs. RTDETRv2#

Die Landschaft der Computer Vision entwickelt sich ständig weiter, während neue Architekturen die Möglichkeiten der Objekterkennung in Echtzeit erweitern. Zwei bekannte Modelle, die viel Aufmerksamkeit auf sich gezogen haben, sind Ultralytics YOLOv8 und RTDETRv2 von Baidu. Dieser Leitfaden bietet einen umfassenden technischen Vergleich der beiden leistungsstarken Modelle und untersucht ihre Architekturen, Leistungskennzahlen und idealen Einsatzszenarien.

Überblick über YOLOv8#

Ultralytics YOLOv8 ist ein wichtiger Meilenstein in der YOLO-Modellfamilie (You Only Look Once). Das Modell baut auf jahrelanger Grundlagenforschung auf und bietet für vielfältige Aufgaben eine außergewöhnliche Geschwindigkeit, Genauigkeit und Benutzerfreundlichkeit.

Wichtige Merkmale:

Architektur und Stärken#

YOLOv8 bietet eine vereinfachte Architektur, die sowohl die Merkmalsextraktion als auch die Regression von Begrenzungsrahmen optimiert. Als anchorfreier Detektor vereinfacht das Modell den Vorhersagekopf und verringert die Anzahl der während des Trainings erforderlichen Anpassungen von Hyperparametern. Diese Architektur gewährleistet eine hervorragende Leistungsbalance zwischen Inferenzgeschwindigkeit und mittlerer durchschnittlicher Präzision (mAP) und eignet sich damit hervorragend für den praktischen Einsatz auf Edge-Geräten und Cloud-Servern.

Darüber hinaus benötigt YOLOv8 während des Trainings deutlich weniger Speicher als Transformer-basierte Architekturen. Dadurch können Entwickler Modelle auf handelsüblichen GPUs trainieren, ohne dass Fehler wegen unzureichenden Speichers auftreten.

Vielseitigkeit#

Eine der größten Stärken von YOLOv8 ist seine von Haus aus gegebene Vielseitigkeit. Während sich viele Modelle ausschließlich auf Begrenzungsrahmen konzentrieren, unterstützt YOLOv8 direkt die Objekterkennung, Instanzsegmentierung, Bildklassifizierung, Posenschätzung und die Erkennung orientierter Begrenzungsrahmen (OBB).

Überblick über RTDETRv2#

RTDETRv2 (Transformer zur Echtzeit-Objekterkennung, Version 2) baut auf dem ursprünglichen RT-DETR auf und soll die leistungsfähigen Aufmerksamkeitsmechanismen von Vision Transformers für die Objekterkennung in Echtzeit nutzbar machen.

Wichtige Merkmale:

Architektur und Stärken#

RTDETRv2 nutzt eine hybride Architektur, die ein Backbone aus einem Convolutional Neural Network (CNN) mit einer Transformer-Encoder-Decoder-Struktur kombiniert. Dadurch kann das Modell mithilfe von Self-Attention komplexe räumliche Beziehungen und den globalen Kontext erfassen. Mit einer Reihe von Trainingsstrategien nach dem „Bag-of-Freebies“-Prinzip erzielt RTDETRv2 auf standardisierten Benchmark-Datensätzen wie dem COCO-Datensatz konkurrenzfähige mAP-Werte.

Schwächen#

Trotz seiner hohen Genauigkeit führt der Transformer-basierte Aufbau von RTDETRv2 im Vergleich zu reinen CNN-Architekturen zu einem höheren Speicherverbrauch und längeren Trainingszeiten. Transformer benötigen von Natur aus mehr VRAM, was das Training auf Hardware mit begrenzten Ressourcen erschwert. RTDETRv2 ist zwar stark bei der Erkennung, bietet aber nicht die für das Ultralytics-Ökosystem typische Vielseitigkeit für mehrere Aufgaben, etwa Posenschätzung und Segmentierung.

Weitere Informationen zu RTDETRv2

Leistungsvergleich#

Bei der Auswahl von Modellen für den produktiven Einsatz ist der Kompromiss zwischen Modellgröße, Inferenzgeschwindigkeit und Genauigkeit entscheidend. Die folgende Tabelle vergleicht Varianten von YOLOv8 und RTDETRv2 direkt.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Hardware und Kennzahlen

Die CPU-Inferenz wurde mit ONNX durchgeführt, während die GPU-Geschwindigkeit mit TensorRT auf einer NVIDIA T4 GPU getestet wurde.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv8 und RT-DETR hängt von den spezifischen Anforderungen deines Projekts, den Bereitstellungsbedingungen und deinen Präferenzen beim Ökosystem ab.

Wann du YOLOv8 wählen solltest#

YOLOv8 ist eine gute Wahl für:

  • Vielseitige Bereitstellung für mehrere Aufgaben: Projekte, die ein bewährtes Modell für Erkennung, Segmentierung, Klassifizierung und Posenschätzung innerhalb des Ultralytics-Ökosystems benötigen.
  • Etablierte Produktivsysteme: Bestehende Produktivumgebungen, die bereits auf der YOLOv8-Architektur und stabilen, umfassend getesteten Bereitstellungspipelines basieren.
  • Umfangreiche Unterstützung durch Community und Ökosystem: Anwendungen, die von den zahlreichen YOLOv8-Anleitungen, Integrationen von Drittanbietern und aktiven Community-Ressourcen profitieren.

Wann du RT-DETR wählen solltest#

RT-DETR empfiehlt sich für:

  • Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
  • Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
  • Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Der Vorteil von Ultralytics#

Bei der Modellwahl zählen nicht nur die reinen Kennzahlen; das umgebende Softwareökosystem ist entscheidend für die Produktivität von Entwicklern. Das Ultralytics-Ökosystem ist für seine einfache Bedienung bekannt und bietet eine einheitliche Python-API, die den gesamten Lebenszyklus des maschinellen Lernens vereinfacht.

Von der Verwaltung von Datensätzen bis zum verteilten Training nimmt Ultralytics Entwicklern komplexen Boilerplate-Code ab. Entwickler profitieren von sofort verfügbaren vortrainierten Gewichten und der nahtlosen Integration mit Plattformen wie Hugging Face sowie Monitoring-Tools. Dieses gut gepflegte Ökosystem gewährleistet aktive Weiterentwicklung, regelmäßige Aktualisierungen und starke Unterstützung durch die Community.

Darüber hinaus zeichnet sich Ultralytics YOLO durch effizientes Training aus. Die Modelle sind für schnelle Konvergenz und einen geringeren Speicherbedarf während des Trainings stark optimiert. Dadurch verkürzen sich Experimentierzyklen im Vergleich zu Transformer-basierten Detektoren wie RTDETRv2 erheblich.

Ausblick: die Leistungsfähigkeit von YOLO26#

YOLOv8 ist nach wie vor ein leistungsstarkes Modell. Entwickler, die nach dem neuesten Stand der Technik suchen, sollten jedoch ein Upgrade auf YOLO26 in Betracht ziehen, das im Januar 2026 veröffentlicht wurde. YOLO26 setzt mit mehreren bahnbrechenden Neuerungen neue Maßstäbe:

  • End-to-End-Design ohne NMS: Der optionale One-to-one-Head von YOLO26 (nms=False) macht die Nachbearbeitung mit Nichtmaximalunterdrückung (NMS) überflüssig. Das sorgt für schnellere und besser vorhersagbare Bereitstellungsabläufe.
  • Entfernung von DFL: Durch den Wegfall von Distribution Focal Loss wird das Modell schlanker und lässt sich besser auf Edge-Geräten und Geräten mit geringem Energieverbrauch einsetzen.
  • MuSGD-Optimierer: Der MuSGD-Optimierer integriert Neuerungen aus dem Training von LLMs und sorgt für stabilere Trainingsläufe und schnellere Konvergenz.
  • Bis zu 43 % schnellere CPU-Inferenz: Stark optimiert für Umgebungen ohne dedizierte GPUs.
  • ProgLoss + STAL: Progressive Loss und Small-Target-Aware Label Assignment verbessern die Erkennung kleiner Objekte deutlich – ein entscheidender Faktor bei Luftaufnahmen und in der Robotik.

Zu den weiteren modernen Alternativen aus der Ultralytics-Modellpalette, die du in Betracht ziehen kannst, gehört YOLO11. Das Modell bietet zuverlässige Leistung für bestehende Projekte, für alle neuen Bereitstellungen wird jedoch YOLO26 empfohlen.

Codebeispiel: Training und Inferenz#

Dank der einfachen Ultralytics-API kannst du Modelle mit nur wenigen Zeilen Python-Code laden, trainieren und bereitstellen. Stelle sicher, dass PyTorch installiert ist, bevor du das folgende Beispiel ausführst.

from ultralytics import YOLO

# Ein vortrainiertes kleines YOLOv8-Modell laden
model = YOLO("yolov8s.pt")

# Das Modell mit deinem eigenen Datensatz trainieren
# Speichereffizientes Training ermöglicht größere Batch-Größen
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)

# Inferenz für ein Testbild ausführen
results = model("https://ultralytics.com/images/bus.jpg")

# Ergebnisse anzeigen
results[0].show()

# Nahtloser Export für die Bereitstellung auf Edge-Geräten
export_path = model.export(format="onnx")
Bereit für die Bereitstellung

Ultralytics unterstützt den Export mit nur einem Klick in zahlreiche Formate, darunter ONNX, TensorRT und CoreML. Das vereinfacht die Optionen zur Modellbereitstellung für unterschiedliche Hardwarearchitekturen.

Fazit#

YOLOv8 und RTDETRv2 bieten beide überzeugende Möglichkeiten zur Objekterkennung in Echtzeit. RTDETRv2 zeigt, wie leistungsfähig Transformer bei der Erfassung globaler Zusammenhänge sind. Damit eignet sich das Modell für komplexe Aufgaben zur räumlichen Schlussfolgerung, bei denen Inferenzgeschwindigkeit und Speicherbedarf nicht die wichtigsten Einschränkungen sind.

Für Entwickler, denen eine ausgezeichnete Balance aus Geschwindigkeit, Genauigkeit und Ressourceneffizienz wichtig ist, bleiben Ultralytics-YOLO-Modelle jedoch die bessere Wahl. YOLOv8 ist leichtgewichtig und außergewöhnlich einfach zu bedienen. Zusammen mit seiner Vielseitigkeit bei zahlreichen Bildverarbeitungsaufgaben und einem lebendigen Open-Source-Ökosystem ist es die bevorzugte Lösung für skalierbare Produktionsumgebungen. Wer die bestmögliche Leistung auf Edge-Geräten sucht, erhält mit dem neu veröffentlichten YOLO26 eine unerreichte Effizienz ohne NMS, die weiterhin Maßstäbe in der Branche setzt.

Kommentare