Ultralytics YOLO27:
Get Started

YOLOv5 vs. RTDETRv2#

Die Computer Vision hat sich in den letzten Jahren deutlich weiterentwickelt und bietet Entwicklern eine breite Auswahl an Architekturen für komplexe visuelle Aufgaben. Zu den beliebtesten Ansätzen gehören faltungsneuronale Netze (CNNs) und Detektions-Transformer (DETRs).

Dieser Leitfaden vergleicht ausführlich und technisch zwei zentrale Modelle aus diesen Kategorien: Ultralytics YOLOv5, ein besonders effizientes und weit verbreitetes CNN-basiertes Modell, und RTDETRv2, einen Transformer-basierten Echtzeit-Objektdetektor auf dem neuesten Stand der Technik.

Ultralytics YOLOv5: Der Branchenstandard für Effizienz#

Seit seiner Veröffentlichung ist Ultralytics YOLOv5 zu einem Grundpfeiler der KI-Community geworden und kommt weltweit in Tausenden kommerziellen Anwendungen und Forschungsprojekten zum Einsatz. Das Modell wurde vollständig auf dem PyTorch-Framework aufgebaut und bietet eine intuitive Entwicklererfahrung, ohne die Echtzeitleistung zu beeinträchtigen.

Wichtige Merkmale:

Architektur und Stärken#

YOLOv5 verwendet eine schlanke CNN-Architektur, die auf eine effiziente Merkmalsextraktion bei äußerst geringem Speicherbedarf ausgelegt ist. Ein CSPDarknet-Backbone und ein PANet-Neck bilden eine leistungsstarke Kombination für die Merkmalsfusion über mehrere Skalen.

Einer der wichtigsten Vorteile von YOLOv5 ist seine ausgewogene Leistung. Das Modell bietet einen hervorragenden Kompromiss zwischen Geschwindigkeit und Genauigkeit und eignet sich daher ideal für die Bereitstellung von Modellen auf Hardware mit begrenzten Ressourcen, etwa NVIDIA Jetson-Geräten und Smartphones.

Darüber hinaus zeichnet sich YOLOv5 durch seine unübertroffene Vielseitigkeit aus. Anders als Modelle, die ausschließlich Begrenzungsrahmen vorhersagen, unterstützt YOLOv5 nativ die Bildklassifizierung und Instanzsegmentierung und bietet so ein einheitliches Framework für vielfältige visuelle Aufgaben. Auch die Trainingseffizienz ist bemerkenswert: Beim Training benötigt YOLOv5 deutlich weniger CUDA-Speicher als Transformer-basierte Architekturen.

Schwächen#

Da YOLOv5 auf einem älteren CNN-Framework basiert, ist das Modell bei der Nachbearbeitung grundsätzlich auf Non-Maximum Suppression (NMS) angewiesen, um doppelte Begrenzungsrahmen zu entfernen. NMS ist im Ultralytics-Framework zwar hochgradig optimiert, kann aber auf spezialisierten Edge-NPUs gelegentlich zu Latenzengpässen führen.

RTDETRv2: Transformer für Echtzeit-Anwendungen von Baidu#

RTDETRv2 (Echtzeit-Detektions-Transformer, Version 2) stellt einen bedeutenden Fortschritt beim Einsatz von Transformer-Architekturen für die Echtzeit-Objekterkennung dar und begegnet den Rechenineffizienzen, die herkömmliche DETRs früher beeinträchtigten.

Wichtige Merkmale:

Architektur und Stärken#

RTDETRv2 baut auf seinem Vorgänger auf und verarbeitet Bilder mithilfe eines hybriden Encoders und eines flexiblen Decoder-Designs. Der Self-Attention-Mechanismus des Transformers verschafft dem Modell ein globales Verständnis des Bildkontexts, sodass es auch in komplexen Szenen mit starker Verdeckung von Objekten besonders gute Ergebnisse erzielt.

Ein besonderes Merkmal von RTDETRv2 ist sein End-to-End-Design ohne NMS. Da das Modell Objektanfragen direkt vorhersagt und weder Ankerrahmen noch eine Nachbearbeitung durch NMS benötigt, wird die Inferenzpipeline vereinfacht. Mit dieser Architektur erzielt das Modell auf Benchmark-Datensätzen wie COCO einen beeindruckenden mAP (mittlere durchschnittliche Genauigkeit).

Schwächen#

Trotz seiner Echtzeitfähigkeit hat RTDETRv2 einen deutlich höheren Speicherbedarf als YOLO-Modelle. Der Speicherbedarf der Aufmerksamkeitsmechanismen in Transformern wächst quadratisch mit der Sequenzlänge. Bei hochauflösendem Training kann es daher zu Speicherfehlern kommen, sofern keine riesigen GPU-Cluster eingesetzt werden. Außerdem bietet RTDETRv2 nicht die sofort verfügbare Vielseitigkeit des Ultralytics-Ökosystems und konzentriert sich vor allem auf die zweidimensionale Objekterkennung, ohne native Unterstützung für Segmentierung oder Posenschätzung.

Erfahre mehr über RTDETRv2

Tabelle zum Leistungsvergleich#

Für einen objektiven Vergleich dieser Architekturen haben wir ihre Leistungskennzahlen zusammengestellt. Fett hervorgehobene Werte kennzeichnen die effizientesten oder leistungsstärksten Kennzahlen der getesteten Modellgrößen.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Einordnung der Leistung

RTDETRv2-x erreicht zwar den höchsten absoluten mAP-Wert, benötigt aber etwa 40-mal so viele Parameter wie YOLOv5n. Für Anwendungen mit hohen Geschwindigkeitsanforderungen und begrenzter Hardware bieten Ultralytics-Modelle durchgehend die beste Recheneffizienz.

Die Vorteile des Ultralytics-Ökosystems#

Wenn du ein Modell aus einem Forschungsnotizbuch in eine Produktionsumgebung überführst, ist die umgebende Software ebenso wichtig wie die Architektur des neuronalen Netzes. Das von Ultralytics bereitgestellte gut gepflegte Ökosystem beschleunigt den Entwicklungszyklus erheblich.

Unübertroffene Benutzerfreundlichkeit#

Ultralytics-Modelle stellen eine äußerst unkomplizierte Benutzererfahrung in den Mittelpunkt. Ob du ein benutzerdefiniertes Modell trainieren, eine Validierung ausführen oder in hardwarespezifische Formate wie TensorRT oder ONNX exportieren möchtest – mit der Ultralytics Python API ist das mit nur wenigen Codezeilen möglich.

Hier ist ein praktisches Codebeispiel, das zeigt, wie einfach sich ein Ultralytics-Modell trainieren und für Inferenz verwenden lässt:

from ultralytics import YOLO

# Modell initialisieren (die Gewichte werden automatisch heruntergeladen)
model = YOLO("yolov5su.pt")  # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket

# Das Modell mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Inferenz mit einem Onlinebild durchführen
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Das Ergebnisbild mit Begrenzungsrahmen anzeigen
inference_results[0].show()

Diese einfache, einheitliche API unterstützt nativ die Integration mit Tools zur Versuchsverfolgung wie Weights & Biases und Comet. So können Entwickler Kennzahlen nahtlos protokollieren, ohne komplexen Boilerplate-Code schreiben zu müssen.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv5 und RT-DETR hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Ökosystempräferenzen ab.

Wann du YOLOv5 wählen solltest#

YOLOv5 eignet sich besonders für:

  • Bewährte Produktionssysteme: Bestehende Bereitstellungen, bei denen die lange Stabilitätsbilanz, die umfassende Dokumentation und die große Unterstützung durch die Community von YOLOv5 geschätzt werden.
  • Training mit begrenzten Ressourcen: Umgebungen mit begrenzten GPU-Ressourcen, in denen die effiziente Trainingspipeline und der geringere Speicherbedarf von YOLOv5 von Vorteil sind.
  • Umfangreiche Unterstützung von Exportformaten: Projekte, die eine Bereitstellung in vielen Formaten erfordern, darunter ONNX, TensorRT, CoreML und LiteRT.

Wann du RT-DETR wählen solltest#

RT-DETR empfiehlt sich für:

  • Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
  • Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
  • Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Ausblick: YOLO11 und YOLO26#

Wenn du heute ein neues Bildverarbeitungsprojekt startest, solltest du unbedingt die neuesten Generationen der Ultralytics-Modelle in Betracht ziehen.

YOLOv5 ist nach wie vor äußerst zuverlässig, doch YOLO11 bietet eine höhere Genauigkeit und unterstützt zusätzliche Aufgaben, darunter die Erkennung orientierter Begrenzungsrahmen (OBB).

Noch bemerkenswerter ist das hochmoderne YOLO26, das die Vorteile beider Ansätze vereint. Es setzt ein End-to-End-Design ohne NMS um – erstmals erprobt in YOLOv10 – und beseitigt so den Aufwand der Nachverarbeitung, während die Effizienz eines CNN erhalten bleibt. YOLO26 führt außerdem den MuSGD-Optimierer ein, der von Innovationen beim Training von LLMs inspiriert ist und eine schnellere Konvergenz ermöglicht. Durch den Wegfall von DFL (Distribution Focal Loss entfällt, was den Export vereinfacht und die Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch verbessert) erreicht YOLO26 eine bis zu 43 % schnellere CPU-Inferenz und ist damit die beste Wahl für Edge AI. Zusätzlich verbessern ProgLoss + STAL die Verlustfunktionen deutlich, insbesondere bei der Erkennung kleiner Objekte – entscheidend für IoT, Robotik und Luftbildaufnahmen.

Fazit#

Die Wahl zwischen YOLOv5 und RTDETRv2 hängt stark von deinen Bereitstellungsbeschränkungen ab. RTDETRv2 erweitert mithilfe leistungsstarker Transformer-Aufmerksamkeitsmechanismen die Grenzen von mAP, verursacht jedoch einen hohen Speicherbedarf und Rechenaufwand.

Ultralytics YOLOv5 hingegen ist eine bewährte, hochgradig optimierte und vielseitige Lösung, die überall reibungslos läuft – von Cloud-Servern bis zu Mikrocontrollern. Für Teams, die höchste Genauigkeit und zugleich nahtlose Bereitstellungswerkzeuge suchen, bietet ein Upgrade innerhalb des Ultralytics-Ökosystems auf YOLO26 die maßgebliche Lösung auf dem neuesten Stand der Technik für moderne Anwendungen im Bereich Vision AI.

Kommentare