Ultralytics YOLO27:
Get Started

RTDETRv2 und YOLOv5#

Die Entwicklung der Computer Vision ist maßgeblich vom stetigen Streben geprägt, Genauigkeit mit Echtzeit-Inferenzgeschwindigkeit in Einklang zu bringen. Beim Vergleich von RTDETRv2 und Ultralytics YOLOv5 wägen Entwickler im Wesentlichen die ausgeprägten Fähigkeiten von Transformer-Architekturen zur Erfassung globaler Zusammenhänge gegen die hochoptimierte und bewährte Effizienz faltender neuronaler Netze (CNNs) ab.

Dieser Leitfaden bietet eine detaillierte technische Analyse dieser beiden bedeutenden Architekturen. Er beschreibt ihre Leistungskennzahlen, Trainingsmethoden, Speicheranforderungen und geeigneten Bereitstellungsszenarien, damit du das beste Objekterkennungsmodell für deinen konkreten Anwendungsfall auswählen kannst.

RTDETRv2: Transformer-Ansatz für Echtzeit-Erkennung#

Aufbauend auf dem ursprünglichen Echtzeit-Erkennungstransformer (RT-DETR) führt RTDETRv2 eine Reihe von „Bag-of-Freebies“-Optimierungen ein, die die Basisarchitektur verbessern, ohne ihre Inferenzlatenz zu beeinträchtigen.

Architektur und Funktionen#

RTDETRv2 nutzt eine hybride CNN-Transformer-Architektur. Das CNN dient als Backbone und extrahiert feingranulare visuelle Merkmale, während die Encoder- und Decoder-Schichten des Transformers die gesamte Merkmalskarte verarbeiten, um den globalen Kontext zu erfassen. Ein wichtiges Merkmal von RTDETRv2 ist sein End-to-End-Ansatz, der die Nachverarbeitung mit Unterdrückung nicht maximaler Werte (NMS) vollständig überflüssig macht.

RTDETRv2 erzielt zwar eine beeindruckende Genauigkeit – insbesondere bei komplexen, dichten Szenen mit überlappenden Objekten –, bringt jedoch deutliche Nachteile mit sich. Der in Transformern eingesetzte Aufmerksamkeitsmechanismus benötigt beim Training deutlich mehr CUDA-Speicher als herkömmliche CNNs. Außerdem läuft das Modell zwar auf leistungsstarken GPUs wie NVIDIA A100 oder T4 gut, ist auf gewöhnlichen CPUs jedoch merklich langsamer und auf leistungsschwachen Edge-Geräten stark eingeschränkt.

Erfahre mehr über RTDETRv2

Ultralytics YOLOv5: Der Branchenstandard für Effizienz#

Ultralytics YOLOv5 veränderte mit seiner Veröffentlichung die angewandte maschinelle Lerntechnik grundlegend und machte leistungsstarke Computer Vision Entwicklerinnen und Entwicklern weltweit durch ein besonders intuitives Framework zugänglich.

Ausgewogenes Verhältnis zwischen Ökosystem und Leistung#

YOLOv5 basiert vollständig auf dem PyTorch-Framework und nutzt eine äußerst effiziente CNN-Architektur. Das Modell wurde von Grund auf auf einfache Bedienung ausgelegt und bietet eine übersichtliche API sowie eine der umfangreichsten Dokumentationen in der KI-Branche.

Der größte Vorteil von YOLOv5 liegt in seiner unübertroffenen Vielseitigkeit und dem geringen Speicherbedarf. Für das Training eines YOLOv5-Modells wird wesentlich weniger VRAM benötigt als für transformerbasierte Modelle. Dadurch ist das Modell auch für Forschende und Ingenieure mit begrenztem Hardwarebudget zugänglich. Während sich RTDETRv2 ausschließlich auf die Erkennung von Begrenzungsrahmen konzentriert, hat sich YOLOv5 zudem zu einem vielseitigen Kraftpaket entwickelt, das Instanzsegmentierung und Bildklassifizierung unterstützt.

Verwaltung von Unternehmensmodellen

Für einen besonders effizienten Arbeitsablauf kannst du YOLOv5 direkt über die Ultralytics-Plattform trainieren, validieren und bereitstellen. Die Plattform bietet Trainingsmöglichkeiten in der Cloud und Bereitstellungspipelines, die keinen Code erfordern.

Leistungs- und Metrikvergleich#

Ein Blick auf die Rohleistung mit dem Standard-COCO-Datensatz zeigt deutliche Unterschiede darin, wie diese Modelle ihre Ressourcen einsetzen.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

Abwägung der Vor- und Nachteile#

Die Daten zeigen, dass RTDETRv2-x eine maximale mittlere durchschnittliche Präzision (mAP) von 54,3 % erreicht und damit YOLOv5x mit 50,7 % leicht übertrifft. Dieser geringe Genauigkeitsgewinn geht jedoch mit einem enormen Rechenaufwand einher. YOLOv5x bietet eine geringere Latenz (11,89 ms gegenüber 15,03 ms mit TensorRT) und benötigt nur einen Bruchteil des Speichers. Für Bereitstellungen am Netzwerkrand mit extrem niedrigem Energieverbrauch ist YOLOv5n (Nano) unübertroffen: Das Modell führt die Inferenz in nur 1,12 ms aus und umfasst lediglich 1,9 Millionen Parameter. RTDETRv2 kann in dieser Leistungsklasse nicht mithalten.

Effizientes Training und einfacher Code#

Eine der größten Stärken des Ultralytics-Ökosystems ist seine einheitliche API. Selbst wenn du für eine rechenintensive Aufgabe die Transformer-Architektur von RT-DETR nutzen möchtest, kannst du das vollständig im Ultralytics-Python-Paket tun und Modelle nahtlos mit nur einer Codezeile austauschen.

from ultralytics import RTDETR, YOLO

# Das kleine Ultralytics-YOLOv5-Modell laden
model_yolo = YOLO("yolov5su.pt")  # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket

# Das große RT-DETR-Modell über Ultralytics laden
model_rtdetr = RTDETR("rtdetr-l.pt")

# YOLOv5 mühelos mit deinen eigenen Daten trainieren
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Mit beiden Modellen nahtlos Inferenz ausführen
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")

results_yolo[0].show()

Über die Ultralytics-Bibliothek erhalten Entwickler automatisch Zugriff auf ein gut gepflegtes Ökosystem mit Integrationen zur Versuchsverfolgung wie Weights & Biases und Comet ML sowie Ein-Klick-Export in Bereitstellungsformate wie ONNX und OpenVINO.

Anwendungen in der Praxis und ideale Einsatzbereiche#

Die Stärken von RTDETRv2#

RTDETRv2 eignet sich am besten für Umgebungen ohne Hardwareeinschränkungen, in denen die höchstmögliche Präzision das einzige Ziel ist.

  • Medizinische Bildgebung auf dem Server: Mikroskopisch kleine Anomalien auf hochauflösenden Röntgenbildern erkennen.
  • Satellitenbilder: Dichte, überlappende Objekte in Aufgaben der Luftbildüberwachung auf leistungsstarken Cloud-Clustern verfolgen.

Die Stärken von YOLOv5#

YOLOv5 ist der unbestreitbare Spitzenreiter bei der praktischen Bereitstellung in der realen Welt auf unterschiedlichster Hardware.

  • Edge-KI-Geräte: Sicherheitsalarmsysteme auf Raspberry Pi- oder NVIDIA-Jetson-Geräten bereitstellen, auf denen der Speicher streng begrenzt ist.
  • Mobile Anwendungen: Schnelle Echtzeit-Inferenz für Begrenzungsrahmen und Segmentierung direkt auf Smartphones mit CoreML oder LiteRT ausführen.
  • Hochgeschwindigkeitsfertigung: Teile auf schnellen Produktionsstraßen prüfen, auf denen eine Latenz im Millisekundenbereich für den betrieblichen Erfolg entscheidend ist.
Weitere Ultralytics-Modelle entdecken

YOLOv5 ist zwar ein legendäres Modell, doch das Ultralytics-Ökosystem erweitert die Möglichkeiten der KI kontinuierlich. Wenn du 2026 Modelle für ein neues Projekt vergleichst, solltest du dir das hochmoderne Ultralytics YOLO26 ansehen. YOLO26 bietet mit seinem optionalen Eins-zu-eins-Kopf (nms=False) ein integriertes End-to-End-Design ohne NMS, ähnlich wie Transformer, aber mit der Geschwindigkeit von CNNs. Außerdem verfügt das Modell über den bahnbrechenden MuSGD-Optimierer für besonders stabiles Training und ermöglicht eine bis zu 43 % schnellere CPU-Inferenz. Alternativ ist YOLO11 weiterhin eine hervorragende, umfassend unterstützte Wahl für vielseitige Bereitstellungen, bei denen Posenschätzung und OBB-Erkennung benötigt werden.

RTDETRv2 verschiebt mit Transformer-Schichten zwar die Grenzen der Genauigkeit, doch das Ultralytics-YOLO-Framework bietet eine unübertroffene Kombination aus Geschwindigkeit, geringem Speicherbedarf und einer durchdachten Entwicklererfahrung, die den Weg vom Prototyp bis zum Produktionseinsatz erheblich verkürzt.

Kommentare