Ultralytics YOLO27:
Get Started

YOLO26 im Vergleich zu RTDETRv2#

Die Bildverarbeitung entwickelt sich ständig weiter. Fachleute müssen dabei eine wichtige Entscheidung treffen: Sollen sie hochgradig optimierte faltende neuronale Netze (CNNs) einsetzen oder neuere Transformer-basierte Architekturen verwenden? Zwei bedeutende Modelle in diesem Bereich sind das hochmoderne Ultralytics YOLO26 und RTDETRv2 von Baidu. Beide Modelle setzen neue Maßstäbe bei der Echtzeit-Objekterkennung, beruhen jedoch auf grundlegend unterschiedlichen Architekturkonzepten.

Dieser Leitfaden bietet einen umfassenden technischen Einblick in beide Modelle und vergleicht ihre Strukturen, Leistungskennzahlen und idealen Anwendungsfälle, damit du die passende Grundlage für dein nächstes Bildverarbeitungsprojekt wählen kannst.

Ultralytics YOLO26: Spitzenleistung bei Edge-orientierter KI für Bildverarbeitung#

YOLO26 wurde von Ultralytics entwickelt und stellt einen gewaltigen Generationssprung für die YOLO-Familie dar. Das im Januar 2026 veröffentlichte Modell wurde gezielt auf Geschwindigkeit, Genauigkeit und eine nahtlose Bereitstellung in Cloud- und Edge-Umgebungen ausgelegt.

Architektonische Neuerungen und Stärken#

YOLO26 führt mehrere bahnbrechende Funktionen ein, die das Modell sowohl von Transformer-Modellen als auch von früheren Versionen wie YOLO11 unterscheiden:

  • End-to-End-Design ohne NMS: Der optionale One-to-one-Kopf von YOLO26 (nms=False) macht die herkömmliche Unterdrückung nicht maximaler Werte (NMS) bei der Nachverarbeitung überflüssig. Dieser Ansatz, der bereits bei Modellen wie YOLOv10 zum Einsatz kam, verringert Schwankungen der Inferenzlatenz und vereinfacht die Bereitstellungslogik – insbesondere auf Edge-Hardware.
  • Bis zu 43 % schnellere CPU-Inferenz: Angesichts des wachsenden Bedarfs an dezentraler KI ist YOLO26 besonders für Geräte ohne dedizierte GPUs optimiert, etwa den Raspberry Pi.
  • Entfernung von DFL: Durch den Verzicht auf den Verteilungs-Fokalverlust (DFL) vereinfacht YOLO26 den Export und verbessert die Kompatibilität mit Edge-Geräten und Mikrocontrollern mit geringem Stromverbrauch erheblich.
  • MuSGD-Optimierer: YOLO26 verbindet das Training großer Sprachmodelle (LLM) mit der Bildverarbeitung und nutzt dafür den MuSGD-Optimierer. Diese von Kimi K2 von Moonshot AI inspirierte Kombination aus SGD und Muon gewährleistet ein robustes, stabiles Training und eine schnellere Konvergenz.
  • ProgLoss + STAL: Fortschrittliche Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich. Das ist entscheidend für Branchen, die auf Luftbildanalysen und Sensoren des Internets der Dinge (IoT) angewiesen sind.

Vielseitigkeit bei Computer-Vision-Aufgaben#

Im Gegensatz zu Modellen, die ausschließlich auf Begrenzungsrahmen beschränkt sind, ist YOLO26 äußerst vielseitig. Das Modell bietet aufgabenspezifische Verbesserungen, etwa eine Verlustfunktion für semantische Segmentierung und Multi-Scale-Proto für die Instanzsegmentierung, die residuale Log-Likelihood-Schätzung (RLE) für die Posenschätzung sowie eine spezialisierte Winkelfehlerfunktion zur Behebung von Problemen an Begrenzungen bei Aufgaben mit orientierten Begrenzungsrahmen (OBB).

Strategie für die Edge-Bereitstellung

Für die Bereitstellung auf Edge-Geräten verwendest du die Varianten YOLO26n (Nano) oder YOLO26s (Small). Dank der Entfernung von DFL und des optionalen NMS-freien Kopfs lassen sich diese Modelle problemlos in CoreML oder LiteRT exportieren und bieten eine reibungslose Echtzeitleistung auf iOS und Android.

RTDETRv2: Transformer für die Echtzeit-Erkennung weiterentwickeln#

RTDETRv2 wurde von Forschern bei Baidu entwickelt und baut auf dem ursprünglichen RT-DETR-Framework auf. Das Modell soll zeigen, dass Detection Transformer (DETR) in Echtzeitszenarien mit hochgradig optimierten CNNs bei Geschwindigkeit und Genauigkeit konkurrieren und diese manchmal sogar übertreffen können.

Architektur und Funktionen#

RTDETRv2 verwendet eine Transformer-basierte Architektur. Durch Selbstaufmerksamkeitsmechanismen verarbeitet sie Bilder grundlegend anders als CNNs und erfasst dabei globale Zusammenhänge.

  • Bag-of-Freebies: Die Version 2 bietet eine Reihe optimierter Trainingstechniken (Bag-of-Freebies), die die Basisleistung verbessern, ohne die Inferenzkosten zu erhöhen.
  • Erfassung globaler Zusammenhänge: Dank der Transformer-Aufmerksamkeitsschichten kann RTDETRv2 komplexe Szenen besonders gut verstehen, in denen globale Zusammenhänge erforderlich sind, um überlappende oder verdeckte Objekte zu unterscheiden.

Erfahre mehr über RTDETRv2

Einschränkungen von Transformer-Modellen#

Transformer-basierte Erkennungsmodelle wie RTDETRv2 sind zwar leistungsstark, stehen bei der praktischen Bereitstellung jedoch oft vor Herausforderungen. Beim Training benötigen sie im Allgemeinen mehr CUDA-Speicher als effiziente CNNs. Außerdem kann die Integration in unterschiedliche Edge-Umgebungen aufgrund der komplexen Operationen der Aufmerksamkeitsschichten mühsam sein. Für Bereitstellungen mit begrenzten Ressourcen sind Modelle wie YOLO26 daher wesentlich attraktiver.

Leistungsvergleich#

Ein direkter Vergleich dieser Modelle macht die greifbaren Vorteile der neuesten CNN-Optimierungen deutlich. Die folgende Tabelle zeigt ihre Leistung bei standardisierten Benchmarks.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Wie die Ergebnisse zeigen, übertrifft YOLO26 RTDETRv2 durchweg bei allen Modellgrößen. YOLO26x erreicht eine beeindruckende mAP von 57.5 bei einer geringeren Latenz (11.8 ms mit TensorRT) und deutlich weniger Parametern (55.7M) als RTDETRv2-x (54.3 mAP, 15.03 ms, 76M Parameter).

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLO26 und RT-DETR hängt von den konkreten Anforderungen deines Projekts, den Bereitstellungseinschränkungen und deinen Ökosystempräferenzen ab.

Wann du YOLO26 wählen solltest#

YOLO26 ist eine gute Wahl für:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Wann du RT-DETR wählen solltest#

RT-DETR empfiehlt sich für:

  • Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
  • Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
  • Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.

Der Vorteil von Ultralytics#

Die Wahl der passenden Architektur für maschinelles Lernen ist nur ein Teil der Gleichung. Das umgebende Ökosystem bestimmt, wie schnell ein Team vom Prototyp zur Produktion gelangt.

Benutzerfreundlichkeit und Trainingseffizienz#

Die Ultralytics-Python-API sorgt für einen bemerkenswert reibungslosen Ablauf. Für das Training komplexer Modelle ist kein umfangreicher Boilerplate-Code mehr nötig. Außerdem ist YOLO26 beim Training wesentlich effizienter: Das Modell benötigt deutlich weniger GPU-VRAM als die speicherintensiven Aufmerksamkeitsmechanismen von RTDETRv2. Dadurch sind selbst auf handelsüblicher Hardware größere Batch-Größen möglich.

from ultralytics import YOLO

# Das hochmoderne YOLO26-Nano-Modell initialisieren
model = YOLO("yolo26n.pt")

# 100 Epochen lang mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Hochgeschwindigkeitsinferenz ohne NMS ausführen
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Für eine reibungslose Bereitstellung nach ONNX exportieren
model.export(format="onnx")

Ein gut gepflegtes Ökosystem#

Durch die Nutzung von Ultralytics-Modellen erhalten Entwickler Zugriff auf ein aktiv gepflegtes Framework, das sich nativ mit modernen Tracking-Tools wie Weights & Biases und Comet ML integrieren lässt. Wenn du einen Ansatz ohne Programmierung bevorzugst, ermöglicht dir die Ultralytics Platform das Training in der Cloud, die Verwaltung von Datensätzen und die Bereitstellung mit einem Klick.

Ausgewogene Leistung#

YOLO26 bietet ein außergewöhnliches Gleichgewicht zwischen Inferenzgeschwindigkeit und Genauigkeit. Die optionale Entfernung von NMS in Kombination mit dem MuSGD-Optimierer sorgt dafür, dass du ein Modell bereitstellst, das sowohl kleine Objekte äußerst genau erkennt (dank ProgLoss + STAL) als auch im Produktivbetrieb extrem schnell ist. Damit ist es für fast alle modernen Anwendungen der Bildverarbeitung die bessere Wahl.

Weitere Modelle im Ökosystem#

YOLO26 und RTDETRv2 decken zwar den neuesten Stand der Echtzeit-Erkennung ab, doch Entwickler, die Altpipelines pflegen oder andere Effizienzprofile untersuchen, könnten auch YOLOv8 für etablierte Unternehmensumgebungen in Betracht ziehen oder Architekturen wie EfficientDet erkunden. Für jedes neue Vorhaben ist YOLO26 jedoch die klare Empfehlung.

Kommentare