Ultralytics YOLO27:

RTDETRv2 vs. YOLOv6-3.0#

Die Landschaft der Computer Vision entwickelt sich ständig weiter und stellt Entwickler vor eine Vielzahl architektonischer Möglichkeiten für die Objekterkennung. Zwei herausragende Modelle, die unterschiedliche Ansätze verkörpern, sind RTDETRv2, ein hochmodernes Vision-Transformer-Modell, und YOLOv6-3.0, ein hochoptimiertes faltendes neuronales Netzwerk (CNN), das auf industrielle Anwendungen zugeschnitten ist.

Dieser umfassende technische Vergleich untersucht die jeweiligen Architekturen, Leistungskennzahlen und idealen Einsatzszenarien. Außerdem betrachten wir, wie das umfassende Ultralytics-Ökosystem für eine bessere Entwicklererfahrung sorgt, und richten den Blick abschließend auf die Fähigkeiten der nächsten Generation von Ultralytics YOLO26.

RTDETRv2: Der Ansatz des Vision Transformers#

RTDETRv2 wurde von Forschern bei Baidu entwickelt und baut auf der Grundlage des ursprünglichen RT-DETR auf, was einen bedeutenden Fortschritt bei der transformerbasierten Objekterkennung darstellt.

Architektonische Merkmale#

RTDETRv2 verwendet eine hybride Architektur, die einen CNN-Merkmalsextraktor mit einem leistungsfähigen Transformer-Decoder kombiniert. Das prägendste Merkmal dieses Modells ist sein von Haus aus NMS-freies Design. Durch den Verzicht auf die Nichtmax-Unterdrückung (NMS) bei der Nachverarbeitung sagt das Modell Begrenzungsrahmen direkt voraus, was die Bereitstellung vereinfacht und die Inferenzlatenz stabilisiert.

Die in RTDETRv2 integrierte „Bag-of-Freebies“ verbessert die Fähigkeit des Modells, komplexe Szenen und sich überschneidende Objekte zu verarbeiten, da globale Aufmerksamkeitsmechanismen räumliche Beziehungen grundsätzlich besser verstehen als lokale Faltungen.

Speicherbedarf von Transformern

Obwohl Transformer komplexe Szenen besonders gut verstehen, benötigen sie beim Training typischerweise deutlich mehr CUDA-Speicher als CNNs. Dies kann die Batch-Größe auf herkömmlichen GPUs für Endverbraucher begrenzen und die gesamte Trainingszeit erhöhen.

YOLOv6-3.0: Maximierung des industriellen Durchsatzes#

YOLOv6-3.0 stammt aus der Abteilung für Vision AI von Meituan und wurde ausdrücklich als Detektor der nächsten Generation für industrielle Produktionslinien entwickelt, bei denen der GPU-Durchsatz entscheidend ist.

  • Autoren: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu und Xiangxiang Chu
  • Organisation: Meituan
  • Datum: 13.01.2023
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Architektonischer Schwerpunkt#

YOLOv6-3.0 basiert auf einem EfficientRep-Backbone, der sorgfältig darauf ausgelegt wurde, Speicherzugriffskosten auf Hardwarebeschleunigern wie NVIDIA GPUs zu minimieren. Die Neck-Architektur verfügt über ein Modul für bidirektionale Konkatenation (BiC), um die Merkmalsfusion über verschiedene Maßstäbe hinweg zu verbessern.

Während des Trainings verwendet das Modell eine Strategie für ankerunterstütztes Training (AAT), um die Vorteile ankerbasierter Paradigmen zu nutzen und gleichzeitig einen ankerfreien Inferenzmodus für eine schnellere Ausführung beizubehalten. Auf GPUs für Server (z. B. T4, A100) erzielt es zwar einen außergewöhnlich hohen Durchsatz, seine spezialisierte Architektur kann bei der Bereitstellung auf Edge-Geräten, die ausschließlich mit einer CPU arbeiten, jedoch zu einer suboptimalen Latenz führen.

Erfahre mehr über YOLOv6

Leistungsvergleich#

Bei der Bewertung von Modellen für den Produktionseinsatz ist es entscheidend, Genauigkeit (mAP), Inferenzgeschwindigkeit und Rechenkosten (FLOPs) gegeneinander abzuwägen. Die folgende Tabelle zeigt, wie diese Modelle im Vergleich abschneiden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

Während YOLOv6-3.0 bei der reinen Verarbeitungsgeschwindigkeit mit TensorRT dominiert, erzielt RTDETRv2 höhere mAP-Werte und skaliert insbesondere bei größeren Modellvarianten besser. Allerdings fehlt beiden Modellen die umfassende Vielseitigkeit moderner, vereinheitlichter Frameworks. YOLOv6-3.0 ist hauptsächlich auf die Objekterkennung spezialisiert und unterstützt Aufgaben wie die Instanzsegmentierung und die Posenschätzung nicht von Haus aus.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen RT-DETR und YOLOv6 hängt von deinen spezifischen Projektanforderungen, Bereitstellungseinschränkungen und Präferenzen hinsichtlich des Ökosystems ab.

Wann du RT-DETR wählen solltest#

RT-DETR ist eine gute Wahl für:

  • Transformer-basierte Forschung zur Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
  • Szenarien mit hoher Genauigkeit und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
  • Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.

Wann du YOLOv6 wählen solltest#

YOLOv6 wird empfohlen für:

  • Hardwarebewusste Bereitstellung in der Industrie: Szenarien, in denen das hardwarebewusste Design und die effiziente Rekonfiguration des Modells eine optimierte Leistung auf bestimmter Zielhardware ermöglichen.
  • Schnelle einstufige Erkennung: Anwendungen, bei denen die reine Inferenzgeschwindigkeit auf der GPU für die Echtzeitverarbeitung von Videos in kontrollierten Umgebungen im Vordergrund steht.
  • Integration in das Meituan-Ökosystem: Teams, die bereits mit dem Technologie-Stack und der Bereitstellungsinfrastruktur von Meituan arbeiten.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklerfreundlichkeit:

  • Edge-Bereitstellungen ohne NMS: Anwendungen, die eine konsistente Inferenz mit geringer Latenz ohne die Komplexität der Nachverarbeitung zur Nichtmaximalunterdrückung erfordern.
  • Umgebungen ausschließlich mit CPU: Geräte ohne dedizierte GPU-Beschleunigung, bei denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftaufnahmen mit Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei winzigen Objekten deutlich steigern.

Der Vorteil von Ultralytics#

Bei der Wahl des richtigen Modells geht es um mehr als reine Benchmarkzahlen. Auch die Entwicklererfahrung, die Flexibilität bei der Bereitstellung und die Unterstützung durch das Ökosystem sind von entscheidender Bedeutung. Durch die Verwendung von in die Ultralytics-Plattform integrierten Modellen profitieren Benutzer erheblich gegenüber statischen Forschungsrepositorys.

  • Benutzerfreundlichkeit: Das ultralytics-Python-Paket bietet eine nahtlose API. Das Trainieren, Validieren und Exportieren von Modellen erfordert nur wenige Codezeilen.
  • Gut gepflegtes Ökosystem: Im Gegensatz zu isolierten wissenschaftlichen Repositories wird die Ultralytics-Plattform aktiv aktualisiert. Sie bietet robuste Integrationen für Tools wie ONNX, OpenVINO und CoreML.
  • Trainingseffizienz: Ultralytics-Modelle benötigen beim Training typischerweise deutlich weniger VRAM als Transformer-Architekturen wie RTDETRv2, wodurch größere Batch-Größen auf Hardware für Endverbraucher möglich werden.
  • Vielseitigkeit: Im Gegensatz zum fokussierten Anwendungsbereich von YOLOv6-3.0 sind Ultralytics-Modelle multiaufgabenfähig und unterstützen Bildklassifizierung, orientierte Bounding Boxes (OBB) sowie Segmentierung nativ in einem einzigen, einheitlichen Framework.
Vereinfachte Bereitstellung

Mit der Ultralytics CLI ist der Export eines trainierten Modells für den Edge-Einsatz so einfach wie die Ausführung von: yolo export model=yolo11n.pt format=tensorrt.

YOLO26: Die ultimative Lösung#

RTDETRv2 und YOLOv6-3.0 bieten zwar spezifische Vorteile, doch das Feld entwickelt sich rasant weiter. Teams, die neue Computer-Vision-Projekte starten, empfehlen wir dringend YOLO26, das im Januar 2026 von Ultralytics veröffentlicht wurde.

YOLO26 vereint die Stärken industrieller CNNs und moderner Transformer und beseitigt zugleich deren jeweilige Schwächen:

  • End-to-End-NMS-freies Design: YOLO26 übernimmt den bahnbrechenden Ansatz, der erstmals in YOLOv10 eingeführt wurde, und eliminiert die NMS-Nachverarbeitung von Haus aus. Dadurch wird eine stabile, vorhersehbare Bereitstellung ähnlich wie bei RTDETRv2 gewährleistet, jedoch mit deutlich geringerem Overhead.
  • MuSGD-Optimierer: Dieser hybride Optimierer ist von fortschrittlichen Trainingstechniken für LLMs inspiriert, etwa von Moonshot AIs Kimi K2, und sorgt für stabiles Training sowie eine schnellere Konvergenz. Dadurch wird die bekannte Instabilität herkömmlicher Vision Transformer überwunden.
  • Für den Edge-Einsatz optimiert: Mit bis zu 43 % schnellerer CPU-Inferenz als frühere Generationen und der gezielten Entfernung von Distribution Focal Loss (DFL) eignet sich YOLO26 ideal für mobile Geräte und IoT-Geräte, auf denen keine GPU-Beschleunigung verfügbar ist.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen führen zu deutlichen Verbesserungen bei der Erkennung kleiner Objekte – einer historischen Herausforderung für CNNs – und machen YOLO26 ideal für Luftaufnahmen und Robotik.

Trainingsbeispiel#

Mit der intuitiven Ultralytics API kannst du hochmoderne Modelle nahtlos trainieren. Das folgende Beispiel kann direkt ausgeführt werden und zeigt, wie du das YOLO26-Nano-Modell mit dem COCO8-Datensatz trainierst:

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

Zusammenfassung#

Beim Vergleich von RTDETRv2 und YOLOv6-3.0 hängt die Entscheidung weitgehend von deiner spezifischen Hardware und deinen Latenzanforderungen ab. RTDETRv2 spielt seine Stärken in Forschungsumgebungen und bei der serverseitigen Verarbeitung aus, wenn die Verarbeitung komplexer, sich überschneidender Objekte entscheidend ist. YOLOv6-3.0 bleibt eine überzeugende Wahl für Fertigungslinien mit hohem Durchsatz, die mit leistungsfähigen NVIDIA GPUs ausgestattet sind.

Für Entwickler, die jedoch das Beste aus beiden Welten suchen – die NMS-freie Eleganz von Transformern kombiniert mit der hohen Geschwindigkeit und dem geringen Speicherbedarf von CNNs –, ist YOLO26 unübertroffen. Unterstützt durch die umfassende Dokumentation und die aktive Community des Ultralytics-Ökosystems stellt YOLO26 sicher, dass deine Vision-AI-Projekte robust, skalierbar und zukunftssicher sind.

Kommentare