Ultralytics YOLO27:
Get Started

YOLOv10 vs. RTDETRv2#

Die Entwicklung im Bereich Computer Vision schreitet rasant voran: Neue Architekturen setzen bei der Echtzeit-Objekterkennung ständig neue Maßstäbe. Zwei bedeutende Meilensteine dieser Entwicklung sind YOLOv10 und RTDETRv2. Beide Modelle zielen darauf ab, einen grundlegenden Engpass herkömmlicher Erkennungspipelines zu beseitigen, indem sie auf die Nachverarbeitung durch Nicht-Maximum-Unterdrückung (NMS) verzichten. Sie verfolgen dabei jedoch völlig unterschiedliche Architekturansätze.

Dieser technische Vergleich analysiert ihre Architekturen, Trainingsmethoden und idealen Bereitstellungsszenarien eingehend, damit Entwickler und Forscher das passende Werkzeug für ihr nächstes Vision-KI-Projekt auswählen können.

YOLOv10: Der Wegbereiter der NMS-freien Erkennung#

YOLOv10 wurde von Forschern der Tsinghua-Universität entwickelt und legt großen Wert auf architektonische Effizienz sowie die Beseitigung von Engpässen bei der Nachverarbeitung. Durch konsistente doppelte Zuweisungen für das NMS-freie Training erreicht das Modell eine wettbewerbsfähige Leistung und verringert zugleich die Inferenzlatenz erheblich.

Technische Daten#

Architektur und Methoden#

Der wichtigste Durchbruch von YOLOv10 ist sein ganzheitliches Modelldesign, das Effizienz und Genauigkeit in Einklang bringt. Es optimiert verschiedene Komponenten anhand beider Kriterien und verringert dadurch den Rechenaufwand erheblich. Dank der Strategie der konsistenten doppelten Zuweisung kann das Modell ohne NMS trainiert werden, was eine optimierte End-to-End-Bereitstellung ermöglicht. Das ist besonders vorteilhaft, wenn Modelle in Edge-Formate wie ONNX oder TensorRT exportiert werden, da Nachverarbeitungsschritte dort zu unerwarteten Latenzen führen können.

Stärken und Schwächen#

Das Modell bietet ein hervorragendes Verhältnis von Geschwindigkeit zu Genauigkeit, insbesondere in den kleineren Varianten (N und S). Dank der minimalen Latenz eignet es sich ideal für schnelle Edge-Umgebungen. YOLOv10 überzeugt zwar durch seine reine Erkennungsgeschwindigkeit, bleibt jedoch auf die Erkennung spezialisiert. Teams, die Instanzsegmentierung oder Posenschätzung benötigen, sollten daher vielseitigere Frameworks in Betracht ziehen.

Mehr über YOLOv10 erfahren

RTDETRv2: Weiterentwicklung des Detection Transformers#

RTDETRv2 baut auf dem ursprünglichen Real-Time Detection Transformer auf und ergänzt ihn um ein „Bündel kostenloser Verbesserungen“, das die Ausgangsleistung steigert. Das Modell zeigt, dass Transformer in Echtzeitszenarien mit CNNs konkurrieren können.

Technische Daten#

Architektur und Methoden#

RTDETRv2 verwendet eine hybride Architektur, die einen Backbone aus einem konvolutionellen neuronalen Netz (CNN) zur Extraktion visueller Merkmale mit einem Transformer-Encoder-Decoder für ein umfassendes Szenenverständnis kombiniert. Dank des Selbstaufmerksamkeitsmechanismus kann der Transformer das gesamte Bild erfassen. Dadurch eignet sich das Modell besonders gut für komplexe Szenen, überlappende Objekte und dicht gedrängte Menschenmengen.

Stärken und Schwächen#

Die Transformer-Architektur bietet eine hervorragende Genauigkeit, insbesondere bei größeren Parameterzahlen, und gibt die finalen Erkennungen nativ ohne NMS aus. Das hat jedoch seinen Preis. Transformer-Modelle benötigen beim Training traditionell deutlich mehr CUDA-Speicher und konvergieren möglicherweise langsamer als reine CNN-Architekturen. RTDETRv2 bietet zwar höhere Inferenzgeschwindigkeiten, verbraucht aber im Allgemeinen mehr Speicher als kompakte YOLO-Varianten.

Erfahre mehr über RTDETRv2

Leistungsvergleich#

Die Auswertung der Leistungskennzahlen zeigt klarer, worin die Stärken der einzelnen Modelle liegen. Die folgende Tabelle hebt ihre Fähigkeiten auf dem COCO-Datensatz hervor:

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Bei der Analyse der Daten zeigt sich, dass YOLOv10 bei vergleichbaren Größen eine klare Überlegenheit bei der Parametereffizienz und der TensorRT-Inferenzgeschwindigkeit behält. RTDETRv2-x erreicht die Genauigkeit von YOLOv10x, benötigt jedoch mehr als 2,5-mal so viele Parameter (76 Mio. gegenüber 29,5 Mio.) und deutlich mehr FLOPs.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv10 und RT-DETR hängt von deinen konkreten Projektanforderungen, Bereitstellungsbeschränkungen und Präferenzen für das jeweilige Ökosystem ab.

Wann du YOLOv10 wählen solltest#

YOLOv10 eignet sich besonders für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du RT-DETR wählen solltest#

RT-DETR empfiehlt sich für:

  • Forschung zu Transformer-basierter Erkennung: Projekte, die Aufmerksamkeitsmechanismen und Transformer-Architekturen für die End-to-End-Objekterkennung ohne NMS untersuchen.
  • Anwendungsfälle mit hohen Genauigkeitsanforderungen und flexibler Latenz: Anwendungen, bei denen die Erkennungsgenauigkeit oberste Priorität hat und eine etwas höhere Inferenzlatenz akzeptabel ist.
  • Erkennung großer Objekte: Szenen mit überwiegend mittelgroßen bis großen Objekten, bei denen der globale Aufmerksamkeitsmechanismus von Transformern einen natürlichen Vorteil bietet.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Der Vorteil von Ultralytics: Ökosystem und Innovation#

YOLOv10 und RTDETRv2 bieten zwar robuste Erkennungsfunktionen, doch bei der Modellwahl kommt es oft auch auf das zugehörige Softwareökosystem an. Die Ultralytics Platform bietet eine nahtlose, einheitliche Benutzeroberfläche, die die Komplexität des Deep Learning abstrahiert.

Der neue Standard: Ultralytics YOLO26#

Für Entwickler, die die bestmögliche Leistung erzielen möchten, vereint Ultralytics YOLO26 die jüngsten Fortschritte in der Architektur. YOLO26 wurde Anfang 2026 veröffentlicht und übernimmt das von YOLOv10 eingeführte End-to-End-Design ohne NMS als optionale Erkennungskomponente (nms=False), wodurch die NMS-Nachverarbeitung entfällt und die Bereitstellung schneller und einfacher wird.

Warum YOLO26 wählen?

YOLO26 bringt Innovationen aus dem LLM-Training in die Computer Vision ein: Der MuSGD-Optimierer (eine Kombination aus SGD und Muon) sorgt für stabileres Training und schnellere Konvergenz. Außerdem bietet das Modell eine bis zu 43 % schnellere CPU-Inferenz und ist damit die erste Wahl für Edge Computing.

Darüber hinaus führt YOLO26 ProgLoss + STAL ein, um die Erkennung kleiner Objekte deutlich zu verbessern. Anders als das spezialisierte YOLOv10 ist YOLO26 vielseitig einsetzbar. Das Modell unterstützt nativ Objekterkennung, Segmentierung, Posenschätzung und orientierte Begrenzungsrahmen (OBB) und bietet aufgabenspezifische Verbesserungen wie einen Verlust für semantische Segmentierung sowie die Residual-Log-Likelihood-Schätzung (RLE) für die Posenschätzung. Darüber hinaus vereinfacht der Wegfall des Distribution Focal Loss (DFL) den Export und verbessert die Kompatibilität mit Geräten mit geringem Stromverbrauch.

Benutzerfreundlichkeit und Trainingseffizienz#

Ob du ältere Modellgenerationen wie Ultralytics YOLO11 oder das hochmoderne YOLO26 ausprobierst: Die optimierte Python-API sorgt für einen geringeren Speicherbedarf beim Training und besonders schnelle Arbeitsabläufe.

from ultralytics import RTDETR, YOLO

# Trainiere das YOLOv10-Modell mit End-to-End-Architektur
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Alternativ kannst du RTDETR mit derselben API auswerten
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

Das gut gepflegte Ökosystem bietet Tools für eine einfache Hyperparameteroptimierung und lässt sich nahtlos in umfangreiche Tracking-Lösungen und Optionen für die Modellbereitstellung integrieren.

Fazit#

YOLOv10 und RTDETRv2 sind bedeutende Meilensteine auf dem Weg zur Objekterkennung ohne NMS. RTDETRv2 zeigt, dass Transformer mit einem hervorragenden Verständnis globaler Zusammenhänge echtzeitfähige Latenzen erreichen können, allerdings bei höherem Speicherbedarf. YOLOv10 bietet eine hocheffiziente, schnelle CNN-Alternative für Erkennungsaufgaben mit begrenzten Ressourcen.

Für eine ausgewogene Leistung, vielseitige Einsatzmöglichkeiten und das ausgereifteste Ökosystem sollten Entwickler jedoch vor allem Ultralytics YOLO26 nutzen. Das Modell verbindet die Architekturinnovationen seiner Vorgänger mit robusten, benutzerfreundlichen Tools, die eine nahtlose Bereitstellung von Vision-KI ermöglichen.

Kommentare