Ultralytics YOLO27:
Get Started

DAMO-YOLO und RTDETRv2#

Die rasante Entwicklung der Computer Vision hat eine beeindruckende Vielfalt an Architekturen hervorgebracht, die Geschwindigkeit, Genauigkeit und Recheneffizienz in Einklang bringen sollen. Zwei herausragende Modelle, die mit unterschiedlichen Ansätzen zu diesen Herausforderungen beitragen, sind DAMO-YOLO und RTDETRv2. Beide Modelle zielen auf moderne Lösungen für Echtzeitinferenz ab, unterscheiden sich jedoch grundlegend in ihren Architekturkonzepten.

Dieser umfassende Leitfaden geht ausführlich auf die technischen Daten, architektonischen Neuerungen und praktischen Anwendungsfälle beider Modelle ein. Außerdem zeigt er, wie moderne Lösungen wie die Ultralytics Platform und das hochmoderne YOLO26 Branchenstandards bei Bereitstellung und Benutzerfreundlichkeit neu definiert haben.

Modellübersicht#

DAMO-YOLO im Überblick#

DAMO-YOLO wurde von Forschern der Alibaba Group entwickelt und bietet ein schnelles, genaues Verfahren zur Objekterkennung, das stark auf neuronaler Architektursuche (NAS) beruht. Statt herkömmlicher, von Hand entworfener Backbones kommen durch NAS erzeugte Strukturen mit niedriger Latenz zum Einsatz. Das Modell integriert außerdem ein effizientes RepGFPN (parametrisiertes verallgemeinertes Merkmals-Pyramidennetzwerk) sowie ein ZeroHead-Design, um die Merkmalsaggregation und Vorhersage von Begrenzungsrahmen zu vereinfachen.

Wichtige Modelldetails:

Mehr über DAMO-YOLO erfahren

RTDETRv2 im Überblick#

Das RTDETRv2-Modell von Baidu ist ein bedeutender Fortschritt bei Echtzeit-Detektoren auf Transformer-Basis. Anders als herkömmliche faltende neuronale Netze (CNNs), die auf Ankerrahmen und Non-Maximum Suppression (NMS) setzen, nutzt RTDETRv2 Selbstaufmerksamkeitsmechanismen, um den Bildkontext als Ganzes zu erfassen. Das Modell gibt Begrenzungsrahmen direkt aus und überspringt die Nachverarbeitung durch NMS vollständig. Eine Trainingsstrategie mit zusätzlichen kostenlosen Verbesserungen steigert die Grundgenauigkeit, ohne die Inferenzlatenz zu erhöhen.

Wichtige Modelldetails:

Erfahre mehr über RTDETRv2

Transformer in der visuellen KI nutzen

Transformer benötigen zwar mehr Rechenressourcen, doch dank ihrer Fähigkeit, globale Zusammenhänge zu erfassen, sind sie äußerst effektiv beim Verständnis komplexer Szenen – eine der großen Stärken von RTDETRv2.

Leistungsvergleich#

Bei der Bewertung dieser Modelle für den praktischen Einsatz sind Kennzahlen wie die mittlere durchschnittliche Präzision (mAP), die Inferenzgeschwindigkeit und der Speicherbedarf entscheidend. Transformer-Modelle wie RTDETRv2 benötigen beim Training und bei der Inferenz im Allgemeinen mehr CUDA-Speicher als leichte faltende neuronale Netze wie DAMO-YOLO.

Im Folgenden findest du einen ausführlichen Vergleich ihrer Leistungskennzahlen.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Ideale Anwendungsfälle#

Die Stärken von DAMO-YOLO: Dank seines NAS-optimierten Backbones und der besonders geringen Parameterzahl kleinerer Varianten wie DAMO-YOLOt eignet sich das Modell hervorragend für den Einsatz auf Hardware mit starken Einschränkungen. Wenn du Lösungen für eingebettete Geräte mit Laufzeitumgebungen wie ONNX oder spezialisierten TensorRT-Engines für Edge Computing entwickelst, bietet DAMO-YOLO ein sehr reaktionsschnelles Framework.

Die Stärken von RTDETRv2: RTDETRv2 glänzt in Szenarien mit GPUs der Serverklasse, in denen der globale Bildkontext entscheidend ist. Dank seiner Transformer-Architektur kann das Modell sich überschneidende Begrenzungsrahmen ohne NMS auf natürliche Weise auflösen. Das macht es zu einer robusten Wahl für die Menschenmengenverwaltung oder die komplexe Objektverfolgung, bei der räumliche Beziehungen zwischen weit voneinander entfernten Objekten entscheidend sind.

Der Vorteil von Ultralytics: YOLO26 im Überblick#

DAMO-YOLO und RTDETRv2 sind zwar bedeutende akademische Leistungen, doch die Überführung dieser Modelle in skalierbare, produktionsreife Anwendungen kann schwierig sein. Entwickler stoßen häufig auf fragmentierte Codebasen, fehlende Unterstützung für das Lernen mehrerer Aufgaben und komplizierte Bereitstellungspipelines.

Hier hebt sich das Ultralytics-Ökosystem deutlich ab. Ultralytics stellt Benutzerfreundlichkeit, eine gut gepflegte Python-API und unübertroffene Vielseitigkeit in den Mittelpunkt. So verbringen Entwickler weniger Zeit mit der Fehlersuche und mehr Zeit mit der Entwicklung.

Das kürzlich veröffentlichte Ultralytics YOLO26 baut diese Vorteile weiter aus und bietet Neuerungen, die sowohl DAMO-YOLO als auch RTDETRv2 übertreffen:

  • End-to-End-Design ohne NMS: Ursprünglich in YOLOv10 entwickelt, bietet YOLO26 einen optionalen End-to-End-Kopf (nms=False). Dadurch entfällt die NMS-Nachverarbeitung, was die Bereitstellung schneller und deutlich einfacher als bei herkömmlichen CNNs macht und zugleich die Vorteile der direkten Ausgabe von RTDETRv2 bietet.
  • Bis zu 43 % schnellere CPU-Inferenz: YOLO26n läuft auf CPU ONNX bis zu 43 % schneller als YOLO11n und ist stark für Edge-KI-Geräte ohne dedizierte GPUs optimiert. Damit ist es für IoT-Anwendungen eine weitaus bessere Wahl als speicherintensive Transformer.
  • MuSGD-Optimierer: Inspiriert von Kimi K2 von Moonshot AI, überträgt diese Kombination aus SGD und Muon Trainingsinnovationen aus dem Bereich großer Sprachmodelle in die Computer Vision. Das Ergebnis sind bemerkenswert stabile Trainingsläufe und eine schnellere Konvergenz.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich – ein Bereich, mit dem Modelle traditionell Schwierigkeiten haben. Das ist entscheidend für Luftaufnahmen und Drohnenanwendungen.
  • Entfernung von DFL: Distribution Focal Loss wurde entfernt, um Exportformate zu vereinfachen und die Kompatibilität mit Edge-Geräten mit geringem Stromverbrauch zu verbessern.
  • Unübertroffene Vielseitigkeit: Anders als Konkurrenzmodelle, die ausschließlich auf Erkennung beschränkt sind, bietet YOLO26 durchgängige, aufgabenspezifische Verbesserungen, darunter einen speziellen Winkelfehler für orientierte Begrenzungsrahmen (OBB), einen Verlust für semantische Segmentierung für pixelgenaue Genauigkeit und eine Residual-Log-Likelihood-Schätzung (RLE) für die Posenschätzung.
Speichereffizienz ist entscheidend

Das Training transformerbasierter Modelle wie RTDETRv2 erfordert enorme CUDA-Speicherzuweisungen und macht häufig kostspielige Systeme mit mehreren GPUs erforderlich. Ultralytics YOLO-Modelle benötigen sowohl beim Training als auch bei der Inferenz deutlich weniger Speicher und machen die KI-Entwicklung so für Forschende und Hobbyentwickler gleichermaßen zugänglich.

Codebeispiel: Die einheitliche Ultralytics-API#

Einer der größten Vorteile des Ultralytics-Ökosystems ist seine einheitliche API. Du kannst verschiedene Modelle nahtlos laden, trainieren und validieren – darunter eine PyTorch-Implementierung von RT-DETR und hochmoderne YOLO-Modelle –, ohne deinen Arbeitsablauf zu ändern.

from ultralytics import RTDETR, YOLO

# Ein RT-DETR-Modell laden
model_rtdetr = RTDETR("rtdetr-l.pt")

# Das hochmoderne YOLO26-Modell laden
model_yolo = YOLO("yolo26n.pt")

# Inferenz mit einer einfachen, einheitlichen Schnittstelle für ein Bild ausführen
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Die erkannten Objekte anzeigen
results_yolo[0].show()

Diese Einfachheit gilt auch für das Training mit benutzerdefinierten Datensätzen und den Export. Mit dem Ultralytics-Python-Paket können Entwickler ihre trainierten Gewichte ganz einfach mit einem einzigen Befehl auf Bereitstellungsplattformen wie CoreML oder OpenVINO übertragen.

Fazit und weiterführende Informationen#

Sowohl DAMO-YOLO als auch RTDETRv2 haben die Grenzen des Machbaren bei der Objekterkennung in Echtzeit zweifellos erweitert. DAMO-YOLO bietet hochoptimierte, automatisch ermittelte Netzwerkstrukturen für maximale Effizienz, während RTDETRv2 zeigt, dass Transformer im Echtzeitbereich konkurrieren können, indem sie herkömmliche Engpässe wie NMS beseitigen.

Für Entwickler, die das optimale Gleichgewicht aus Leistung, umfassender Dokumentation und Produktionsreife suchen, bleiben Ultralytics YOLO-Modelle jedoch der Goldstandard. Mit YOLO26 erhalten Nutzer optional eine transformerähnliche End-to-End-Erkennung, eine von LLMs inspirierte Trainingseffizienz und eine beispiellose CPU-Geschwindigkeit – alles in einem intuitiven und robusten Ökosystem.

Wenn du Modelle für dein nächstes Projekt evaluierst, sind vielleicht auch unsere Vergleiche zu EfficientDet vs. RT-DETR, zur vorherigen Generation YOLO11 oder zu akademischen Referenzmodellen wie YOLOX interessant. Starte noch heute und informiere dich im Ultralytics-Schnellstartleitfaden.

Kommentare