Ultralytics YOLO27:
Get Started

DAMO-YOLO vs. YOLOv10#

Die Computer Vision hat eine rasante Entwicklung bei Architekturen zur Echtzeit-Objekterkennung erlebt. Beim Vergleich von DAMO-YOLO und YOLOv10 zeigen sich zwei unterschiedliche Ansätze beim Modelldesign: die automatisierte Architektursuche und die End-to-End-Optimierung ohne NMS. Beide erweitern die Grenzen von Genauigkeit und Geschwindigkeit, doch ihre zugrunde liegenden Strukturen und idealen Einsatzbereiche unterscheiden sich deutlich.

DAMO-YOLO: Neuronale Architektursuche im großen Maßstab#

DAMO-YOLO wurde von der Alibaba Group entwickelt und ist ein leistungsstarker Detektor, der auf automatisierte Suche nach struktureller Effizienz setzt.

Architekturmerkmale#

DAMO-YOLO setzt stark auf die Suche nach neuronalen Architekturen (NAS), um Leistung und Latenz auszubalancieren. Sein Backbone mit dem Namen MAE-NAS nutzt eine Suche unter strengen Rechenbudgets, die von maximaler Entropie geleitet wird, um die optimale Tiefe und Breite der Schichten zu ermitteln.

Für die Fusion von Merkmalen über verschiedene Skalen hinweg verwendet das Modell ein effizientes RepGFPN (rekonfiguriertes verallgemeinertes Merkmals-Pyramidennetzwerk). Dieses aufwendige Neck-Design eignet sich besonders gut dazu, komplexe räumliche Hierarchien zu extrahieren, und ist daher beispielsweise für die Analyse von Luftaufnahmen nützlich. Außerdem führt DAMO-YOLO ZeroHead ein, einen schlanken Erkennungskopf, der die Komplexität der abschließenden Vorhersageschichten deutlich reduziert und sich während des Trainings auf einen robusten Destillationsprozess stützt.

Training durch Destillation

DAMO-YOLO verwendet häufig ein mehrstufiges Verfahren zur Wissensdestillation. Dafür muss ein umfangreicheres „Lehrer“-Modell trainiert werden, das das kleinere „Schüler“-Modell anleitet. So lässt sich ein höherer mAP (mittlere durchschnittliche Präzision) erreichen, allerdings steigt dadurch die erforderliche GPU-Rechenzeit erheblich.

Erfahre mehr über DAMO-YOLO

YOLOv10: Wegweisend bei der End-to-End-Objekterkennung#

YOLOv10 wurde eineinhalb Jahre später veröffentlicht und führte einen Paradigmenwechsel ein, indem es bei der Inferenz vollständig auf Non-Maximum Suppression (NMS) verzichtet.

Architekturmerkmale#

Das herausragende Merkmal von YOLOv10 sind die konsistenten dualen Zuweisungen für das Training ohne NMS. Herkömmliche Detektoren sagen für ein einzelnes Objekt mehrere überlappende Begrenzungsrahmen voraus, die durch NMS gefiltert werden müssen, um Duplikate zu entfernen. Dieser Nachverarbeitungsschritt wird zum Engpass, besonders auf Edge-Geräten. YOLOv10 löst dieses Problem, indem das Modell auf natürliche Weise einen einzelnen, präzisen Begrenzungsrahmen pro Objekt vorhersagt.

Die Autoren legten außerdem den Schwerpunkt auf ein ganzheitliches Modelldesign, das Effizienz und Genauigkeit miteinander verbindet. Durch eine sorgfältige Analyse redundanter Berechnungen in bestehenden Architekturen optimierten sie Backbone und Kopf, um die Anzahl der FLOPs und Parameter zu verringern. Dank dieses leichten Designs erreicht YOLOv10 eine außergewöhnlich geringe Inferenzlatenz, wenn es in Formate wie TensorRT oder OpenVINO exportiert wird.

Mehr über YOLOv10 erfahren

Leistung und Benchmarks#

Die folgende Tabelle zeigt die unverarbeiteten Leistungskennzahlen auf dem COCO-Datensatz. Die jeweils besten Gesamtwerte pro Spalte sind fett hervorgehoben.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

DAMO-YOLO kann bei der Genauigkeit durchaus mithalten, doch YOLOv10 erzielt bei vergleichbarer Größe eine höhere Genauigkeit und benötigt deutlich kleinere Modellgewichte. So erreicht YOLOv10s beispielsweise einen etwas höheren mAP (46,3 %) als DAMO-YOLOs (46,0 %) und benötigt dabei weniger als halb so viele Parameter (7,2 Mio. gegenüber 16,3 Mio.). Der geringere Speicherbedarf macht YOLOv10 zu einer besonders vielseitigen Wahl für eingebettete Systeme.

Trainingseffizienz und Benutzerfreundlichkeit#

Beim Übergang von der akademischen Forschung zum produktiven Einsatz ist die Benutzerfreundlichkeit entscheidend. Das mehrstufige Destillationsverfahren und die komplexen NAS-Konfigurationen von DAMO-YOLO können für Entwicklungsteams eine steile Lernkurve bedeuten.

YOLOv10 hingegen profitiert stark von der vollständigen Integration in das Ultralytics Python SDK. Für das Training eines benutzerdefinierten Modells ist nur wenig Boilerplate-Code nötig. Ultralytics übernimmt Datenerweiterung, Abstimmung der Hyperparameter und Experimentverfolgung automatisch.

from ultralytics import YOLO

# Ein vortrainiertes YOLOv10-Nano-Modell laden
model = YOLO("yolov10n.pt")

# Mit integrierter Validierung auf einem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Nahtlos Inferenz auf einem Bild ausführen
prediction = model("path/to/image.jpg")
prediction[0].show()
Schnelles Prototyping

Mit dem Ultralytics-Ökosystem können Entwickler mit wenigen Codezeilen vom Prototyp zu einem vollständig exportierten ONNX-Modell gelangen und dabei die komplexe Einrichtung der Umgebungen umgehen, die ältere Frameworks erfordern.

Anwendungsfälle in der Praxis#

  • Intelligenter Einzelhandel (DAMO-YOLO): Die Genauigkeit von DAMO-YOLO eignet sich gut für Serverumgebungen mit hoher Dichte, in denen Kundenverhalten analysiert wird, GPUs reichlich verfügbar sind und sich Engpässe durch NMS in Echtzeit bewältigen lassen.
  • Autonome Fahrzeuge (YOLOv10): Die Architektur ohne NMS garantiert eine deterministische, vorhersehbare Latenz – entscheidend für Sicherheitssysteme beim autonomen Fahren.
  • Industrielle Automatisierung (YOLOv10): Die Erkennung von Fehlern auf schnell laufenden Montagelinien erfordert Modelle, die die Geschwindigkeit der Echtzeit-Inferenz maximieren, ohne große Mengen VRAM zu verbrauchen. Deshalb eignet sich YOLOv10 besonders gut für den Einsatz am Edge.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen DAMO-YOLO und YOLOv10 hängt von deinen spezifischen Projektanforderungen, Bereitstellungseinschränkungen und Präferenzen für das Ökosystem ab.

Wann du DAMO-YOLO wählen solltest#

DAMO-YOLO eignet sich besonders für:

  • Videoanalyse mit hohem Durchsatz: Verarbeitung von Videostreams mit hoher Bildrate auf fest installierter NVIDIA-GPU-Infrastruktur, bei der der Durchsatz mit Batchgröße 1 im Vordergrund steht.
  • Industrielle Fertigungslinien: Szenarien mit strengen GPU-Latenzvorgaben auf dedizierter Hardware, etwa die Qualitätsprüfung in Echtzeit auf Fließbändern.
  • Forschung zur neuronalen Architektursuche: Untersuchung der Auswirkungen automatisierter Architektursuche (MAE-NAS) und effizienter Architekturen mit reparametrisierten Rückgraten auf die Erkennungsleistung.

Wann du YOLOv10 wählen solltest#

YOLOv10 empfiehlt sich für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die nächste Generation: Ultralytics YOLO26 ist da#

YOLOv10 ebnete den Weg für die Erkennung ohne NMS, doch die Technologie hat sich rasant weiterentwickelt. Für moderne Anwendungen bietet das Modell Ultralytics YOLO26 eine herausragende Leistung und Benutzerfreundlichkeit: Es vereint die Stärken früherer Generationen und optimiert sie für den produktiven Einsatz.

YOLO26 bietet einen nativen End-to-End-Modus (nms=False), der die Nachverarbeitung durch NMS überspringt und so Bereitstellungspipelines für Edge-Geräte vereinfacht. Darüber hinaus hat der Wegfall des Distribution Focal Loss (DFL) die Kompatibilität mit stromsparender Edge-KI-Hardware erheblich verbessert.

Für das Training führt YOLO26 den MuSGD-Optimierer ein, einen hybriden Optimierer, der von Trainingstechniken für große Sprachmodelle (LLM) inspiriert ist. Er sorgt für stabileres Training und schnellere Konvergenz. Zusammen mit den Loss-Funktionen ProgLoss + STAL erzielt YOLO26 bemerkenswerte Verbesserungen bei der Erkennung kleiner Objekte – entscheidend für den Schutz von Wildtieren und den Drohneneinsatz.

Wichtig ist, dass YOLO26 nicht nur ein Objektdetektor ist. Das Modell bietet umfassende, auf die jeweilige Aufgabe zugeschnittene Verbesserungen und unterstützt nativ Instanzsegmentierung, Posenschätzung mithilfe der Residual-Log-Likelihood-Schätzung (RLE) sowie spezielle Winkelfunktionen für orientierte Begrenzungsrahmen (OBB). Mit einer bis zu 43 % schnelleren CPU-Inferenz als bei seinen Vorgängern ist es die maßgebliche Wahl für agile Entwicklungsteams.

Für die zentrale Verwaltung, Annotation und das Cloud-Training von YOLO26-Modellen bietet die Ultralytics Platform eine intuitive Oberfläche, die den gesamten Computer-Vision-Lebenszyklus vereinfacht.

Entwickler, die weitere aktuelle Fortschritte erkunden möchten, können auch Ultralytics YOLO11 oder das transformerbasierte Framework RT-DETR für Anwendungsfälle mit anderen Architekturansätzen bewerten.

Kommentare