Ultralytics YOLO27:
Get Started

YOLOv10 und YOLO26#

Die Computer Vision hat sich in den letzten Jahren bemerkenswert weiterentwickelt: Komplexe Architekturen mit umfangreicher Nachverarbeitung wurden durch schlanke End-to-End-Modelle abgelöst. Dieser technische Vergleich beleuchtet zwei wichtige Meilensteine dieser Entwicklung: den akademischen Durchbruch YOLOv10 und das hochmoderne, für Unternehmen geeignete YOLO26. Anhand ihrer Architekturen, Trainingsmethoden und Möglichkeiten für den praktischen Einsatz können Entwickler fundierte Entscheidungen für ihre nächste KI-Anwendung zur Bildverarbeitung treffen.

YOLOv10: Wegweisend bei der End-to-End-Objekterkennung#

YOLOv10 wurde Mitte 2024 veröffentlicht und bedeutete einen wichtigen Fortschritt in der akademischen Computer-Vision-Forschung, da es einen der hartnäckigsten Engpässe bei der Echtzeit-Objekterkennung angeht: Non-Maximum Suppression (NMS). Herkömmliche Objektdetektoren waren stark auf NMS angewiesen, um überflüssige Begrenzungsrahmen herauszufiltern. Das verursachte variable Latenz bei der Inferenz und erschwerte die Bereitstellung auf Edge-Geräten.

Das Team der Tsinghua-Universität führte eine konsistente duale Zuweisungsstrategie für das Training ohne NMS ein. Dadurch konnte das Modell Begrenzungsrahmen präzise vorhersagen, ohne einen Filterschritt zur Nachverarbeitung zu benötigen. Das verbesserte direkt die Inferenzlatenz und erleichterte die Bereitstellung auf Hardwarebeschleunigern. Obwohl das Modell bei herkömmlichen Erkennungsaufgaben sehr effizient ist, konzentriert es sich vor allem auf die Vorhersage von Begrenzungsrahmen und unterstützt komplexere Aufgaben wie Instanzsegmentierung oder Posenschätzung nicht nativ.

Mehr über YOLOv10 erfahren

YOLO26: Der neue Standard für Edge- und Cloud-Bildverarbeitung mit KI#

YOLO26 baut auf den zuvor entwickelten Konzepten zur Vermeidung von NMS auf und setzt neue Maßstäbe bei Leistung und Vielseitigkeit. Das Modell wurde sowohl für akademische Forschung als auch für den Einsatz in Unternehmen entwickelt und bietet dank eines optionalen One-to-one-Heads (nms=False) ein End-to-End-Design ohne NMS. Dieser überspringt die NMS-Nachverarbeitung und ermöglicht eine schnellere und einfachere Bereitstellung auf sämtlicher unterstützter Hardware.

YOLO26 bringt mehrere grundlegende Architekturverbesserungen mit sich. Durch den Wegfall von Distribution Focal Loss (DFL) wird der Modelleexport erheblich vereinfacht und die Kompatibilität mit stromsparenden Edge-Geräten verbessert. Zusammen mit diesen strukturellen Änderungen ermöglicht YOLO26 eine bis zu 43 % schnellere CPU-Inferenz und eignet sich damit besonders für IoT- und Robotikanwendungen, bei denen möglicherweise keine GPU-Beschleunigung verfügbar ist.

Der MuSGD-Optimierer, eine von Trainingsmethoden für LLMs inspirierte Kombination aus SGD und Muon, sorgt für wesentlich stabileres Training und schnellere Konvergenz. Zusammen mit fortschrittlichen Verlustfunktionen wie ProgLoss + STAL verbessert YOLO26 die Erkennung kleiner Objekte deutlich. Außerdem umfasst das Modell aufgabenspezifische Verbesserungen: Prototypenbildung über mehrere Maßstäbe für die Segmentierung, Residual Log-Likelihood Estimation (RLE) für die Posenschätzung und eine spezielle Winkelfunktion zur Behebung von Randproblemen bei der Erkennung orientierter Begrenzungsrahmen (OBB).

Bereitstellung in Unternehmen

Teams, die ihre Computer-Vision-Workflows ausbauen möchten, profitieren von der nahtlosen Integration von YOLO26 in die Ultralytics-Plattform. Sie bietet intuitive Datenannotation, automatisiertes Cloud-Training und Bereitstellung mit nur einem Klick, ohne dass eine umfangreiche MLOps-Infrastruktur erforderlich ist.

Technischer Leistungsvergleich#

Beim Vergleich dieser Modelle sind Genauigkeit, Modellgröße und Inferenzgeschwindigkeit entscheidend. Die folgende Tabelle zeigt die Leistung beider Modellfamilien in verschiedenen Größenklassen, gemessen am Standard-COCO-Datensatz.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Die Daten zeigen klar, welche Vorteile die neuere Architektur bietet. YOLO26 erreicht in allen Größenklassen eine höhere mAP (mittlere durchschnittliche Präzision) und behält zugleich eine sehr konkurrenzfähige Inferenzgeschwindigkeit bei. Der Wegfall von DFL trägt speziell zur herausragenden CPU-Leistung von YOLO26 mit ONNX bei – ein Bereich, in dem frühere Generationen häufig Schwierigkeiten hatten.

Trainingsmethoden und Ökosystem#

Der Nutzen eines Modells hängt auch von dem Ökosystem ab, das es unterstützt. YOLOv10 bot zwar eine hervorragende akademische Implementierung auf Grundlage von PyTorch, erfordert für Aufgaben jenseits der grundlegenden Erkennung aber häufig eine manuelle Konfiguration.

YOLO26 ist dagegen vollständig in das gut gepflegte Ultralytics-Ökosystem integriert. Beim Training benötigt es deutlich weniger Speicher als Transformer-basierte Modelle wie RT-DETR. Dadurch können Forschende hochmoderne Netzwerke auf handelsüblicher Hardware trainieren. Die Benutzerfreundlichkeit ist unübertroffen: Eine einheitliche API übernimmt automatisch Datenerweiterung, Hyperparameteroptimierung und Protokollierung.

Codebeispiel: YOLO26 trainieren#

Für das Training eines vielseitigen und hochpräzisen Modells genügen wenige Zeilen Python-Code:

from ultralytics import YOLO

# Das hochoptimierte kleine YOLO26-Modell laden
model = YOLO("yolo26s.pt")

# Das Modell effizient mit automatischer Speicherverwaltung trainieren
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
)

# Den One-to-one-Head ohne NMS nach TensorRT exportieren
model.export(format="engine", nms=False)

Anwendungen und Anwendungsfälle in der Praxis#

Die Wahl der passenden Architektur hängt vollständig von den Einsatzbedingungen ab.

Hochgeschwindigkeits-Edge-Computing#

Für Anwendungen, die eine schnelle Bereitstellung auf Mikrocontrollern, in der Robotik oder auf älteren Mobilgeräten erfordern, ist YOLO26 dank bis zu 43 % schnellerer CPU-Inferenz die eindeutige Wahl. Die NMS-freie und DFL-freie Architektur lässt sich nahtlos in Formate wie OpenVINO und TensorRT konvertieren – ideal für Videoanalysen in Echtzeit in der Infrastruktur intelligenter Städte.

Fortgeschrittene Vision mit mehreren Aufgaben#

YOLOv10 ist zwar besonders stark bei der reinen Begrenzungsrahmenerkennung, doch Projekte, die ein umfassendes visuelles Verständnis erfordern, sollten auf YOLO26 setzen. Von der Instanzsegmentierung in der medizinischen Bildgebung bis zur präzisen Posenschätzung für Sportanalysen bietet YOLO26 aufgabenspezifische Verlustfunktionen, die eine überragende Genauigkeit in unterschiedlichen Anwendungsbereichen gewährleisten.

Alternativen

Wenn dein Projekt eine robuste Erkennung mit offenem Vokabular erfordert, solltest du YOLO-World ausprobieren. Für alle, die bestehende Pipelines weiter betreiben, bleibt YOLO11 eine vollständig unterstützte und leistungsstarke Alternative innerhalb des Ultralytics-Frameworks.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv10 und YOLO26 hängt von den konkreten Anforderungen deines Projekts, den Einsatzbedingungen und den Präferenzen für das jeweilige Ökosystem ab.

Wann du YOLOv10 wählen solltest#

YOLOv10 eignet sich besonders für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du YOLO26 wählen solltest#

YOLO26 wird empfohlen für:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Fazit#

Der Übergang von YOLOv10 zu YOLO26 verdeutlicht einen entscheidenden Wandel: weg vom akademischen Machbarkeitsnachweis und hin zu produktionsreifen Unternehmenslösungen. Mit seinem wegweisenden NMS-freien Design sowie dem MuSGD-Optimierer, ProgLoss und einer verbesserten Kompatibilität mit Edge-Geräten setzt YOLO26 neue Maßstäbe für die Möglichkeiten der Computer Vision in Echtzeit. Für Entwickler, die die optimale Balance aus Geschwindigkeit, Genauigkeit und Benutzerfreundlichkeit anstreben, ist YOLO26 die klare Empfehlung.

Mitwirkende

Kommentare