Ultralytics YOLO27:
Get Started

YOLOv10 vs. YOLO11#

Die Computer Vision entwickelt sich ständig weiter, und neue Architekturen erweitern die Grenzen der Echtzeitverarbeitung. Für Entwickler und Forschende, die sich in diesem dynamischen Feld zurechtfinden müssen, ist es entscheidend, die Unterschiede zwischen modernen Modellen zu verstehen. Dieser ausführliche Vergleich untersucht die technischen Unterschiede, Kompromisse bei der Leistung und idealen Anwendungsfälle von YOLOv10 und Ultralytics YOLO11, zwei leistungsfähigen Frameworks für die Objekterkennung.

Beide Modelle erzielen zwar bemerkenswerte Ergebnisse auf Benchmark-Datensätzen, unterscheiden sich jedoch deutlich in ihren grundlegenden Designphilosophien und der Integration in ihre jeweiligen Ökosysteme. Ein Vergleich ihrer Architekturen zeigt, welche Lösung am besten zu deinen Einsatzbedingungen und Projektzielen passt.

YOLOv10: Wegweisende NMS-freie Erkennung von Anfang bis Ende#

YOLOv10 wurde im Frühjahr 2024 veröffentlicht und führte einen neuartigen Ansatz für die traditionelle Pipeline zur Objekterkennung ein, indem es die zusätzliche Latenz durch die Nachverarbeitung direkt angeht.

Die herausragende Neuerung von YOLOv10 ist die Strategie der konsistenten doppelten Zuordnung, die ein NMS-freies Training ermöglicht. Herkömmliche Objektdetektoren sind stark auf Nichtmaximum-Unterdrückung (NMS) angewiesen, um redundante Vorhersagen von Begrenzungsrahmen herauszufiltern. Durch den Wegfall dieses Schritts erzielt YOLOv10 eine echte Erkennung von Anfang bis Ende, verringert die Inferenzlatenz und vereinfacht die Bereitstellung auf Hardwarebeschleunigern wie neuronalen Verarbeitungseinheiten (NPUs), auf denen sich benutzerdefinierte NMS-Operationen bekanntermaßen nur schwer optimieren lassen.

Mehr über YOLOv10 erfahren

YOLO11: Vielseitigkeit und Leistung dank eines starken Ökosystems#

YOLO11 wurde später im selben Jahr eingeführt und steht für die kontinuierliche Weiterentwicklung der Ultralytics-Modellfamilie. Im Mittelpunkt steht dabei die optimale Balance aus Geschwindigkeit, Genauigkeit und Entwicklerfreundlichkeit.

YOLO11 wurde für den Produktiveinsatz entwickelt. Das Modell eignet sich hervorragend für die standardmäßige Erkennung von Begrenzungsrahmen, seine größte Stärke liegt jedoch in seiner Vielseitigkeit. Anders als YOLOv10, das vor allem auf Objekterkennung ausgerichtet ist, unterstützt YOLO11 nativ Instanzsegmentierung, Posenschätzung, Bildklassifizierung und Aufgaben mit orientierten Begrenzungsrahmen (OBB) in einer einheitlichen Architektur. Beim Training benötigt YOLO11 bemerkenswert wenig Speicher, wodurch es im Vergleich zu umfangreicheren Transformer-basierten Architekturen auch für Teams mit handelsüblichen GPUs gut zugänglich ist.

Leistungs- und Metrikvergleich#

Beim direkten Vergleich dieser Modelle ist es wichtig, ihre Leistung bei verschiedenen Größenvarianten auf Standardbenchmarks wie dem COCO-Datensatz zu betrachten.

Die folgende Tabelle zeigt die Leistungsunterschiede. YOLO11 erzielt bei den meisten Größenkategorien häufig einen etwas höheren mAP-Wert als YOLOv10 und behält zugleich eine sehr konkurrenzfähige Inferenzgeschwindigkeit mit TensorRT bei.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
Hardwarebeschleunigung

Um diese hohen Inferenzgeschwindigkeiten lokal zu erreichen, solltest du deine Modelle in optimierte Formate wie OpenVINO für Intel-CPUs oder TensorRT für NVIDIA-GPUs exportieren.

Architekturanalyse#

Trainingsmethodik und Effizienz#

Die Architektur von YOLOv10 zielt darauf ab, rechnerische Redundanzen zu verringern. Durch die Optimierung der Backbone- und Neck-Architektur anhand einer ganzheitlichen Strategie, die Effizienz und Genauigkeit gleichermaßen berücksichtigt, konnten die Forschenden der Tsinghua-Universität die Anzahl der Parameter in den mittleren Modellvarianten wie YOLOv10m im Vergleich zu früheren Versionen deutlich senken.

Ein wesentliches Merkmal der Ultralytics-Modelle ist jedoch die Trainingseffizienz. YOLO11 verwendet das ausgereifte Python-Paket ultralytics, das komplexe Verfahren zur Abstimmung von Hyperparametern vereinfacht. Das Framework übernimmt automatisch erweiterte Datenerweiterungen, die Planung der Lernrate und das verteilte Training auf mehreren GPUs. Die Architektur von YOLO11 zeichnet sich außerdem durch einen ausgezeichneten Gradientenfluss aus, was zu schnellerer Konvergenz und geringerem VRAM-Verbrauch während des Trainings führt.

Benutzerfreundlichkeit und Vorteile des Ökosystems#

Ein entscheidender Faktor für die Einführung in Unternehmen ist ein gut gepflegtes Ökosystem. Forschungs-Repositories sind zwar oft bahnbrechend, werden nach der Veröffentlichung der ursprünglichen Arbeit jedoch häufig nicht weiter gepflegt. Das Ultralytics-Ökosystem rund um YOLO11 bietet Entwicklerinnen und Entwicklern einen nahtlosen Arbeitsablauf von Anfang bis Ende.

Durch die nahtlose Integration mit Tools wie Weights & Biases zur Nachverfolgung von Experimenten und Roboflow zur Verwaltung von Datensätzen beschleunigt YOLO11 den Übergang vom Prototyp zum Produktiveinsatz. Die Benutzerfreundlichkeit zeigt sich in der übersichtlichen API, mit der Entwickler Modelle mit nur wenigen Codezeilen trainieren und exportieren können.

from ultralytics import YOLO

# Das kleine YOLO11-Modell initialisieren
model = YOLO("yolo11s.pt")

# # Trainiere das Modell effizient und mit optimierter Speicherverwaltung
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="0")

# # Exportiere das Modell im ONNX-Format, um es flexibel bereitstellen zu können
model.export(format="onnx")

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv10 und YOLO11 hängt von den konkreten Anforderungen deines Projekts, den Einsatzbedingungen und den Präferenzen für das jeweilige Ökosystem ab.

Wann du YOLOv10 wählen solltest#

YOLOv10 eignet sich besonders für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du YOLO11 wählen solltest#

YOLO11 wird empfohlen für:

  • Bereitstellung auf Edge-Geräten im Produktionseinsatz: Kommerzielle Anwendungen auf Geräten wie Raspberry Pi oder NVIDIA Jetson, bei denen Zuverlässigkeit und aktive Wartung entscheidend sind.
  • Vision-Anwendungen mit mehreren Aufgaben: Projekte, die Objekterkennung, Segmentierung, Posenschätzung und OBB innerhalb eines einheitlichen Frameworks erfordern.
  • Schnelle Prototypentwicklung und Bereitstellung: Teams, die mithilfe der optimierten Ultralytics-Python-API schnell von der Datenerfassung zum Produktionseinsatz gelangen müssen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Weitere Architekturen entdecken#

YOLOv10 und YOLO11 sind zwar ausgezeichnete Optionen, doch für deinen konkreten Anwendungsfall könnten auch andere in der Dokumentation aufgeführte Architekturen geeignet sein. Für sequenzbasiertes Schlussfolgern bieten Transformer-Modelle wie RT-DETR hohe Genauigkeit, benötigen jedoch in der Regel mehr Speicher. Wenn du dagegen neuartige Klassen ohne erneutes Training erkennen möchtest, bietet YOLO-World mit Eingaben in natürlicher Sprache einen Ansatz mit offenem Vokabular und Zero-Shot-Fähigkeiten.

Die nächste Generation: YOLO26#

Für Teams, die eine hochmoderne Lösung suchen, vereint das kürzlich veröffentlichte Ultralytics YOLO26 die besten Eigenschaften der beiden oben beschriebenen Modelle. YOLO26 wurde im Januar 2026 veröffentlicht und ist die klare Empfehlung für moderne Einsatzszenarien.

YOLO26 baut auf den Grundlagen seiner Vorgänger auf und bietet nativ ein optionales End-to-End-Design ohne NMS (nms=False). Damit werden die Engpässe bei der Nachverarbeitung, die YOLOv10 erstmals angegangen ist, effektiv beseitigt – und das innerhalb des robusten Ultralytics-Frameworks. Außerdem verzichtet YOLO26 auf DFL (Distribution Focal Loss), was die Exportgraphen der Modelle erheblich vereinfacht und die Kompatibilität mit Edge-Geräten und stromsparenden IoT-Geräten verbessert.

Mit der Einführung des MuSGD-Optimierers hat sich auch die Trainingsstabilität deutlich verbessert. Dieser hybride Ansatz ist von Methoden zum Training großer Sprachmodelle inspiriert und sorgt für eine sehr schnelle Konvergenz. Zusammen mit fortschrittlichen Verlustfunktionen wie ProgLoss + STAL verbessert YOLO26 die Erkennung kleiner Objekte erheblich. Auf herkömmlichen Edge-Geräten führen diese architektonischen Weiterentwicklungen zu einer bis zu 43 % schnelleren CPU-Inferenz. Damit ist YOLO26 eine herausragende Wahl für alle Aufgaben der Computer Vision.

Kommentare