Ultralytics YOLO27:
Get Started

YOLOv10 im Vergleich zu YOLOv7#

Die rasante Entwicklung der Bildverarbeitung in den vergangenen Jahren hat immer effizientere Architekturen für Echtzeitanwendungen hervorgebracht. Der Vergleich von YOLOv10 und YOLOv7 verdeutlicht einen entscheidenden Übergang in dieser Entwicklung. YOLOv7 führte zwar äußerst wirksame Trainingsstrategien und eine Skalierung der Architektur ein, doch YOLOv10 revolutionierte die Bereitstellung, indem es die langjährige Abhängigkeit von der Nichtmaximumunterdrückung (NMS) beseitigte.

Beide Modelle erweiterten bei ihrer jeweiligen Veröffentlichung die Grenzen der Objekterkennung. Das moderne Ultralytics-Ökosystem und neue Modelle wie YOLO26 ermöglichen heutigen KI-Fachleuten jedoch deutlich bessere Arbeitsabläufe.

Modellprofile und Ursprünge#

Wenn du die Ursprünge dieser Modelle kennst, kannst du ihre Architekturentscheidungen und die dahinterstehende akademische Forschung besser einordnen.

YOLOv10-Details#

Mehr über YOLOv10 erfahren

YOLOv7-Details#

Mehr über YOLOv7 erfahren

Architektonische Innovationen#

Der YOLOv7-Ansatz#

YOLOv7 wurde 2022 veröffentlicht und konzentrierte sich stark auf die Optimierung von Gradientenpfaden. Das Modell führte das Extended Efficient Layer Aggregation Network (E-ELAN) ein, das vielfältigere Merkmale erlernen konnte, ohne den ursprünglichen Gradientenpfad zu beeinträchtigen. Außerdem implementierten die Autorinnen und Autoren eine Methode mit einem „trainierbaren Bündel kostenloser Verbesserungen“: Dabei kamen während des Trainings Reparametrisierungstechniken zum Einsatz, die sich bei der Inferenz zusammenführen ließen, um hohe Ausführungsgeschwindigkeiten beizubehalten. Trotz dieser beeindruckenden Optimierungen war YOLOv7 bei der Nachverarbeitung weiterhin stark auf NMS angewiesen, was bei der Analyse dichter Szenen zu schwankender Latenz führte.

Der Durchbruch von YOLOv10#

YOLOv10 ging die NMS-Beschränkung direkt an. Durch die Einführung konsistenter dualer Zuweisungen während des Trainings ermöglichte das Team der Tsinghua-Universität eine durchgängige Objekterkennung ohne NMS. Bei diesem Ansatz mit zwei Köpfen verwendet ein Zweig während des Trainings Viele-zu-eins-Zuweisungen für umfangreiche Trainingssignale, während ein anderer Zweig für die NMS-freie Inferenz Eins-zu-eins-Zuweisungen nutzt. Dieser Architekturwechsel gewährleistet eine konsistente, extrem niedrige Inferenzlatenz, die sich für die schnelle Videoanalyse eignet. Darüber hinaus verwendet YOLOv10 ein ganzheitliches, auf Effizienz und Genauigkeit ausgerichtetes Modelldesign und beseitigt dabei überflüssige Berechnungen früherer Generationen.

Auswirkungen der Nachverarbeitung

Der Wegfall der NMS-Nachverarbeitung beschleunigt nicht nur die Inferenz, sondern vereinfacht auch die Bereitstellung auf Edge-KI-Hardware wie KI-Beschleunigern und NPUs erheblich, auf denen sich benutzerdefinierte NMS-Operationen bekanntermaßen nur schwer kompilieren lassen.

Leistungsvergleich#

Beim Vergleich der Rohdaten auf dem MS-COCO-Datensatz wird der Generationsunterschied deutlich. YOLOv10 bietet einen deutlich besseren Kompromiss zwischen Parameterzahl, Rechenaufwand und Genauigkeit.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Wie oben zu sehen, erzielt YOLOv10x mit 54,4 % einen höheren mAP als YOLOv7x mit 53,1 % und benötigt dabei weniger als halb so viele Parameter (29,5 Mio. gegenüber 71,3 Mio.). Darüber hinaus bieten die leichtgewichtigen YOLOv10-Modelle (Nano und Small) eine herausragende Geschwindigkeit bei der TensorRT-Bereitstellung, wodurch sie sich besonders für mobile Geräte eignen.

Die Vorteile des Ultralytics-Ökosystems#

Die Lektüre von Architekturarbeiten ist aufschlussreich, doch die moderne Entwicklung im Bereich der Bildverarbeitung beruht auf robusten, gut gepflegten Frameworks. Ein von Ultralytics unterstütztes Modell bietet Entwicklerinnen und Entwicklern, die rasch vom Prototyp zur Produktion übergehen möchten, einen enormen Vorteil.

Optimierte Entwicklung#

YOLOv10 wird nativ vom standardmäßigen Ultralytics-Python-Paket unterstützt. YOLOv7-Checkpoints, die mit der ursprünglichen Version trainiert wurden, lassen sich in Ultralytics dagegen erst nach dem Export nach ONNX oder TensorRT ausführen. Die native Unterstützung bietet herausragende Benutzerfreundlichkeit und ersetzt Tausende Zeilen Boilerplate-Code durch eine einfache, intuitive API. Außerdem benötigen Ultralytics-YOLO-Modelle beim Training deutlich weniger CUDA-Speicher als umfangreiche Transformer-Architekturen, sodass sich größere Stapel auf handelsüblicher Hardware verwenden lassen.

Unübertroffene Vielseitigkeit#

Während ältere Repositories sich häufig ausschließlich auf die Erkennung von Begrenzungsrahmen konzentrieren, unterstützt das integrierte Ultralytics-Framework nahtlos eine Vielzahl von Aufgaben. Ob du Instanzsegmentierung, Posenschätzung oder die Erkennung orientierter Begrenzungsrahmen (OBB) durchführst – der Arbeitsablauf bleibt derselbe.

Codebeispiel: Einheitliche Trainingsabläufe#

Der folgende Codeausschnitt zeigt den nahtlosen Trainingsprozess, der Datenerweiterung und die Anpassung der Lernrate automatisch übernimmt:

from ultralytics import YOLO

# Das gewünschte Modell laden (z. B. YOLOv10 oder das empfohlene YOLO26)
model = YOLO("yolo26n.pt")

# Das Modell mühelos mit deinem Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)

# Für eine schnelle Bereitstellung ins ONNX-Format exportieren
model.export(format="onnx")

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv10 und YOLOv7 hängt von den konkreten Projektanforderungen, den Einschränkungen der Bereitstellungsumgebung und deinen Präferenzen beim Ökosystem ab.

Wann du YOLOv10 wählen solltest#

YOLOv10 eignet sich besonders für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du YOLOv7 wählen solltest#

YOLOv7 empfiehlt sich für:

  • Akademische Benchmarks: Reproduktion des Stands der Technik von 2022 oder Untersuchung der Auswirkungen von E-ELAN und Techniken mit trainierbaren Bündeln kostenloser Verbesserungen.
  • Reparametrisierungsforschung: Untersuchung geplanter reparametrisierter Faltungen und Strategien zur zusammengesetzten Modellskalierung.
  • Bestehende benutzerdefinierte Pipelines: Projekte mit stark angepassten Pipelines auf Basis der spezifischen YOLOv7-Architektur, die sich nicht ohne Weiteres umgestalten lassen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Der neue Standard: YOLO26#

YOLOv10 war 2024 ein gewaltiger Fortschritt, doch die Bildverarbeitung entwickelt sich unglaublich schnell. Für alle neuen Entwicklungen empfehlen wir ausdrücklich das Modell der neuesten Generation: Ultralytics YOLO26. Das im Januar 2026 veröffentlichte Modell ist der absolute Höhepunkt der Echtzeit-Bildverarbeitung mit KI und übertrifft YOLOv7 und YOLOv10 deutlich.

YOLO26 bietet beispiellose Neuerungen, die speziell auf moderne Bereitstellungsumgebungen zugeschnitten sind:

  • End-to-End-Design ohne NMS: Aufbauend auf der Grundlage von YOLOv10 beseitigt der optionale Eins-zu-eins-Kopf von YOLO26 (nms=False) die NMS-Nachverarbeitung. Dadurch werden Bereitstellungspipelines einfacher und die Hochgeschwindigkeitsinferenz gleichmäßiger.
  • Bis zu 43 % schnellere CPU-Inferenz: Umfassend für Edge-Computing und Geräte ohne dedizierte GPUs optimiert und mit erheblichen Einsparungen bei den Hardwarekosten.
  • Wegfall von DFL: Distribution Focal Loss wurde vollständig entfernt. Dadurch wird die Exportlogik deutlich einfacher und die Kompatibilität mit energiesparenden Edge-Geräten und Mikrocontrollern erheblich verbessert.
  • MuSGD-Optimierer: Inspiriert von Kimi K2 von Moonshot AI verbindet diese Hybridlösung aus SGD und Muon Trainingsinnovationen von großen Sprachmodellen (LLM) mit der Bildverarbeitung und sorgt so für eine äußerst stabile Trainingsdynamik und schnellere Konvergenz.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich. Das war bisher ein schwieriger Bereich und ist entscheidend für Drohnen, Robotik und die Überwachung intelligenter Städte.
  • Aufgabenspezifische Verbesserungen: YOLO26 ist nicht nur ein Detektor. Das Modell umfasst einen spezialisierten Verlust für die semantische Segmentierung, Residual Log-Likelihood Estimation (RLE) für hochpräzise Posenschätzung sowie spezielle Winkelverlustalgorithmen, die Probleme mit den Grenzen von OBB beseitigen.
Datensätze verwalten und Modelle trainieren

Die optimale Umgebung zur Verwaltung deiner Datensätze, zum Trainieren von YOLO26 und zur Bereitstellung von Modellen in der Cloud findest du auf der Ultralytics-Plattform. Sie bietet eine codefreie Benutzeroberfläche, die die Python-SDK optimal ergänzt.

Anwendungsfälle in der Praxis#

Die Wahl der passenden Architektur hängt stark von deiner Hardware und den Anforderungen der Anwendung ab.

Wann du YOLOv7 verwenden solltest#

YOLOv7 bleibt eine zuverlässige Wahl, wenn du bestehende Pipelines pflegst, die bereits eng mit den spezifischen Tensorstrukturen des Modells verzahnt sind, oder akademische Benchmarks aus den Jahren 2022 und 2023 reproduzierst. Auf leistungsstarken Server-GPUs erzielt das Modell sehr gute Ergebnisse.

Wann du YOLOv10 verwenden solltest#

YOLOv10 eignet sich besonders für Szenarien, in denen die Latenz strikt konstant bleiben muss. Da das Modell ohne NMS auskommt, eignet es sich hervorragend für die Zählung großer Menschenmengen oder die Erkennung von Fertigungsfehlern, bei denen die Objektzahl stark schwankt, die Verarbeitungszeit pro Bild jedoch konstant bleiben muss.

Wann du YOLO26 verwenden solltest#

Für jedes neue Projekt ist YOLO26 die eindeutig beste Wahl. Von der Bereitstellung anspruchsvoller Sicherheitsalarmsysteme auf einem einfachen Raspberry Pi bis hin zu umfangreicher cloudbasierter Videoanalyse ist das Modell dank seiner überlegenen CPU-Geschwindigkeit und der fortschrittlichen Erkennung kleiner Objekte älteren Generationen deutlich überlegen.

Für Entwicklerinnen und Entwickler, die moderne alternative Architekturen erkunden möchten, bieten wir auch umfassende Unterstützung für Transformer-basierte Detektoren wie RT-DETR und bewährte Modelle früherer Generationen wie Ultralytics YOLO11.

Kommentare