Ultralytics YOLO27:
Get Started

YOLOv7 im Vergleich zu YOLOv10#

Die Computer Vision hat in den vergangenen Jahren bemerkenswerte Fortschritte gemacht. Dabei treibt die Modellfamilie YOLO (You Only Look Once) die Echtzeit-Objekterkennung maßgeblich voran. Für die Wahl der richtigen Architektur für deine Computer-Vision-Projekte musst du die verfügbaren Optionen genau kennen. In diesem umfassenden technischen Vergleich untersuchen wir die wichtigsten Unterschiede zwischen zwei wegweisenden Architekturen: YOLOv7 und YOLOv10.

Einführung in die Modelle#

Beide Modelle sind wichtige Meilensteine in der Geschichte der künstlichen Intelligenz, gehen aber grundsätzlich unterschiedlich an die Herausforderungen der Objekterkennung heran.

YOLOv7: Wegbereiter der Bag-of-Freebies#

YOLOv7 wurde am 6. Juli 2022 von den Forschenden Chien-Yao Wang, Alexey Bochkovskiy und Hong-Yuan Mark Liao vom Institute of Information Science der Academia Sinica veröffentlicht und leitete einen Paradigmenwechsel bei der Optimierung neuronaler Netze ein. Die ursprüngliche Forschung, beschrieben in ihrer wissenschaftlichen Arbeit und veröffentlicht in ihrem offiziellen GitHub-Repository, konzentrierte sich stark auf die architektonische Reparametrisierung und ein trainierbares „Paket kostenloser Verbesserungen“.

YOLOv7 nutzt ein erweitertes effizientes Layer-Aggregationsnetzwerk (E-ELAN), das dem Netzwerk hilft, vielfältige Merkmale zu erlernen, ohne den ursprünglichen Gradientenpfad zu beeinträchtigen. Dadurch eignet es sich gut für akademische Forschungsbenchmarks und Systeme, die stark auf herkömmliche High-End-GPUs angewiesen sind.

Mehr über YOLOv7 erfahren

YOLOv10: End-to-End-Erkennung in Echtzeit#

YOLOv10 wurde von Ao Wang und seinem Team an der Tsinghua-Universität entwickelt und am 23. Mai 2024 veröffentlicht. Wie in der Veröffentlichung auf arXiv und im GitHub-Repository der Tsinghua-Universität beschrieben, beseitigt das Modell einen langjährigen Engpass bei der Objekterkennung: Non-Maximum Suppression (NMS).

YOLOv10 führte für das NMS-freie Training konsistente duale Zuordnungen ein und veränderte damit grundlegend die Nachbearbeitung. Durch einen ganzheitlichen Modellierungsansatz, der Effizienz und Genauigkeit in Einklang bringt, verringert YOLOv10 redundante Berechnungen. Das Ergebnis ist eine Architektur, die sich besonders für Edge-Geräte mit extrem niedriger Latenz eignet.

Mehr über YOLOv10 erfahren

NMS-freie Architektur

Durch den Wegfall von Non-Maximum Suppression (NMS) in YOLOv10 lässt sich das gesamte Modell als einzelner Berechnungsgraph exportieren. Das vereinfacht die Bereitstellung mit Laufzeitumgebungen wie TensorRT oder OpenVINO erheblich.

Leistungs- und Metrikvergleich#

Bei der Analyse der Modellleistung müssen die Abwägungen zwischen Präzision, Geschwindigkeit und Rechenaufwand sorgfältig berücksichtigt werden. Die folgende Tabelle zeigt, wie die verschiedenen Größen dieser Modelle im Vergleich abschneiden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

Abwägungen im Vergleich#

Die obigen Kennzahlen zeigen einen deutlichen Abstand zwischen den Modellgenerationen. YOLOv7x erreicht mit einem mAPval von 53,1 % zwar einen sehr hohen Wert, benötigt jedoch 71,3M Parameter und 189,9B FLOPs. Im Gegensatz dazu übertrifft YOLOv10l diese Genauigkeit mit einem mAP von 53,2 %, benötigt aber nur etwa ein Drittel der Parameter (24,4M) und deutlich weniger FLOPs (120,3B). Außerdem bietet das stark optimierte YOLOv10n eine beeindruckende Inferenzgeschwindigkeit von 1,84 ms und eignet sich damit ideal für Videoanalysen in Echtzeit und mobile Anwendungen.

Anwendungsfälle in der Praxis#

Die architektonischen Unterschiede zwischen diesen Modellen bestimmen, für welche Einsatzbereiche sie sich am besten eignen.

Wann YOLOv7 sinnvoll ist#

Dank seiner umfangreichen Merkmalsrepräsentation überzeugt YOLOv7 in sehr komplexen Umgebungen. Anwendungsfälle wie die Überwachung des Verkehrsflusses in dicht besiedelten Städten, die Analyse von Satellitenbildern oder die Erkennung von Fehlern in der Fertigungsautomatisierung profitieren von seiner robusten strukturellen Reparametrisierung. YOLOv7 wird auch häufig in älteren Umgebungen eingesetzt, die bereits tief in spezifische PyTorch-1.12-Pipelines integriert sind.

Wann YOLOv10 sinnvoll ist#

Das NMS-freie, kompakte Design von YOLOv10 spielt seine Stärken in Umgebungen mit begrenzten Ressourcen aus. Es empfiehlt sich besonders für Edge-Computing-Geräte wie den NVIDIA Jetson Nano oder Raspberry Pi. Dank der niedrigen Latenz eignet es sich ideal für schnell ablaufende Anwendungen wie Sportanalysen, die autonome Navigation von Drohnen und das Hochgeschwindigkeitssortieren durch Roboter auf Förderbändern.

Die Vorteile des Ultralytics-Ökosystems#

Beide Modelle haben starke akademische Wurzeln, doch das volle Potenzial von YOLOv10 entfaltet sich bei der Nutzung auf der einheitlichen Ultralytics-Plattform. Computer-Vision-Modelle von Grund auf zu entwickeln, ist bekanntermaßen schwierig. Das Ultralytics-Ökosystem bietet Machine-Learning-Ingenieuren jedoch eine unvergleichliche Arbeitsumgebung.

  • Benutzerfreundlichkeit: Die Ultralytics-Python-API bietet eine einheitliche Schnittstelle. Du kannst Modelle mit nur wenigen Codezeilen trainieren, validieren und exportieren und so die komplexen Abhängigkeitsprobleme vermeiden, die mit typischen akademischen Repositorys verbunden sind.
  • Aktiv gepflegtes Ökosystem: Ultralytics stellt sicher, dass der zugrunde liegende Code aktiv weiterentwickelt wird. Nutzer profitieren von nahtlosen Integrationen mit beliebten ML-Werkzeugen wie Weights & Biases für die Protokollierung oder Gradio für schnelle Web-Demos.
  • Speicherbedarf: Transformer-basierte Objektdetektoren benötigen beim Training oft sehr viel CUDA-Speicher. Ultralytics-YOLO-Modelle kommen dagegen mit deutlich weniger Speicher aus und ermöglichen so größere Batchgrößen auf Hardware für Endverbraucher.
  • Vielseitigkeit: Die Ultralytics-Pipeline ist nicht auf herkömmliche Begrenzungsrahmen beschränkt. Sie unterstützt nahtlos Posenschätzung, Instanzsegmentierung und orientierte Begrenzungsrahmen bei unterstützten Modellfamilien wie YOLO11 und YOLOv8.

Vereinfachtes Trainingsbeispiel#

Mit Ultralytics lässt sich eine Trainingspipeline besonders einfach ausführen. Ob du die NMS-freie Geschwindigkeit von YOLOv10 oder ein anderes unterstütztes Modell nutzt – die Syntax bleibt gleich. Beachte, dass das Ultralytics-Paket das Training von YOLOv7 nicht unterstützt:

from ultralytics import YOLO

# Lade das bevorzugte Modell (z. B. YOLOv10 Nano)
model = YOLO("yolov10n.pt")

# Das Modell mit dem COCO8-Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Führe eine Inferenzvorhersage für ein Beispielbild aus
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Exportiere das Modell in ein Edge-freundliches Format wie ONNX
model.export(format="onnx")

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv7 und YOLOv10 hängt von den konkreten Anforderungen deines Projekts, den Einschränkungen bei der Bereitstellung und deinen Präferenzen für das Ökosystem ab.

Wann du YOLOv7 wählen solltest#

YOLOv7 eignet sich besonders für:

  • Akademische Benchmarks: Reproduktion des Stands der Technik von 2022 oder Untersuchung der Auswirkungen von E-ELAN und Techniken mit trainierbaren Bündeln kostenloser Verbesserungen.
  • Reparametrisierungsforschung: Untersuchung geplanter reparametrisierter Faltungen und Strategien zur zusammengesetzten Modellskalierung.
  • Bestehende benutzerdefinierte Pipelines: Projekte mit stark angepassten Pipelines auf Basis der spezifischen YOLOv7-Architektur, die sich nicht ohne Weiteres umgestalten lassen.

Wann du YOLOv10 wählen solltest#

YOLOv10 empfiehlt sich für:

  • Echtzeiterkennung ohne NMS: Anwendungen, die von einer durchgängigen Erkennung ohne Non-Maximum Suppression profitieren und dadurch die Komplexität der Bereitstellung verringern.
  • Ausgewogenes Verhältnis von Geschwindigkeit und Genauigkeit: Projekte, die über verschiedene Modellgrößen hinweg ein ausgewogenes Verhältnis zwischen Inferenzgeschwindigkeit und Erkennungsgenauigkeit erfordern.
  • Anwendungen mit gleichbleibender Latenz: Bereitstellungsszenarien, in denen vorhersehbare Inferenzzeiten entscheidend sind, etwa in der Robotik oder bei autonomen Systemen.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die Zukunft: YOLO26 im Überblick#

YOLOv7 und YOLOv10 sind zwar beeindruckende Meilensteine, doch die KI entwickelt sich stetig weiter. Das im Januar 2026 veröffentlichte Ultralytics YOLO26 ist der neue unangefochtene Standard für Effizienz und Genauigkeit bei allen Bereitstellungsszenarien am Edge und in der Cloud.

Wenn du heute ein neues Computer-Vision-Projekt beginnst, ist YOLO26 die empfohlene Architektur. YOLO26 baut auf den Vorgängermodellen auf und integriert mehrere wegweisende Neuerungen:

  • End-to-End-Design ohne NMS: Nach dem Vorbild von YOLOv10 überspringt der optionale One-to-one-Kopf von YOLO26 (nms=False) die NMS-Nachbearbeitung und ermöglicht so extrem niedrige Inferenzlatenz für deterministische Echtzeitrobotik.
  • Bis zu 43 % schnellere CPU-Inferenz: Durch das gezielte Entfernen des Moduls Distribution Focal Loss (DFL) beschleunigt YOLO26 die Ausführung auf Edge-Computing-Hardware ohne GPU erheblich und eignet sich damit hervorragend für IoT-Geräte.
  • MuSGD-Optimierer: YOLO26 ist von aktuellen Innovationen beim Training großer Sprachmodelle inspiriert und kombiniert SGD mit Muon. Das stabilisiert die Trainingsabläufe und sorgt für schnellere Konvergenz.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich und beheben damit eine bekannte Schwäche älterer YOLO-Generationen.
  • Unübertroffene Vielseitigkeit: YOLO26 bietet native, auf bestimmte Aufgaben zugeschnittene Optimierungen, etwa Residual Log-Likelihood Estimation (RLE) für die Verfolgung von Posen und spezielle Winkelfunktionen für die präzise OBB-Erkennung in Luftaufnahmen.

Für Ingenieure, die ein optimales Gleichgewicht zwischen Geschwindigkeit, Genauigkeit und einfacher Bereitstellung suchen, verschafft der Wechsel von älteren Modellen zu YOLO26 einen unmittelbaren und messbaren Wettbewerbsvorteil.

Mitwirkende

Kommentare