YOLOv7 im Vergleich zu YOLOv5#
Beim Aufbau moderner Computer-Vision-Pipelines ist die Wahl der passenden Objekterkennungsarchitektur entscheidend, um Genauigkeit, Inferenzgeschwindigkeit und Ressourcennutzung auszubalancieren. Dieser umfassende Vergleich untersucht zwei einflussreiche Modelle im Bereich Computer Vision: YOLOv7 und Ultralytics YOLOv5.
Durch die Analyse ihrer Architekturunterschiede, Leistungskennzahlen und idealen Einsatzszenarien möchten wir Entwicklerinnen, Entwicklern und Forschenden helfen, das beste Modell für ihre spezifischen Anforderungen auszuwählen.
Hintergrund und Ursprung der Modelle#
Wenn du den Ursprung dieser Modelle kennst, kannst du ihre Designphilosophie und vorgesehenen Einsatzbereiche besser einordnen.
YOLOv5#
YOLOv5 wurde am 26. Juni 2020 von Glenn Jocher und dem Team von Ultralytics veröffentlicht. Das Modell revolutionierte das Feld mit einer nativen Implementierung in PyTorch, bei der Benutzerfreundlichkeit ohne Leistungseinbußen im Vordergrund stand. Dank seines ausgesprochen schlanken Ökosystems und zuverlässiger Trainingsdynamik wurde es schnell zum Branchenstandard. Den Quellcode findest du im YOLOv5-GitHub-Repository; auf das Modell kannst du direkt über die Ultralytics Platform zugreifen.
YOLOv7#
YOLOv7 wurde am 6. Juli 2022 von Chien-Yao Wang, Alexey Bochkovskiy und Hong-Yuan Mark Liao vom Institute of Information Science der Academia Sinica in Taiwan vorgestellt. Der Schwerpunkt lag auf architektonischen Neuerungen wie den Extended Efficient Layer Aggregation Networks (E-ELAN) und einem trainierbaren „Bag of Freebies“, um den Stand der Technik bei der Genauigkeit voranzubringen. Weitere Informationen findest du in der offiziellen Arxiv-Arbeit und im YOLOv7-GitHub-Repository. Für eine nahtlose Integration wirf einen Blick in die Ultralytics-Dokumentation zu YOLOv7.
YOLOv5 ist vollständig in das Ultralytics-Python-Paket integriert. YOLOv7 wird nicht nativ für das Training oder die PyTorch-Inferenz unterstützt. Upstream-YOLOv7-Checkpoints, die nach ONNX oder TensorRT exportiert wurden, lassen sich jedoch mit Ultralytics ausführen, wie in der YOLOv7-Dokumentation beschrieben.
Architektonische Innovationen#
Das Design von Ultralytics YOLOv5#
YOLOv5 verwendet ein angepasstes CSPDarknet53-Backbone in Kombination mit einem Path Aggregation Network (PANet)-Neck. Dieses Design ist auf schnelle Merkmalsextraktion und effiziente Speichernutzung ausgelegt. Im Gegensatz zu älteren Architekturen oder umfangreichen Transformer-Modellen benötigt YOLOv5 während des Trainings deutlich weniger CUDA-Speicher, sodass sich größere Batchgrößen auf handelsüblichen GPUs für Endverbraucher nutzen lassen. Darüber hinaus unterstützt das Ultralytics-Framework von Haus aus zahlreiche Aufgaben jenseits herkömmlicher Bounding Boxes, darunter Bildsegmentierung und Bildklassifizierung.
Das Design von YOLOv7#
YOLOv7 führte mehrere strukturelle Reparametrisierungen und die E-ELAN-Architektur ein. Dadurch kann das Netzwerk vielfältigere Merkmale lernen, ohne den ursprünglichen Gradientenpfad zu zerstören. Außerdem wird ein zusätzlicher Kopf zur Zwischenüberwachung während des Trainings eingesetzt. Diese Fortschritte sorgen zwar für eine hohe mittlere Average Precision (mAP), führen aber oft zu komplexen Tensorstrukturen, die den Export in Edge-Formate wie ONNX oder TensorRT im Vergleich zu den optimierten, nativen Exporten von Ultralytics-Modellen etwas anspruchsvoller machen können.
Leistungsanalyse#
Beim Vergleich dieser Modelle müssen Entwicklerinnen und Entwickler mAPval, Inferenzgeschwindigkeit und Rechenaufwand (FLOPs) gegeneinander abwägen. Die folgende Tabelle zeigt die Leistung beider Architekturen auf dem COCO-Datensatz.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Wichtigste Erkenntnisse#
- Maximale Genauigkeit: YOLOv7x erreicht mit beeindruckenden 53.1 mAPval die höchste Gesamtgenauigkeit und ist damit eine sehr konkurrenzfähige Wahl, wenn die bestmögliche Erkennungsleistung im Vordergrund steht.
- Geschwindigkeit und Effizienz: Ultralytics YOLOv5n ist ein Musterbeispiel für Effizienz: Das Modell bietet eine äußerst niedrige Inferenzlatenz (1.12 ms auf T4 TensorRT) und benötigt mit nur 1.9M Parametern sehr wenig Speicher. Damit ist es eine hervorragende Wahl für Edge-Einsätze mit besonders knappen Ressourcen.
- Ausgewogene Leistung: Die YOLOv5-Serie bietet eine hervorragende Auswahl an Modellgrößen. YOLOv5l liegt als überzeugender Mittelweg bei der Genauigkeit nur knapp hinter YOLOv7l, bietet aber eine sehr ausgereifte Bereitstellungspipeline.
Die Vorteile des Ultralytics-Ökosystems#
Die Architektur eines Modells ist nur die halbe Gleichung; das dazugehörige Ökosystem entscheidet über seine Praxistauglichkeit. Hier spielen Ultralytics-Modelle ihre Stärken aus.
Einfache Bedienung: Ultralytics bietet eine einheitliche, sehr intuitive Python-API. Mit minimalem Boilerplate-Code kannst du Modelle trainieren, validieren und bereitstellen. Umfangreiche offizielle Dokumentation unterstützt dich dabei. Gut gepflegtes Ökosystem: Die aktive Entwicklung sorgt für regelmäßige Updates, Fehlerbehebungen und eine nahtlose Integration mit modernen Tracking-Tools wie Weights & Biases. Effizientes Training: Durch optimierte Datenlader und intelligentes Caching verkürzt YOLOv5 die Trainingszeiten deutlich. Außerdem beschleunigen sofort einsetzbare vortrainierte Gewichte das Transferlernen in verschiedenen Bereichen.
Codebeispiel: Vereinfachtes Training#
Mit dem Ultralytics-Paket startest du einen Trainingslauf nahezu identisch, unabhängig davon, welche Architektur du auswählst.
from ultralytics import YOLO
# Ein vortrainiertes YOLOv5-Modell laden
model = YOLO("yolov5su.pt") # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket
# Trainiere das Modell mit dem Beispieldatensatz COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exportiere das trainierte Modell zur Bereitstellung im ONNX-Format
success = model.export(format="onnx")Ideale Anwendungsfälle#
Wann du YOLOv7 wählen solltest#
- Akademisches Benchmarking: Ideal für Forschende, die neue Techniken mit einer gut dokumentierten Ausgangsbasis von 2022 vergleichen möchten.
- Verarbeitung in einer GPU-Cloud mit leistungsstarker Hardware: Für den Einsatz auf leistungsfähigen Servern, wenn die höchstmögliche mAP in dichten Szenen wichtiger ist als ein einfacher Export.
Wann du YOLOv5 wählen solltest#
- Produktiveinsatz: Ideal für kommerzielle Anwendungen, die hohe Stabilität, unkomplizierte Optionen zur Modellbereitstellung und breite plattformübergreifende Kompatibilität erfordern.
- Edge-Geräte: Die kleineren Varianten (YOLOv5n und YOLOv5s) laufen besonders gut auf Mobiltelefonen und eingebetteten Systemen.
- Anforderungen an mehrere Aufgaben: Wenn dein Projekt über einfache Erkennung hinaus zu Instanzsegmentierung oder Klassifizierung in einem einheitlichen Framework erweitert werden soll.
Suchst du nach neueren Versionen? Sieh dir Ultralytics YOLOv8 oder Ultralytics YOLO11 an, um mehr über Fortschritte bei der ankerfreien Erkennung und beim Lernen mehrerer Aufgaben zu erfahren.
Die nächste Generation: Ultralytics YOLO26#
YOLOv5 und YOLOv7 nehmen einen wichtigen Platz in der Geschichte der KI für Computer Vision ein, doch das Feld entwickelt sich ständig weiter. Ultralytics YOLO26, veröffentlicht im Januar 2026, steht an der Spitze der Objekkennungstechnologie und übertrifft frühere Generationen in allen Kennzahlen.
YOLO26 bringt mehrere wegweisende Funktionen mit:
- End-to-End-Design ohne NMS: Aufbauend auf Konzepten früherer Versionen bietet YOLO26 einen nativen End-to-End-Kopf (
nms=False), der die Nachverarbeitung mit Non-Maximum Suppression (NMS) überflüssig macht. So werden Latenzengpässe reduziert und die Bereitstellungslogik deutlich vereinfacht. - MuSGD-Optimierer: Inspiriert von Kimi K2 von Moonshot AI vereint dieser neuartige Optimierer die Stabilität von SGD mit dem beschleunigten Impuls von Muon und überträgt fortschrittliche Innovationen beim Training von LLMs direkt auf Computer Vision.
- Höhere CPU-Geschwindigkeit: Durch den gezielten Verzicht auf Distribution Focal Loss (DFL) erreicht YOLO26 eine um bis zu 43 % schnellere CPU-Inferenz. Damit ist das Modell unübertroffen für den Einsatz auf Edge-Geräten und IoT-Geräten mit niedrigem Stromverbrauch.
- ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte erheblich. Das ist besonders wichtig für Luftaufnahmen und Präzisionsrobotik.
- Aufgabenspezifische Verbesserungen: Dazu gehören Semantic-Segmentation-Loss für die Maskenerstellung, Residual Log-Likelihood Estimation (RLE) für die Posenschätzung und eine spezielle Winkelfunktion zur Lösung schwieriger Probleme an den Grenzen von Oriented Bounding Boxes (OBB).
Fazit#
YOLOv5 und YOLOv7 bieten beide leistungsfähige Lösungen für die Objekterkennung in Echtzeit. YOLOv7 bleibt eine starke Wahl, wenn auf leistungsstarker Hardware vor allem die reine Genauigkeit zählt. YOLOv5 überzeugt dagegen als besonders entwicklerfreundliches Werkzeug mit einer außergewöhnlichen Balance aus Geschwindigkeit und Effizienz sowie einem erstklassigen Ökosystem.
Wenn du deine Pipelines zukunftssicher machen und die ideale Kombination aus Geschwindigkeit, Einfachheit und Genauigkeit auf dem neuesten Stand der Technik erreichen möchtest, empfehlen wir dir jedoch dringend den Umstieg auf Ultralytics YOLO26. Das Modell vereint die legendäre Benutzerfreundlichkeit der Ultralytics-Plattform mit bahnbrechenden architektonischen Neuerungen.