YOLOv5 vs. YOLOv7#
Die Computer Vision hat sich in den letzten Jahren rasant weiterentwickelt. Angetrieben wurde diese Entwicklung durch den Bedarf an schnellerer und genauerer Objekterkennung in Echtzeit. Wenn du die passende Architektur für dein Computer-Vision-Projekt auswählst, ist es entscheidend, die Unterschiede zwischen beliebten Modellen wie Ultralytics YOLOv5 und YOLOv7 zu verstehen. Dieser umfassende technische Vergleich beleuchtet die Architekturen, Trainingsmethoden, Leistungskennzahlen und optimalen Bereitstellungsszenarien der Modelle, damit du eine fundierte Entscheidung treffen kannst.
Auf einen Blick: Ursprünge der Modelle#
Wenn du die Ursprünge und Designphilosophien dieser Modelle verstehst, kannst du ihre Architekturentscheidungen besser einordnen.
YOLOv5-Details:
- Autoren: Glenn Jocher
- Organisation: Ultralytics
- Datum: 2020-06-26
- GitHub: YOLOv5-Repository
- Dokumentation: YOLOv5-Dokumentation
Details zu YOLOv7:
- Autoren: Chien-Yao Wang, Alexey Bochkovskiy und Hong-Yuan Mark Liao
- Organisation: Institut für Informationswissenschaft, Academia Sinica, Taiwan
- Datum: 2022-07-06
- Arxiv: YOLOv7-Artikel
- GitHub: YOLOv7-Repository
- Dokumentation: YOLOv7-Dokumentation
Möchtest du wissen, wie diese Modelle im Vergleich zu anderen abschneiden? Sieh dir unsere Vergleiche wie YOLOv5 vs. YOLO11 oder YOLOv7 vs. EfficientDet an, um dein Verständnis des Ökosystems für Objekterkennung zu vertiefen.
Architektonische Innovationen und Unterschiede#
YOLOv5: Der zugängliche Standard#
YOLOv5 wurde 2020 von Ultralytics vorgestellt und leitete einen Paradigmenwechsel ein, indem es nativ das PyTorch-Framework verwendete. Dadurch wurde der Einstieg für Forschende und Entwickler deutlich leichter. Die Architektur basiert auf einem modifizierten CSPDarknet53-Backbone und integriert Cross-Stage-Partial-Netzwerke (CSP), um die Parameteranzahl zu verringern und gleichzeitig den Gradientenfluss aufrechtzuerhalten.
Eine der größten Stärken des Modells ist sein Speicherbedarf. Im Vergleich zu älteren zweistufigen Detektoren oder rechenintensiven Transformer-Modellen wie RT-DETR benötigt YOLOv5 beim Training deutlich weniger CUDA-Speicher. So sind größere Batch-Größen auf handelsüblichen GPUs möglich. Darüber hinaus unterstützt die nativ integrierte Vielseitigkeit nahtlos Bildklassifizierung, Objekterkennung und Bildsegmentierung.
YOLOv7: Die Grenzen der Echtzeitgenauigkeit verschieben#
YOLOv7 wurde Mitte 2022 veröffentlicht und sollte den Stand der Technik bei der Echtzeit-Objekterkennung in den MS-COCO-Benchmarks vorantreiben. Die Autoren führten das Extended Efficient Layer Aggregation Network (E-ELAN) ein, das die Lernfähigkeit des Netzwerks verbessert, ohne den ursprünglichen Gradientenpfad zu beeinträchtigen.
YOLOv7 ist auch für seine „trainable bag-of-freebies“ bekannt. Dazu gehören insbesondere Reparametrisierungstechniken während des Trainings, bei denen mehrere Module für die Inferenz in eine einzelne Faltungsschicht umgewandelt werden. Das erhöht die Geschwindigkeit, ohne die Genauigkeit zu beeinträchtigen. Diese komplexe Trainingsmethode führt jedoch oft zu einer steileren Lernkurve und weniger unkomplizierten Exportpipelines als das native Ultralytics-Ökosystem.
Leistungsvergleich#
Bei der Bewertung dieser Modelle ist die Leistungsbalance zwischen Geschwindigkeit, Genauigkeit und Rechenaufwand entscheidend. Die folgende Tabelle vergleicht ihre Leistungskennzahlen anhand des Datensatzes MS COCO val2017.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
YOLOv7 erzielt bei größeren Varianten zwar höhere absolute mAP-Werte, aber YOLOv5 bietet eine unübertroffene Modellpalette – vom extrem leichten Nano-Modell (YOLOv5n) für Edge-Geräte mit besonders knappen Ressourcen bis zum Extra-Large-Modell (YOLOv5x) für die Inferenz in der Cloud.
Die Vorteile des Ultralytics-Ökosystems#
Der Nutzen eines Modells hängt nicht nur von seiner Architektur ab. Das umgebende Ökosystem bestimmt, wie schnell sich das Modell in die Produktion überführen lässt. Hier glänzen die Ultralytics-Modelle.
- Einfache Nutzung: Die Ultralytics Platform und ihre einheitliche Python-API bieten eine unkomplizierte Benutzererfahrung, eine einfache Syntax und eine ausführliche Dokumentation. Für das Training mit einem eigenen Datensatz ist kein Boilerplate-Code erforderlich.
- Gut gepflegtes Ökosystem: Ultralytics profitiert von aktiver Entwicklung, häufigen Aktualisierungen und starker Unterstützung durch die Community. Integrationen mit Tools wie Comet ML und Weights & Biases sind direkt integriert.
- Trainingseffizienz: Datenlader, intelligentes Caching und Unterstützung für mehrere GPUs machen Ultralytics-Modelle besonders effizient trainierbar. Sofort verfügbare vortrainierte Gewichte beschleunigen das Transfer Learning erheblich.
Codebeispiel: Erste Schritte#
Mit Ultralytics lässt sich ein Modell mit nur wenigen Codezeilen bereitstellen. Das folgende Python-Beispiel zeigt, wie einfach es ist, das empfohlene Paket ultralytics zu laden, ein Modell zu trainieren und Inferenz auszuführen.
from ultralytics import YOLO
# Ein vortrainiertes YOLOv5s-Modell laden
model = YOLO("yolov5su.pt") # YOLOv5u: ankerfreie YOLOv5-Gewichte für das ultralytics-Paket
# Trainiere das Modell mit dem Beispieldatensatz COCO8
# Ultralytics übernimmt das Herunterladen und die Erweiterung der Daten automatisch
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Inferenz mit einem Beispielbild ausführen
predictions = model("https://ultralytics.com/images/bus.jpg")
# Die Vorhersagen anzeigen
predictions[0].show()Die Verwendung des ursprünglichen YOLOv7-Repositorys erfordert dagegen meist das Klonen komplexer Repositorys, die manuelle Verwaltung von Abhängigkeiten und lange Befehlszeilenargumente.
Anwendungen in der Praxis und ideale Einsatzbereiche#
Wann du YOLOv7 wählen solltest#
YOLOv7 eignet sich weiterhin für akademische Benchmarks oder spezielle GPU-Pipelines älterer Systeme, bei denen der höchstmögliche mAP-Wert das einzige Ziel ist und das System bereits auf die anchor-basierten Ausgabetensoren zugeschnitten ist. Forschende, die Gradientenpfade analysieren, verwenden YOLOv7 häufig als Basismodell.
Wann du YOLOv5 wählen solltest#
YOLOv5 wird aufgrund seiner außergewöhnlichen Stabilität besonders häufig in Produktionsumgebungen eingesetzt. Es ist die erste Wahl für:
- Mobilgeräte und Edge-Computing: YOLOv5n lässt sich über CoreML auf iOS oder über LiteRT auf Android bereitstellen.
- Agile Start-ups: Teams, die kurze Entwicklungszyklen benötigen, profitieren von der nahtlosen Integration mit der Ultralytics Platform zur Verwaltung von Datensätzen und zum Training in der Cloud.
- Umgebungen mit mehreren Aufgaben: Systeme, die gleichzeitig Objekterkennung, Klassifizierung und Segmentierung erfordern.
Die Zukunft: der Wechsel zu YOLO26#
Der Vergleich von YOLOv5 und YOLOv7 ist eine hervorragende Möglichkeit, die Entwicklung der Vision-KI nachzuvollziehen. Der Stand der Technik hat sich jedoch weiterentwickelt. Das im Januar 2026 veröffentlichte Ultralytics YOLO26 stellt einen gewaltigen Fortschritt dar und macht ältere Architekturen für neue Projekte weitgehend überflüssig.
Für Entwickler, die Spitzenleistung anstreben, bietet YOLO26 mehrere bahnbrechende Vorteile gegenüber YOLOv5 und YOLOv7:
- End-to-End-Design ohne NMS: Indem die Nachbearbeitung durch Non-Maximum Suppression optional übersprungen wird (
nms=False), ermöglicht YOLO26 eine deutlich einfachere Bereitstellung sowie eine schnellere und gleichmäßigere Latenz. - MuSGD-Optimierer: Inspiriert von den LLM-Innovationen von Moonshot AI ermöglicht dieser hybride Optimierer ein äußerst stabiles Training und eine schnelle Konvergenz.
- Beispiellose Geschwindigkeit am Edge: Die speziell für Edge-Umgebungen optimierte Nano-Variante bietet durch den Wegfall des Distribution Focal Loss (DFL) eine bis zu 43 % schnellere CPU-Inferenz.
- Höhere Genauigkeit: Neue Verlustfunktionen wie ProgLoss + STAL verbessern die Erkennung kleiner Objekte erheblich und machen das Modell ideal für Drohnenaufnahmen und Robotik.
Ganz gleich, ob du eine bestehende YOLOv5-Pipeline wartest oder das hochmoderne YOLO26 einführen möchtest: Die Ultralytics Platform bietet alle Werkzeuge, die du für den Erfolg in der modernen Computer Vision benötigst.