YOLOv9 im Vergleich zu YOLOv7#
Die Entwicklung der Objekterkennung in Echtzeit wurde vom stetigen Bestreben geprägt, Recheneffizienz und hohe Genauigkeit miteinander in Einklang zu bringen. Zwei wegweisende Architekturen auf diesem Weg sind YOLOv9 und YOLOv7, die beide von Forschenden am Institute of Information Science der Academia Sinica in Taiwan entwickelt wurden. YOLOv7 führte bahnbrechende, trainierbare Bag-of-Freebies ein, während YOLOv9 gezielt die Informationsengpässe des Deep Learning angeht.
Dieser umfassende technische Vergleich beleuchtet die architektonischen Unterschiede, Leistungskennzahlen und idealen Bereitstellungsszenarien beider Modelle und hilft Fachleuten für maschinelles Lernen und Forschenden, das richtige Werkzeug für ihre Computer-Vision-Verarbeitungsketten auszuwählen.
Leistungs- und Metrikvergleich#
Beim Vergleich dieser Modelle sind die reine Leistung und Effizienz entscheidende Faktoren. Die folgende Tabelle enthält die mittlere durchschnittliche Präzision (mAP) und den Rechenaufwand für Benchmarks auf dem Standarddatensatz COCO.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Beachte, dass YOLOv9c mit 53,0 mAP ungefähr dieselbe Genauigkeit wie YOLOv7x mit 53,1 mAP erreicht, dabei aber deutlich weniger Parameter (25,5 Mio. gegenüber 71,3 Mio.) und FLOPs benötigt. Das zeigt die Verbesserungen bei der ausgewogenen Leistung moderner Architekturen.
YOLOv9: Den Informationsengpass beheben#
YOLOv9 wurde Anfang 2024 vorgestellt und veränderte grundlegend, wie tiefe neuronale Netze Daten über ihre Schichten hinweg beibehalten.
- Autoren: Chien-Yao Wang und Hong-Yuan Mark Liao
- Organisation: Institute of Information Science, Academia Sinica
- Datum: 21. Februar 2024
- Ressourcen: Arxiv-Artikel | GitHub-Repository
Architektonische Neuerungen#
YOLOv9 führt das generalisierte effiziente Layer-Aggregationsnetzwerk (GELAN) und programmierbare Gradienteninformationen (PGI) ein. GELAN kombiniert die Stärken von CSPNet und ELAN, um die Parametereffizienz und den Rechenaufwand zu optimieren und so mit weniger Parametern eine hohe Genauigkeit zu gewährleisten. PGI ist ein Framework zur zusätzlichen Überwachung, das Datenverlust in tiefen Netzen verhindern und zuverlässige Gradienten für die Aktualisierung der Gewichte während des Trainings erzeugen soll.
Stärken und Einschränkungen#
Die größte Stärke von YOLOv9 ist seine Fähigkeit, subtile Merkmale ohne enormen Rechenaufwand zu extrahieren. Dadurch eignet es sich besonders gut für Aufgaben, die eine hohe Merkmalstreue erfordern, etwa die medizinische Bildanalyse. Die komplexe PGI-Struktur während des Trainings kann jedoch individuelle Architekturänderungen für Einsteiger schwieriger machen als bei einheitlicheren Frameworks.
YOLOv7: Wegbereiter der Bag-of-Freebies#
YOLOv7 wurde 2022 veröffentlicht und setzte neue Maßstäbe für den Einsatz auf Hardware für Endverbraucher. Strukturelle Neuerungen steigerten die Geschwindigkeit der Inferenz in Echtzeit erheblich.
- Autoren: Chien-Yao Wang, Alexey Bochkovskiy und Hong-Yuan Mark Liao
- Organisation: Institute of Information Science, Academia Sinica
- Datum: 6. Juli 2022
- Ressourcen: Arxiv-Artikel | GitHub-Repository
Architektonische Neuerungen#
Der wichtigste Beitrag von YOLOv7 ist das erweiterte effiziente Layer-Aggregationsnetzwerk (E-ELAN). Diese Architektur ermöglicht es dem Modell, kontinuierlich vielfältigere Merkmale zu erlernen. Außerdem nutzt YOLOv7 „trainierbare Bag-of-Freebies“ – Techniken wie geplante umparametrisierte Faltungen und dynamische Labelzuweisung. Diese Methoden verbessern die Genauigkeit des Modells während des Trainings, ohne bei der Bereitstellung zusätzliche Inferenzkosten zu verursachen.
Stärken und Einschränkungen#
YOLOv7 ist stark für die Edge-Verarbeitung in Echtzeit optimiert und bleibt in älteren Systemen und CUDA-Umgebungen weiterhin weit verbreitet. Seine größte Einschränkung ist heute die höhere Parameterzahl im Vergleich zu neueren Modellen. Wie die Leistungstabelle zeigt, ist für Spitzengenauigkeit das große Modell YOLOv7x erforderlich, das deutlich mehr GPU-Speicher benötigt als vergleichbare moderne Architekturen.
Der Vorteil von Ultralytics: einfache Bereitstellung#
Die ursprünglichen Forschungs-Repositories für YOLOv9 und YOLOv7 bieten zwar hervorragende wissenschaftliche Grundlagen, doch die Bereitstellung dieser Modelle in Produktionsumgebungen kann komplex sein. Die Integration von YOLOv9 über das Paket ultralytics (YOLOv7 wird nur über exportierte ONNX- oder TensorRT-Modelle unterstützt) bietet eine herausragende Benutzerfreundlichkeit.
Mit der integrierten Ultralytics Platform profitieren Entwickler von einem gut gepflegten Ökosystem mit einer intuitiven Python-API, aktiver Unterstützung durch die Community und zuverlässiger Experimentverfolgung.
Zukunftssicherheit mit YOLO26#
Wenn du ein neues Computer-Vision-Projekt beginnst, empfehlen wir dringend, statt YOLOv9 oder YOLOv7 das neu veröffentlichte YOLO26 auszuprobieren. YOLO26 wurde als neuer Stand der Technik veröffentlicht und bietet bahnbrechende Fortschritte:
- End-to-End-Design ohne NMS: Ein optionaler One-to-one-Kopf (
nms=False) überspringt die Nachbearbeitung mit Nicht-Maximum-Unterdrückung und reduziert so Komplexität und Latenz bei der Bereitstellung erheblich. - Bis zu 43 % schnellere CPU-Inferenz: Optimiert für Edge-Computing-Umgebungen, damit deine Anwendung auch ohne dedizierte GPUs reibungslos läuft.
- MuSGD Optimizer: Ein hybrider Optimierer, inspiriert vom Training großer Sprachmodelle, der eine äußerst stabile Konvergenz ermöglicht und die Trainingszeit verkürzt.
- DFL Removal: Der vereinfachte Modelleport durch Entfernen des Distribution Focal Loss verbessert die Kompatibilität mit mobilen Geräten mit geringem Stromverbrauch.
- ProgLoss + STAL: Verbessert die Leistung bei der Erkennung kleiner Objekte erheblich und macht das Verfahren zur ersten Wahl für Luftbilder und Überwachung.
Weitere beliebte Alternativen innerhalb des Ökosystems sind Ultralytics YOLOv8 und YOLO11. Beide sind vielseitig einsetzbar, etwa für die Instanzsegmentierung und die Posenschätzung.
Implementierungsbeispiel#
Das Training und der Export von YOLOv9 oder YOLO26 sind mit der einheitlichen API ganz einfach. Der folgende Code veranschaulicht die optimierte Trainingseffizienz, die für Ultralytics-Tools charakteristisch ist.
from ultralytics import YOLO
# YOLOv9 oder das empfohlene YOLO26-Modell initialisieren
model = YOLO("yolov9c.pt") # Für schnellere Leistung auf Edge-Geräten durch "yolo26n.pt" ersetzen
# Mit integrierter Datenerweiterung auf einem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Exportiere das trainierte Modell zur Bereitstellung im ONNX-Format
model.export(format="onnx")Beim Training auf Hardware für Endverbraucher ist Speichereffizienz entscheidend. Die Ultralytics-Implementierungen von YOLOv9 und YOLO26 sind stark optimiert, um VRAM-Spitzen zu reduzieren. Transformer-basierte Modelle wie RT-DETR leiden dagegen beim Training oft unter einem erheblich anwachsenden Speicherbedarf.
Anwendungen in der Praxis und ideale Einsatzbereiche#
Die Wahl zwischen diesen Architekturen hängt oft von den spezifischen Einschränkungen deiner Produktionsumgebung ab.
Wann du YOLOv9 einsetzen solltest: YOLOv9 eignet sich besonders für Umgebungen, in denen winzige Details erhalten bleiben müssen. Dank der zuverlässigen Merkmalsextraktion ist das Modell ideal für Einzelhandelsanalysen, etwa zum Zählen dicht aneinandergereihter Produkte in Regalen, sowie für landwirtschaftliche Anwendungen, bei denen Krankheiten im Frühstadium auf kleinen Blättern erkannt werden müssen.
Wann du YOLOv7 einsetzen solltest: YOLOv7 ist weiterhin eine gute Wahl für bestehende Bereitstellungspipelines. Wenn du das Modell in ältere Hardwaresysteme integrierst, etwa bestimmte Generationen des Google Coral Edge TPU, lässt sich die einfache CNN-Architektur von YOLOv7 möglicherweise leichter kompilieren als die neuerer Modelle.
Wann du YOLO26 einsetzen solltest (empfohlen): Für jede moderne Bereitstellung – von autonomen Drohnen bis hin zur intelligenten Verkehrssteuerung in Städten – ist YOLO26 die beste Wahl. Die NMS-freie Architektur garantiert deterministische Inferenzzeiten, was für sicherheitskritische Robotik unverzichtbar ist. Gleichzeitig übertrifft die hohe Präzision durchweg YOLOv9 und YOLOv7.