Ultralytics YOLO27:
Get Started

YOLOv8 vs. YOLOv9#

Die Entwicklung der Objekterkennung in Echtzeit war geprägt vom kontinuierlichen Streben nach höherer Genauigkeit, geringerer Latenz und besserer Hardwareauslastung. Zwei wichtige Meilensteine auf diesem Weg sind Ultralytics YOLOv8 und YOLOv9. Beide Modelle bieten modernste Funktionen im Bereich Computer Vision, sind jedoch auf unterschiedliche Bereitstellungsanforderungen, Architekturphilosophien und Entwicklerökosysteme ausgerichtet.

Dieser umfassende Leitfaden erläutert die technischen Unterschiede, architektonischen Neuerungen und praktischen Aspekte der Bereitstellung, damit du das passende Modell für dein nächstes Projekt im Bereich künstliche Intelligenz auswählen kannst.

Modellherkunft und grundlegende Konzepte#

Bevor wir uns mit den Kennzahlen befassen, ist es wichtig, die Ursprünge und wichtigsten Designziele der einzelnen Modelle zu verstehen.

Ultralytics YOLOv8: Der vielseitige Ökosystemstandard#

Das von einem Team bei Ultralytics veröffentlichte YOLOv8 wurde nicht nur als eigenständiger Objektdetektor, sondern als einheitliches Framework für mehrere Aufgaben entwickelt. Im Mittelpunkt stehen eine nahtlose Entwicklererfahrung, ein geringer Speicherbedarf und breite Hardwarekompatibilität.

YOLOv9: Programmierbare Gradienteninformationen#

YOLOv9 wurde unabhängig von Forschenden der Academia Sinica entwickelt und konzentriert sich vor allem auf die Architekturtheorie. Im Mittelpunkt steht dabei das Informationsengpassphänomen in tiefen neuronalen Netzen.

  • Autoren: Chien-Yao Wang und Hong-Yuan Mark Liao
  • Organisation: Institute of Information Science, Academia Sinica, Taiwan
  • Datum: 2024-02-21
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

Mehr über YOLOv9 erfahren

Bereitstellung in Unternehmen

Wenn du eine groß angelegte kommerzielle Bereitstellung planst, solltest du die Ultralytics Platform ausprobieren. Sie vereinfacht das Training in der Cloud, die Verwaltung von Datensätzen und die Einrichtung von API-Endpunkten mit einem Klick.

Architekturanalyse#

Architekturentscheidungen im Deep Learning bestimmen, wie effizient ein Modell lernt und wie schnell es auf Zielhardware wie einem NVIDIA Jetson oder einer Intel-CPU läuft.

YOLOv8-Architektur: C2f und entkoppelte Köpfe#

YOLOv8 führte das C2f-Modul ein (Flaschenhals mit zwei Faltungen und teilweiser Verarbeitung über mehrere Stufen), das das ältere C3-Modul ersetzte. Diese Änderung verbessert den Gradientenfluss und ermöglicht dem Netzwerk, reichhaltigere Merkmalsrepräsentationen zu lernen, ohne den GPU-Speicher stark zu beanspruchen.

Außerdem verwendet YOLOv8 ein ankerfreies Design mit einem entkoppelten Kopf. Da Klassifizierung und Regression über getrennte Pfade verarbeitet werden, konvergiert das Modell beim Training schneller und verallgemeinert besser auf verschiedene benutzerdefinierte Datensätze.

YOLOv9-Architektur: PGI und GELAN#

YOLOv9 führt Programmable Gradient Information (PGI) und das Generalized Efficient Layer Aggregation Network (GELAN) ein. PGI stellt sicher, dass wichtige Daten beim Durchlaufen der Netzwerkschichten nicht verloren gehen, und sorgt so für zuverlässige Gradienten bei der Aktualisierung der Gewichte. GELAN maximiert die Parametereffizienz und ermöglicht dem Modell eine hohe Genauigkeit, während die Anzahl der FLOPs möglichst überschaubar bleibt.

Obwohl YOLOv9 mathematisch beeindruckend ist, kann die Abhängigkeit von bestimmten zusätzlichen reversiblen Verzweigungen während des Trainings den Trainingscode im Vergleich zu Standardpipelines schwieriger anpassbar machen.

Leistungskennzahlen und Benchmarks#

Die folgende Tabelle vergleicht die Modelle in verschiedenen Größen direkt miteinander. Die Leistung wird anhand des MS-COCO-Datensatzes gemessen, einem Standardbenchmark für die Objekterkennung.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.1
YOLOv8x64053.9479.114.3768.2257.8
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Hinweis: Die besten Werte in jeder Spalte sind fett hervorgehoben.

Abwägung der Vor- und Nachteile#

YOLOv9 erreicht eine etwas höhere Spitzenleistung bei der Genauigkeit (mAP), insbesondere mit seiner größeren Variante e. Das hat jedoch seinen Preis. Ultralytics YOLOv8 ist bei der Inferenzgeschwindigkeit deutlich im Vorteil, besonders bei der Kompilierung in Formate wie TensorRT oder ONNX. Für Anwendungen, die eine hohe Bildrate (FPS) auf ressourcenbeschränkter Edge-Hardware benötigen, etwa einem Raspberry Pi oder älteren Mobilchips, bieten die Varianten n und s von YOLOv8 eine wesentlich praktischere Leistungsbalance.

Trainingseffizienz und Ökosystemintegration#

Bei der Modellauswahl zählen mehr als nur Genauigkeitstabellen – die Entwicklererfahrung ist entscheidend.

Der Vorteil von Ultralytics: einfache Bedienung#

Für das Training von YOLOv9 müssen häufig komplexe GitHub-Repositories geklont, PyTorch-Umgebungen sorgfältig verwaltet und zusätzliche Gewichte für Verlustfunktionen manuell konfiguriert werden.

Im Gegensatz dazu bietet Ultralytics YOLOv8 eine bemerkenswert schlanke Python-API. Sie ist auf einfache Bedienung ausgelegt und übernimmt nativ die Datenerweiterung, die Protokollierung (mit Tools wie Weights & Biases und Comet ML) sowie die Verteilung auf Hardware.

from ultralytics import YOLO

# Ein vortrainiertes kleines YOLOv8-Modell laden
model = YOLO("yolov8s.pt")

# Das Modell effizient mit benutzerdefinierten Daten trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Für die Bereitstellung auf Edge-Geräten exportieren
model.export(format="engine", quantize=16)  # TensorRT-Export

Diese einzelne API verkürzt die Zeit vom Prototyp bis zur Produktion erheblich. Außerdem benötigt YOLOv8 beim Training in der Regel weniger CUDA-Speicher, sodass Entwickler auf Hardware für Endverbraucher größere Batch-Größen verwenden können.

Vielseitigkeit bei verschiedenen Aufgaben#

YOLOv9 ist zwar ein ausgezeichneter Begrenzungsrahmen-Detektor, doch Computer-Vision-Anwendungen in der Praxis erfordern oft mehr. YOLOv8 ist ein vielseitiges Kraftpaket und unterstützt nativ Instanzsegmentierung, Posenschätzung, Bildklassifizierung und orientierte Begrenzungsrahmen (OBB). Ein einziges Framework für mehrere Aufgaben zu verwenden, reduziert den Umfang der Software und den Wartungsaufwand erheblich.

Blick in die Zukunft

Wenn du ein neues Projekt startest, solltest du auch Ultralytics YOLO11 oder das hochmoderne YOLO26 in Betracht ziehen. Letzteres bietet eine optionale End-to-End-Inferenz ohne NMS.

Anwendungsfälle in der Praxis#

Wie bewähren sich diese Modelle in der Produktion?

Autonome Drohnen und Robotik#

Für Robotik, die Hindernissen schnell ausweichen muss, ist YOLOv8 die bevorzugte Wahl. Die extrem niedrige Latenz von YOLOv8n stellt sicher, dass autonome Systeme in Echtzeit auf ihre Umgebung reagieren und so Zusammenstöße verhindern. Dank der nativen Exportmöglichkeiten zu OpenVINO und CoreML ist die Bereitstellung auf stromsparenden Chips, wie sie in kommerziellen Drohnen üblich sind, ganz einfach.

Fehlererkennung bei hoher Auflösung#

In spezialisierten Fertigungsumgebungen, in denen die Erkennung mikroskopisch kleiner Anomalien entscheidend ist und eine Offline-Verarbeitung akzeptabel ist, kann YOLOv9 sehr effektiv sein. Die PGI-Architektur hilft dem Netzwerk, die feinen visuellen Details zu bewahren, die für das Erkennen feinster Risse oder Lötfehler auf Leiterplatten nötig sind.

Intelligenter Einzelhandel und Sicherheitsanalysen#

Um Kunden in den Gängen eines Geschäfts zu verfolgen oder automatisierte Kassensysteme zu verwalten, bietet YOLOv8 die beste Balance. YOLOv8 kann gleichzeitig Erkennung und Mehrfachobjektverfolgung mit Standardalgorithmen wie BoT-SORT ausführen und ist damit eine robuste Lösung für den Einzelhandel mit mehreren Kameras.

Anwendungsfälle und Empfehlungen#

Die Wahl zwischen YOLOv8 und YOLOv9 hängt von den konkreten Anforderungen deines Projekts, den Einschränkungen bei der Bereitstellung und deinen Präferenzen bezüglich des Ökosystems ab.

Wann du YOLOv8 wählen solltest#

YOLOv8 ist eine gute Wahl für:

  • Vielseitige Bereitstellung für mehrere Aufgaben: Projekte, die ein bewährtes Modell für Erkennung, Segmentierung, Klassifizierung und Posenschätzung innerhalb des Ultralytics-Ökosystems benötigen.
  • Etablierte Produktivsysteme: Bestehende Produktivumgebungen, die bereits auf der YOLOv8-Architektur und stabilen, umfassend getesteten Bereitstellungspipelines basieren.
  • Umfangreiche Unterstützung durch Community und Ökosystem: Anwendungen, die von den zahlreichen YOLOv8-Anleitungen, Integrationen von Drittanbietern und aktiven Community-Ressourcen profitieren.

Wann du YOLOv9 wählen solltest#

YOLOv9 empfiehlt sich für:

  • Forschung zu Informationsengpässen: Akademische Projekte, die programmierbare Gradienteninformationen (PGI) und Architekturen mit effizienten, verallgemeinerten Schichtaggregationsnetzwerken (GELAN) untersuchen.
  • Studien zur Optimierung des Gradientenflusses: Forschung, die darauf abzielt, Informationsverluste in tiefen Netzwerkschichten während des Trainings zu verstehen und zu verringern.
  • Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Vergleichsmaßstab für Architekturvergleiche benötigt wird.

Wann du Ultralytics (YOLO26) wählen solltest#

Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:

  • NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
  • Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
  • Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.

Die nächste Entwicklungsstufe: YOLO26#

YOLOv8 und YOLOv9 sind leistungsstark, doch die KI-Landschaft entwickelt sich rasant. Für Teams, die auf höchstmögliche Leistung angewiesen sind, baut das neu veröffentlichte YOLO26 auf den Erfolgen dieser früheren Generationen auf.

YOLO26 führt ein optionales End-to-End-Design ohne NMS (nms=False) ein, das aufwendige Engpässe bei der Nachverarbeitung beseitigt und die Bereitstellung vereinfacht sowie die Latenz besser vorhersehbar macht. Dank des neuen MuSGD-Optimierers und der verbesserten Verlustfunktionen ProgLoss + STAL sowie der Entfernung von DFL (Distribution Focal Loss entfällt für einen einfacheren Export und bessere Kompatibilität mit Edge-Geräten und Geräten mit geringem Stromverbrauch) erreicht YOLO26 eine um bis zu 43 % schnellere CPU-Inferenz und verbessert zugleich die Erkennung kleiner Objekte. Entwickler, die die Grenzen des Edge-Computings ausloten, sollten unbedingt YOLO26 evaluieren.

Zusammenfassend lässt sich sagen: YOLOv9 bietet zwar spannende Architekturforschung und eine ausgezeichnete Spitzenleistung bei der Genauigkeit, doch Ultralytics YOLOv8 bleibt für die große Mehrheit der Computer-Vision-Ingenieure, die schnell zuverlässige Software bereitstellen wollen, die praktischste, am besten unterstützte und vielseitigste Wahl.

Kommentare