Ultralytics YOLO27:
Get Started

YOLOv6-3.0 und YOLOv9#

Die Echtzeit-Objekterkennung entwickelt sich ständig weiter. Treiber sind der Bedarf an höherer Genauigkeit, geringerer Latenz und besserer Hardwareauslastung. Dieser umfassende Vergleich beleuchtet zwei wichtige Meilensteine auf diesem Gebiet: YOLOv6-3.0, entwickelt für hohen industriellen Durchsatz, und YOLOv9, das neuartige Architekturen einführte, um Informationsengpässe beim Deep Learning zu überwinden.

Beide Modelle bieten einzigartige Architekturinnovationen. Entwickler, die nach der optimalen Balance zwischen Leistung und einfacher Bereitstellung suchen, wechseln jedoch häufig zu modernen Ökosystemen. Für neue Projekte ist das von Haus aus durchgängige Ultralytics YOLO26 der empfohlene Standard. Es bietet modernste Genauigkeit und eine deutlich effizientere Entwicklererfahrung.

YOLOv6-3.0: Optimierung für industriellen Durchsatz#

YOLOv6-3.0 wurde von der Vision-AI-Abteilung bei Meituan entwickelt und intensiv auf maximalen Durchsatz in industriellen Anwendungen, insbesondere auf GPU-Hardware, ausgelegt.

  • Autoren: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu und Xiangxiang Chu
  • Organisation: Meituan
  • Datum: 13. Januar 2023
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

Architektonische Innovationen#

YOLOv6-3.0 führte mehrere wichtige Änderungen ein, um die Merkmalsfusion und die Hardwareeffizienz zu verbessern. Die Architektur umfasst ein Modul für bidirektionale Konkatenation (BiC) in ihrem Neck, das genauere Lokalisierungssignale liefert. Zudem kommt eine Strategie des ankerunterstützten Trainings (AAT) zum Einsatz. Dieser Ansatz verbindet die umfassende Anleitung des ankerbasierten Trainings mit der Inferenzgeschwindigkeit eines ankerfreien Verfahrens und erzielt so bessere Leistung, ohne die Bereitstellung zu verlangsamen.

Das Backbone basiert auf einem EfficientRep-Design, das sorgfältig für GPU-Inferenz und eine hohe Hardwareeffizienz optimiert wurde. Dadurch eignet es sich hervorragend für Szenarien der industriellen Fertigung, in denen eine intensive Stapelverarbeitung üblich ist.

Stärken und Schwächen#

Die größte Stärke von YOLOv6-3.0 ist die hohe Bildrate auf GPUs wie der NVIDIA T4. Dadurch eignet sich das Modell für Videoanalyse mit hoher Streamdichte. Seine starke Abhängigkeit von bestimmten Hardwareoptimierungen kann jedoch zu suboptimaler Latenz auf Edge-Geräten mit ausschließlich CPU führen. Außerdem kann die Einrichtung der Trainingspipeline im Vergleich zu einheitlicheren Frameworks komplex sein.

Mehr über YOLOv6 erfahren

YOLOv9: Programmierbare Gradienteninformationen#

YOLOv9 wurde ein Jahr später veröffentlicht und konzentriert sich darauf, den Informationsengpass zu überwinden, der tiefen neuronalen Netzen innewohnt, und die theoretischen Grenzen von CNN-Architekturen zu verschieben.

Architektonische Innovationen#

Der wichtigste Beitrag von YOLOv9 ist programmierbare Gradienteninformation (PGI). Sie stellt sicher, dass wichtige Daten beim Durchlaufen mehrerer Netzwerkschichten erhalten bleiben, und ermöglicht so zuverlässigere Gewichtsaktualisierungen. Neben PGI umfasst das Modell das generalisierte effiziente Schichtaggregationsnetzwerk (GELAN). GELAN maximiert die Parametereffizienz und ermöglicht YOLOv9 dadurch eine höhere Genauigkeit bei weniger FLOPs als viele Vorgängermodelle.

Stärken und Schwächen#

YOLOv9 erzielt auf Benchmark-Datensätzen wie COCO eine herausragende mittlere durchschnittliche Präzision (mAP) und ist daher bei Forschenden beliebt, die vor allem höchste Genauigkeit anstreben. Wie YOLOv6 stützt es sich bei der Nachverarbeitung jedoch weiterhin auf die herkömmliche Nichtmaximumunterdrückung (NMS). Das erhöht die Latenz und erschwert die Pipeline zur Modellbereitstellung, insbesondere bei der Übertragung auf Edge-Geräte mit Formaten wie ONNX oder TensorRT.

Mehr über YOLOv9 erfahren

Leistungsvergleich#

Beim Vergleich dieser Modelle müssen Genauigkeit, Parameterzahl und Inferenzgeschwindigkeit gemeinsam betrachtet werden.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Der Vorteil von Ultralytics: YOLO26 im Überblick#

YOLOv6-3.0 und YOLOv9 bieten zwar leistungsfähige Architekturen, doch Produktionsumgebungen verlangen ein gut gepflegtes Ökosystem, einen geringen Speicherbedarf und außergewöhnliche Benutzerfreundlichkeit. Hier überzeugen die Ultralytics Platform sowie Modelle wie YOLO11 und das hochmoderne YOLO26.

YOLO26 wurde Anfang 2026 veröffentlicht und definiert die Effizienz bei der Bereitstellung grundlegend neu, indem es überholte Engpässe beseitigt.

Natives End-to-End-Design

YOLO26 bietet ein End-to-End-Design ohne NMS: Sein optionaler Eins-zu-eins-Kopf (nms=False) macht die Nachverarbeitung durch Nichtmaximumunterdrückung überflüssig. Das verringert die Schwankungen der Inferenzlatenz erheblich und vereinfacht die Bereitstellungslogik am Netzwerkrand.

Wichtige Neuerungen in YOLO26#

  1. MuSGD-Optimierer: Inspiriert vom Training großer Sprachmodelle, etwa Kimi K2 von Moonshot AI, verwendet YOLO26 eine Kombination aus SGD und Muon. Dadurch werden Stabilität beim Training und schnellere Konvergenz für Computer-Vision-Aufgaben auf ein neues Niveau gehoben.
  2. Bis zu 43 % schnellere CPU-Inferenz: Im Gegensatz zum starken GPU-Fokus von YOLOv6 ist YOLO26 umfassend für Edge-Geräte optimiert. Durch den Wegfall von Distribution Focal Loss (DFL) wird der Kopf vereinfacht, wodurch das Modell besonders gut mit stromsparenden CPUs und Hardware für Edge Computing kompatibel ist.
  3. ProgLoss + STAL: Fortschrittliche Verlustfunktionen verbessern die Erkennung kleiner Objekte erheblich – ein entscheidender Vorteil für Luftaufnahmen und Robotik.
  4. Unerreichte Vielseitigkeit: YOLOv6 ist ausschließlich auf Erkennung ausgelegt, während YOLO26 nahtlos Instanzsegmentierung, Klassifizierung, Posenschätzung und die Erkennung orientierter Begrenzungsrahmen (OBB) unterstützt.

Nahtloses Training mit Ultralytics#

Das Training hochmoderner Modelle sollte keine komplexen Bash-Skripte erfordern. Die Ultralytics-Python-API bietet einen optimierten Ablauf mit automatischem Laden der Daten, minimalem CUDA-Speicherverbrauch und integrierter Nachverfolgung.

from ultralytics import YOLO

# Das hochmoderne YOLO26-Nano-Modell laden
model = YOLO("yolo26n.pt")

# Auf dem COCO8-Datensatz trainieren (optimizer='auto' wählt MuSGD bei längeren Trainingsläufen aus)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Das trainierte Modell mit einem einzigen Befehl in das ONNX-Format exportieren
model.export(format="onnx")

Ideale Anwendungsfälle#

Die Wahl der passenden Architektur hängt vollständig von der angestrebten Bereitstellungsumgebung ab:

  • YOLOv6-3.0 verwenden für: Fabrikautomatisierung und Fehlererkennung, wenn Server-GPUs wie A100 in großer Zahl verfügbar sind und Stapelverarbeitung den Durchsatz maximiert.
  • YOLOv9 verwenden für: Akademische Forschung oder Wettbewerbe, bei denen vor allem die höchstmögliche mAP auf standardisierten Datensätzen wie COCO zählt.
  • YOLO26 verwenden für: Fast alle modernen kommerziellen Anwendungen. Optionale Inferenz ohne NMS, geringer Speicherbedarf und schnelle CPU-Inferenz machen das Modell ideal für Sicherheitsalarmanlagen, intelligenten Einzelhandel und die Echtzeit-Objektverfolgung auf eingebetteten Geräten.

Mithilfe des umfassenden Ultralytics-Ökosystems können Entwickler problemlos mit YOLOv8, YOLO11 und YOLO26 experimentieren, um für ihre konkreten Herausforderungen in der Praxis die passende Leistungsbalance zu finden.

Kommentare