YOLO26 und YOLOv9#
Die Computer Vision entwickelt sich rasant weiter, und neue Architekturen verschieben kontinuierlich die Grenzen von Geschwindigkeit und Genauigkeit. In diesem technischen Vergleich untersuchen wir die Unterschiede zwischen YOLO26 und YOLOv9, zwei einflussreichen Modellen für die Objekterkennung in Echtzeit. Beide Modelle bieten eigene Architekturinnovationen. Um das richtige Werkzeug für dein nächstes Computer-Vision-Projekt auszuwählen, musst du jedoch ihre Kompromisse bei der Leistung, ihre Bereitstellungsmöglichkeiten und ihre Hardwareanforderungen verstehen.
YOLO26: Leistungsstark und für Edge-Geräte optimiert#
Das Anfang 2026 veröffentlichte Ultralytics YOLO26 stellt einen Generationssprung bei der Bereitstellungseffizienz und der Trainingsstabilität von Modellen dar. Als von Grund auf durchgängiges Framework konzipiert, geht es direkt auf Engpässe bei der Bereitstellung ein, die KI-Anwendungen auf Edge-Geräten seit Langem beeinträchtigen.
Modelldetails:
- Autoren: Glenn Jocher und Jing Qiu
- Organisation: Ultralytics
- Datum: 2026-01-14
- GitHub: Ultralytics-Repository
- Dokumentation: YOLO26-Dokumentation
Architektur und Innovationen#
YOLO26 gestaltet die Nachbearbeitung grundlegend neu und führt ein durchgängiges Design ohne NMS ein. Bei Verwendung des optionalen One-to-One-Kopfes (nms=False) überspringt das Modell Non-Maximum Suppression (NMS) und erreicht eine deutlich geringere Schwankung der Latenz. Dadurch wird die Bereitstellung auf mobilen Plattformen und Edge-Plattformen erheblich einfacher, insbesondere beim Export in Frameworks wie ONNX und Apple CoreML.
Darüber hinaus vereinfacht die Entfernung von Distribution Focal Loss (DFL) den Export und verbessert die Kompatibilität mit Mikrocontrollern mit geringem Stromverbrauch. Um die Trainingsstabilität zu erhöhen, integriert YOLO26 den neuartigen MuSGD-Optimierer, eine Kombination aus stochastischem Gradientenabstieg (SGD) und Muon, die von Innovationen beim Training großer Sprachmodelle inspiriert ist. Das führt zu einer schnelleren Konvergenz und einer robusteren Merkmalsextraktion bei anspruchsvollen Datensätzen.
Dank architektonischer Vereinfachungen und der Entfernung von DFL erreicht YOLO26 eine bis zu 43 % schnellere CPU-Inferenz und ist damit die ideale Wahl für Edge-Geräte mit begrenzten Ressourcen, etwa den Raspberry Pi oder den NVIDIA Jetson Nano.
Für die Erkennung besonders anspruchsvoller Objekte in Szenen wie Luftbildern von Drohnen verwendet YOLO26 die überarbeiteten Verlustfunktionen ProgLoss + STAL. Diese verbessern den Recall bei der Erkennung kleiner Objekte deutlich. Außerdem bietet das Modell aufgabenspezifische Verbesserungen, darunter mehrskalige Prototypen für die Instanzsegmentierung, die Residualschätzung der Log-Likelihood (RLE) für die Posenschätzung und eine spezielle Winkelfunktion zur Erkennung orientierter Begrenzungsrahmen (OBB).
YOLOv9: Programmierbare Gradienteninformationen#
YOLOv9 wurde Anfang 2024 vorgestellt und brachte theoretische Fortschritte beim Umgang neuronaler Netze mit dem Gradientenfluss während des Trainings. Dabei lag der Schwerpunkt auf Parametereffizienz und dem Erhalt tiefer Merkmale.
Modelldetails:
- Autoren: Chien-Yao Wang und Hong-Yuan Mark Liao
- Organisation: Institute of Information Science, Academia Sinica, Taiwan
- Datum: 2024-02-21
- Arxiv: YOLOv9-Fachartikel
- GitHub: YOLOv9-Repository
- Dokumentation: YOLOv9-Dokumentation
Architektur und Stärken#
YOLOv9 basiert auf den Konzepten der programmierbaren Gradienteninformationen (PGI) und des effizienten, verallgemeinerten Schichtaggregationsnetzwerks (GELAN). Diese Konzepte lösen das Informationsengpassproblem, das häufig in tiefen neuronalen Netzen auftritt. Indem GELAN wesentliche Informationen während des Vorwärtsdurchlaufs bewahrt, stellt es sicher, dass die für die Aktualisierung der Gewichte verwendeten Gradienten zuverlässig bleiben. Diese Architektur bietet eine hohe Genauigkeit und macht YOLOv9 zu einem starken Kandidaten für die akademische Forschung zur Theorie neuronaler Netze und zur Optimierung von Gradientenpfaden mit dem Framework PyTorch.
Einschränkungen#
Trotz seiner ausgezeichneten Parametereffizienz ist YOLOv9 bei der Nachbearbeitung von Begrenzungsrahmen stark auf herkömmliche NMS angewiesen. Das kann bei der Inferenz auf Edge-Geräten zu Rechenengpässen führen. Außerdem konzentriert sich das offizielle Repository weitgehend auf die Objekterkennung. Für spezielle Aufgaben wie Tracking oder Posenschätzung ist daher erheblicher eigener Entwicklungsaufwand erforderlich.
Leistungsvergleich#
Bei der Bewertung dieser Modelle für den Einsatz in der Praxis ist es entscheidend, Genauigkeit (mAP), Inferenzgeschwindigkeit und Speicherverbrauch gegeneinander abzuwägen. Ultralytics-Modelle sind für ihren geringen Speicherbedarf sowohl beim Training als auch bei der Inferenz bekannt. Sie benötigen deutlich weniger CUDA-Speicher als transformerbasierte Alternativen wie RT-DETR.
Nachfolgend findest du einen direkten Leistungsvergleich von YOLO26 und YOLOv9 auf dem COCO-Datensatz. Die jeweils besten Werte sind fett hervorgehoben.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Hinweis: Die CPU-Geschwindigkeiten für YOLOv9 werden nicht aufgeführt, da sie je nach NMS-Konfiguration stark variieren und im Allgemeinen unter denen der nativen NMS-freien Implementierung von YOLO26 liegen.
Anwendungsfälle und Empfehlungen#
Ob du YOLO26 oder YOLOv9 wählst, hängt von den Anforderungen deines Projekts, den Einschränkungen bei der Bereitstellung und deinen Präferenzen beim Ökosystem ab.
Wann du YOLO26 wählen solltest#
YOLO26 ist eine gute Wahl für:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Wann du YOLOv9 wählen solltest#
YOLOv9 empfiehlt sich für:
- Forschung zu Informationsengpässen: Akademische Projekte, die programmierbare Gradienteninformationen (PGI) und Architekturen mit effizienten, verallgemeinerten Schichtaggregationsnetzwerken (GELAN) untersuchen.
- Studien zur Optimierung des Gradientenflusses: Forschung, die darauf abzielt, Informationsverluste in tiefen Netzwerkschichten während des Trainings zu verstehen und zu verringern.
- Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Vergleichsmaßstab für Architekturvergleiche benötigt wird.
Der Vorteil von Ultralytics#
Bei der Modellwahl geht es um mehr, als nur einen Genauigkeitsbenchmark zu lesen. Das umgebende Softwareökosystem bestimmt, wie schnell du von der Datenerfassung zur Bereitstellung gelangst.
Benutzerfreundlichkeit und Ökosystem#
Die Ultralytics Python-API bietet einen nahtlosen Weg „vom Einstieg bis zum Profi“. Statt komplexe Repositories zu klonen oder verteilte Trainingsskripte manuell zu konfigurieren, können Entwickler das Paket mit pip installieren und sofort mit dem Training beginnen. Das aktiv gepflegte Ultralytics-Ökosystem sorgt für häufige Aktualisierungen, automatisierte Integrationen mit ML-Plattformen wie Weights & Biases und eine ausführliche Dokumentation.
Vielseitigkeit bei Computer-Vision-Aufgaben#
YOLOv9 ist vor allem ein Erkennungsmodell, während YOLO26 ein vielseitiges Computer-Vision-Werkzeug ist. Mit einer einheitlichen Syntax kannst du mühelos von der Objekterkennung zur pixelgenauen Bildsegmentierung oder zur Klassifizierung ganzer Bilder wechseln. Diese Vielseitigkeit verringert den technischen Aufwand für die Pflege mehrerer voneinander getrennter Codebasen für unterschiedliche Computer-Vision-Funktionen.
Effizientes Training und Bereitstellung#
Trainingseffizienz ist ein Grundpfeiler der Ultralytics-Philosophie. YOLO26 nutzt problemlos verfügbare vortrainierte Gewichte und benötigt deutlich weniger Speicher als umfangreiche Vision-Transformer. Nach dem Training ermöglichen integrierte Exportpipelines die Umwandlung in optimierte Formate wie TensorRT oder LiteRT mit nur einem Klick und erleichtern so den Weg in den produktiven Einsatz.
Codebeispiel: Erste Schritte mit YOLO26#
Die Implementierung von YOLO26 ist bemerkenswert einfach. Der folgende Python-Code zeigt, wie du mit der Ultralytics-API ein vortrainiertes Modell lädst, es mit eigenen Daten trainierst und Inferenzen ausführst.
from ultralytics import YOLO
# Lade das neueste hochmoderne YOLO26-Nano-Modell
model = YOLO("yolo26n.pt")
# Trainiere das Modell mit dem COCO8-Datensatz (optimizer='auto' wählt MuSGD für längere Trainingsläufe)
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Verwende GPU 0 oder 'cpu' für das CPU-Training
)
# Führe eine Inferenz ohne NMS auf einem Beispielbild aus
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Zeige die Begrenzungsrahmen und Konfidenzwerte an
predictions[0].show()Dank der Geschwindigkeit, der vereinfachten Architektur und des robusten Ökosystems von YOLO26 können Teams fortschrittliche KI-Anwendungen für Computer Vision schneller und mit weniger technischen Hürden als je zuvor auf den Markt bringen.