YOLOv9 vs. YOLOX#
Der Bereich Computer Vision hat eine rasante Entwicklung bei Architekturen zur Objekterkennung in Echtzeit erlebt. Dieser Leitfaden bietet einen umfassenden Vergleich von YOLOv9 und YOLOX und untersucht ihre architektonischen Innovationen, Leistungskennzahlen und Trainingsmethoden. Ob du intelligente Anwendungen für KI in der Fertigung entwickelst oder dich mit prädiktiver Modellierung beschäftigst – das Verständnis dieser Modelle hilft dir, fundierte Entscheidungen für deine nächste Bereitstellung zu treffen.
Architektonische Innovationen#
YOLOv9: Programmierbare Gradienteninformationen#
YOLOv9 leitete einen Paradigmenwechsel ein, indem es das Problem des Informationsengpasses in tiefen neuronalen Netzen angeht. Zu den wichtigsten Innovationen gehören Programmable Gradient Information (PGI) und das Generalized Efficient Layer Aggregation Network (GELAN).
- Autoren: Chien-Yao Wang und Hong-Yuan Mark Liao
- Organisation: Institute of Information Science, Academia Sinica, Taiwan
- Datum: 21. Februar 2024
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
Indem YOLOv9 wichtige Merkmalsdaten während der Vorwärtsverarbeitung erhält, stellt es sicher, dass die Gradienten zur Aktualisierung der Gewichte bei der Rückpropagierung genau bleiben. Die Architektur eignet sich hervorragend zur Merkmalsextraktion und kann daher kleine Objekte in komplexen Umgebungen zuverlässig erkennen, etwa auf Luftaufnahmen und in detaillierten medizinischen Aufnahmen.
YOLOX: Forschung und Industrie verbinden#
YOLOX wurde Mitte 2021 veröffentlicht und führte die YOLO-Reihe in Richtung eines anchorfreien Designs. Das Modell führte einen entkoppelten Head ein, der Klassifizierungs- und Lokalisierungsaufgaben trennt, und verwendete die SimOTA-Strategie zur Labelzuweisung, um die Trainingskonvergenz zu verbessern.
- Autoren: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun
- Organisation: Megvii
- Datum: 18. Juli 2021
- Arxiv: 2107.08430
- GitHub: Megvii-BaseDetection/YOLOX
YOLOX war für seine Zeit zwar wegweisend, erreichte eine hervorragende mittlere durchschnittliche Präzision (mAP) und machte die Abstimmung von Anchor-Box-Hyperparametern überflüssig. Seine zugrunde liegende Architektur wurde inzwischen jedoch von modernen Netzwerken übertroffen, die die Anzahl der Parameter und den Erhalt von Merkmalen besser ausbalancieren.
Sowohl YOLOX als auch neuere Ultralytics-Modelle setzen auf anchorfreie Designs. Dadurch wird die Abstimmung von Hyperparametern weniger komplex und die Generalisierung auf unterschiedliche Datensätze verbessert.
Leistungsanalyse#
Beim Vergleich dieser Modelle mit dem MS-COCO-Benchmark werden die Fortschritte von YOLOv9 deutlich. YOLOv9 erzielt durchgängig ein besseres Verhältnis zwischen Genauigkeit und FLOPs.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
YOLOX bietet zwar leichte Varianten wie YOLOX-Nano für besonders anspruchsvolle Edge-Szenarien, doch YOLOv9-Varianten übertreffen ähnlich große YOLOX-Modelle durchgängig bei der reinen Genauigkeit. YOLOv9m erreicht beispielsweise eine mAP von 51,4 % gegenüber 49,7 % bei YOLOXl – obwohl YOLOv9m weniger als halb so viele Parameter hat (20,1 Mio. gegenüber 54,2 Mio.).
Der Vorteil von Ultralytics#
Bei der Wahl eines Modells zählt mehr als nur die Architekturtheorie: Das zugehörige Ökosystem bestimmt die Entwicklungsgeschwindigkeit und den Erfolg der Bereitstellung. Die Verwendung von YOLOv9 im Ultralytics-Ökosystem bietet eine unübertroffene Benutzerfreundlichkeit und umfassende Unterstützung durch die Community.
Im Gegensatz zu älteren Repositories aus der ursprünglichen Forschung bietet das Ultralytics-Framework eine einheitliche Python-API, die komplexe Pipelines vereinfacht. Das Training benötigt deutlich weniger GPU-Speicher als viele Alternativen und bietet eine hervorragende Trainingseffizienz.
from ultralytics import YOLO
# Das YOLOv9c-Modell initialisieren
model = YOLO("yolov9c.pt")
# Das Modell nahtlos mit deinem benutzerdefinierten Datensatz trainieren
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Die Leistung des Modells validieren
metrics = model.val()
# Das optimierte Modell ins TensorRT-Format exportieren
model.export(format="engine")Dank der integrierten Unterstützung verschiedener Aufgaben, darunter Objekterkennung, Instanzsegmentierung und Posenschätzung, kannst du deine Computer-Vision-Lösungen schnell an neue Anforderungen anpassen, ohne die gesamte Codebasis ändern zu müssen.
Anwendungen in der Praxis#
Die besonderen Stärken dieser Modelle machen sie für unterschiedliche reale Anwendungsfälle geeignet:
Einzelhandelsanalysen mit hoher Geschwindigkeit#
YOLOv9 eignet sich hervorragend für moderne Einzelhandelsumgebungen, in denen Produkte in Echtzeit erkannt werden müssen. Dank der Fähigkeit, komplexe Merkmalsdetails zu bewahren, eignet sich das Modell ideal für den Einsatz von KI im Einzelhandel, wenn ähnlich aussehende Produkte in einem voll belegten Regal unterschieden werden müssen.
Bereitstellungen auf älteren Edge-Systemen#
Bei strengen Hardwarebeschränkungen oder spezialisierten NPUs, die mit neueren Aggregationsblöcken Schwierigkeiten haben, kann YOLOX-Nano in bestimmten Fällen eine geeignete Nische finden. Seine schlichten, reduzierten Faltungsmuster werden manchmal für extrem ressourcenbeschränkte Mikrocontroller bevorzugt.
Autonome Robotik#
Bei der Navigation von Robotern kann das Übersehen kleiner Objekte katastrophale Folgen haben. Die GELAN-Architektur in YOLOv9 stellt sicher, dass Merkmale kleiner, weit entfernter Hindernisse nicht in den tiefen Schichten des Netzwerks verloren gehen. In sicherheitskritischen Umgebungen übertrifft sie ältere Modelle, etwa bei Anwendungen für KI im Automobilbereich.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOv9 und YOLOX hängt von deinen konkreten Projektanforderungen, Bereitstellungseinschränkungen und Ökosystempräferenzen ab.
Wann du YOLOv9 wählen solltest#
YOLOv9 ist eine gute Wahl für:
- Forschung zu Informationsengpässen: Akademische Projekte, die programmierbare Gradienteninformationen (PGI) und Architekturen mit effizienten, verallgemeinerten Schichtaggregationsnetzwerken (GELAN) untersuchen.
- Studien zur Optimierung des Gradientenflusses: Forschung, die darauf abzielt, Informationsverluste in tiefen Netzwerkschichten während des Trainings zu verstehen und zu verringern.
- Benchmarking hochgenauer Erkennung: Szenarien, in denen die starke COCO-Benchmarkleistung von YOLOv9 als Vergleichsmaßstab für Architekturvergleiche benötigt wird.
Wann du YOLOX wählen solltest#
YOLOX empfiehlt sich für:
- Forschung zur anchorfreien Erkennung: Akademische Forschung, bei der YOLOX aufgrund seiner übersichtlichen, anchorfreien Architektur als Grundlage für Experimente mit neuen Erkennungs-Heads oder Verlustfunktionen dient.
- Besonders kleine Edge-Geräte: Bereitstellungen auf Mikrocontrollern oder älterer Mobilhardware, bei denen die extrem geringe Größe der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
- Studien zur SimOTA-Labelzuweisung: Forschungsprojekte, die Strategien zur Labelzuweisung auf Grundlage optimalen Transports und deren Auswirkungen auf die Trainingskonvergenz untersuchen.
Wann du Ultralytics (YOLO26) wählen solltest#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freie Bereitstellung auf Edge-Geräten: Anwendungen, die eine gleichbleibende Inferenz mit geringer Latenz ohne die Komplexität der Nachbearbeitung durch Non-Maximum Suppression erfordern.
- Umgebungen ohne GPU: Geräte ohne dedizierte GPU-Beschleunigung, auf denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftbilder von Drohnen oder die Analyse von IoT-Sensoren, bei denen ProgLoss und STAL die Genauigkeit bei sehr kleinen Objekten deutlich steigern.
Die Zukunft: YOLO26 kommt#
YOLOv9 ist zwar ein beeindruckender Meilenstein, doch die Anforderungen an Produktionsumgebungen verschieben ständig die Grenzen. Das neu veröffentlichte YOLO26 ist der maßgebliche Standard für moderne Vision-KI.
YOLO26 gestaltet die Bereitstellung mit einem optionalen End-to-End-Design ohne NMS grundlegend neu. Da bei der Nachverarbeitung mit nms=False keine komplexe Nicht-Maximum-Unterdrückung mehr erforderlich ist, wird die Inferenzlatenz deutlich reduziert.
Darüber hinaus umfasst YOLO26 den wegweisenden MuSGD-Optimierer, eine Kombination aus SGD und Muon, die Innovationen aus dem Training von LLMs aufgreift und für äußerst stabile und schnelle Konvergenz sorgt. Durch die Entfernung von Distribution Focal Loss (DFL) erreicht YOLO26 im Vergleich zu seinen Vorgängern eine um bis zu 43 % schnellere CPU-Inferenz und ist damit die beste Wahl für Edge-Geräte und den Unternehmenseinsatz. Dank deutlicher Verbesserungen bei der Erkennung kleiner Objekte durch ProgLoss und STAL übertrifft YOLO26 sowohl YOLOX als auch YOLOv9.
Für Ingenieurinnen und Ingenieure, die sich mit modernen Architekturen beschäftigen, empfehlen wir auch YOLO11 und RT-DETR als leistungsstarke Alternativen im Ultralytics-Angebot. Mach dein Projekt zukunftssicher und nutze die herausragende Leistung der neuesten Modelle auf der Ultralytics Platform.