YOLOv5 vs YOLOX#
Die Entwicklung der Echtzeit-Computer-Vision hat zahlreiche Meilensteine hervorgebracht, wobei verschiedene Architekturen die Grenzen von Geschwindigkeit und Genauigkeit verschieben. Zwei äußerst einflussreiche Modelle in diesem Bereich sind YOLOv5 und YOLOX. Während beide für ihre hohe Leistung bei der Objekterkennung bekannt sind, verfolgen sie grundlegend unterschiedliche architektonische Ansätze.
Dieser Leitfaden bietet eine tiefgehende technische Analyse dieser beiden Modelle, vergleicht ihre Architekturen, Leistungskennzahlen, Trainingsmethoden und idealen Einsatzszenarien, um Entwicklern und Forschern bei der Auswahl des richtigen Werkzeugs für ihre Vision-KI-Projekte zu helfen.
Modellübersichten und architektonische Unterschiede#
Ultralytics YOLOv5#
- Autor: Glenn Jocher
- Organisation: Ultralytics
- Datum: 2020-06-26
- GitHub: Ultralytics YOLOv5 Repository
- Dokumentation: YOLOv5 Official Docs
Introduced by Ultralytics, YOLOv5 quickly became an industry standard due to its exceptional balance of performance, ease of use, and memory efficiency. Built natively on the PyTorch framework, YOLOv5 uses an anchor-based architecture. It relies on predefined bounding box shapes to predict object locations, which makes it highly effective for standard object detection tasks.
One of the greatest strengths of YOLOv5 is its well-maintained ecosystem. It boasts extensive documentation, an incredibly simple Python API, and native integration with the Ultralytics Platform. This allows developers to transition seamlessly from dataset labeling to training and exporting to formats like ONNX and TensorRT.
Ultralytics YOLO-Modelle benötigen während des Trainings in der Regel deutlich weniger GPU-Speicher im Vergleich zu komplexen Transformer-basierten Alternativen. Dieser geringe Speicherbedarf macht YOLOv5 für Forscher, die mit Hardware auf Verbraucherniveau arbeiten, sehr zugänglich.
Megvii YOLOX#
- Autoren: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li und Jian Sun
- Organisation: Megvii
- Datum: 18.07.2021
- Arxiv: YOLOX: Exceeding YOLO Series in 2021
- GitHub: Megvii YOLOX Repository
- Dokumentation: YOLOX GitHub Docs
Entwickelt von Forschern bei Megvii, schlug YOLOX einen anderen Weg ein, indem es ein ankerfreies Design in die YOLO-Familie einführte. Durch den Verzicht auf Anchor Boxes vereinfacht YOLOX den Detektionskopf und reduziert die Anzahl der heuristischen Parameter, die während des Trainings manuell angepasst werden müssen, erheblich.
YOLOX enthält zudem einen entkoppelten Kopf – der Klassifizierungs- und Regressionsaufgaben in verschiedene Netzwerkzweige trennt – und nutzt die SimOTA-Strategie für die Label-Zuweisung. Diese Innovationen überbrücken die Lücke zwischen akademischer Forschung und industriellen Anwendungen, was YOLOX besonders effektiv in Umgebungen mit stark variierenden Objektgrößen macht.
Leistung und Metriken#
Bei der Bewertung von Computer-Vision-Modellen ist das Abwägen zwischen mittlerer durchschnittlicher Präzision (mAP) und Inferenzgeschwindigkeit entscheidend. Beide Modelle bieten eine Reihe von Größen (von Nano bis Extra-Large), um unterschiedlichen Hardwarebeschränkungen gerecht zu werden.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Während YOLOXx eine etwas höhere Spitzenpräzision (51.1 mAP) erreicht, bietet YOLOv5 eine wesentlich robustere und gründlich getestete Deployment-Pipeline für CPU- und GPU-Hardware. Die TensorRT-Geschwindigkeiten für YOLOv5 unterstreichen seine tiefe Optimierung für Edge-Computing-Geräte, was es zu einer äußerst zuverlässigen Wahl für Videoanalysen in Echtzeit macht.
Trainingsmethoden und Benutzerfreundlichkeit#
Die Entwicklererfahrung unterscheidet sich bei diesen beiden Architekturen erheblich.
Der YOLOX-Ansatz#
Training YOLOX typically requires cloning the original repository, managing specific dependencies, and executing complex command-line scripts. While it supports advanced features like mixed-precision training and multi-node setups via MegEngine, the learning curve can be steep for developers who need rapid prototyping.
Der Ultralytics-Vorteil#
In contrast, Ultralytics prioritizes an exceptionally streamlined user experience. With the ultralytics Python package, developers can load, train, and validate a model with minimal boilerplate code. Ultralytics automatically handles complex data augmentations, hyperparameter evolution, and learning rate scheduling.
from ultralytics import YOLO
# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance
metrics = model.val()Furthermore, YOLOv5's versatility extends beyond standard object detection, offering robust support for image classification and instance segmentation within the exact same cohesive API.
When your training is complete, exporting a YOLOv5 model to CoreML, TFLite, or OpenVINO is as simple as running model.export(format="onnx"). This eliminates the need for third-party conversion scripts commonly required by research-focused repositories.
Anwendungen in der Praxis#
Die Wahl zwischen diesen Modellen hängt von deiner Deployment-Umgebung und den technischen Anforderungen ab:
- Einzelhandel und Bestandsmanagement: Für Anwendungen, die eine Echtzeit-Produkterkennung auf Edge-Geräten wie dem NVIDIA Jetson erfordern, ist YOLOv5 außergewöhnlich gut geeignet. Sein minimaler Speicherbedarf und die schnellen TensorRT-Inferenzgeschwindigkeiten ermöglichen Multi-Kamera-Tracking ohne Bildverlust.
- Akademische Forschung und benutzerdefinierte Architekturen: YOLOX ist in der Forschungsgemeinschaft hoch angesehen. Sein entkoppelter Kopf und seine ankerfreie Natur machen es zu einer exzellenten Basis für Ingenieure, die mit neuartigen Strategien zur Label-Zuweisung experimentieren möchten oder an Datensätzen arbeiten, bei denen traditionelle Anchor Boxes nicht verallgemeinerbar sind.
- Agricultural AI: For precision agriculture tasks like fruit detection or weed identification via drones, the ease of training and deploying YOLOv5 models using the Ultralytics Platform allows domain experts to implement AI solutions without needing deep machine learning engineering backgrounds.
Anwendungsfälle und Empfehlungen#
Die Wahl zwischen YOLOv5 und YOLOX hängt von deinen spezifischen Projektanforderungen, Deployment-Beschränkungen und Präferenzen im Ökosystem ab.
Wann du YOLOv5 wählen solltest#
YOLOv5 ist eine starke Wahl für:
- Bewährte Produktionssysteme: Bestehende Bereitstellungen, bei denen die langjährige Stabilität, die umfangreiche Dokumentation und die massive Community-Unterstützung von YOLOv5 geschätzt werden.
- Ressourcenbegrenztes Training: Umgebungen mit begrenzten GPU-Ressourcen, in denen die effiziente Trainings-Pipeline und der geringere Speicherbedarf von YOLOv5 von Vorteil sind.
- Umfassende Unterstützung von Exportformaten: Projekte, die eine Bereitstellung in vielen Formaten einschließlich ONNX, TensorRT, CoreML und TFLite erfordern.
Wann man sich für YOLOX entscheiden sollte#
YOLOX wird empfohlen für:
- Forschung an ankerfreier Detektion: Akademische Forschung, die die saubere, ankerfreie Architektur von YOLOX als Basislinie verwendet, um mit neuen Detektions-Heads oder Verlustfunktionen zu experimentieren.
- Ultraleichte Edge-Geräte: Bereitstellung auf Mikrocontrollern oder älterer mobiler Hardware, wo der extrem kleine Platzbedarf der YOLOX-Nano-Variante (0,91 Mio. Parameter) entscheidend ist.
- SimOTA Label-Zuweisungsstudien: Forschungsprojekte, die transportbasierte Strategien zur Label-Zuweisung und deren Auswirkungen auf die Trainingskonvergenz untersuchen.
Wann du Ultralytics wählen solltest (YOLO26)#
Für die meisten neuen Projekte bietet Ultralytics YOLO26 die beste Kombination aus Leistung und Entwicklererfahrung:
- NMS-freies Edge-Deployment: Anwendungen, die eine konsistente Inferenz mit niedriger Latenz ohne die Komplexität der Non-Maximum Suppression-Nachverarbeitung erfordern.
- Umgebungen nur mit CPU: Geräte ohne dedizierte GPU-Beschleunigung, bei denen die bis zu 43 % schnellere CPU-Inferenz von YOLO26 einen entscheidenden Vorteil bietet.
- Erkennung kleiner Objekte: Anspruchsvolle Szenarien wie Luftaufnahmen von Drohnen oder IoT-Sensoranalysen, bei denen ProgLoss und STAL die Genauigkeit bei winzigen Objekten deutlich erhöhen.
Die Zukunft der Vision-KI: YOLO26#
While both YOLOv5 and YOLOX have cemented their places in computer vision history, the field is rapidly advancing. For developers starting new projects today, Ultralytics highly recommends exploring its latest flagship model, YOLO26.
Das im Januar 2026 veröffentlichte YOLO26 stellt einen riesigen Sprung nach vorn in Bezug auf Leistung und Benutzerfreundlichkeit dar. Es führt ein bahnbrechendes end-to-end NMS-freies Design ein, das die Non-Maximum Suppression-Nachbearbeitung vollständig eliminiert. Dies reduziert die Latenzvariabilität erheblich und vereinfacht die Deployment-Logik auf Geräten mit geringer Leistung.
Furthermore, YOLO26 utilizes the novel MuSGD Optimizer—a hybrid of SGD and Muon inspired by LLM training innovations—for incredibly stable and fast convergence. With DFL Removal (Distribution Focal Loss removed for simplified export and better edge/low-power device compatibility), YOLO26 achieves up to 43% faster CPU inference, solidifying its position as the ultimate model for modern edge computing, robotics, and IoT applications. Additionally, ProgLoss + STAL delivers improved loss functions with notable improvements in small-object recognition, critical for IoT, robotics, and aerial imagery. Users interested in previous generations may also look into YOLO11, though YOLO26 is the undisputed state-of-the-art choice.
Fazit#
YOLOv5 und YOLOX bieten beide unglaubliche Fähigkeiten zur Objekterkennung. YOLOX hat die architektonischen Grenzen verschoben, indem es bewies, dass ankerfreie Designs 2021 mit traditionellen Methoden konkurrieren und diese übertreffen konnten. Dennoch bleibt YOLOv5 eine dominante Kraft aufgrund seiner beispiellosen Benutzerfreundlichkeit, seines umfangreichen Ökosystems und des geringeren Speicherbedarfs während des Trainings.
Für die überwiegende Mehrheit kommerzieller Anwendungen bietet das Ultralytics-Ökosystem den schnellsten Weg von einem Rohdatensatz zu einem bereitgestellten Produktionsmodell. Ob man das bewährte YOLOv5 nutzt oder auf das hochmoderne YOLO26 aktualisiert, Entwickler profitieren von einem Framework, das darauf ausgelegt ist, Vision-KI zugänglich, effizient und hochgradig leistungsfähig zu machen.