YOLOv5 vs. YOLO11#
Bei der Wahl der passenden Computer-Vision-Architektur für ein neues Projekt ist es entscheidend, die Entwicklung der modernsten Modelle zu verstehen. Der Fortschritt von früheren Architekturen zu modernen, einheitlichen Frameworks zeigt deutliche Sprünge sowohl bei der algorithmischen Effizienz als auch bei der Entwicklererfahrung. Dieser Leitfaden bietet einen ausführlichen technischen Vergleich zweier wegweisender, von Ultralytics entwickelter Modelle: YOLOv5, den Vorreiter, und das umfassend weiterentwickelte YOLO11.
Einführung in die Modelle#
Beide Architekturen sind wichtige Meilensteine im Bereich der Echtzeit-Objekterkennung und bieten je nach Bereitstellungsumgebung und Anforderungen an Altsysteme unterschiedliche Vorteile.
YOLOv5: Das Arbeitstier der Branche#
YOLOv5 wurde im Sommer 2020 veröffentlicht und entwickelte sich dank seiner nativen Implementierung für PyTorch, die die Einstiegshürden für Training und Bereitstellung deutlich senkte, schnell zum Branchenstandard. Das Modell löste sich von den komplexen C-Frameworks Darknet seiner Vorgänger und bot einen Python-typischen Ansatz zur Modellerstellung.
- Autoren: Glenn Jocher
- Organisation: Ultralytics
- Datum: 2020-06-26
- GitHub: ultralytics/yolov5
- Dokumentation: YOLOv5-Dokumentation
YOLOv5 setzte einen starken Maßstab für Benutzerfreundlichkeit und führte leistungsfähige Trainingsmethoden ein, darunter fortschrittliche Mosaic-Datenaugmentation und automatische Ankererzeugung. Das Modell ist nach wie vor äußerst beliebt bei Forschenden, die auf einer gut dokumentierten und umfassend getesteten Codebasis aufbauen.
YOLO11: Das einheitliche Vision-Framework#
Aufbauend auf jahrelangem Feedback und Architekturstudien wurde YOLO11 als Teil eines einheitlichen Frameworks eingeführt, das nativ mehrere Vision-Aufgaben bewältigen kann. Das Modell wurde von Grund auf für maximale Vielseitigkeit und Effizienz entwickelt und geht damit über Begrenzungsrahmen hinaus.
- Autoren: Glenn Jocher und Jing Qiu
- Organisation: Ultralytics
- Datum: 2024-09-27
- GitHub: ultralytics/ultralytics
- Dokumentation: YOLO11-Dokumentation
YOLO11 bietet mit dem Python-Paket ultralytics eine optimierte Benutzererfahrung und eine einfache API, die Objekterkennung, Instanzsegmentierung, Klassifizierung, Posenschätzung und orientierte Begrenzungsrahmen (OBB) vereint. Das Modell bietet ein besonders günstiges Verhältnis zwischen Geschwindigkeit und Genauigkeit und eignet sich dadurch ideal für vielfältige Einsatzszenarien in der Praxis.
Beide Modelle profitieren vom gut gepflegten Ökosystem der Ultralytics Platform. Diese integrierte Umgebung vereinfacht die Annotation von Datensätzen, das Cloud-Training und den Modellexport für verschiedene Hardwareziele.
Leistungs- und Metrikvergleich#
Ein direkter Vergleich dieser Modelle zeigt, wie architektonische Verbesserungen zu konkreten Leistungssteigerungen führen. Die folgende Tabelle zeigt die auf dem COCO-Datensatz ermittelte mittlere durchschnittliche Präzision (mAP) sowie Inferenzgeschwindigkeiten auf CPU und GPU und die Parameteranzahl.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Auswertung der Ergebnisse#
Die Kennzahlen verdeutlichen den großen Sprung beim von YOLO11 erzielten Leistungsgleichgewicht. So erreicht das Modell YOLO11n (nano) eine mAP von 39,5 % gegenüber 28,0 % bei YOLOv5n – ein Zuwachs von 11,5 Punkten bei nur 0,7 Mio. zusätzlichen Parametern. Darüber hinaus benötigt YOLO11 beim Training deutlich weniger Speicher als große Transformer-basierte Modelle und lässt sich dadurch problemlos auf Verbraucherhardware und Edge-Geräten einsetzen.
Architektonische Unterschiede#
Die Leistungsverbesserungen von YOLO11 sind auf mehrere wichtige architektonische Entwicklungen zurückzuführen. Während YOLOv5 ein standardmäßiges CSPNet-Backbone mit C3-Modulen verwendete, führten neuere Ultralytics-Modelle effizientere Merkmalsextraktionsblöcke wie C2f (YOLOv8) und C3k2 (YOLO11) ein, die den Gradientenfluss optimieren und den Rechenaufwand verringern.
YOLO11 verfügt außerdem über einen stark weiterentwickelten Erkennungskopf. Anstelle des anchorbasierten Designs älterer Modelle setzen neuere Ultralytics-Architekturen auf einen ankerfreien Ansatz. Dadurch verringert sich die Anzahl der Begrenzungsrahmen-Vorhersagen, was die Nachbearbeitung vereinfacht und die Generalisierungsfähigkeit des Modells über verschiedene Größen und Seitenverhältnisse hinweg verbessert. Zudem zeichnen sich diese Modelle durch eine überlegene Trainingseffizienz und leicht verfügbare vortrainierte Gewichte aus, die die Konvergenz feinabgestimmter Datensätze beschleunigen.
Implementierung und Codebeispiele#
Eine der herausragenden Eigenschaften des Ultralytics-Ökosystems ist seine Einfachheit. YOLOv5 machte die Verwendung von torch.hub für schnelle Inferenz populär, und YOLO11 geht mit dem einheitlichen Python-Paket ultralytics noch einen Schritt weiter.
Training mit YOLO11#
Zum Laden, Trainieren und Validieren eines Modells ist nur wenig Boilerplate-Code nötig. Die API übernimmt die Optimierung der Hyperparameter und die Modellverwaltung nahtlos.
from ultralytics import YOLO
# Ein vortrainiertes YOLO11-Modell laden
model = YOLO("yolo11s.pt")
# Auf einem benutzerdefinierten Datensatz 50 Epochen lang trainieren
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Schnelle Inferenz ausführen und Ergebnisse anzeigen
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# Das Modell zur Hardwarebeschleunigung ganz einfach nach TensorRT exportieren
model.export(format="engine")Inferenz mit älteren YOLOv5-Versionen#
Wenn du eine ältere Pipeline betreust, lässt sich YOLOv5 direkt über den nativen Lademechanismus von PyTorch einbinden und problemlos in bestehende Inferenzskripte integrieren.
import torch
# Ein benutzerdefiniertes oder vortrainiertes YOLOv5-Modell von PyTorch Hub laden
model = torch.hub.load("ultralytics/yolov5", "yolov5s")
# Inferenz mit einer Bild-URL ausführen
results = model("https://ultralytics.com/images/zidane.jpg")
# Vorhersagedetails in der Konsole ausgeben
results.print()Beide Modelle unterstützen zahlreiche Exportformate. Ob du mit TensorRT auf einem NVIDIA Jetson oder mit CoreML in einer iOS-Anwendung arbeitest – der Bereitstellungsprozess ist ausführlich dokumentiert und wird von der Community unterstützt.
Ideale Anwendungsfälle#
Die Wahl zwischen diesen Modellen hängt größtenteils vom Lebenszyklus deines Projekts und den spezifischen Anforderungen ab.
Wann du YOLOv5 wählen solltest#
- Pflege älterer Codebasen: Wenn deine Produktionsumgebung stark an die Repository-Struktur von YOLOv5 oder bestimmte Verfahren zur Hyperparameteroptimierung angepasst ist.
- Akademische Referenzmodelle: Wenn du Forschungsergebnisse veröffentlichst, die einen direkten Vergleich mit etablierten Computer-Vision-Standards aus den Jahren 2020 bis 2022 erfordern.
Wann du YOLO11 wählen solltest#
- Projekte mit mehreren Aufgaben: Wenn deine Anwendung eine Kombination von Aufgaben wie Posenschätzung und Instanzsegmentierung über eine einzige, einheitliche API erfordert.
- Bereitstellungen am Netzwerkrand: Für Edge-Computing-Szenarien, in denen es entscheidend ist, bei einem bestimmten Rechenbudget (FLOPs) eine möglichst hohe mAP zu erzielen.
- Kommerzielle KI-Lösungen: Ideal für Unternehmensanwendungen in Einzelhandel und Sicherheit, die von der zuverlässigen Unterstützung durch die Ultralytics Platform profitieren.
Die nächste Generation: Ultralytics YOLO26#
YOLO11 bietet zwar ein hervorragendes Gleichgewicht aus Geschwindigkeit und Genauigkeit, doch die künstliche Intelligenz entwickelt sich rasant weiter. Entwicklerinnen und Entwickler, die heute neue Projekte beginnen, empfehlen wir dringend, den neuesten Standard der Vision-KI zu erkunden: Ultralytics YOLO26.
YOLO26 wurde im Januar 2026 veröffentlicht und führt bahnbrechende Neuerungen ein, die speziell auf moderne Bereitstellungsanforderungen zugeschnitten sind:
- End-to-End-Design ohne NMS: Aufbauend auf Konzepten, die erstmals mit YOLOv10 eingeführt wurden, arbeitet YOLO26 von Haus aus End-to-End. Der optionale One-to-one-Kopf des Modells (
nms=False) macht eine Nachbearbeitung mit Unterdrückung nichtmaximaler Werte (NMS) überflüssig, vereinfacht Bereitstellungspipelines deutlich und verringert die Latenz. - MuSGD-Optimierer: Inspiriert von Innovationen beim Training großer Sprachmodelle, wie sie Modelle wie Kimi K2 von Moonshot AI eingeführt haben, gewährleistet diese Kombination aus SGD und Muon ein äußerst stabiles Training und eine deutlich schnellere Konvergenz.
- Beispiellose CPU-Geschwindigkeit: Durch die Entfernung von Distribution Focal Loss (DFL) erzielt YOLO26 eine um bis zu 43 % schnellere CPU-Inferenz und ist damit die beste Wahl für Edge-Geräte und Umgebungen ohne dedizierte GPUs.
- Fortschrittliche Verlustfunktionen: Die Integration von ProgLoss und STAL verbessert die Erkennung kleiner Objekte deutlich, was für Drohnenanalysen, IoT und Robotik entscheidend ist.
- Aufgabenspezifische Verbesserungen: Das Modell bietet spezialisierte Optimierungen, darunter Residual Log-Likelihood Estimation (RLE) für Posenschätzung und eine spezielle Winkelfunktion für den Verlust bei orientierten Begrenzungsrahmen. So wird eine überlegene Leistung bei allen Computer-Vision-Aufgaben gewährleistet.
Wenn du dich für spezialisierte Architekturen jenseits der Standardobjekterkennung interessierst, könntest du auch Modelle wie RT-DETR für Transformer-basierte Erkennung oder YOLO-World für Tracking und Erkennung mit offenem Vokabular ausprobieren. Mit diesen gut gepflegten und hochgradig optimierten Tools bleiben deine Computer-Vision-Pipelines effizient, skalierbar und der Entwicklung voraus.