YOLO26 und EfficientDet im Vergleich#
Die Wahl der richtigen neuronalen Netzwerkarchitektur ist entscheidend für den Erfolg jeder Bildverarbeitungsanwendung. Dieser technische Leitfaden beleuchtet die Kompromisse, Leistungskennzahlen und architektonischen Neuerungen zweier bedeutender Modelle: des hochmodernen Ultralytics YOLO26 und des bewährten EfficientDet von Google.
Ob du das Modell auf Cloud-Servern mit hohem Durchsatz oder auf Edge-AI-Geräten mit strengen Latenzvorgaben einsetzt: Wenn du die Unterschiede zwischen diesen Architekturen kennst, kannst du Geschwindigkeit, Genauigkeit und Effizienz optimal aufeinander abstimmen.
Architekturübersicht: YOLO26#
- Autoren: Glenn Jocher und Jing Qiu
- Organisation: Ultralytics
- Datum: 2026-01-14
- GitHub: Ultralytics auf GitHub
- Dokumentation: Offizielle YOLO26-Dokumentation
YOLO26, veröffentlicht Anfang 2026, ist die neueste Weiterentwicklung der YOLO-Familie. Das Modell wurde speziell für ein herausragendes Benutzererlebnis und eine erstklassige mittlere durchschnittliche Präzision (mAP) entwickelt. Es wurde von Grund auf für moderne Hardware konzipiert und ist vielseitig für Aufgaben wie Objekterkennung, Instanzsegmentierung, Bildklassifizierung und Posenschätzung einsetzbar.
YOLO26 bietet mehrere wegweisende Funktionen, die sowohl die Trainingsstabilität als auch die Inferenzgeschwindigkeit deutlich verbessern:
- End-to-End-Architektur ohne NMS: Aufbauend auf Konzepten aus YOLOv10 bietet YOLO26 einen optionalen End-to-End-Kopf mit Eins-zu-eins-Zuordnung (
nms=False), der die Nachverarbeitung durch Non-Maximum-Unterdrückung (NMS) überflüssig macht. Das vereinfacht die Bereitstellungslogik und verringert die Latenzschwankungen deutlich. - Bis zu 43 % schnellere CPU-Inferenz: Dank umfangreicher architektonischer Optimierungen erreicht das Modell beispiellose Inferenzgeschwindigkeiten auf handelsüblichen CPUs und eignet sich damit besonders für IoT- und eingebettete Systeme.
- Wegfall von DFL: Der Distribution Focal Loss wurde entfernt. Dadurch wird der Export vereinfacht und die Kompatibilität mit stromsparenden Edge-Geräten verbessert, auf denen Tools wie ONNX zum Einsatz kommen.
- MuSGD-Optimierer: Inspiriert von den Trainingsverfahren für Kimi K2 von Moonshot AI, überträgt diese Kombination aus SGD und Muon Innovationen aus dem Training großer Sprachmodelle direkt auf die Bildverarbeitung und sorgt für schnellere Konvergenz und stabilere Trainingsläufe.
- ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen verbessern die Erkennung kleiner Objekte deutlich – ein entscheidender Faktor für Anwendungen mit Luftbildern von Drohnen und für die Robotik.
Dank des Wegfalls von DFL und der Architektur ohne NMS lassen sich YOLO26-Modelle praktisch ohne Entwicklung benutzerdefinierter Plug-ins in für Edge-Geräte geeignete Formate wie NVIDIA TensorRT oder Intel OpenVINO exportieren.
Architekturübersicht: EfficientDet#
- Autoren: Mingxing Tan, Ruoming Pang und Quoc V. Le
- Organisation: Google Research
- Datum: 2019-11-20
- Arxiv: EfficientDet-Artikel
- GitHub: Google-AutoML-Repository
EfficientDet wurde von Google vorgestellt, nutzt intensiv das TensorFlow-Ökosystem und wurde nach dem Konzept der zusammengesetzten Skalierung entwickelt. Die Architektur skaliert gleichzeitig das Backbone-Netzwerk, das Merkmalsnetzwerk und die Netzwerke für Box- und Klassenprognosen entsprechend den verfügbaren Ressourcen.
Zu den wichtigsten Innovationen von EfficientDet gehören:
- BiFPN (bidirektionales Merkmals-Pyramidennetzwerk): Ein Mechanismus, der eine einfache und schnelle Fusion von Merkmalen auf mehreren Maßstabsebenen ermöglicht, sodass das Netzwerk Objekte unterschiedlicher Größe besser erfassen kann.
- Zusammengesetzte Skalierung: Eine heuristische Methode, um Auflösung, Tiefe und Breite gleichmäßig zu skalieren und eine Modellfamilie von d0 (kleinstes Modell) bis d7 (größtes Modell) zu erstellen.
EfficientDet bleibt zwar eine robuste Wahl für die präzise Erkennung von Begrenzungsrahmen, bietet aber im Allgemeinen nicht die moderne Vielseitigkeit für mehrere Aufgaben (z. B. native OBB-Aufgaben) und das einheitliche, schlanke Python-Ökosystem, das moderne Entwickler erwarten.
Erfahre mehr über EfficientDet
Leistungs- und Metrikvergleich#
Um die Pareto-Grenze zwischen Geschwindigkeit und Genauigkeit zu ermitteln, haben wir beide Architekturen in Standardumgebungen anhand des COCO-Datensatzes verglichen. Die folgende Tabelle zeigt die Unterschiede bei Modellgrößen, Präzision und Latenz. Die CPU-Geschwindigkeiten wurden mit ONNX Runtime und die GPU-Geschwindigkeiten mit TensorRT auf einer NVIDIA T4 gemessen.
| Modell | Größe (Pixel) | mAPval 50-95 | Geschwindigkeit CPU ONNX (ms) | Geschwindigkeit T4 TensorRT10 (ms) | Parameter (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Wie oben zu sehen ist, bietet YOLO26 eine überlegene Balance aus Leistung und Genauigkeit. Das Modell YOLO26x erzielt die höchste Genauigkeit (57.5 mAP) und übertrifft damit das größte Modell EfficientDet-d7 deutlich. Darüber hinaus benötigen YOLO26-Modelle wesentlich weniger Speicher und ermöglichen deutlich schnellere GPU-Inferenz (bis zu 1.7 ms mit TensorRT), was die Vorteile eines Designs ohne NMS unterstreicht.
Trainingseffizienz und die Vorteile des Ökosystems#
Ein wesentlicher Unterschied zwischen den beiden Architekturen liegt in ihren Entwicklungsumgebungen. EfficientDet ist eng in das Google-AutoML- und TensorFlow-Ökosystem eingebunden. Dieses ist zwar leistungsstark, kann aber bei benutzerdefinierten Datensätzen wie DOTAv1 eine steile Lernkurve und starre Konfigurationen mit sich bringen.
Ultralytics bietet dagegen ein äußerst gepflegtes Ökosystem auf Basis von PyTorch. Der Speicherverbrauch beim Training ist gezielt optimiert, sodass Entwickler robuste Modelle trainieren können, ohne den hohen VRAM-Bedarf in Kauf nehmen zu müssen, der bei transformerbasierten Netzwerken üblich ist.
Über die Ultralytics Platform erhalten Entwickler Zugriff auf einen durchgängigen MLOps-Arbeitsablauf. Dazu gehören die nahtlose Datenannotation, die automatisierte Optimierung von Hyperparametern und das Cloud-Training mit nur einem Klick. So wird der Weg vom Prototyp bis zur Produktion erheblich verkürzt.
Implementierungsbeispiel#
Dank der einfachen Ultralytics API kannst du ein hochmodernes YOLO26-Modell mit nur wenigen Zeilen Code trainieren und validieren.
from ultralytics import YOLO
# Das durchgängige YOLO26-Modell ohne NMS initialisieren
model = YOLO("yolo26n.pt")
# Auf einem benutzerdefinierten Datensatz trainieren (optimizer='auto' wählt MuSGD für längere Trainingsläufe aus)
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device="0", # Auf der GPU trainieren
)
# Für eine Bereitstellung mit extrem niedriger Latenz nativ nach TensorRT exportieren
model.export(format="engine")Ideale Anwendungsfälle#
Wann solltest du YOLO26 verwenden?
- Edge Computing und Mobilgeräte: Mit einer bis zu 43 % schnelleren CPU-Inferenz und ohne NMS-Aufwand eignet sich YOLO26 hervorragend für Geräte mit stark begrenzten Rechenressourcen, etwa Raspberry Pis oder Mobiltelefone.
- Mehrere Aufgaben: Wenn eine einzelne Pipeline Begrenzungsrahmen, Segmentierungsmasken und Tracking erfordert, ist YOLO26 unübertroffen vielseitig.
- Drohnen und Luftbilder: Die Kombination aus ProgLoss und STAL verbessert die Erkennung extrem kleiner Objekte aus großer Höhe erheblich.
Wann solltest du EfficientDet verwenden?
- Bestehende TensorFlow-Pipelines: Wenn deine Infrastruktur weitgehend fest auf TensorFlow-SavedModels ausgelegt ist oder bestimmte TensorFlow-Serving-Pipelines erfordert, bietet EfficientDet native Kompatibilität.
- TPUs mit begrenzten Ressourcen: EfficientDet wurde umfassend für die speziell von Google entwickelten Tensor Processing Units (TPUs) optimiert.
Weitere Alternativen entdecken#
Dieser Leitfaden konzentriert sich zwar vor allem auf den Vergleich YOLO26 und EfficientDet, doch das umfassendere Ultralytics-Ökosystem bietet weitere beeindruckende Architekturen. Wenn deine Anwendung stark auf Transformer setzt, ermöglicht RT-DETR die echtzeitfähige transformerbasierte Erkennung. Wenn du dagegen bestehende Systeme unterstützt, wird YOLO11 weiterhin vollständig unterstützt und bietet eine hohe Leistung. Eine umfassendere Übersicht findest du im Ultralytics Model Comparisons Hub.
Letztlich machen die enorme Geschwindigkeit, einfache Bedienung und hochmoderne Genauigkeit von YOLO26 das Modell zur klaren Empfehlung für Forschende und Entwickler, die heute eine moderne Computer-Vision-Pipeline erstellen.