Ultralytics YOLO27:

YOLO26 vs. EfficientDet#

Die Wahl der richtigen neuronalen Netzwerkarchitektur ist entscheidend für den Erfolg jeder Computer-Vision-Anwendung. Dieser technische Leitfaden untersucht die Kompromisse, Leistungskennzahlen und architektonischen Innovationen zweier bedeutender Modelle: des hochmodernen Ultralytics YOLO26 und des etablierten EfficientDet von Google.

Unabhängig davon, ob du deine Anwendung auf Cloud-Servern mit hohem Durchsatz oder auf Edge-AI-Geräten mit strengen Latenzanforderungen bereitstellst: Wenn du die Unterschiede zwischen diesen Architekturen verstehst, kannst du ein optimales Gleichgewicht zwischen Geschwindigkeit, Genauigkeit und Effizienz erreichen.

Architekturüberblick: YOLO26#

YOLO26, das Anfang 2026 veröffentlicht wurde, stellt die neueste Weiterentwicklung der YOLO-Familie dar und wurde speziell entwickelt, um eine unvergleichliche Benutzerfreundlichkeit und eine erstklassige mittlere durchschnittliche Präzision (mAP) zu bieten. Das von Grund auf für moderne Hardware entwickelte Modell ist äußerst vielseitig und eignet sich für Objekterkennung, Instanzsegmentierung, Bildklassifizierung und Posenschätzung.

YOLO26 führt mehrere bahnbrechende Funktionen ein, die sowohl die Trainingsstabilität als auch die Inferenzgeschwindigkeit drastisch verbessern:

  • End-to-End-Design ohne NMS: Aufbauend auf Konzepten, die mit YOLOv10 eingeführt wurden, arbeitet YOLO26 nativ end-to-end und macht die Nachverarbeitung mit Non-Maximum Suppression (NMS) vollständig überflüssig. Dies führt zu einer einfacheren Bereitstellungslogik und einer deutlich geringeren Varianz der Latenz.
  • Bis zu 43 % schnellere CPU-Inferenz: Durch tiefgreifende architektonische Optimierungen erreicht das Modell beispiellose Inferenzgeschwindigkeiten auf standardmäßigen CPUs, wodurch es sich besonders für IoT- und eingebettete Umgebungen eignet.
  • Entfernung von DFL: Die Distribution Focal Loss wurde entfernt. Das Ergebnis ist ein saubererer Exportprozess und eine bessere Kompatibilität mit stromsparenden Edge-Geräten, die Tools wie ONNX verwenden.
  • MuSGD-Optimierer: Inspiriert von den Trainingsverfahren für LLMs von Moonshot AIs Kimi K2, bringt diese Kombination aus SGD und Muon Innovationen aus dem Training großer Sprachmodelle direkt in die Computer Vision und sorgt für eine schnellere Konvergenz sowie stabilere Trainingsabläufe.
  • ProgLoss + STAL: Diese fortschrittlichen Verlustfunktionen führen zu deutlichen Verbesserungen bei der Erkennung kleiner Objekte, einem entscheidenden Faktor für Anwendungen mit Luftaufnahmen von Drohnen und in der Robotik.
Optimierter Export

Dank der Entfernung von DFL und der Architektur ohne NMS erfordert der Export von YOLO26-Modellen in für Edge-Geräte geeignete Formate wie NVIDIA TensorRT oder Intel OpenVINO praktisch keine Entwicklung eigener Plugins.

Architekturüberblick: EfficientDet#

EfficientDet wurde von Google eingeführt, nutzt das TensorFlow-Ökosystem intensiv und basiert auf dem Konzept der kombinierten Skalierung. Seine Architektur skaliert das Backbone-Netzwerk, das Merkmalsnetzwerk sowie die Netzwerke für Box- und Klassenprognosen abhängig von den verfügbaren Ressourcen gleichzeitig.

Zu den wichtigsten Innovationen von EfficientDet gehören:

  • BiFPN (bidirektionales Merkmals-Pyramidennetzwerk): Ein Mechanismus, der eine einfache und schnelle Fusion von Merkmalen auf mehreren Maßstabsebenen ermöglicht, sodass das Netzwerk Objekte unterschiedlicher Größe besser verstehen kann.
  • Kombinierte Skalierung: Eine heuristische Methode, um Auflösung, Tiefe und Breite gleichmäßig zu vergrößern und eine Modellfamilie von d0 (am kleinsten) bis d7 (am größten) zu erstellen.

EfficientDet bleibt zwar eine robuste Wahl für die reine Erkennung von Begrenzungsrahmen, bietet jedoch im Allgemeinen nicht die moderne Vielseitigkeit für mehrere Aufgaben, etwa native OBB-Aufgaben, und auch nicht das optimierte, einheitliche Python-Ökosystem, das moderne Entwickler erwarten.

Erfahre mehr über EfficientDet

Vergleich von Leistung und Metriken#

Um die Pareto-Grenze von Geschwindigkeit und Genauigkeit zu bestimmen, haben wir beide Architekturen in Standardumgebungen anhand des COCO-Datensatzes getestet. Die folgende Tabelle zeigt die Unterschiede bei Modellgrößen, Präzision und Latenz, gemessen auf einer AWS-EC2-P4d-Instanz.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Wie oben dargestellt, erzielt YOLO26 ein überlegenes Gleichgewicht bei der Leistung. Das Modell YOLO26x erreicht die höchste Genauigkeit (57,5 mAP) und übertrifft damit das größte Modell EfficientDet-d7 deutlich. Darüber hinaus benötigen YOLO26-Modelle erheblich weniger Speicher und bieten eine deutlich höhere GPU-Inferenzgeschwindigkeit (bis zu 1,7 ms mit TensorRT), was die Vorteile eines Designs ohne NMS unterstreicht.

Trainingseffizienz und der Vorteil des Ökosystems#

Ein wesentlicher Unterschied zwischen den beiden Architekturen liegt in ihren Entwicklungsumgebungen. EfficientDet ist eng in das Google-AutoML- und TensorFlow-Ökosystem eingebettet, was zwar leistungsfähig ist, aber bei benutzerdefinierten Datensätzen wie DOTAv1 zu steilen Lernkurven und starren Konfigurationen führen kann.

Ultralytics bietet dagegen ein außerordentlich gut gepflegtes Ökosystem auf Basis von PyTorch. Die Speichernutzung während des Trainings ist konsequent optimiert, sodass Ingenieure robuste Modelle trainieren können, ohne die übermäßige VRAM-Zuweisung zu benötigen, die bei Transformer-basierten Netzwerken häufig vorkommt.

Einheitliche Plattformintegration

Über die Ultralytics Platform erhalten Entwickler Zugriff auf einen durchgängigen MLOps-Workflow. Dazu gehören eine nahtlose Datenannotation, die automatisierte Optimierung von Hyperparametern und das Cloud-Training mit nur einem Klick, wodurch der Weg vom Prototyping bis zur Produktion deutlich beschleunigt wird.

Implementierungsbeispiel#

Dank der einfachen Nutzung der Ultralytics API kannst du ein hochmodernes YOLO26-Modell mit nur wenigen Codezeilen trainieren und validieren.

from ultralytics import YOLO

# Initialize the End-to-End NMS-Free YOLO26 model
model = YOLO("yolo26n.pt")

# Train using the innovative MuSGD optimizer on a custom dataset
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="0",  # Train on GPU
)

# Export natively to TensorRT for ultra-low latency deployment
model.export(format="engine")

Ideale Anwendungsfälle#

Wann du YOLO26 verwenden solltest:

  • Edge Computing und mobile Geräte: Mit bis zu 43 % schnellerer CPU-Inferenz und ohne NMS-Overhead überzeugt YOLO26 auf Geräten mit stark begrenzten Rechenbudgets, etwa Raspberry Pis oder Mobiltelefonen.
  • Mehrere Aufgaben: Wenn eine einzelne Pipeline Begrenzungsrahmen, Segmentierungsmasken und Tracking benötigt, ist die Vielseitigkeit von YOLO26 unübertroffen.
  • Drohnen- und Luftaufnahmen: Die Kombination aus ProgLoss und STAL verbessert die Erkennung extrem kleiner Objekte aus großen Höhen erheblich.

Wann du EfficientDet verwenden solltest:

  • Ältere TensorFlow-Pipelines: Wenn deine Infrastruktur weitgehend fest auf die Unterstützung ausschließlich von TensorFlow SavedModels ausgelegt ist oder bestimmte TensorFlow-Serving-Pipelines erfordert, bietet EfficientDet native Kompatibilität.
  • TPUs mit begrenzten Ressourcen: EfficientDet wurde stark für die speziell entwickelten Tensor Processing Units von Google (TPUs) optimiert.

Weitere Alternativen erkunden#

Dieser Leitfaden konzentriert sich zwar stark auf das Paradigma YOLO26 vs. EfficientDet, doch das umfassendere Ultralytics-Ökosystem umfasst weitere leistungsfähige Architekturen. Wenn deine Anwendung stark auf Transformer setzt, bietet RT-DETR eine echtzeitfähige Transformer-basierte Erkennung. Wenn du hingegen ältere Systeme unterstützt, wird YOLO11 weiterhin vollständig unterstützt und ist äußerst leistungsfähig. Einen umfassenderen Überblick findest du im Ultralytics Hub für Modellvergleiche.

Letztlich machen die enorme Geschwindigkeit, die einfache Nutzung und die hochmoderne Genauigkeit von YOLO26 die Lösung für jede heute entwickelte moderne Computer-Vision-Pipeline zur eindeutigen Empfehlung für Forschende und Entwickler gleichermaßen.

Kommentare