YOLO Vision 2026:

Ultralytics YOLO26#

Übersicht#

Ultralytics YOLO26 ist eine einheitliche Familie von Echtzeit-Visionsmodellen, die im Ultralytics YOLO26 paper beschrieben wird. Sie führt native End-to-End-Inferenz, einen leichteren Detektionskopf, ein aktualisiertes Trainingsrezept und aufgabenspezifische Köpfe für Detektion, Segmentierung, Pose-Schätzung, Klassifikation und orientierte Detektion ein.

Über die fünf Detektionsskalen hinweg erreicht YOLO26 40,9-57,5 mAP auf COCO bei 1,7-11,8 ms T4 TensorRT-Latenz. Das Paper berichtet zudem von bis zu 43 % schnellerer CPU ONNX-Inferenz für YOLO26n im Vergleich zu YOLO11n auf einer Intel Xeon CPU mit 2,00 GHz.

Ultralytics YOLO26 Comparison Plots



Watch: How to Train a YOLO26 model on Your Custom Dataset in Google Colab.
Schnellstart
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # load a pretrained YOLO26n model
results = model("path/to/bus.jpg")  # run inference
Auf der Ultralytics-Plattform ausprobieren

Erkunde und starte YOLO26-Modelle direkt auf der Ultralytics Platform.

Die YOLO26-Modellfamilie ist um vier Designbereiche herum aufgebaut:

  • Native End-to-End-Inferenz: Der standardmäßige One-to-One-Detektionskopf erzeugt Vorhersagen ohne Non-Maximum Suppression (NMS), was den Einsatz vereinfacht und die Nachbearbeitung reduziert.
  • Leichtere Box-Regression: YOLO26 entfernt den Distribution Focal Loss (DFL), was die Komplexität des Detektionskopfes reduziert und gleichzeitig einen uneingeschränkten Regressionsbereich beibehält.
  • Aktualisierungen des Trainingsrezepts: Die Training-Pipeline kombiniert MuSGD (einen hybriden Muon- und SGD-Optimierer), Progressive Loss und STAL (Small-Target-Aware Label Assignment), um die Optimierung zu verbessern, die Überwachung auf den Inferenz-Kopf zu verlagern und die positive Label-Abdeckung für kleine Objekte beizubehalten. Die vollständigen Hyperparameter hinter den veröffentlichten Checkpoints sind im YOLO26 Training Recipe guide dokumentiert.
  • Aufgabenspezifische Köpfe und Losses: YOLO26 fügt gezielte Designs für Instanz-Segmentierung, Varianten der semantischen Segmentierung, Pose-Schätzung und orientierte Detektion hinzu, während eine einheitliche Modell-Pipeline über Aufgaben hinweg beibehalten wird.

Zusammen verbessern diese Aktualisierungen das Verhältnis zwischen Genauigkeit und Latenz über verschiedene Modellskalen und Einsatzziele hinweg.

Hauptfunktionen#

  • DFL-freie Regression YOLO26 entfernt den Distribution Focal Loss (DFL), reduziert die Komplexität des Detektionskopfes und vereinfacht den Export.

  • End-to-End NMS-freie Inferenz Im Gegensatz zu herkömmlichen Detektoren, die auf NMS als separaten Nachbearbeitungsschritt angewiesen sind, ist YOLO26 standardmäßig nativ End-to-End. Vorhersagen werden direkt generiert, was die Latenz verringert und die Integration in die Produktion vereinfacht.

  • Progressive Loss + STAL Progressive Loss verlagert den Trainingsschwerpunkt auf den Inferenz-Kopf, während STAL die Abdeckung positiver Labels für kleine Objekte verbessert.

  • MuSGD-Optimierer Ein hybrider Optimierer, der SGD mit Muon kombiniert und Optimierungsideen aus dem Training großer Sprachmodelle auf die Computer Vision anwendet.

  • Effiziente Bereitstellung Der vereinfachte Kopf und der NMS-freie Standardpfad reduzieren den Inferenz-Overhead über Exportziele und Hardwareprofile hinweg, einschließlich der im Paper berichteten CPU ONNX-Geschwindigkeitssteigerung für YOLO26n gegenüber YOLO11n.

  • Verbesserungen bei der Instanz-Segmentierung Führt einen Loss für semantische Segmentierung ein, um die Modellkonvergenz zu verbessern, sowie ein aktualisiertes Proto-Modul, das Informationen über mehrere Skalen hinweg für eine überragende Maskenqualität nutzt. Das Paper berichtet von Zuwächsen gegenüber YOLO11 von bis zu +2,5 Box AP und +3,7 Mask AP bei der COCO-Instanz-Segmentierung.

  • Präzise Pose-Schätzung Integriert Residual Log-Likelihood Estimation (RLE) für eine genauere Keypoint-Lokalisierung und optimiert den Dekodierungsprozess für eine höhere Inferenzgeschwindigkeit. Das Paper berichtet von bis zu +7,2 AP gegenüber YOLO11 bei der COCO-Pose-Schätzung.

  • Verfeinerte OBB-Dekodierung Führt einen spezialisierten Winkel-Loss ein, um die Detektionsgenauigkeit für quadratische Objekte zu verbessern, und optimiert die OBB-Dekodierung, um Probleme mit Grenzdiskontinuitäten zu lösen. Das Paper berichtet von bis zu +3,4 mAP gegenüber YOLO11 bei der DOTA-v1.0 orientierten Detektion.

Ultralytics YOLO26 End-to-End Comparison Plots


Unterstützte Aufgaben und Modi#

YOLO26 unterstützt das standardmäßige Ultralytics-Aufgabenset über fünf Modellskalen hinweg:

ModellDateinamenAufgabeTrainingValidationInferenceExportieren
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptDetektion
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptInstanzsegmentierung
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptSemantic Segmentation
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptDepth Estimation
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptClassification
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPose/Keypoints
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptOriented Detection

Dieses einheitliche Framework deckt Echtzeit-Detektion, Instanz-Segmentierung, semantische Segmentierung, monokulare Tiefenschätzung, Klassifizierung, Pose-Schätzung und orientierte Objekterkennung ab, mit Unterstützung für Training, Validierung, Inferenz und Export.

Nur-Architektur-Varianten

yolo26-p2.yaml und yolo26-p6.yaml fügen einen P2- (kleine Objekte) oder P6-Detektionskopf (große Eingaben) hinzu und werden nur als YAML-Architekturen ausgeliefert. Es werden keine größenspezifischen yolo26*-p2.pt- oder yolo26*-p6.pt-Gewichte veröffentlicht. Instanziiere eine skalierte Konfiguration aus YAML (zum Beispiel YOLO("yolo26n-p6.yaml")) und trainiere oder optimiere sie nach Bedarf.


Leistungsmetriken#

Leistung

Siehe Detection Docs für Anwendungsbeispiele mit diesen Modellen, die auf COCO trainiert wurden und 80 vortrainierte Klassen umfassen.

ModellGröße
(Pixel)
mAPval
50-95
mAPval
50-95(e2e)
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLO26n64040,940,138,9 ± 0,71,7 ± 0,02,45,4
YOLO26s64048,647,887,2 ± 0,92,5 ± 0,09,520,7
YOLO26m64053,152,5220,0 ± 1,44,7 ± 0,120,468,2
YOLO26l64055,054,4286,2 ± 2,06,2 ± 0,224,886,4
YOLO26x64057,556,9525,8 ± 4,011,8 ± 0,255,7193,9

Parameter- und FLOPs-Werte gelten für das fusionierte Modell nach model.fuse(), welches Conv- und BatchNorm-Schichten zusammenführt und den辅助 One-to-Many-Erkennungskopf entfernt. Vortrainierte Checkpoints behalten die vollständige Trainingsarchitektur bei und können höhere Werte aufweisen.


Anwendungsbeispiele#

Dieser Abschnitt bietet einfache Beispiele für das Training und die Inferenz mit YOLO26. Vollständige Dokumentationen zu diesen und anderen modes findest du auf den Dokumentationsseiten zu Predict, Train, Val und Export.

Beachte, dass das folgende Beispiel für YOLO26 Detect-Modelle für die object detection gedacht ist. Weitere unterstützte Aufgaben findest du in der Dokumentation zu Segment, Semantic Segmentation, Depth, Classify, Pose und OBB.

Beispiel

PyTorch-vortrainierte *.pt-Modelle sowie Konfigurationsdateien vom Typ *.yaml können an die Klasse YOLO() übergeben werden, um eine Modellinstanz in Python zu erstellen:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Dual-Head-Architektur

YOLO26-Erkennungsmodelle verwenden eine Dual-Head-Architektur, die Flexibilität für verschiedene Bereitstellungsszenarien bietet:

  • One-to-One Head (Standard): Erzeugt End-to-End-Vorhersagen ohne NMS und gibt (N, 300, 6) mit maximal 300 Detektionen pro Bild aus. Dieser Kopf ist für eine schnelle Inferenz und vereinfachte Bereitstellung optimiert.
  • One-to-Many Head: Generiert herkömmliche YOLO-Ausgaben, die eine NMS-Nachbearbeitung erfordern, und gibt (N, nc + 4, 8400) aus, wobei nc die Anzahl der Klassen ist. Dieser Kopf erzielt typischerweise eine etwas höhere Genauigkeit auf Kosten zusätzlicher Verarbeitung.

Du kannst während des Exports, der Vorhersage oder der Validierung zwischen den Köpfen wechseln:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Use one-to-one head (default, no NMS required)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Use one-to-many head (requires NMS)
results = model.predict("image.jpg", end2end=False)  # inference
metrics = model.val(data="coco.yaml", end2end=False)  # validation
model.export(format="onnx", end2end=False)  # export

Die Wahl hängt von deinen Bereitstellungsanforderungen ab: Verwende den One-to-One-Kopf für maximale Geschwindigkeit und Einfachheit oder den One-to-Many-Kopf, wenn Genauigkeit oberste Priorität hat.

YOLOE-26: Open-Vocabulary-Erkennung und Segmentierung#

YOLO26 betreibt auch YOLOE-26, eine Open-Vocabulary-Variante, die Objektkategorien aus Text-Prompts, visuellen Prompts oder einem Prompt-freien Modus anstelle einer festen, beim Training gelernten Klassenliste erkennt und segmentiert. YOLOE-26 behält das NMS-freie End-to-End-Design (e2e) von YOLO26 bei, sodass die Open-Vocabulary-Inferenz schnell genug für dynamische Umgebungen bleibt, in denen sich Zielkategorien im Laufe der Zeit ändern. YOLOE-26x erreicht 40,6 AP auf LVIS minival bei Text-Prompting, 38,5 AP bei visuellem Prompting und 31,1 AP in der Prompt-freien Non-E2E-Einstellung.

Siehe die YOLOE documentation für Leistungstabellen nach Maßstab, Prompt-freie Varianten und vollständige Anwendungsbeispiele.

Zitate und Danksagungen#

Eine vollständige technische Beschreibung der YOLO26-Architektur, des Trainingsrezepts, der Aufgabenköpfe und der YOLOE-26 Open-Vocabulary-Erweiterung findest du unter Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models. Wenn du YOLO26 in deiner Forschung verwendest, zitiere bitte:

Zitat
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

YOLO26-Code, -Modelle und -Dokumentation sind im Ultralytics GitHub repository und in den Ultralytics Docs unter AGPL-3.0- und Enterprise-Lizenzen verfügbar.


FAQ#

Was sind die wichtigsten Verbesserungen in YOLO26?#

  • DFL-freie Regression: Vereinfacht den Detection-Head und den Export-Pfad
  • End-to-End NMS-freie Inferenz: Entfernt NMS aus dem Standard-Inferenzpfad
  • Progressive Loss + STAL: Verbessert die Trainingsausrichtung und die Label-Abdeckung für kleine Objekte
  • MuSGD-Optimierer: Kombiniert SGD mit einer von Muon inspirierten Optimierung für stabiles Training
  • Aufgabenspezifische Heads und Losses: Verbessert die Unterstützung für Segmentierung, Pose-Schätzung und orientierte Objekterkennung

Welche Aufgaben unterstützt YOLO26?#

YOLO26 ist eine einheitliche Modellfamilie, die End-to-End-Unterstützung für mehrere Computer-Vision-Aufgaben bietet:

Jede Größenvariante (n, s, m, l, x) unterstützt alle Aufgaben sowie Open-Vocabulary-Versionen über YOLOE-26.

Warum ist YOLO26 effizient für das Deployment?#

YOLO26 verbessert die Deployment-Effizienz durch:

  • Native End-to-End-Inferenz ohne NMS standardmäßig
  • DFL-freie Regression und ein leichterer Detection-Head
  • Fused-Model-Export, der nur für das Training benötigte Hilfskomponenten entfernt
  • Bis zu 43 % schnellere CPU-ONNX-Inferenz für YOLO26n gegenüber YOLO11n auf einer Intel Xeon CPU @ 2.00 GHz
  • Flexible Exportformate wie TensorRT, ONNX, CoreML, LiteRT und OpenVINO

Wie lege ich mit YOLO26 los?#

YOLO26-Modelle stehen über das Paket ultralytics zum Download bereit. Installiere oder aktualisiere das Paket und lade ein Modell:

from ultralytics import YOLO

# Load a pretrained YOLO26 nano model
model = YOLO("yolo26n.pt")

# Run inference on an image
results = model("image.jpg")

Siehe den Abschnitt Usage Examples für Anweisungen zu Training, Validierung und Export.

Kommentare