Ultralytics YOLO27:

Ultralytics YOLO26#

Übersicht#

Ultralytics YOLO26 ist eine einheitliche Familie von Echtzeit-Visionmodellen, die im Ultralytics-YOLO26-Paper beschrieben wird. Sie führt native End-to-End-Inferenz, einen kompakteren Erkennungskopf, ein aktualisiertes Trainingsrezept und aufgabenspezifische Köpfe für Erkennung, Segmentierung, Posenschätzung, Klassifizierung und orientierte Erkennung ein.

Über seine fünf Erkennungsskalen erreicht YOLO26 40.9–57.5 mAP auf COCO bei einer T4-TensorRT-Latenz von 1.7–11.8 ms. Das Paper berichtet außerdem für YOLO26n eine bis zu 43 % schnellere CPU-ONNX-Inferenz im Vergleich zu YOLO11n auf einer Intel Xeon-CPU @ 2.00 GHz.

Sieh dir die unreleased YOLO27 preview an, um Informationen zu geplanter Architektur, Aufgaben und vorläufigen Benchmarks zu erhalten.

Vergleichsdiagramme zu Ultralytics YOLO26



Watch: How to Train a YOLO26 model on Your Custom Dataset in Google Colab.
Schnellstart
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # load a pretrained YOLO26n model
results = model("path/to/bus.jpg")  # run inference
Auf der Ultralytics Platform ausprobieren

Erkunde und führe YOLO26-Modelle direkt auf der Ultralytics Platform aus.

Die YOLO26-Modellfamilie basiert auf vier Designbereichen:

  • Native End-to-End-Inferenz: Der optionale One-to-One-Detektionskopf erstellt Vorhersagen ohne Non-Maximum Suppression (NMS), was die Bereitstellung vereinfacht und die Nachbearbeitung reduziert.
  • Kompaktere Box-Regression: YOLO26 entfernt den Fokusverlust für Verteilungen (DFL), wodurch die Komplexität des Erkennungskopfs reduziert und gleichzeitig ein uneingeschränkter Regressionsbereich beibehalten wird.
  • Aktualisierungen des Trainingsrezepts: Die Trainingspipeline kombiniert MuSGD (einen hybriden Muon- und SGD-Optimierer), Progressive Loss und STAL (kleine Ziele berücksichtigende Label-Zuweisung), um die Optimierung zu verbessern, die Überwachung auf den Inferenzkopf zu verlagern und eine positive Label-Abdeckung für kleine Objekte aufrechtzuerhalten. Die vollständigen Hyperparameter hinter den veröffentlichten Checkpoints sind im Leitfaden zum YOLO26-Trainingsrezept dokumentiert.
  • Aufgabenspezifische Köpfe und Verluste: YOLO26 ergänzt gezielte Designs für Instanzsegmentierung, Varianten der semantischen Segmentierung, Posenschätzung und orientierte Erkennung und behält dabei eine einheitliche Modellpipeline für alle Aufgaben bei.

Zusammen verbessern diese Aktualisierungen das Verhältnis zwischen Genauigkeit und Latenz über verschiedene Modellgrößen und Bereitstellungsziele hinweg.

Wichtige Funktionen#

  • Regression ohne DFL YOLO26 entfernt den Fokusverlust für Verteilungen (DFL), wodurch die Komplexität des Erkennungskopfs reduziert und der Export vereinfacht wird.

  • End-to-End NMS-freie Inferenz YOLO26 unterstützt native End-to-End-Inferenz mit nms=False und erzeugt Vorhersagen ohne separaten NMS-Durchlauf. Der standardmäßige One-to-Many-Pfad verwendet NMS für die Genauigkeit.

  • Progressive Loss + STAL Progressive Loss verlagert den Schwerpunkt des Trainings auf den Inferenzkopf, während STAL die positive Label-Abdeckung für kleine Objekte verbessert.

  • MuSGD-Optimierer Ein hybrider Optimierer, der SGD mit Muon kombiniert und Optimierungsideen aus dem Training großer Sprachmodelle auf Computer Vision überträgt.

  • Effiziente Bereitstellung Der vereinfachte Kopf und der optionale NMS-freie Pfad reduzieren den Inferenz-Mehraufwand über Exportziele und Hardwareprofile hinweg, einschließlich des im Papier berichteten CPU ONNX-Geschwindigkeitszuwachses für YOLO26n im Vergleich zu YOLO11n.

  • Verbesserungen der Instanzsegmentierung Führt einen Verlust für semantische Segmentierung ein, um die Konvergenz des Modells zu verbessern, sowie ein überarbeitetes Proto-Modul, das mehrskalige Informationen für eine höhere Maskenqualität nutzt. Das Paper berichtet gegenüber YOLO11 Verbesserungen von bis zu +2.5 Box AP und +3.7 Mask AP bei der COCO-Instanzsegmentierung.

  • Präzise Posenschätzung Integriert die Schätzung der Residual-Log-Likelihood (RLE) für eine genauere Lokalisierung von Keypoints und optimiert den Dekodierungsprozess für eine höhere Inferenzgeschwindigkeit. Das Paper berichtet bei der COCO-Posenschätzung Verbesserungen von bis zu +7.2 AP gegenüber YOLO11.

  • Verbesserte OBB-Dekodierung Führt einen spezialisierten Winkelverlust ein, um die Erkennungsgenauigkeit bei quadratischen Objekten zu verbessern, und optimiert die OBB-Dekodierung, um Probleme mit Diskontinuitäten an Grenzen zu beheben. Das Paper berichtet bei der orientierten Erkennung auf DOTA-v1.0 Verbesserungen von bis zu +3.4 mAP gegenüber YOLO11.

End-to-End-Vergleichsdiagramme zu Ultralytics YOLO26

Unterstützte Aufgaben und Modi#

YOLO26 unterstützt den standardmäßigen Ultralytics-Aufgabensatz über fünf Modellgrößen hinweg:

ModellDateinamenAufgabeTrainingValidierungInferenzExport
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptErkennung
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptInstanzsegmentierung
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptSemantische Segmentierung
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptTiefenschätzung
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptKlassifizierung
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPose/Schlüsselpunkte
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptErkennung orientierter Objekte

Dieses einheitliche Framework deckt Echtzeiterkennung, Instanzsegmentierung, semantische Segmentierung, monokulare Tiefenschätzung, Klassifizierung, Posenschätzung und orientierte Objekterkennung ab und unterstützt Training, Validierung, Inferenz und Export.

Varianten nur mit Architektur

yolo26-p2.yaml und yolo26-p6.yaml ergänzen einen P2-Erkennungskopf (für kleine Objekte) oder einen P6-Erkennungskopf (für große Eingaben) und werden ausschließlich als YAML-Architekturen bereitgestellt. Es werden keine skalenbezogenen Gewichte für yolo26*-p2.pt oder yolo26*-p6.pt veröffentlicht. Erzeuge eine skalierte Konfiguration aus YAML (zum Beispiel YOLO("yolo26n-p6.yaml")) und trainiere oder fine-tune sie nach Bedarf.

Leistungsmetriken#

Leistung

Beispiele zur Verwendung dieser auf COCO trainierten Modelle mit 80 vortrainierten Klassen findest du in der Dokumentation zur Erkennung.

ModellGröße
(Pixel)
mAPval
50-95
mAPval
50-95(e2e)
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B)
YOLO26n64040.940.138.9 ± 0.71.7 ± 0.02.45.5
YOLO26s64048.647.887.2 ± 0.92.5 ± 0.09.520.9
YOLO26m64053.152.5220.0 ± 1.44.7 ± 0.120.468.4
YOLO26l64055.054.4286.2 ± 2.06.2 ± 0.224.886.8
YOLO26x64057.556.9525.8 ± 4.011.8 ± 0.255.7194.4

Parameter- und FLOPs-Werte gelten für das fusionierte Modell nach Conv/BatchNorm-Faltung und dem Entfernen des ungenutzten Detektionszweigs. Geschwindigkeitsmessungen wählen den NMS-freien Kopf mit nms=False. Vorrainierte Checkpoints behalten die vollständige Trainingsarchitektur bei und zeigen möglicherweise höhere Werte.

Verwendungsbeispiele#

Dieser Abschnitt enthält einfache Beispiele für das Training und die Inferenz mit YOLO26. Eine vollständige Dokumentation zu diesen und anderen Modi findest du auf den Dokumentationsseiten zu Predict, Train, Val und Export.

Beachte, dass sich das folgende Beispiel auf YOLO26-Detect-Modelle zur Objekterkennung bezieht. Weitere unterstützte Aufgaben findest du in der Dokumentation zu Segment, Semantischer Segmentierung, Depth, Classify, Pose und OBB.

Beispiel

Vortrainierte *.pt-Modelle für PyTorch sowie Konfigurationsdateien *.yaml können an die Klasse YOLO() übergeben werden, um eine Modellinstanz in Python zu erstellen:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Architektur mit zwei Köpfen

YOLO26-Erkennungsmodelle verwenden eine Architektur mit zwei Köpfen, die Flexibilität für verschiedene Bereitstellungsszenarien bietet:

  • One-to-Many-Kopf (Standard): Generiert traditionelle YOLO-Ausgaben, die eine NMS-Nachbearbeitung erfordern, und gibt (N, nc + 4, 8400) aus, wobei nc die Anzahl der Klassen ist. Dieser Kopf erzielt typischerweise eine etwas höhere Genauigkeit auf Kosten zusätzlicher Verarbeitung.
  • One-to-One-Kopf (nms=False): Erzeugt End-to-End-Vorhersagen ohne NMS und gibt (N, 300, 6) mit maximal 300 Detektionen pro Bild aus. Dieser Kopf ist für schnelle Inferenz und vereinfachte Bereitstellung optimiert.

Du kannst während des Exports, der Vorhersage oder der Validierung zwischen den Köpfen wechseln:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Use one-to-many head (default, Ultralytics applies NMS)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Opt into the NMS-free one-to-one head
results = model.predict("image.jpg", nms=False)  # inference
metrics = model.val(data="coco.yaml", nms=False)  # validation
model.export(format="onnx", nms=False)  # export

Für die Genauigkeit verwenden Vorhersage und Validierung standardmäßig den One-to-Many-Kopf. Nutze nms=False für NMS-freie Inferenz oder nms=True, um NMS in einen unterstützten Export einzubetten. Beide Köpfe werden unabhängig von dieser Wahl trainiert. Siehe die End-to-End Detection guide für Ausgabeformate und Exportkompatibilität.

YOLOE-26: Erkennung und Segmentierung mit offenem Vokabular#

YOLO26 steuert auch YOLOE-26 an, eine Variante für offenes Vokabular, die Objektkategorien anhand von Text-Prompts, visuellen Prompts oder einem promptfreien Modus anstelle einer festen, während des Trainings gelernten Klassenliste erkennt und segmentiert. YOLOE-26 behält den optionalen NMS-freien End-to-End-Kopf (e2e) von YOLO26 bei, sodass die Inferenz mit offenem Vokabular schnell genug für dynamische Umgebungen bleibt, in denen sich Zielkategorien im Laufe der Zeit ändern. YOLOE-26x erreicht 40.6 AP auf LVIS minival bei textbasiertem Prompting, 38.5 AP bei visuellem Prompting und 31.1 AP promptfrei – dies sind die Non-E2E-Zahlen des Papers, hinter denen der End-to-End-Kopf um 1.1, 2.3 und 1.2 AP zurückbleibt.

Siehe die YOLOE-Dokumentation für Leistungstabellen nach Modellgröße, Prompt-freie Varianten und vollständige Anwendungsbeispiele.

Zitate und Danksagungen#

Eine vollständige technische Beschreibung der YOLO26-Architektur, des Trainingsrezepts, der Aufgaben-Köpfe und der YOLOE-26-Erweiterung mit offenem Vokabular findest du in Ultralytics YOLO26: Einheitliche Echtzeit-End-to-End-Visionmodelle. Wenn du YOLO26 in deiner Forschung verwendest, zitiere bitte:

Zitat
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

YOLO26-Code, -Modelle und -Dokumentation sind im Ultralytics-GitHub-Repository und in den Ultralytics Docs unter AGPL-3.0- und Enterprise-Lizenzen verfügbar.

FAQ#

    • Regression ohne DFL: Vereinfacht den Erkennungskopf und den Exportpfad
    • End-to-End NMS-freie Inferenz: Unterstützt NMS-freie Inferenz mit nms=False
    • Progressive Loss + STAL: Verbessert die Abstimmung des Trainings und die Label-Abdeckung für kleine Objekte
    • MuSGD-Optimierer: Kombiniert SGD mit einer von Muon inspirierten Optimierung für stabiles Training
    • Aufgabenspezifische Köpfe und Verluste: Verbessert die Unterstützung für Segmentierung, Posenschätzung und orientierte Erkennung
  • YOLO26 ist eine einheitliche Modellfamilie, die End-to-End-Unterstützung für mehrere Computer-Vision-Aufgaben bietet:

    Jede Größenvariante (n, s, m, l, x) unterstützt alle Aufgaben sowie Varianten mit offenem Vokabular über YOLOE-26.

  • YOLO26 verbessert die Effizienz der Bereitstellung durch:

    • Optionale native End-to-End-Inferenz ohne NMS (nms=False)
    • Regression ohne DFL und einen kompakteren Erkennungskopf
    • Export zusammengeführter Modelle, bei dem ausschließlich für das Training benötigte Zusatzkomponenten entfernt werden
    • Bis zu 43 % schnellere CPU-ONNX-Inferenz für YOLO26n gegenüber YOLO11n auf einer Intel Xeon-CPU @ 2.00 GHz
    • Flexible Exportformate einschließlich TensorRT, ONNX, CoreML, LiteRT und OpenVINO
  • YOLO26-Modelle können über das Paket ultralytics heruntergeladen werden. Installiere das Paket oder aktualisiere es und lade ein Modell:

    from ultralytics import YOLO
    
    # Load a pretrained YOLO26 nano model
    model = YOLO("yolo26n.pt")
    
    # Run inference on an image
    results = model("image.jpg")

    Im Abschnitt Anwendungsbeispiele findest du Anleitungen für Training, Validierung und Export.

Kommentare