YOLO Vision 2026:
YOLO27 kommt bald

YOLO27-Modelle befinden sich in der finalen Forschung und Entwicklung, die Einführung wird für später in diesem Jahr erwartet. Die Modelle sind noch nicht verfügbar, und es wurde kein Starttermin festgelegt. Diese Seite gibt einen Ausblick auf die kommenden Modelle; Funktionen und Benchmarks können sich vor der Veröffentlichung noch ändern. Code-Beispiele unten sind für die Verwendung gedacht, sobald die Modelle und die Paketunterstützung veröffentlicht sind, und funktionieren nicht mit dem aktuellen öffentlichen Paket. Modellgewichte, Konfigurationen und Implementierungscode werden zum jetzigen Zeitpunkt nicht veröffentlicht.

Ultralytics YOLO27#

Übersicht#

Ultralytics YOLO27 ist eine Familie von Echtzeit-Visionsmodellen, deren Erfassungsmodelle zwei sich ergänzende Designs verwenden: eine optimierte CNN-Architektur für die kompakten N- und S-Modelle sowie eine abfragebasierte, NMS-freie Architektur für die größeren M- und L-Modelle. Beide Designs sind End-to-End und werden über dieselbe Schnittstelle bereitgestellt.

YOLO27 ist die kommende Modellfamilie in der Ultralytics YOLO-Serie und die Nachfolgeversion von YOLO26. Sie ist in vier Größen – N, S, M und L – erhältlich und unterstützt Objekterkennung, Instanzsegmentierung, semantische Segmentierung, Tiefenschätzung, Klassifizierung, Posenschätzung sowie orientierte Objekterkennung. Die Aufteilung auf zwei Designs gilt für die Objekterkennung; alle anderen Aufgaben verwenden die CNN-Architektur.

Über seine vier Erkennungsskalen hinweg erreicht YOLO27 42,3–60,4 mAP auf COCO bei einer Latenz von 0,62–2,32 ms auf einer NVIDIA RTX PRO 6000 – und bis zu 61,2 mAP mit YOLO27l bei einer größeren Eingabe von 800 Pixeln. YOLO27l ist das erste Ultralytics-Modell, das 60 mAP auf COCO übertrifft, während die kompakten Modelle YOLO27n/s die Genauigkeit von YOLO27n/s bei im Wesentlichen gleicher Geschwindigkeit verbessern.

Schnellstart (nach Veröffentlichung)
from ultralytics import YOLO

model = YOLO("yolo27n.pt")  # load a pretrained YOLO27n model
results = model("path/to/bus.jpg")  # run inference

Wichtige Funktionen#

  • Erkennung mit zwei Skalen Standard-Detektoren sagen Objekte auf drei Merkmalspaketen vor – fein, mittel und grob. YOLO27 N und S lassen das mittlere weg und sagen nur auf einer feinen Karte (für kleine Objekte) und einer groben Karte (für große Objekte) voraus, wobei eine feste Skalierung der fusionierten Merkmale die beiden Skalen im Gleichgewicht hält. Dadurch entfällt ein Großteil der Berechnungen im Erkennungskopf, was die Modelle schneller macht, während sie genauso zuverlässig trainieren wie das Design mit allen drei Skalen.

  • Stärkere Erkennung kleiner Objekte Die frühe, hochauflösende Merkmalsstufe wird verbreitert, damit sie detailgetreuere Informationen erfassen kann. In Kombination mit der verbleibenden feinen Vorhersagekarte verbessert dies die Lokalisierung und Regression für kleine Objekte – die schwierigste Kategorie für kompakte Modelle.

  • Überwachung der Vordergrundausrichtung Während des Trainings lernt ein zusätzlicher, leichter Zweig, an jeder Position zwischen „Objekt“ und „Hintergrund“ zu unterscheiden. Er soll die Lücke zwischen der dichteren Eins-zu-viele-Überwachung während des Trainings und dem Eins-zu-eins-Kopf, der die endgültigen Vorhersagen liefert, schließen – wodurch diese Genauigkeitslücke von 0,9/0,8 mAP bei YOLO26n/s auf nur noch 0,4 mAP bei YOLO27n/s verringert wird, sodass der bereitgestellte Eins-zu-eins-Kopf fast die gesamte Trainingsgenauigkeit behält. Der Zweig wird nur während des Trainings verwendet und für die Inferenz sowie den Export entfernt, sodass er bei der Bereitstellung keine Rechenleistung kostet.

  • Abfragebasierte Erkennung ohne NMS Die größeren Modelle ersetzen die dichte Vorhersage durch einen Transformer-Decoder, der einen festen Satz von Objektabfragen verfeinert und direkt die endgültigen Erkennungen ausgibt – ganz ohne Non-Maximum Suppression-Nachbearbeitung. YOLO27m paart diesen Decoder mit dem bewährten konvolutionalen Backbone im YOLO26-Stil, während YOLO27l denselben FPN/PAN-Hals beibehält und einen UltraViT-Backbone einsetzt, der in seiner tiefsten Stufe Self-Attention verwendet, um den globalen Kontext zu erfassen.

  • Eine einfache Schnittstelle Beide Architekturen werden über dieselbe YOLO Python-Schnittstelle verwendet. Die passende Trainings-, Validierungs-, Vorhersage- und Export-Pipeline wird automatisch anhand des Modells ausgewählt, sodass für eine YOLO27-Skala geschriebener Code unverändert für die anderen funktioniert.

Welches YOLO27 sollte ich verwenden?#

Die folgende Anleitung dient der Modellauswahl, sobald YOLO27 veröffentlicht ist. Verwende für aktuelle Projekte YOLO26.

  • YOLO27n / YOLO27s – Edge-Geräte, Drohnen und Echtzeit-Video: die schnellsten Modelle der Familie mit verbesserter Erkennung kleiner Objekte durch das Zwei-Skalen-Design. Siehe NVIDIA Jetson und Raspberry Pi für die gerätespezifische Bereitstellung.
  • YOLO27m – der optimale Punkt zwischen Genauigkeit und Geschwindigkeit auf GPUs: verbessert YOLO26m um 3,2 mAP bei gleicher Latenz, was es zur Standardwahl für die GPU-Bereitstellung in der Produktion macht.
  • YOLO27l – anspruchsvolle Anwendungen: das erste Ultralytics-Modell mit über 60 mAP auf COCO, das 61,2 mAP bei einer größeren Eingabegröße erreicht und dabei auf der GPU in Echtzeit läuft.

Um den Vergleich mit anderen Familien anzustellen, siehe alle Ultralytics-Modelle. Um das Verhältnis von Genauigkeit und Geschwindigkeit auf eigener statt auf unserer Hardware zu messen, siehe Benchmark-Modus.


Unterstützte Aufgaben und Modi#

Die folgende Tabelle zeigt eine Vorschau der geplannten Aufgaben- und Modusunterstützung über die vier YOLO27-Modellgrößen hinweg. Häkchen zeigen die bei der Veröffentlichung beabsichtigte Unterstützung an, nicht die aktuelle öffentliche Verfügbarkeit; alle aufgeführten Modelldateien sind unveröffentlicht.

ModellDateinamenAufgabeTrainingValidierungInferenzExport
YOLO27yolo27n.pt yolo27s.pt yolo27m.pt yolo27l.ptErkennung
YOLO27-segyolo27n-seg.pt yolo27s-seg.pt yolo27m-seg.pt yolo27l-seg.ptInstanzsegmentierung
YOLO27-semyolo27n-sem.pt yolo27s-sem.pt yolo27m-sem.pt yolo27l-sem.ptSemantische Segmentierung
YOLO27-depthyolo27n-depth.pt yolo27s-depth.pt yolo27m-depth.pt yolo27l-depth.ptTiefenschätzung
YOLO27-clsyolo27n-cls.pt yolo27s-cls.pt yolo27m-cls.pt yolo27l-cls.ptKlassifizierung
YOLO27-poseyolo27n-pose.pt yolo27s-pose.pt yolo27m-pose.pt yolo27l-pose.ptPose/Schlüsselpunkte
YOLO27-obbyolo27n-obb.pt yolo27s-obb.pt yolo27m-obb.pt yolo27l-obb.ptErkennung orientierter Objekte

YOLO27-Modelle für Erkennung, Segmentierung, Pose und OBB funktionieren auch mit dem Track-Modus, der auf der Vorhersage aufbaut, um eine Verfolgung mehrerer Objekte über Videoframes hinweg durchzuführen.

Zwei Architekturpfade

Die YOLO27-Erkennung verwendet zwei Designs unter einer Schnittstelle: Die Skalen N und S verwenden die optimierte CNN-Architektur, während die Skalen M und L die abfragebasierte, NMS-freie Architektur nutzen. Alle anderen Aufgaben verwenden die CNN-Architektur.


Leistungsmetriken#

Die Erkennungsgenauigkeit wird auf dem COCO-Validierungssatz angegeben. Siehe YOLO-Leistungsmetriken für Erklärungen zu mAP, Präzision und Recall. Die Inferenzgeschwindigkeit wird auf einer NVIDIA RTX PRO 6000 (TensorRT 11, FP16) für GPU und einem AMD EPYC 9655 (ONNX Runtime, FP32) für CPU gemessen. Nach der Veröffentlichung können die Genauigkeitswerte mit yolo val model=yolo27n.pt data=coco.yaml reproduziert werden.

Vorläufige Ergebnisse

Diese Forschungsergebnisse können sich während der finalen Forschung und Entwicklung noch ändern. Öffentliche Gewichtungen und Reproduktionsanweisungen werden der Veröffentlichung beiliegen.

Leistung

Siehe Erkennungsdokumentation für Anwendungsbeispiele mit diesen Modellen, die auf COCO trainiert wurden und 80 vortrainierte Klassen umfassen. Die Tabelle verwendet eine Eingabe von 640 Pixeln; die Übersicht berichtet zudem über YOLO27l bei 800 Pixeln.

ModellGröße
(Pixel)
mAPval
50-95
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
RTX PRO 6000 TensorRT11
(ms)
Parameter
(M)
FLOPs
(B)
YOLO27n64042.316.1 ± 1.60.62 ± 0.003.07.2
YOLO27s64049.633.2 ± 0.10.79 ± 0.0011.828.2
YOLO27m64055.867.2 ± 0.31.39 ± 0.0022.865.0
YOLO27l64060.4149.6 ± 1.42.32 ± 0.0072.3165.3

Parameter- und FLOPs-Werte gelten für das fusionierte Modell nach Conv/BatchNorm-Faltung und dem Entfernen des ungenutzten Detektionszweigs. Geschwindigkeitsmessungen wählen den NMS-freien Kopf mit nms=False. Vorrainierte Checkpoints behalten die vollständige Trainingsarchitektur bei und zeigen möglicherweise höhere Werte.


Verwendungsbeispiele#

Zur Verwendung nach der Veröffentlichung

Diese Beispiele zeigen die beabsichtigte YOLO27-API, sobald Modellgewichte und Paketunterstützung veröffentlicht sind. Sie können mit dem aktuellen öffentlichen ultralytics-Paket nicht ausgeführt werden.

Dieser Abschnitt bietet einfache YOLO27-Trainings- und Inferenzbeispiele. Vollständige Dokumentationen zu diesen und anderen Modi findest du auf den Dokumentationsseiten zu Vorhersage, Training, Validierung und Export. Für benutzerdefinierte Datensätze siehe Tipps für beste Trainingsergebnisse und die Anleitung zur Hyperparameter-Optimierung.

Beachte, dass das folgende Beispiel für YOLO27-Erkennungsmodelle zur Objekterkennung gedacht ist. Für weitere unterstützte Aufgaben siehe die Dokumentationen zu Segmentierung und Klassifizierung.

Training und Inferenz (nach Veröffentlichung)

Vortrainierte PyTorch-Modelle von *.pt sowie Konfigurationsdateien von *.yaml können an die Klasse YOLO() übergeben werden, um eine Modellinstanz in Python zu erstellen:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO27n model
model = YOLO("yolo27n.pt")

# Run inference with the YOLO27n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

Derzeit ist nur diese Dokumentationsvorschau verfügbar. YOLO27-Modellgewichte, Konfigurationen und Implementierungscode sind weiterhin unveröffentlicht. Veröffentlichungsanweisungen werden dieser Seite hinzugefügt, sobald die Modelle verfügbar sind.


FAQ#

    • Erkennung mit zwei Skalen (N/S): lässt die mittlere Vorhersagekarte zugunsten eines schnelleren Kopfes bei wettbewerbsfähiger Genauigkeit weg
    • Stärkere Erkennung kleiner Objekte (N/S): eine verbreiterte frühe Merkmalsstufe verbessert die Lokalisierung kleiner Objekte
    • Überwachung der Vordergrundausrichtung (N/S): reduziert die Genauigkeitslücke zwischen Eins-zu-viele und Eins-zu-eins von 0,9/0,8 mAP bei YOLO26n/s auf 0,4 mAP bei YOLO27n/s, bei null Inferenzkosten
    • Abfragebasierte NMS-freie Erkennung (M/L): ein Transformer-Decoder gibt endgültige Erkennungen direkt aus
    • Eine einfache Schnittstelle: beide Architekturen laufen über dieselbe YOLO-Klasse
  • Noch nicht – YOLO27 ist unveröffentlicht. Verwende für aktuelle Projekte weiterhin YOLO26. Vorläufige Ergebnisse zeigen eine verbesserte Genauigkeit über alle Modellgrößen hinweg, wobei YOLO27l 60 mAP auf COCO übertrifft. Evaluiere die final veröffentlichten Modelle für deine Arbeitslast vor der Migration.

  • Nach der Veröffentlichung ist YOLO27 so konzipiert, dass es dieselbe YOLO-Klasse und dieselbe Train/Val/Predict/Export-API wie YOLO26 verwendet – die korrekte Pipeline (CNN oder abfragebasiert) wird automatisch anhand des Modells ausgewählt. Das Ersetzen von yolo26n.pt durch yolo27n.pt ist die beabsichtigte Änderung bei der Modellauswahl, sobald YOLO27-Unterstützung und -Gewichte verfügbar sind.

  • Die meisten Detektoren sagen auf drei Merkmalspaketen mit unterschiedlichen Auflösungen voraus. YOLO27 N und S behalten die feine Karte bei, auf die kleine Objekte angewiesen sind, sowie die grobe Karte, die große Objekte benötigen, und überspringen die mittlere. Dies reduziert einen signifikanten Teil der Berechnungen im Erkennungskopf, und die oben genannten Trainingsverbesserungen halten das Verhältnis von Genauigkeit und Latenz wettbewerbsfähig.

  • YOLO27l ist das erste Ultralytics-Modell, das 60 mAP auf COCO übertrifft. Es erreicht 60,4 mAP bei einer 640-Pixel-Eingabe (2,3 ms auf einer NVIDIA RTX PRO 6000) und 61,2 mAP bei einer 800-Pixel-Eingabe (2,9 ms). Es kombiniert den UltraViT-Backbone, multi-skalige Merkmalsfusion und einen abfragebasierten Detektor, der endgültige Erkennungen direkt ohne NMS ausgibt.

  • YOLO27 befindet sich in der finalen Forschung und Entwicklung, die Einführung wird für später in diesem Jahr erwartet. Es wurde kein Starttermin festgelegt. Modellgewichte und Implementierungscode sind noch nicht öffentlich verfügbar.

  • Sobald YOLO27 veröffentlicht ist, siehe Schnellstart, um das ultralytics-Paket zu installieren oder zu aktualisieren, und lade dann ein Modell wie unten gezeigt. Dieses Beispiel ist für die Verwendung nach der Veröffentlichung bestimmt:

    from ultralytics import YOLO
    
    # Load a pretrained YOLO27 nano model
    model = YOLO("yolo27n.pt")
    
    # Run inference on an image
    results = model("image.jpg")

    Im Abschnitt Anwendungsbeispiele findest du Anleitungen für Training, Validierung und Export.

Mitwirkende

Kommentare