Ultralytics YOLO27:
Get Started

NYU Depth V2-Tiefendatensatz#

NYU Depth V2 ist der Standardbenchmark für Innenräume zur monokularen Tiefenschätzung. Er besteht aus RGB-D-Videosequenzen unterschiedlichster Innenraumszenen, die mit einer Microsoft Kinect v1 aufgenommen wurden. Er ist der wichtigste Benchmark zur Angabe der YOLO26-Depth-Genauigkeit.

Entdecke NYU Depth V2 auf der Ultralytics-Plattform, um die RGB-Tiefenpaare in der Vorschau anzusehen, Datensatzstatistiken zu prüfen und den Datensatz für das Training zu klonen.

Wichtige Funktionen#

  • Aufgenommen mit einem Microsoft Kinect v1 RGB-D-Sensor.
  • Umfasst vielfältige reale Innenräume (Wohnungen, Büros, Klassenzimmer und ähnliche Räume).
  • Tiefenbereich bis etwa 10 m, typisch für RGB-D-Aufnahmen in Innenräumen mit Verbrauchergeräten.
  • Die Evaluierung erfolgt anhand der standardmäßigen Eigen-Testaufteilung mit 654 Bildern.
  • Der wichtigste Benchmark zur Angabe der Genauigkeit bei der monokularen Tiefenschätzung.

Rolle in YOLO26-Depth#

NYU Depth V2 ist der wichtigste Zero-Shot-Evaluierungsbenchmark für die YOLO26-Depth-Modellfamilie. Die wichtigsten Metriken auf der Seite zur Tiefenaufgabe werden anhand dieses Datensatzes angegeben. Die veröffentlichten YOLO26-Depth-Modelle wurden nicht mit NYU trainiert. Obwohl der Datensatz eine Trainingsaufteilung enthält, wird diese nicht verwendet; berichtet werden ausschließlich Ergebnisse für zurückgehaltene Testdaten.

Die Auswertung nutzt Test-Time-Augmentation (TTA) mit mehreren Maßstäben und horizontaler Spiegelung. Vor der Berechnung der Metriken werden die vorhergesagten Tiefenkarten dann durch eine Log-Least-Squares-Skalenausrichtung an die Tiefenreferenzkarten angepasst.

Ergebnisse#

Die folgende Tabelle zeigt die Genauigkeit delta1 (Anteil der Pixel innerhalb eines Schwellenwerts von 1,25×; höhere Werte sind besser) nach Modellgröße auf der NYU Depth V2-Eigen-Testaufteilung.

Modelldelta1
YOLO26n-depth0.882
YOLO26s-depth0.896
YOLO26m-depth0.921
YOLO26l-depth0.930
YOLO26x-depth0.933

YAML-Datei des Datensatzes#

Eine YAML-Datei legt die Dataset-Konfiguration fest. Sie enthält Angaben zu den Pfaden, Klassen und weiteren relevanten Informationen des Datensatzes.

ultralytics/cfg/datasets/nyu-depth.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── nyu-depth-png  ← downloads here (≈1.5 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images

# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.

# Classes
nc: 1
names:
  0: depth

channels: 3
depth_scale: 1000

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zip

Verwendung#

Um ein YOLO26-Depth-Modell auf dem NYU Depth V2-Benchmark zu evaluieren, kannst du die folgenden Codebeispiele verwenden. Eine vollständige Liste der verfügbaren Argumente findest du auf der Seite zur Validierung des Modells.

Validierungsbeispiel
from ultralytics import YOLO

# Ein Modell laden
model = YOLO("yolo26x-depth.pt")  # Ein vortrainiertes Tiefenmodell laden

# Auf dem NYU Depth V2-Benchmark evaluieren
results = model.val(data="nyu-depth.yaml")

Vortrainierte Modelle#

Die YOLO26-Tiefenmodellfamilie wird ohne vorheriges Training auf dem NYU Depth V2-Benchmark evaluiert. Bei der ersten Verwendung werden diese Modelle automatisch aus der Ultralytics-Version v8.4.0 mit Modellressourcen heruntergeladen, zum Beispiel YOLO26x-depth. Die Modelle sind in verschiedenen Größen verfügbar (yolo26n/s/m/l/x-depth), passend zu unterschiedlichen Anforderungen an Genauigkeit und Ressourcen.

Zitate und Danksagungen#

Wenn du den NYU Depth V2-Datensatz in deiner Forschung oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Arbeit:

Zitat
@inproceedings{silberman2012indoor,
      title={Indoor Segmentation and Support Inference from RGBD Images},
      author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
      booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
      year={2012}
}

Wir möchten den Autorinnen und Autoren dafür danken, dass sie diese wertvolle Ressource für die Bildverarbeitungsgemeinschaft erstellt haben und pflegen.

Häufig gestellte Fragen#

  • NYU Depth V2 ist der Standardbenchmark für monokulare Tiefenschätzung in Innenräumen. Er umfasst RGB-D-Aufnahmen von Wohnungen, Büros und Klassenzimmern mit einer Kinect v1, die Tiefen bis etwa 10 m erfassen, sowie eine weithin verwendete Eigen-Testaufteilung mit 654 Bildern. Die wichtigsten YOLO26-Depth-Metriken auf der Seite zur Aufgabe Tiefenschätzung werden anhand dieses Datensatzes angegeben.

  • Nein. Die veröffentlichten Modelle werden ohne vorheriges Training evaluiert. Daher wird die NYU-Trainingsaufteilung nicht verwendet, und es werden ausschließlich Ergebnisse für zurückgehaltene Testdaten angegeben. Die veröffentlichten Werte beruhen auf Testzeit-Augmentierung mit mehreren Maßstäben und Spiegelungen, gefolgt von einer Maßstabsanpassung nach der Methode der kleinsten Quadrate im Logarithmusraum.

  • Führe yolo depth val data=nyu-depth.yaml model=yolo26x-depth.pt aus oder verwende das Python-Beispiel im Abschnitt Verwendung. Der integrierte Validator verwendet Inferenz mit einer einzelnen Skalierung und Median-Ausrichtung, daher fallen seine Werte niedriger aus als die TTA-Zahlen unter Ergebnisse; die reproduzierbaren Werte findest du auf der Aufgabenseite.

  • Entdecke NYU Depth V2 auf der Ultralytics Platform, um RGB-Tiefen-Paare in der Vorschau anzuzeigen, Datensatzstatistiken einzusehen und den Datensatz für das Training in der Cloud zu klonen.

Kommentare