NYU-Depth-V2-Tiefendatensatz#
NYU Depth V2 ist der Standardbenchmark für die monokulare Tiefenschätzung in Innenräumen. Er besteht aus RGB-D-Videosequenzen verschiedenster Innenraumszenen, die mit einer Microsoft Kinect v1 aufgezeichnet wurden. Er ist der primäre Benchmark zur Berichterstattung über die Genauigkeit von YOLO26-Depth.
Erkunde NYU Depth V2 auf der Ultralytics Platform, um die RGB-Tiefenpaare in der Vorschau anzuzeigen, die Datensatzstatistiken zu prüfen und den Datensatz für das Training zu klonen.
Wichtige Funktionen#
- Aufgezeichnet mit einem RGB-D-Sensor Microsoft Kinect v1.
- Deckt eine große Vielfalt realer Innenraumszenen ab (Wohnhäuser, Büros, Klassenzimmer und ähnliche Räume).
- Tiefenbereich bis ungefähr 10 m, typisch für die RGB-D-Aufzeichnung in Innenräumen mit Geräten für den Verbraucherbereich.
- Die Auswertung erfolgt auf dem standardmäßigen Eigen-Testsplitt mit 654 Bildern.
- Der primäre Benchmark zur Berichterstattung über die Genauigkeit der monokularen Tiefenschätzung.
Rolle in YOLO26-Depth#
NYU Depth V2 ist der primäre Zero-Shot-Evaluierungsbenchmark für die YOLO26-Depth-Familie, und die zentralen Metriken auf der Seite zur Tiefenaufgabe werden darauf ausgewiesen. Die veröffentlichten YOLO26-Depth-Modelle wurden nicht auf NYU trainiert. Obwohl der Datensatz einen Trainingssplit enthält, wird dieser nicht verwendet, und es werden nur Ergebnisse auf dem zurückgehaltenen Testsplitt berichtet.
Für die Auswertung werden Testzeit-Augmentierung (TTA) mit mehreren Maßstäben und horizontalem Spiegeln verwendet. Anschließend erfolgt eine Skalenausrichtung zwischen den vorhergesagten Tiefenkarten und den Tiefenkarten der Referenzdaten mithilfe der logarithmischen Methode der kleinsten Quadrate, bevor die Metriken berechnet werden.
Ergebnisse#
Die folgende Tabelle zeigt die Genauigkeit von delta1 (Prozentsatz der Pixel innerhalb eines Schwellenwerts von 1.25×; höher ist besser) auf dem Eigen-Testsplitt von NYU Depth V2, aufgeschlüsselt nach Modellgröße.
| Modell | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.855 |
| YOLO26m-depth | 0.919 |
| YOLO26l-depth | 0.927 |
| YOLO26x-depth | 0.923 |
Dataset-YAML#
Eine YAML-Datei wird verwendet, um die Dataset-Konfiguration zu definieren. Sie enthält Informationen über die Pfade des Datasets, die Klassen und andere relevante Informationen.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth-png ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
depth_scale: 1000
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zipVerwendung#
Um ein YOLO26-Depth-Modell auf dem NYU-Depth-V2-Benchmark auszuwerten, kannst du die folgenden Codebeispiele verwenden. Eine umfassende Liste der verfügbaren Argumente findest du auf der Seite Validierung des Modells.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")Vortrainierte Modelle#
Die YOLO26-Depth-Familie wird ohne zusätzliches Training auf dem NYU-Depth-V2-Benchmark ausgewertet. Diese Modelle werden automatisch aus der neuesten Ultralytics-Version heruntergeladen, zum Beispiel YOLO26x-depth aus v8.4.0, und decken für unterschiedliche Genauigkeits- und Ressourcenanforderungen eine Reihe von Größen ab (yolo26n/s/m/l/x-depth).
Zitate und Danksagungen#
Wenn du den Datensatz NYU Depth V2 in deiner Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Veröffentlichung:
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Wir möchten den Autoren für die Erstellung und Pflege dieser wertvollen Ressource für die Computer-Vision-Community danken.
FAQ#
NYU Depth V2 ist der Standard-Benchmark für monokulare Tiefenschätzung in Innenräumen mit Kinect v1 RGB-D-Aufnahmen von Wohnungen, Büros und Klassenzimmern bis zu etwa 10 m und einem weit verbreiteten Eigen-Test-Split mit 654 Bildern. Die wichtigsten YOLO26-Depth-Metriken auf der Depth Estimation task page werden hierfür ausgewiesen.
Nein. Die veröffentlichten Modelle werden im Zero-Shot-Verfahren evaluiert, sodass der Trainings-Split von NYU Depth V2 ungenutzt bleibt und nur die Ergebnisse der zurückgehaltenen Testdaten berichtet werden. Die veröffentlichten Zahlen verwenden eine Test-Time-Augmentation mit mehreren Skalierungen und Spiegelung, gefolgt von einer Log-Least-Squares-Skalenanpassung.
Führe
yolo depth val data=nyu-depth.yaml model=yolo26x-depth.ptaus oder verwende das Python-Beispiel im Abschnitt Usage. Der integrierte Validator verwendet eine Inferenz mit einzelner Skalierung und Median-Ausrichtung, weshalb seine Werte niedriger sind als die TTA-Zahlen unter Results; siehe die task page für die reproduzierbaren Werte.Erkunde NYU Depth V2 on Ultralytics Platform, um eine Vorschau von RGB-Tiefenpaaren anzuzeigen, Datensatzstatistiken zu inspizieren und den Datensatz für das Cloud-Training zu klonen.



