Conjunto de datos de profundidad NYU Depth V2#
NYU Depth V2 es el estándar de referencia de interiores para la estimación de profundidad monocular. Consiste en secuencias de vídeo RGB-D de una gran variedad de escenas de interiores grabadas con un Microsoft Kinect v1. Es el estándar de referencia principal utilizado para informar sobre la precisión de YOLO26-Depth.
Características clave#
- Capturado con un sensor RGB-D Microsoft Kinect v1.
- Cubre una amplia variedad de escenas interiores reales (hogares, oficinas, aulas y espacios similares).
- Rango de profundidad de hasta aproximadamente 10 m, típico de la captura RGB-D de consumo en interiores.
- La evaluación se realiza sobre la partición de prueba estándar Eigen de 654 imágenes.
- La referencia principal para informar de la precisión de la estimación de profundidad monocular.
Rol en YOLO26-Depth#
NYU Depth V2 es la referencia de evaluación zero-shot principal para la familia YOLO26-Depth, y las métricas destacadas en la página de tareas de profundidad se basan en ella. Los modelos YOLO26-Depth publicados no están entrenados en NYU; aunque el conjunto de datos incluye una partición de entrenamiento, no se utiliza y solo se informan los resultados de las pruebas de validación.
La evaluación utiliza aumento de datos durante la inferencia (TTA) a multiescala y con inversión horizontal, seguido de una alineación de escala log-mínimos cuadrados entre los mapas de profundidad predichos y los de verdad fundamental antes de calcular las métricas.
Resultados#
La tabla siguiente muestra la precisión de delta1 (porcentaje de píxeles dentro de un umbral de 1.25×, cuanto mayor sea, mejor) en la división de pruebas Eigen de NYU Depth V2 según el tamaño del modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.855 |
| YOLO26m-depth | 0.919 |
| YOLO26l-depth | 0.927 |
| YOLO26x-depth | 0.923 |
YAML del dataset#
Se utiliza un archivo YAML (Yet Another Markup Language) para definir la configuración del conjunto de datos. Contiene información sobre las rutas del conjunto de datos, clases y otra información relevante.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired .npy files (float32, meters) under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth.zipUso#
Para evaluar un modelo YOLO26-Depth en el estándar de referencia NYU Depth V2, puedes utilizar los siguientes fragmentos de código. Para ver una lista exhaustiva de los argumentos disponibles, consulta la página de Validación del modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")Modelos preentrenados#
La familia de modelos de profundidad YOLO26 se evalúa mediante zero-shot en el estándar de referencia NYU Depth V2. Estos modelos se descargan automáticamente desde la versión más reciente de Ultralytics, por ejemplo, YOLO26x-depth a partir de la versión v8.4.0, y abarcan una variedad de tamaños (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisión y recursos.
Citas y agradecimientos#
Si utilizas el conjunto de datos NYU Depth V2 en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Queremos agradecer a los autores por crear y mantener este valioso recurso para la comunidad de visión por computador.