Ultralytics YOLO27:

Conjunto de datos de profundidad NYU Depth V2#

NYU Depth V2 es el referente estándar de interiores para la estimación monocular de profundidad. Consta de secuencias de vídeo RGB-D de una gran variedad de escenas interiores, grabadas con una Microsoft Kinect v1. Es el principal referente utilizado para informar sobre la precisión de YOLO26-Depth.

Explora NYU Depth V2 en la plataforma Ultralytics para previsualizar sus pares RGB-profundidad, consultar las estadísticas del conjunto de datos y clonarlo para entrenar.

Características principales#

  • Capturado con un sensor RGB-D Microsoft Kinect v1.
  • Abarca una gran variedad de escenas reales en interiores (hogares, oficinas, aulas y espacios similares).
  • Rango de profundidad de hasta aproximadamente 10 m, habitual en la captura RGB-D de interiores con dispositivos de consumo.
  • La evaluación se realiza en la división de prueba Eigen estándar de 654 imágenes.
  • El principal referente para informar sobre la precisión de la estimación monocular de profundidad.

Papel de YOLO26-Depth#

NYU Depth V2 es el principal referente de evaluación de cero disparo para la familia YOLO26-Depth, y las métricas principales de la página de la tarea de profundidad se presentan con este conjunto. Los modelos YOLO26-Depth publicados no se han entrenado con NYU; aunque el conjunto de datos incluye una división de entrenamiento, no se utiliza y solo se presentan resultados de prueba con datos reservados.

La evaluación utiliza aumento de datos de prueba (TTA) multiescala y volteo horizontal, seguido de una alineación de escala por mínimos cuadrados en el dominio logarítmico entre los mapas de profundidad predichos y los de referencia, antes de calcular las métricas.

Resultados#

La siguiente tabla muestra la precisión delta1 (fracción de píxeles dentro de un umbral de 1,25×; cuanto más alta, mejor) en la división de prueba Eigen de NYU Depth V2, desglosada por tamaño del modelo.

Modelodelta1
YOLO26n-depth0.882
YOLO26s-depth0.896
YOLO26m-depth0.921
YOLO26l-depth0.930
YOLO26x-depth0.933

YAML del conjunto de datos#

Se utiliza un archivo YAML para definir la configuración del conjunto de datos. Contiene información sobre las rutas, las clases y otros datos relevantes del conjunto.

ultralytics/cfg/datasets/nyu-depth.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── nyu-depth-png  ← downloads here (≈1.5 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images

# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.

# Classes
nc: 1
names:
  0: depth

channels: 3
depth_scale: 1000

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zip

Uso#

Para evaluar un modelo YOLO26-Depth en el referente NYU Depth V2, puedes utilizar los siguientes fragmentos de código. Consulta la página de validación del modelo para ver una lista completa de los argumentos disponibles.

Ejemplo de validación
from ultralytics import YOLO

# Cargar un modelo
model = YOLO("yolo26x-depth.pt")  # cargar un modelo de profundidad preentrenado

# Evalúa el referente NYU Depth V2
results = model.val(data="nyu-depth.yaml")

Modelos preentrenados#

La familia de modelos de profundidad YOLO26 se evalúa sin entrenamiento específico en el referente NYU Depth V2. Estos modelos se descargan automáticamente la primera vez que se utilizan desde la versión de recursos v8.4.0 de Ultralytics, por ejemplo, YOLO26x-depth, y están disponibles en varios tamaños (yolo26n/s/m/l/x-depth) para distintos requisitos de precisión y recursos.

Citas y agradecimientos#

Si utilizas el conjunto de datos NYU Depth V2 en tu investigación o trabajo de desarrollo, cita el siguiente artículo:

Cita
@inproceedings{silberman2012indoor,
      title={Indoor Segmentation and Support Inference from RGBD Images},
      author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
      booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
      year={2012}
}

Queremos agradecer a los autores la creación y el mantenimiento de este valioso recurso para la comunidad de visión artificial.

Preguntas frecuentes#

  • NYU Depth V2 es el referente estándar para la estimación monocular de profundidad en interiores, con capturas RGB-D de Kinect v1 en hogares, oficinas y aulas de hasta unos 10 m, y una división de prueba Eigen de 654 imágenes ampliamente utilizada. Las métricas principales de YOLO26-Depth se presentan en la página de la tarea de estimación de profundidad.

  • No. Los modelos publicados se evalúan sin entrenamiento específico, por lo que no se utiliza la división de entrenamiento de NYU y solo se presentan resultados de prueba con datos reservados. Las cifras publicadas utilizan aumento de datos de prueba con escalas múltiples y volteo, seguido de alineación de escala por mínimos cuadrados en el dominio logarítmico.

  • Ejecuta yolo depth val data=nyu-depth.yaml model=yolo26x-depth.pt o usa el ejemplo de Python de la sección Uso. El validador integrado usa inferencia a escala única con alineación mediana, por lo que sus puntuaciones son inferiores a las cifras de TTA de Resultados; consulta la página de la tarea para ver los valores reproducibles.

  • Explora NYU Depth V2 en Ultralytics Platform para previsualizar pares RGB-profundidad, consultar las estadísticas del conjunto de datos y clonarlo para entrenar en la nube.

Comentarios