Conjunto de dados de profundidade NYU Depth V2#
NYU Depth V2 é a referência padrão em interiores para a estimativa monocular de profundidade. É composto por sequências de vídeo RGB-D de uma grande variedade de cenas interiores, gravadas com um Microsoft Kinect v1. É a principal referência utilizada para comunicar a precisão do YOLO26-Depth.
Explora NYU Depth V2 na plataforma Ultralytics para pré-visualizares os pares RGB-profundidade, inspecionares as estatísticas do conjunto de dados e criares um clone para treino.
Principais funcionalidades#
- Captado com um sensor RGB-D Microsoft Kinect v1.
- Abrange uma grande variedade de cenas reais interiores (casas, escritórios, salas de aula e espaços semelhantes).
- Intervalo de profundidade até aproximadamente 10 m, típico da captura RGB-D em interiores com dispositivos de consumo.
- A avaliação é realizada na divisão de teste Eigen padrão de 654 imagens.
- A principal referência para comunicar a precisão da estimativa monocular de profundidade.
Papel no YOLO26-Depth#
NYU Depth V2 é a principal referência de avaliação zero-shot para a família YOLO26-Depth, e as métricas principais da página da tarefa de profundidade são calculadas com este conjunto. Os modelos YOLO26-Depth publicados não são treinados com NYU; embora o conjunto de dados inclua uma divisão de treino, esta não é utilizada e são comunicados apenas os resultados de teste em dados não vistos.
A avaliação usa aumento de dados de teste (TTA) com várias escalas e inversão horizontal, seguido de alinhamento de escala por mínimos quadrados em log entre os mapas de profundidade previstos e os de ground truth antes do cálculo das métricas.
Resultados#
A tabela abaixo apresenta a precisão delta1 (fração de píxeis dentro de um limiar de 1.25×; valores mais altos são melhores) na divisão de teste Eigen de NYU Depth V2, por tamanho do modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.896 |
| YOLO26m-depth | 0.921 |
| YOLO26l-depth | 0.930 |
| YOLO26x-depth | 0.933 |
YAML do conjunto de dados#
Um arquivo YAML é usado para definir a configuração do conjunto de dados. Ele contém informações sobre os caminhos, as classes e outros dados relevantes do conjunto.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth-png ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
depth_scale: 1000
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zipUso#
Para avaliar um modelo YOLO26-Depth na referência NYU Depth V2, podes utilizar os seguintes excertos de código. Para veres a lista completa dos argumentos disponíveis, consulta a página de validação do modelo.
from ultralytics import YOLO
# Carregar um modelo
model = YOLO("yolo26x-depth.pt") # carregar um modelo de profundidade pré-treinado
# Avalia na referência NYU Depth V2
results = model.val(data="nyu-depth.yaml")Modelos pré-treinados#
A família YOLO26 de profundidade é avaliada em zero-shot na referência NYU Depth V2. Estes modelos são transferidos automaticamente na primeira utilização a partir da versão de ativos v8.4.0 da Ultralytics, por exemplo YOLO26x-depth, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.
Citações e agradecimentos#
Se utilizares o conjunto de dados NYU Depth V2 no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Agradecemos aos autores por criarem e manterem este valioso recurso para a comunidade de visão computacional.
Perguntas frequentes#
NYU Depth V2 é a referência padrão em interiores para profundidade monocular, com capturas RGB-D do Kinect v1 em casas, escritórios e salas de aula até cerca de 10 m, e uma divisão de teste Eigen de 654 imagens amplamente utilizada. As métricas principais do YOLO26-Depth são comunicadas na página da tarefa de estimativa de profundidade com base neste conjunto.
Não. Os modelos disponibilizados são avaliados em zero-shot, pelo que a divisão de treino NYU não é utilizada e são comunicados apenas os resultados de teste em dados não vistos. Os valores publicados utilizam aumento de dados de teste com várias escalas e inversão, seguido de alinhamento de escala por mínimos quadrados no logaritmo.
Execute
yolo depth val data=nyu-depth.yaml model=yolo26x-depth.ptou use o exemplo em Python na seção Uso. O validador integrado usa inferência em escala única com alinhamento pela mediana, por isso suas pontuações são inferiores aos números de TTA em Resultados; consulte a página da tarefa para ver os valores reproduzíveis.Explore o NYU Depth V2 na Ultralytics Platform para visualizar pares RGB-profundidade, analisar estatísticas do conjunto de dados e cloná-lo para treinamento na nuvem.



