Ultralytics YOLO27:

Dataset de profundidade NYU Depth V2#

NYU Depth V2 é o benchmark padrão para estimativa monocular de profundidade. É composto por sequências de vídeo RGB-D de uma grande variedade de cenas interiores, gravadas com um Microsoft Kinect v1. É o principal benchmark utilizado para reportar a precisão do YOLO26-Depth.

Explora o NYU Depth V2 na Ultralytics Platform para pré-visualizar os seus pares RGB-profundidade, consultar as estatísticas do dataset e cloná-lo para treino.

Principais funcionalidades#

  • Capturado com um sensor RGB-D Microsoft Kinect v1.
  • Abrange uma grande variedade de cenas interiores reais (casas, escritórios, salas de aula e espaços semelhantes).
  • Alcance de profundidade até aproximadamente 10 m, típico da captura RGB-D interior para consumidores.
  • A avaliação é realizada na divisão de teste Eigen padrão, composta por 654 imagens.
  • O principal benchmark para reportar a precisão da estimativa monocular de profundidade.

Função no YOLO26-Depth#

O NYU Depth V2 é o principal benchmark de avaliação zero-shot para a família YOLO26-Depth, e as métricas principais na página da tarefa de profundidade são reportadas com base nele. Os modelos YOLO26-Depth publicados não são treinados no NYU; embora o dataset inclua uma divisão de treino, esta não é utilizada e apenas são reportados os resultados de teste mantidos à parte.

A avaliação utiliza aumento de dados em tempo de teste (TTA) multiescala e com inversão horizontal, seguido de alinhamento de escala por mínimos quadrados logarítmicos entre os mapas de profundidade previstos e os mapas de ground truth antes do cálculo das métricas.

Resultados#

A tabela abaixo apresenta a precisão delta1 (percentagem de pixels dentro de um limiar de 1.25×; valores mais altos são melhores) na divisão de teste Eigen do NYU Depth V2, por tamanho do modelo.

Modelodelta1
YOLO26n-depth0.882
YOLO26s-depth0.855
YOLO26m-depth0.919
YOLO26l-depth0.927
YOLO26x-depth0.923

YAML do Conjunto de Dados#

Um arquivo YAML é usado para definir a configuração do dataset. Ele contém informações sobre os caminhos, as classes e outras informações relevantes do dataset.

ultralytics/cfg/datasets/nyu-depth.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── nyu-depth-png  ← downloads here (≈1.5 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images

# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.

# Classes
nc: 1
names:
  0: depth

channels: 3
depth_scale: 1000

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zip

Utilização#

Para avaliar um modelo YOLO26-Depth no benchmark NYU Depth V2, podes utilizar os seguintes trechos de código. Para obter uma lista abrangente dos argumentos disponíveis, consulta a página de Validação do modelo.

Exemplo de validação
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")

Modelos pré-treinados#

A família de modelos de profundidade YOLO26 é avaliada em modo zero-shot no benchmark NYU Depth V2. Estes modelos são transferidos automaticamente a partir da versão mais recente da Ultralytics, por exemplo o YOLO26x-depth da v8.4.0, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.

Citações e agradecimentos#

Se utilizares o dataset NYU Depth V2 no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:

Citação
@inproceedings{silberman2012indoor,
      title={Indoor Segmentation and Support Inference from RGBD Images},
      author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
      booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
      year={2012}
}

Gostaríamos de agradecer aos autores por criarem e manterem este recurso valioso para a comunidade de visão computacional.

Perguntas frequentes#

  • O NYU Depth V2 é o benchmark padrão de profundidade monocular em ambientes internos, com capturas RGB-D do Kinect v1 de residências, escritórios e salas de aula de até aproximadamente 10 m e uma divisão de teste Eigen de 654 imagens amplamente utilizada. As principais métricas do YOLO26-Depth na página da tarefa de estimativa de profundidade são relatadas nele.

  • Não. Os modelos lançados são avaliados em zero-shot, portanto, a divisão de treinamento do NYU não é utilizada e apenas os resultados dos testes mantidos em separado são relatados. Os números publicados utilizam aumento em tempo de teste multiescala e com inversão, seguido por alinhamento de escala de mínimos quadrados logarítmicos.

  • Execute yolo depth val data=nyu-depth.yaml model=yolo26x-depth.pt, ou utilize o exemplo em Python na seção Uso. O validador integrado utiliza inferência em escala única com alinhamento de mediana, portanto, suas pontuações são inferiores aos números de TTA em Resultados; consulte a página da tarefa para obter os valores reproduzíveis.

  • Explore o NYU Depth V2 na Plataforma Ultralytics para visualizar pares de RGB e profundidade, inspecionar estatísticas do conjunto de dados e clonar o conjunto de dados para treinamento na nuvem.

Comentários