Jeu de données de profondeur NYU Depth V2#
NYU Depth V2 est le benchmark d'intérieur standard pour l'estimation de profondeur monoculaire. Il se compose de séquences vidéo RGB-D d'une grande variété de scènes d'intérieur enregistrées avec un Microsoft Kinect v1. C'est le principal benchmark utilisé pour rapporter la précision de YOLO26-Depth.
Fonctionnalités clés#
- Capturé avec un capteur RGB-D Microsoft Kinect v1.
- Couvre une grande variété de scènes d'intérieur réelles (maisons, bureaux, salles de classe et espaces similaires).
- Portée de profondeur jusqu'à environ 10 m, typique de la capture RGB-D grand public en intérieur.
- L'évaluation est effectuée sur le split de test Eigen standard de 654 images.
- La référence principale pour rapporter la précision de l'estimation de profondeur monoculaire.
Rôle dans YOLO26-Depth#
NYU Depth V2 est la référence principale d'évaluation zero-shot pour la famille YOLO26-Depth, et les métriques principales sur la page de tâche de profondeur sont rapportées sur celui-ci. Les modèles YOLO26-Depth publiés ne sont pas entraînés sur NYU ; bien que le jeu de données inclue un split d'entraînement, il n'est pas utilisé et seuls les résultats de test mis de côté sont rapportés.
L'évaluation utilise une augmentation de données lors du test (TTA) multi-échelle et par retournement horizontal, suivie d'un alignement d'échelle par moindres carrés logarithmiques entre les cartes de profondeur prédites et la vérité terrain avant le calcul des métriques.
Résultats#
Le tableau ci-dessous indique la précision de delta1 (pourcentage de pixels dans un seuil de 1,25×, plus c'est élevé, mieux c'est) sur la division de test Eigen de NYU Depth V2 par taille de modèle.
| Modèle | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.855 |
| YOLO26m-depth | 0.919 |
| YOLO26l-depth | 0.927 |
| YOLO26x-depth | 0.923 |
YAML du jeu de données#
Un fichier YAML (Yet Another Markup Language) est utilisé pour définir la configuration du jeu de données. Il contient des informations sur les chemins, les classes et d'autres informations pertinentes du jeu de données.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired .npy files (float32, meters) under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth.zipUtilisation#
Pour évaluer un modèle YOLO26-Depth sur le benchmark NYU Depth V2, tu peux utiliser les extraits de code suivants. Pour une liste complète des arguments disponibles, consulte la page de Validation du modèle.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")Modèles pré-entraînés#
La famille de profondeur YOLO26 est évaluée en zero-shot sur le benchmark NYU Depth V2. Ces modèles se téléchargent automatiquement à partir de la dernière version d'Ultralytics, par exemple YOLO26x-depth à partir de v8.4.0, et couvrent une gamme de tailles (yolo26n/s/m/l/x-depth) pour différentes exigences de précision et de ressources.
Citations et remerciements#
Si tu utilises le jeu de données NYU Depth V2 dans tes travaux de recherche ou de développement, cite l'article suivant :
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Nous tenons à remercier les auteurs pour la création et la maintenance de cette ressource précieuse pour la communauté de la vision par ordinateur.