Jeu de données de profondeur NYU Depth V2#
NYU Depth V2 est le benchmark intérieur de référence pour l’estimation de profondeur monoculaire. Il se compose de séquences vidéo RGB-D représentant une grande variété de scènes intérieures, enregistrées avec un Microsoft Kinect v1. Il s’agit du benchmark principal utilisé pour communiquer la précision de YOLO26-Depth.
Explore NYU Depth V2 sur la plateforme Ultralytics pour prévisualiser ses paires RGB-profondeur, examiner les statistiques du jeu de données et le cloner pour l’entraînement.
Fonctionnalités clés#
- Capturé avec un capteur RGB-D Microsoft Kinect v1.
- Couvre une grande variété de scènes intérieures réelles (habitations, bureaux, salles de classe et espaces similaires).
- Plage de profondeurs allant jusqu’à environ 10 m, caractéristique des captures RGB-D intérieures grand public.
- L’évaluation est effectuée sur la partition de test Eigen standard de 654 images.
- Le benchmark principal pour communiquer la précision de l’estimation de profondeur monoculaire.
Rôle dans YOLO26-Depth#
NYU Depth V2 est le benchmark principal d’évaluation zero-shot pour la famille YOLO26-Depth, et les métriques principales de la page consacrée à la tâche de profondeur sont calculées sur celui-ci. Les modèles YOLO26-Depth publiés ne sont pas entraînés sur NYU ; bien que le jeu de données inclue une partition d’entraînement, celle-ci n’est pas utilisée et seuls les résultats sur le test mis de côté sont communiqués.
L’évaluation utilise une augmentation au moment du test multi-échelle et par retournement horizontal (TTA), suivie d’un alignement d’échelle par moindres carrés logarithmiques entre les cartes de profondeur prédites et celles de la vérité terrain avant le calcul des métriques.
Résultats#
Le tableau ci-dessous indique la précision delta1 (pourcentage de pixels situés dans un seuil de 1.25×, une valeur plus élevée étant préférable) sur la partition de test Eigen de NYU Depth V2, par taille de modèle.
| Modèle | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.855 |
| YOLO26m-depth | 0.919 |
| YOLO26l-depth | 0.927 |
| YOLO26x-depth | 0.923 |
YAML du jeu de données#
Un fichier YAML est utilisé pour définir la configuration du jeu de données. Il contient des informations sur les chemins du jeu de données, les classes et d'autres informations pertinentes.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth-png ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
depth_scale: 1000
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zipUtilisation#
Pour évaluer un modèle YOLO26-Depth sur le benchmark NYU Depth V2, tu peux utiliser les extraits de code suivants. Pour obtenir la liste complète des arguments disponibles, consulte la page Validation du modèle.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")Modèles préentraînés#
La famille de modèles de profondeur YOLO26 est évaluée en zero-shot sur le benchmark NYU Depth V2. Ces modèles sont téléchargés automatiquement depuis la dernière version d’Ultralytics, par exemple YOLO26x-depth depuis la version v8.4.0, et couvrent différentes tailles (yolo26n/s/m/l/x-depth) pour répondre à divers besoins en matière de précision et de ressources.
Citations et remerciements#
Si tu utilises le jeu de données NYU Depth V2 dans tes travaux de recherche ou de développement, cite l’article suivant :
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Nous souhaitons remercier les auteurs d'avoir créé et maintenu cette ressource précieuse pour la communauté de la vision par ordinateur.
FAQ#
NYU Depth V2 est le benchmark standard d'estimation de profondeur monoculaire en intérieur, avec des captures RGB-D Kinect v1 de maisons, de bureaux et de salles de classe jusqu'à environ 10 m et une division de test Eigen de 654 images largement utilisée. Les métriques phares de YOLO26-Depth sur la page de la tâche Depth Estimation sont rapportées sur NYU Depth V2.
Non. Les modèles publiés sont évalués en mode zéro-shot, de sorte que la division d'entraînement de NYU Depth V2 n'est pas utilisée et seuls les résultats des tests retenus sont rapportés. Les chiffres publiés utilisent une augmentation au moment du test multi-échelle et par retournement, suivie d'un alignement d'échelle par moindres carrés logarithmiques.
Explore NYU Depth V2 sur Ultralytics Platform pour prévisualiser des paires RGB-profondeur, inspecter les statistiques de NYU Depth V2 et cloner NYU Depth V2 pour l'entraînement dans le cloud.




Exécute
yolo depth val data=nyu-depth.yaml model=yolo26x-depth.pt, ou utilise l'exemple Python dans la section Usage. Le validateur intégré utilise une inférence à échelle unique avec un alignement médian, de sorte que ses scores sont inférieurs aux chiffres TTA dans Results ; consulte la page de la tâche pour obtenir les valeurs reproductibles.