Dataset di profondità NYU Depth V2#
NYU Depth V2 è il benchmark indoor standard per la stima monoculare della profondità. È composto da sequenze video RGB-D di un'ampia varietà di scene interne, registrate con una Microsoft Kinect v1. È il benchmark principale utilizzato per riportare l'accuratezza di YOLO26-Depth.
Esplora NYU Depth V2 sulla piattaforma Ultralytics per visualizzare in anteprima le coppie RGB-profondità, esaminare le statistiche del dataset e clonarlo per l'addestramento.
Funzionalità principali#
- Acquisito con un sensore RGB-D Microsoft Kinect v1.
- Comprende un'ampia varietà di scene indoor reali (case, uffici, aule e spazi simili).
- Portata della profondità fino a circa 10 m, tipica dell'acquisizione RGB-D indoor consumer.
- La valutazione viene eseguita sulla suddivisione di test Eigen standard di 654 immagini.
- Il benchmark principale per riportare l'accuratezza della stima monoculare della profondità.
Ruolo in YOLO26-Depth#
NYU Depth V2 è il benchmark principale di valutazione zero-shot per la famiglia YOLO26-Depth e le metriche principali sulla pagina dell'attività di profondità vengono riportate su questo dataset. I modelli YOLO26-Depth pubblicati non sono stati addestrati su NYU; sebbene il dataset includa una suddivisione di addestramento, questa non viene utilizzata e vengono riportati solo i risultati sul set di test tenuto da parte.
La valutazione usa un test-time augmentation (TTA) multi-scala e con ribaltamento orizzontale, seguito dall'allineamento della scala ai minimi quadrati in logaritmi tra le mappe di profondità predette e quelle ground truth, prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza delta1 (frazione di pixel entro una soglia di 1,25×; i valori più alti sono migliori) sulla suddivisione di test Eigen di NYU Depth V2, per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.896 |
| YOLO26m-depth | 0.921 |
| YOLO26l-depth | 0.930 |
| YOLO26x-depth | 0.933 |
YAML del dataset#
Per definire la configurazione del dataset si usa un file YAML. Contiene informazioni sui percorsi del dataset, sulle classi e su altri dettagli pertinenti.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth-png ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
depth_scale: 1000
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zipUtilizzo#
Per valutare un modello YOLO26-Depth sul benchmark NYU Depth V2, puoi utilizzare i seguenti frammenti di codice. Per un elenco completo degli argomenti disponibili, consulta la pagina Validazione del modello.
from ultralytics import YOLO
# Carica un modello
model = YOLO("yolo26x-depth.pt") # carica un modello di profondità preaddestrato
# Valuta sul benchmark NYU Depth V2
results = model.val(data="nyu-depth.yaml")Modelli preaddestrati#
La famiglia di modelli di profondità YOLO26 viene valutata zero-shot sul benchmark NYU Depth V2. Al primo utilizzo, questi modelli vengono scaricati automaticamente dalla release degli asset v8.4.0 di Ultralytics, ad esempio YOLO26x-depth, e sono disponibili in diverse dimensioni (yolo26n/s/m/l/x-depth) per soddisfare requisiti diversi di accuratezza e risorse.
Citazioni e ringraziamenti#
Se utilizzi il dataset NYU Depth V2 nella tua attività di ricerca o sviluppo, cita il seguente articolo:
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.
Domande frequenti#
NYU Depth V2 è il benchmark standard per la stima monoculare della profondità indoor, con acquisizioni RGB-D Kinect v1 di case, uffici e aule fino a circa 10 m e la suddivisione di test Eigen di 654 immagini, ampiamente utilizzata. Le metriche principali di YOLO26-Depth sono riportate nella pagina dell'attività di stima della profondità.
No. I modelli rilasciati vengono valutati zero-shot, quindi la suddivisione di addestramento NYU non viene utilizzata e vengono riportati solo i risultati sul set di test tenuto da parte. I valori pubblicati utilizzano l'aumento dei dati in fase di test con più scale e ribaltamenti, seguito dall'allineamento della scala ai minimi quadrati in scala logaritmica.
Esegui
yolo depth val data=nyu-depth.yaml model=yolo26x-depth.ptoppure usa l'esempio Python nella sezione Utilizzo. Il validatore integrato usa l'inferenza a scala singola con allineamento mediano, quindi i suoi punteggi sono inferiori ai valori TTA in Risultati; consulta la pagina dell'attività per i valori riproducibili.Esplora NYU Depth V2 su Ultralytics Platform per visualizzare in anteprima le coppie RGB-depth, esaminare le statistiche del dataset e clonare il dataset per l'addestramento nel cloud.



