Bộ dữ liệu độ sâu NYU Depth V2#
NYU Depth V2 là bộ dữ liệu chuẩn trong nhà dành cho monocular depth estimation. Nó bao gồm các chuỗi video RGB-D về nhiều bối cảnh trong nhà khác nhau được ghi lại bằng thiết bị Microsoft Kinect v1. Đây là bộ dữ liệu chuẩn chính được sử dụng để báo cáo độ chính xác của YOLO26-Depth.
Tính năng chính#
- Được ghi lại bằng cảm biến RGB-D Microsoft Kinect v1.
- Bao gồm nhiều cảnh trong nhà thực tế đa dạng (nhà ở, văn phòng, lớp học và các không gian tương tự).
- Phạm vi độ sâu lên tới khoảng 10 m, điển hình cho việc thu thập dữ liệu RGB-D trong nhà của người tiêu dùng.
- Đánh giá được thực hiện trên tập kiểm tra Eigen tiêu chuẩn gồm 654 hình ảnh.
- Tiêu chuẩn đánh giá chính để báo cáo độ chính xác của ước tính độ sâu đơn hình.
Vai trò trong YOLO26-Depth#
NYU Depth V2 là tiêu chuẩn đánh giá zero-shot chính cho dòng sản phẩm YOLO26-Depth và các chỉ số tiêu đề trên trang tác vụ độ sâu đều được báo cáo dựa trên bộ dữ liệu này. Các model YOLO26-Depth được công bố không được huấn luyện trên NYU; mặc dù bộ dữ liệu bao gồm một tập huấn luyện (train split), nó không được sử dụng và chỉ kết quả kiểm tra trên tập dữ liệu chưa từng thấy (held-out test results) mới được báo cáo.
Việc đánh giá sử dụng TTA (test-time augmentation) đa quy mô và lật ngang, sau đó là căn chỉnh quy mô log-least-squares giữa bản đồ độ sâu dự đoán và ground truth trước khi tính toán các số liệu.
Kết quả#
Bảng dưới đây báo cáo độ chính xác của delta1 (tỷ lệ phần trăm các pixel nằm trong ngưỡng 1,25×, giá trị càng cao càng tốt) trên tập kiểm thử Eigen của NYU Depth V2 theo kích thước model.
| Mô hình | delta1 |
|---|---|
| YOLO26n-depth | 0.882 |
| YOLO26s-depth | 0.855 |
| YOLO26m-depth | 0.919 |
| YOLO26l-depth | 0.927 |
| YOLO26x-depth | 0.923 |
YAML tập dữ liệu#
Một tệp YAML (Yet Another Markup Language) được sử dụng để xác định cấu hình tập dữ liệu. Nó chứa thông tin về đường dẫn, các lớp và các thông tin liên quan khác của tập dữ liệu.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~silberman/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
# └── nyu-depth ← downloads here (≈1.5 GB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images
# Depth maps are paired .npy files (float32, meters) under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.
# Classes
nc: 1
names:
0: depth
channels: 3
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth.zipCách sử dụng#
Để đánh giá một model YOLO26-Depth trên bộ dữ liệu NYU Depth V2, bạn có thể sử dụng các đoạn mã sau. Để có danh sách toàn diện các tham số khả dụng, hãy tham khảo trang Validation của model.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Evaluate on the NYU Depth V2 benchmark
results = model.val(data="nyu-depth.yaml")Các model đã được tiền huấn luyện#
Họ model chiều sâu YOLO26 được đánh giá theo phương pháp zero-shot trên bộ dữ liệu NYU Depth V2. Các model này sẽ tự động tải xuống từ bản phát hành mới nhất của Ultralytics, ví dụ YOLO26x-depth từ v8.4.0, và bao gồm nhiều kích thước khác nhau (yolo26n/s/m/l/x-depth) để đáp ứng các yêu cầu khác nhau về độ chính xác và tài nguyên.
Trích dẫn và Ghi nhận#
Nếu bạn sử dụng bộ dữ liệu NYU Depth V2 trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:
@inproceedings{silberman2012indoor,
title={Indoor Segmentation and Support Inference from RGBD Images},
author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
year={2012}
}Chúng tôi xin ghi nhận các tác giả đã tạo ra và duy trì tài nguyên giá trị này cho cộng đồng computer vision.