Ultralytics YOLO27:

Dataset độ sâu NYU Depth V2#

NYU Depth V2 là benchmark trong nhà tiêu chuẩn cho ước tính độ sâu đơn mắt. Dataset này gồm các chuỗi video RGB-D về nhiều loại cảnh trong nhà, được ghi lại bằng Microsoft Kinect v1. Đây là benchmark chính được dùng để báo cáo độ chính xác của YOLO26-Depth.

Khám phá NYU Depth V2 trên Ultralytics Platform để xem trước các cặp RGB-độ sâu, kiểm tra thống kê dataset và sao chép dataset để huấn luyện.

Tính năng chính#

  • Được ghi lại bằng cảm biến RGB-D Microsoft Kinect v1.
  • Bao gồm nhiều cảnh trong nhà thực tế (nhà ở, văn phòng, lớp học và các không gian tương tự).
  • Phạm vi độ sâu lên đến khoảng 10 m, mức điển hình của thiết bị ghi hình RGB-D trong nhà dành cho người dùng phổ thông.
  • Đánh giá được thực hiện trên tập kiểm tra Eigen tiêu chuẩn gồm 654 ảnh.
  • Benchmark chính để báo cáo độ chính xác ước tính độ sâu đơn mắt.

Vai trò trong YOLO26-Depth#

NYU Depth V2 là benchmark đánh giá zero-shot chính cho dòng YOLO26-Depth, và các metric chính trên trang tác vụ độ sâu được báo cáo dựa trên dataset này. Các model YOLO26-Depth đã công bố không được huấn luyện trên NYU; mặc dù dataset có tập huấn luyện, tập này không được sử dụng và chỉ báo cáo kết quả trên tập kiểm tra được giữ riêng.

Quá trình đánh giá sử dụng augmentation kiểm thử đa tỷ lệ và lật ngang (TTA), sau đó căn chỉnh tỷ lệ theo phương pháp bình phương tối thiểu log giữa bản đồ độ sâu dự đoán và ground truth trước khi tính các metric.

Kết quả#

Bảng dưới đây báo cáo độ chính xác delta1 (tỷ lệ pixel nằm trong ngưỡng 1,25×; cao hơn là tốt hơn) trên tập kiểm tra Eigen của NYU Depth V2 theo kích thước model.

Modeldelta1
YOLO26n-depth0.882
YOLO26s-depth0.896
YOLO26m-depth0.921
YOLO26l-depth0.930
YOLO26x-depth0.933

YAML của dataset#

Tệp YAML được dùng để xác định cấu hình dataset. Tệp này chứa thông tin về đường dẫn, class và các thông tin liên quan khác của dataset.

ultralytics/cfg/datasets/nyu-depth.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# NYU Depth V2 dataset for monocular depth estimation
# Documentation: https://cs.nyu.edu/~fergus/datasets/nyu_depth_v2.html
# 795 train + 654 val (Eigen test split) images, 480x640, indoor scenes, depth in meters
# Example usage: yolo depth train data=nyu-depth.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── nyu-depth-png  ← downloads here (≈1.5 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: nyu-depth-png # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 795 images
val: images/val # val images (relative to 'path') 654 images

# Depth maps are paired uint16 millimeter PNGs under depth/<split>/, resolved by
# swapping '/images/' -> '/depth/' on each image path.

# Classes
nc: 1
names:
  0: depth

channels: 3
depth_scale: 1000

# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/nyu-depth-png.zip

Cách sử dụng#

Để đánh giá model YOLO26-Depth trên benchmark NYU Depth V2, bạn có thể dùng các đoạn code sau. Để xem danh sách đầy đủ các đối số hiện có, hãy tham khảo trang Validation model.

Ví dụ Validation
from ultralytics import YOLO

# Tải model
model = YOLO("yolo26x-depth.pt")  # tải model depth đã huấn luyện trước

# Đánh giá trên benchmark NYU Depth V2
results = model.val(data="nyu-depth.yaml")

Model được tiền huấn luyện#

Dòng model độ sâu YOLO26 được đánh giá zero-shot trên benchmark NYU Depth V2. Các model này tự động tải xuống khi sử dụng lần đầu từ bản phát hành tài nguyên v8.4.0 của Ultralytics, chẳng hạn như YOLO26x-depth, và có nhiều kích thước (yolo26n/s/m/l/x-depth) để đáp ứng các yêu cầu khác nhau về độ chính xác và tài nguyên.

Trích dẫn và lời cảm ơn#

Nếu sử dụng dataset NYU Depth V2 trong nghiên cứu hoặc công việc phát triển, vui lòng trích dẫn bài báo sau:

Trích dẫn
@inproceedings{silberman2012indoor,
      title={Indoor Segmentation and Support Inference from RGBD Images},
      author={Silberman, Nathan and Hoiem, Derek and Kohli, Pushmeet and Fergus, Rob},
      booktitle={Proceedings of the European Conference on Computer Vision (ECCV)},
      year={2012}
}

Chúng tôi xin ghi nhận công lao của các tác giả trong việc tạo và duy trì tài nguyên quý giá này cho cộng đồng thị giác máy tính.

Câu hỏi thường gặp#

  • NYU Depth V2 là benchmark độ sâu đơn mắt trong nhà tiêu chuẩn, gồm dữ liệu RGB-D ghi bằng Kinect v1 tại nhà ở, văn phòng và lớp học với phạm vi lên đến khoảng 10 m, cùng tập kiểm tra Eigen gồm 654 ảnh được sử dụng rộng rãi. Các metric chính của YOLO26-Depth được báo cáo trên dataset này tại trang tác vụ Ước tính độ sâu.

  • Không. Các model đã phát hành được đánh giá zero-shot, vì vậy tập huấn luyện NYU không được sử dụng và chỉ báo cáo kết quả trên tập kiểm tra được giữ riêng. Các số liệu đã công bố sử dụng tăng cường kiểm thử đa tỷ lệ và lật, sau đó căn chỉnh tỷ lệ bình phương tối thiểu trên log.

  • Chạy yolo depth val data=nyu-depth.yaml model=yolo26x-depth.pt hoặc sử dụng ví dụ Python trong phần Cách sử dụng. Bộ validator tích hợp sử dụng suy luận một tỷ lệ với căn chỉnh trung vị, vì vậy điểm số thấp hơn các con số TTA trong Kết quả; xem trang tác vụ để biết các giá trị có thể tái lập.

  • Khám phá NYU Depth V2 trên Ultralytics Platform để xem trước các cặp RGB-depth, kiểm tra thống kê dataset và sao chép dataset để huấn luyện trên cloud.

Bình luận