Tập dữ liệu độ sâu Make3D#
Make3D là một benchmark ngoài trời kinh điển cho ước lượng độ sâu một mắt. Nó chứa các hình ảnh cảnh khuôn viên trường học được ghép nối với dữ liệu mặt nạ độ sâu thực tế (ground truth) được thu thập bằng một máy quét laser 3D tùy chỉnh, và được sử dụng rộng rãi để kiểm tra khả năng tổng quát hóa ngoài phân phối (out-of-distribution).
Tính năng chính#
- Độ sâu thực tế (ground truth) được ghi lại bằng máy quét laser 3D tùy chỉnh.
- Bao phủ các cảnh quan khuôn viên trường học ngoài trời thực tế.
- Phạm vi độ sâu lên đến khoảng 70 m.
- Việc đánh giá được thực hiện trên tập kiểm tra tiêu chuẩn gồm 134 hình ảnh.
- Một benchmark tổng quát hóa ngoài phân phối kinh điển.
Vai trò trong YOLO26-Depth#
Make3D là một benchmark đánh giá zero-shot cho dòng YOLO26-Depth; các model được công bố không được huấn luyện trên tập này. Là một tập dữ liệu ngoài trời ngoài phân phối, đây là benchmark khó nhất cho tất cả các model, và các giá trị delta1 tuyệt đối đều thấp trên diện rộng, điều này là dự kiến đối với dataset này.
Việc đánh giá sử dụng TTA (test-time augmentation) đa quy mô và lật ngang, sau đó là căn chỉnh quy mô log-least-squares giữa bản đồ độ sâu dự đoán và ground truth trước khi tính toán các số liệu.
Kết quả#
Bảng dưới đây báo cáo độ chính xác delta1 (tỷ lệ phần trăm các pixel nằm trong ngưỡng 1.25×, giá trị càng cao càng tốt) trên tập kiểm tra Make3D theo kích thước model.
| Mô hình | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Đánh giá#
Make3D không đi kèm với một tập dữ liệu YAML đóng gói sẵn. Nó được đánh giá thông qua một tập lệnh đánh giá chuyên dụng, giúp tải các hình ảnh Make3D và dữ liệu độ sâu thực tế từ máy quét laser, áp dụng TTA tiêu chuẩn và căn chỉnh tỷ lệ log-least-squares, sau đó báo cáo các chỉ số độ sâu.
Cách sử dụng#
Make3D là một benchmark bên ngoài, vì vậy các model thường được chạy với predict trên các hình ảnh của nó. Để có danh sách đầy đủ các tham số có sẵn, hãy tham khảo trang Dự đoán của model.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")Các model đã được tiền huấn luyện#
Dòng model độ sâu YOLO26 được đánh giá zero-shot trên benchmark Make3D. Các model này tự động tải xuống từ bản phát hành Ultralytics mới nhất, ví dụ YOLO26x-depth từ v8.4.0, và bao gồm nhiều kích thước khác nhau (yolo26n/s/m/l/x-depth) cho các yêu cầu về độ chính xác và tài nguyên khác nhau.
Trích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu Make3D trong nghiên cứu hoặc công việc phát triển của mình, vui lòng trích dẫn bài báo sau:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Chúng tôi xin ghi nhận các tác giả đã tạo ra và duy trì tài nguyên giá trị này cho cộng đồng computer vision.