Link to this sectionTập dữ liệu độ sâu Make3D#
Make3D là một benchmark ngoại cảnh kinh điển cho ước lượng độ sâu đơn ảnh. Nó bao gồm các hình ảnh cảnh quan khuôn viên trường học đi kèm với dữ liệu độ sâu thực tế (ground truth) được ghi lại bằng máy quét laser 3D tùy chỉnh, và được sử dụng rộng rãi để kiểm tra khả năng tổng quát hóa ngoài phân phối (out-of-distribution).
Link to this sectionTính năng chính#
- Độ sâu thực tế (ground truth) được ghi lại bằng máy quét laser 3D tùy chỉnh.
- Bao phủ các cảnh quan khuôn viên trường học ngoài trời thực tế.
- Phạm vi độ sâu lên đến khoảng 70 m.
- Việc đánh giá được thực hiện trên tập kiểm tra tiêu chuẩn gồm 134 hình ảnh.
- Một benchmark tổng quát hóa ngoài phân phối kinh điển.
Link to this sectionVai trò trong YOLO26-Depth#
Make3D là một benchmark đánh giá zero-shot cho họ mô hình YOLO26-Depth; các mô hình được công bố không được huấn luyện trên tập dữ liệu này. Là một tập dữ liệu ngoại cảnh ngoài phân phối, đây là benchmark khó nhất cho tất cả các mô hình, và các giá trị delta1 tuyệt đối thường thấp trên diện rộng, điều này hoàn toàn bình thường đối với tập dữ liệu này.
Việc đánh giá sử dụng TTA (test-time augmentation) đa quy mô và lật ngang, sau đó là căn chỉnh quy mô log-least-squares giữa bản đồ độ sâu dự đoán và ground truth trước khi tính toán các số liệu.
Link to this sectionKết quả#
Bảng dưới đây báo cáo độ chính xác delta1 (tỷ lệ phần trăm các điểm ảnh nằm trong ngưỡng 1.25×, càng cao càng tốt) trên tập kiểm tra Make3D theo kích thước mô hình.
| Mô hình | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Link to this sectionĐánh giá#
Make3D không đi kèm với một tập dữ liệu YAML đóng gói sẵn. Nó được đánh giá thông qua một tập lệnh đánh giá chuyên dụng, giúp tải các hình ảnh Make3D và dữ liệu độ sâu thực tế từ máy quét laser, áp dụng TTA tiêu chuẩn và căn chỉnh tỷ lệ log-least-squares, sau đó báo cáo các chỉ số độ sâu.
Link to this sectionCách sử dụng#
Make3D là một benchmark bên ngoài, vì vậy các mô hình thường được chạy bằng lệnh predict trên hình ảnh của nó. Để có danh sách đầy đủ các tham số khả dụng, hãy tham khảo trang Dự đoán (Prediction) của mô hình.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")Link to this sectionCác model đã được tiền huấn luyện#
Họ mô hình YOLO26 depth được đánh giá zero-shot trên benchmark Make3D. Các mô hình này tự động tải về từ phiên bản Ultralytics mới nhất, ví dụ YOLO26x-depth từ v8.4.0, và bao gồm nhiều kích thước (yolo26n/s/m/l/x-depth) cho các yêu cầu khác nhau về độ chính xác và tài nguyên.
Link to this sectionTrích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu Make3D trong nghiên cứu hoặc công việc phát triển của mình, vui lòng trích dẫn bài báo sau:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Chúng tôi xin ghi nhận các tác giả vì đã tạo ra và duy trì tài nguyên quý giá này cho cộng đồng thị giác máy tính.