Bộ dữ liệu độ sâu ImageNet (Gán nhãn giả)#
Bộ dữ liệu ImageNet (độ sâu gán nhãn giả) sử dụng lại 1,281,167 ảnh huấn luyện ImageNet-1K vốn không có độ sâu ground truth, rồi ghép mỗi ảnh với một bản đồ độ sâu giả do teacher Depth Anything 3 tạo ra, kết hợp checkpoint đơn ảnh và metric của teacher. Bộ dữ liệu này chỉ được dùng cho chưng cất tri thức và khai thác sự đa dạng về cảnh vật, đối tượng mà ImageNet cung cấp. Là nguồn dữ liệu đơn lẻ lớn nhất trong hỗn hợp pretraining YOLO26-Depth khoảng 2.19M ảnh (khoảng 58%), việc bổ sung bộ dữ liệu này có tính quyết định đối với khả năng tổng quát hóa liên miền trong nhà.
Tính năng chính#
- 1,281,167 ảnh huấn luyện ImageNet-1K bao quát rất nhiều đối tượng, cảnh vật và bối cảnh.
- Không có độ sâu ground truth: mỗi mục tiêu độ sâu là một nhãn giả do teacher Depth Anything 3 tạo ra theo cặp (
DA3MONO-LARGEcho cấu trúc cảnh,DA3METRIC-LARGEcho tỷ lệ metric). - Chỉ dùng để chưng cất tri thức và khai thác sự đa dạng về cảnh vật/đối tượng, không dùng làm benchmark.
- Nguồn dữ liệu đơn lẻ lớn nhất trong hỗn hợp pretraining khoảng ~2.19M ảnh (~58%), có tính quyết định đối với khả năng tổng quát hóa liên miền trong nhà.
- Không có tập validation — việc xác thực chỉ được thực hiện trên các bộ dữ liệu thực có ground truth.
Cấu trúc dataset#
Nguồn ImageNet gán nhãn giả gồm các ảnh huấn luyện ImageNet-1K, mỗi ảnh đi kèm một bản đồ độ sâu do máy tạo:
- Ảnh huấn luyện: 1,281,167 ảnh huấn luyện ImageNet-1K, thành phần đơn lẻ lớn nhất (~58%) trong hỗn hợp pretraining YOLO26-Depth khoảng ~2.19M ảnh.
- Validation: không có. Nguồn này không có tập validation; quá trình xác thực YOLO26-Depth chỉ sử dụng các bộ dữ liệu thực có ground truth như NYU Depth V2 và KITTI Eigen.
Cách tạo nhãn giả#
Vì ImageNet không đi kèm chú giải độ sâu, các mục tiêu độ sâu được tạo ngoại tuyến thay vì đo đạc. Hai checkpoint Depth Anything 3 được kết hợp: một checkpoint cho cấu trúc cảnh và một checkpoint cho tỷ lệ tuyệt đối:
- Mỗi ảnh huấn luyện ImageNet được đưa qua
depth-anything/DA3MONO-LARGE, model dự đoán bản đồ độ sâu rất chi tiết nhưng chỉ xác định được đến một tỷ lệ và độ lệch chưa biết riêng cho từng ảnh, đồng thời được đưa quadepth-anything/DA3METRIC-LARGE, có đầu ra thô hơn nhưng sử dụng đơn vị thực. - Một phép khớp affine bền vững theo từng ảnh ánh xạ dự đoán đơn ảnh sang dự đoán metric
label = a * mono + b. Do đó, mọi chi tiết theo từng pixel đều đến từ checkpoint đơn ảnh, trong khi checkpoint metric chỉ xác định hai giá trị vô hướng để đặt bản đồ theo trục mét. Không cần thông số nội tại của camera, nên có thể gán nhãn cho ảnh chưa được hiệu chuẩn. - Kết quả được lưu thành ảnh PNG millimeter 16 bit theo định dạng bộ dữ liệu depth của Ultralytics và được ghép với ảnh nguồn dựa trên tên tệp không có phần mở rộng.
- Sau đó, các cặp ảnh gán nhãn giả được thêm vào làm một thành phần trong hỗn hợp huấn luyện lớn hơn, nơi model YOLO26-Depth student học cách khớp với teacher đồng thời được huấn luyện trên các nguồn dữ liệu thực có ground truth.
Vì tỷ lệ đến từ dự đoán chứ không phải phép đo, mỗi bản đồ có thể chứa sai số tỷ lệ toàn cục. YOLO26-Depth được huấn luyện bằng hàm mất mát log bất biến theo tỷ lệ (SILog) cùng với phương pháp khớp gradient và được xác thực bằng căn chỉnh median, nên độ lệch tỷ lệ theo từng ảnh trong nhãn giả phần lớn được hấp thụ.
Nguồn dữ liệu gán nhãn giả này là một thành phần trong cấu hình huấn luyện hỗn hợp nội bộ dùng để pretrain các trọng số YOLO26-Depth được phát hành và không được phân phối dưới dạng bản tải xuống độc lập.
Vai trò trong YOLO26-Depth#
Nguồn dữ liệu này đóng góp phần lớn dữ liệu pretraining YOLO26-Depth và mang lại sự đa dạng lớn nhất về cảnh vật, đối tượng. Bằng cách chưng cất một teacher Depth Anything 3 mạnh trên hơn một triệu ảnh, phương pháp này truyền các prior cảnh tổng quát sang student. Trên thực tế, việc bổ sung nguồn dữ liệu này có tính quyết định đối với khả năng tổng quát hóa liên miền trong nhà, giúp model hoạt động tốt trên các cảnh trong nhà nằm ngoài phân phối dữ liệu huấn luyện thực có ground truth.
Cách sử dụng#
Dữ liệu ImageNet gán nhãn giả không được huấn luyện riêng lẻ; dữ liệu được dùng như một thành phần của hỗn hợp depth kết hợp, được định nghĩa bằng YAML nội bộ/thử nghiệm chứ không phải bản tải xuống bộ dữ liệu công khai. Về mặt khái niệm, quá trình huấn luyện trên hỗn hợp như vậy có dạng như sau:
from ultralytics import YOLO
# Tải model độ sâu đã huấn luyện trước
model = YOLO("yolo26n-depth.pt")
# Huấn luyện trên hỗn hợp depth kết hợp (YAML bộ dữ liệu đa nguồn của riêng bạn)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Model được tiền huấn luyện#
Các model YOLO26-Depth được huấn luyện trước sẽ tự động tải xuống từ bản phát hành tài sản v8.4.0 của Ultralytics khi được tham chiếu lần đầu bằng tên:
Trích dẫn và lời cảm ơn#
Nếu sử dụng dataset ImageNet trong nghiên cứu hoặc công việc phát triển, vui lòng trích dẫn bài báo sau:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Chúng tôi xin ghi nhận đóng góp của nhóm ImageNet trong việc tạo và duy trì dataset, cũng như các tác giả của Depth Anything 3 đã cung cấp các model teacher dùng để tạo nhãn độ sâu giả.
Câu hỏi thường gặp#
Dataset này tái sử dụng 1.281.167 ảnh huấn luyện ImageNet-1K không có dữ liệu độ sâu đo được và ghép mỗi ảnh với một bản đồ độ sâu được dự đoán bởi model teacher Depth Anything 3. Đây là nguồn lớn nhất trong hỗn hợp tiền huấn luyện YOLO26-Depth gồm khoảng 2,19 triệu ảnh (khoảng 58%), và chỉ được dùng cho chưng cất tri thức và tăng tính đa dạng của cảnh.
Mỗi ảnh được đưa qua
DA3MONO-LARGEđể lấy cấu trúc tương đối chi tiết vàDA3METRIC-LARGEđể lấy tỷ lệ theo đơn vị thực. Phép khớp affine bền vững theo từng ảnh ánh xạ dự đoán đơn mắt lên dự đoán theo đơn vị thực, sau đó kết quả được lưu thành ảnh PNG 16-bit tính theo milimét theo định dạng độ sâu Ultralytics. Xem Cách tạo nhãn giả để biết thêm chi tiết.Không. Nguồn này là một phần của cấu hình huấn luyện kết hợp nội bộ dùng cho các trọng số YOLO26-Depth đã phát hành và không được phân phối để tải xuống riêng. Để tạo một bộ dữ liệu tương tự, hãy tạo nhãn giả cho ảnh của riêng bạn bằng model teacher độ sâu và lưu chúng theo cấu trúc độ sâu tiêu chuẩn.