Link to this sectionTập dữ liệu độ sâu ImageNet (được gán nhãn giả)#
Tập dữ liệu ImageNet (độ sâu được gán nhãn giả) tái sử dụng 1.281.167 ảnh huấn luyện ImageNet-1K, vốn không có dữ liệu độ sâu thực (ground-truth), và ghép mỗi ảnh với một bản đồ độ sâu giả do mô hình giáo viên Depth Anything V3 (đơn thị và hệ mét) tạo ra. Tập dữ liệu này được sử dụng thuần túy cho mục đích chưng cất tri thức cũng như tận dụng sự đa dạng về cảnh và vật thể mà ImageNet cung cấp. Là nguồn dữ liệu lớn nhất đơn lẻ trong hỗn hợp tiền huấn luyện YOLO26-Depth khoảng 2,19 triệu ảnh (chiếm khoảng 58%), việc bổ sung tập dữ liệu này đóng vai trò quyết định cho khả năng tổng quát hóa liên miền trong nhà.
Link to this sectionTính năng chính#
- 1.281.167 ảnh huấn luyện ImageNet-1K bao phủ phạm vi rất rộng các vật thể, cảnh quan và ngữ cảnh.
- Không có độ sâu thực (ground-truth): mỗi mục tiêu độ sâu là một nhãn giả được tạo bởi mô hình giáo viên Depth Anything V3 (đơn thị, hệ mét).
- Được sử dụng thuần túy cho mục đích chưng cất tri thức và tạo sự đa dạng về cảnh/vật thể, không dùng làm benchmark.
- Là nguồn đơn lẻ lớn nhất trong hỗn hợp tiền huấn luyện ~2,19 triệu ảnh (~58%), đóng vai trò quyết định cho khả năng tổng quát hóa liên miền trong nhà.
- Không có tập phân tách validation — việc đánh giá chỉ được thực hiện trên các tập dữ liệu có độ sâu thực (ground-truth).
Link to this sectionCấu trúc tập dữ liệu#
Nguồn ImageNet được gán nhãn giả bao gồm các ảnh huấn luyện ImageNet-1K với một bản đồ độ sâu do máy tạo ra cho mỗi ảnh:
- Ảnh huấn luyện: 1.281.167 ảnh huấn luyện ImageNet-1K, thành phần đơn lẻ lớn nhất (~58%) của hỗn hợp tiền huấn luyện YOLO26-Depth ~2,19 triệu ảnh.
- Validation: không có. Nguồn này không có tập phân tách validation; quy trình validation của YOLO26-Depth chỉ sử dụng các tập dữ liệu có độ sâu thực (ground-truth) như NYU Depth V2 và KITTI Eigen.
Link to this sectionCách các nhãn giả được tạo ra#
Vì ImageNet không đi kèm chú thích độ sâu, các mục tiêu độ sâu được tạo ngoại tuyến thay vì được đo đạc trực tiếp:
- Mỗi ảnh huấn luyện ImageNet được đưa qua một mô hình giáo viên Depth Anything V3 đã được tiền huấn luyện để dự đoán bản đồ độ sâu hệ mét cho từng pixel.
- Kết quả dự đoán từ giáo viên được lưu dưới dạng mảng
.npyfloat32 theo đơn vị mét, tuân thủ định dạng tập dữ liệu độ sâu Ultralytics, và được ghép cặp với ảnh nguồn theo tên tệp. - Các cặp được gán nhãn giả sau đó được thêm vào như một thành phần của hỗn hợp huấn luyện lớn hơn, nơi mô hình học sinh YOLO26-Depth học cách khớp với giáo viên trong khi vẫn huấn luyện trên các nguồn độ sâu thực (ground-truth).
Nguồn được gán nhãn giả này là một thành phần trong cấu hình huấn luyện hỗn hợp nội bộ được sử dụng để tiền huấn luyện các trọng số YOLO26-Depth đã phát hành và không được phân phối dưới dạng bản tải xuống độc lập.
Link to this sectionVai trò trong YOLO26-Depth#
Nguồn này đóng góp phần lớn dữ liệu tiền huấn luyện YOLO26-Depth và mang lại sự đa dạng phong phú nhất về cảnh và vật thể. Bằng cách chưng cất tri thức từ mô hình giáo viên Depth Anything V3 mạnh mẽ trên hơn một triệu ảnh, nó chuyển giao các thông tin tiền nghiệm về cảnh quan rộng lớn sang cho mô hình học sinh. Trong thực tế, việc bổ sung nó đã đóng vai trò quyết định cho khả năng tổng quát hóa liên miền trong nhà, giúp mô hình hoạt động hiệu quả trên các cảnh trong nhà nằm ngoài phân phối dữ liệu huấn luyện có độ sâu thực (ground-truth).
Link to this sectionCách sử dụng#
Dữ liệu ImageNet được gán nhãn giả không được huấn luyện riêng biệt; nó được tiêu thụ như một thành phần của hỗn hợp độ sâu kết hợp, được định nghĩa bởi một tệp YAML nội bộ/thử nghiệm thay vì tải xuống dưới dạng tập dữ liệu công khai. Về mặt khái niệm, việc huấn luyện trên hỗn hợp như vậy trông như sau:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionCác model đã được tiền huấn luyện#
Các mô hình YOLO26-Depth đã tiền huấn luyện tự động tải xuống từ bản phát hành tài nguyên v8.4.0 của Ultralytics khi được tham chiếu theo tên lần đầu tiên:
Link to this sectionTrích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu ImageNet trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Chúng tôi xin gửi lời cảm ơn đến đội ngũ ImageNet vì đã tạo và duy trì tập dữ liệu này, cũng như các tác giả của Depth Anything vì mô hình giáo viên đã được sử dụng để tạo ra các nhãn độ sâu giả.