YOLO Vision 2026:

Tập dữ liệu độ sâu ImageNet (được gán nhãn giả)#

Bộ dữ liệu ImageNet (chiều sâu có nhãn giả) tái sử dụng 1.281.167 ảnh huấn luyện ImageNet-1K vốn không có độ sâu mặt đất thực tế (ground-truth depth), và ghép nối mỗi ảnh với bản đồ độ sâu giả do một mô hình giáo viên Depth Anything 3 tạo ra, kết hợp các checkpoint đơn mắt và metric của nó. Nó được sử dụng thuần túy cho quá trình chưng cất kiến thức và tận dụng độ đa dạng về cảnh vật cũng như đối tượng mà ImageNet cung cấp. Là nguồn đơn lẻ lớn nhất trong khoảng 2,19 triệu ảnh của hỗn hợp tiền huấn luyện YOLO26-Depth (khoảng 58%), việc bổ sung nguồn này mang tính quyết định đối với khả năng tổng quát hóa xuyên miền trong nhà.

Tính năng chính#

  • 1.281.167 ảnh huấn luyện ImageNet-1K bao phủ phạm vi rất rộng các vật thể, cảnh quan và ngữ cảnh.
  • Không có độ sâu mặt đất thực tế: mọi mục tiêu độ sâu đều là nhãn giả do mô hình giáo viên Depth Anything 3 tạo ra bằng cách kết hợp (DA3MONO-LARGE cho cấu trúc cảnh, DA3METRIC-LARGE cho tỷ lệ metric).
  • Được sử dụng thuần túy cho mục đích chưng cất tri thức và tạo sự đa dạng về cảnh/vật thể, không dùng làm benchmark.
  • Là nguồn đơn lẻ lớn nhất trong hỗn hợp tiền huấn luyện ~2,19 triệu ảnh (~58%), đóng vai trò quyết định cho khả năng tổng quát hóa liên miền trong nhà.
  • Không có tập phân tách validation — việc đánh giá chỉ được thực hiện trên các tập dữ liệu có độ sâu thực (ground-truth).

Cấu trúc tập dữ liệu#

Nguồn ImageNet được gán nhãn giả bao gồm các ảnh huấn luyện ImageNet-1K với một bản đồ độ sâu do máy tạo ra cho mỗi ảnh:

  1. Ảnh huấn luyện: 1.281.167 ảnh huấn luyện ImageNet-1K, thành phần đơn lẻ lớn nhất (~58%) của hỗn hợp tiền huấn luyện YOLO26-Depth ~2,19 triệu ảnh.
  2. Validation: không có. Nguồn này không có tập phân tách validation; quy trình validation của YOLO26-Depth chỉ sử dụng các tập dữ liệu có độ sâu thực (ground-truth) như NYU Depth V2 và KITTI Eigen.

Cách các nhãn giả được tạo ra#

Vì ImageNet đi kèm mà không có chú thích độ sâu, các mục tiêu độ sâu được tạo ngoại tuyến thay vì được đo đạc. Hai checkpoint Depth Anything 3 được kết hợp, một cho cấu trúc cảnh và một cho tỷ lệ tuyệt đối:

  1. Mỗi ảnh huấn luyện ImageNet được chạy qua depth-anything/DA3MONO-LARGE, mô hình này dự đoán bản đồ độ sâu cực kỳ chi tiết chỉ được xác định theo tỷ lệ và độ dịch chuyển ẩn cho mỗi ảnh, và qua depth-anything/DA3METRIC-LARGE, có đầu ra thô hơn nhưng theo đơn vị thực tế.
  2. Một phép khớp affine mạnh mẽ trên mỗi ảnh sẽ ánh xạ dự đoán đơn mắt sang dự đoán metric, label = a * mono + b. Do đó, mọi chi tiết trên mỗi pixel đều đến từ checkpoint đơn mắt, trong khi checkpoint metric chỉ thiết lập hai giá trị vô hướng để đặt bản đồ lên trục mét. Không có thông số nội tại camera nào liên quan, vì vậy các ảnh không có hiệu chuẩn vẫn có thể được gán nhãn.
  3. Kết quả được lưu dưới dạng ảnh PNG 16-bit tính bằng milimet, tuân theo định dạng tập dữ liệu độ sâu Ultralytics và được ghép nối với ảnh nguồn theo tên gốc của tệp.
  4. Các cặp được gán nhãn giả sau đó được thêm vào như một thành phần của hỗn hợp huấn luyện lớn hơn, nơi mô hình học sinh YOLO26-Depth học cách khớp với giáo viên trong khi vẫn huấn luyện trên các nguồn độ sâu thực (ground-truth).

Vì tỷ lệ đến từ một dự đoán thay vì một phép đo, mỗi bản đồ có thể mang sai số tỷ lệ toàn cục. YOLO26-Depth huấn luyện với hàm mất mát log bất biến tỷ lệ (SILog) cộng với việc khớp độ gradient và xác thực bằng căn chỉnh trung vị, do đó độ lệch tỷ lệ trên mỗi ảnh trong các nhãn giả sẽ phần lớn được hấp thụ.

Nguồn được gán nhãn giả này là một thành phần trong cấu hình huấn luyện hỗn hợp nội bộ được sử dụng để tiền huấn luyện các trọng số YOLO26-Depth đã phát hành và không được phân phối dưới dạng bản tải xuống độc lập.

Vai trò trong YOLO26-Depth#

Nguồn này đóng góp phần lớn dữ liệu tiền huấn luyện YOLO26-Depth và độ đa dạng phong phú nhất về cảnh vật cũng như đối tượng. Bằng cách chưng cất một mô hình giáo viên Depth Anything 3 mạnh mẽ trên hơn một triệu hình ảnh, nó truyền tải các tiền nghiệm cảnh rộng rãi sang mô hình học sinh. Trên thực tế, việc bổ sung nguồn này mang tính quyết định đối với khả năng tổng quát hóa xuyên miền trong nhà, giúp mô hình hoạt động tốt trên các cảnh trong nhà vượt ra ngoài phân phối huấn luyện mặt đất thực tế.

Cách sử dụng#

Dữ liệu ImageNet được gán nhãn giả không được huấn luyện riêng biệt; nó được tiêu thụ như một thành phần của hỗn hợp độ sâu kết hợp, được định nghĩa bởi một tệp YAML nội bộ/thử nghiệm thay vì tải xuống dưới dạng tập dữ liệu công khai. Về mặt khái niệm, việc huấn luyện trên hỗn hợp như vậy trông như sau:

Ví dụ về Training
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Các model đã được tiền huấn luyện#

Các model YOLO26-Depth đã được huấn luyện trước sẽ tự động tải xuống từ v8.4.0 assets release của Ultralytics khi được tham chiếu theo tên lần đầu tiên:

Trích dẫn và Ghi nhận#

Nếu bạn sử dụng tập dữ liệu ImageNet trong công việc nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:

Trích dẫn
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Chúng tôi xin gửi lời cảm ơn đến nhóm ImageNet vì đã tạo và duy trì bộ dữ liệu, cũng như các tác giả của Depth Anything 3 vì các mô hình giáo viên được sử dụng để tạo ra các nhãn độ sâu giả.

Người đóng góp

Bình luận