Ultralytics YOLO27:

Bộ dữ liệu độ sâu ImageNet (Gán nhãn giả)#

Bộ dữ liệu ImageNet (độ sâu gán nhãn giả) tái sử dụng 1,281,167 ảnh huấn luyện ImageNet-1K không có độ sâu ground-truth và ghép mỗi ảnh với một bản đồ độ sâu giả do teacher Depth Anything 3 tạo ra, kết hợp các checkpoint đơn ảnh và metric của model. Bộ dữ liệu này chỉ được sử dụng cho chưng cất tri thức và khai thác sự đa dạng về cảnh cũng như đối tượng mà ImageNet cung cấp. Là nguồn đơn lẻ lớn nhất trong hỗn hợp pretraining YOLO26-Depth khoảng 2,19 triệu ảnh (xấp xỉ 58%), việc bổ sung nguồn này mang tính quyết định đối với khả năng khái quát hóa xuyên miền trong nhà.

Tính năng chính#

  • 1,281,167 ảnh huấn luyện ImageNet-1K bao phủ phạm vi rất rộng về đối tượng, cảnh và bối cảnh.
  • Không có độ sâu ground-truth: mọi target độ sâu đều là nhãn giả do teacher Depth Anything 3 tạo ra thông qua việc ghép cặp (DA3MONO-LARGE cho cấu trúc cảnh, DA3METRIC-LARGE cho tỷ lệ metric).
  • Chỉ được sử dụng cho chưng cất tri thức và sự đa dạng về cảnh/đối tượng, không phải làm benchmark.
  • Nguồn đơn lẻ lớn nhất trong hỗn hợp pretraining ~2,19 triệu ảnh (~58%), mang tính quyết định đối với khả năng khái quát hóa xuyên miền trong nhà.
  • Không có tập validation — việc validation chỉ được thực hiện trên các dataset có ground-truth thực.

Cấu trúc bộ dữ liệu#

Nguồn ImageNet được gán nhãn giả bao gồm các ảnh huấn luyện ImageNet-1K, với một bản đồ độ sâu do máy tạo cho mỗi ảnh:

  1. Ảnh huấn luyện: 1,281,167 ảnh huấn luyện ImageNet-1K, là thành phần đơn lẻ lớn nhất (~58%) trong hỗn hợp pretraining YOLO26-Depth khoảng ~2,19 triệu ảnh.
  2. Validation: không có. Nguồn này không có tập validation; validation của YOLO26-Depth chỉ sử dụng các dataset có ground-truth thực như NYU Depth V2 và KITTI Eigen.

Cách tạo nhãn giả#

Vì ImageNet được cung cấp mà không có annotation độ sâu, các target độ sâu được tạo offline thay vì đo trực tiếp. Hai checkpoint Depth Anything 3 được kết hợp, một checkpoint cho cấu trúc cảnh và một checkpoint cho tỷ lệ tuyệt đối:

  1. Mỗi ảnh huấn luyện ImageNet được đưa qua depth-anything/DA3MONO-LARGE, model dự đoán một bản đồ độ sâu có độ chi tiết cao nhưng chỉ được xác định đến một tỷ lệ và độ dịch chuyển chưa biết riêng cho từng ảnh, đồng thời được đưa qua depth-anything/DA3METRIC-LARGE, model có đầu ra thô hơn nhưng sử dụng đơn vị thực.
  2. Một phép fit affine robust riêng cho từng ảnh ánh xạ dự đoán đơn ảnh lên dự đoán metric, label = a * mono + b. Do đó, mọi chi tiết trên từng pixel đều đến từ checkpoint đơn ảnh, trong khi checkpoint metric chỉ thiết lập hai scalar để đặt bản đồ lên trục mét. Không cần đến intrinsic của camera, vì vậy có thể gán nhãn cho các ảnh không có calibration.
  3. Kết quả được lưu dưới dạng PNG millimeter 16-bit, tuân theo format dataset độ sâu của Ultralytics, và được ghép với ảnh nguồn bằng file stem.
  4. Các cặp được gán nhãn giả sau đó được thêm vào như một thành phần của hỗn hợp training lớn hơn, trong đó model student YOLO26-Depth học cách khớp với teacher đồng thời training trên các nguồn ground-truth thực.

Vì tỷ lệ đến từ một dự đoán thay vì phép đo, mỗi bản đồ có thể chứa sai số tỷ lệ toàn cục. YOLO26-Depth được training với loss log bất biến theo tỷ lệ (SILog), kết hợp với gradient matching, và validation bằng median alignment, nên độ lệch tỷ lệ theo từng ảnh trong các nhãn giả phần lớn được hấp thụ.

Nguồn được gán nhãn giả này là một thành phần của cấu hình mixed-training nội bộ dùng để pretrain các weight YOLO26-Depth được phát hành và không được phân phối dưới dạng bản tải xuống độc lập.

Vai trò trong YOLO26-Depth#

Nguồn này đóng góp phần lớn dữ liệu pretraining YOLO26-Depth cũng như sự đa dạng rộng nhất về cảnh và đối tượng. Bằng cách chưng cất một teacher Depth Anything 3 mạnh trên hơn một triệu ảnh, nguồn này truyền các prior rộng về cảnh vào student. Trên thực tế, việc bổ sung nguồn này mang tính quyết định đối với khả năng khái quát hóa xuyên miền trong nhà, giúp model hoạt động tốt trên các cảnh trong nhà nằm ngoài các phân phối training ground-truth thực.

Cách sử dụng#

Dữ liệu ImageNet được gán nhãn giả không được training riêng lẻ; dữ liệu này được sử dụng như một thành phần của hỗn hợp độ sâu kết hợp, được định nghĩa bằng YAML nội bộ/thử nghiệm thay vì một bản tải xuống dataset công khai. Về mặt khái niệm, training trên một hỗn hợp như vậy có dạng sau:

Ví dụ huấn luyện
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Các model đã tiền huấn luyện#

Các model YOLO26-Depth pretrained sẽ tự động tải xuống từ bản phát hành assets v8.4.0 của Ultralytics khi được tham chiếu lần đầu theo tên:

Trích dẫn và ghi nhận đóng góp#

Nếu sử dụng dataset ImageNet trong công việc nghiên cứu hoặc phát triển, vui lòng trích dẫn bài báo sau:

Trích dẫn
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Chúng tôi xin ghi nhận đóng góp của đội ngũ ImageNet trong việc tạo và duy trì dataset, cùng các tác giả của Depth Anything 3 đã cung cấp các model teacher được sử dụng để tạo các nhãn độ sâu giả.

FAQ#

  • Tập dữ liệu này tái sử dụng 1.281.167 ảnh huấn luyện ImageNet-1K vốn không có dữ liệu độ sâu đo đạc, và ghép nối mỗi ảnh với một bản đồ độ sâu do một mô hình giáo viên Depth Anything 3 dự đoán. Đây là nguồn dữ liệu lớn nhất trong tập huấn luyện trước YOLO26-Depth với khoảng 2,19 triệu ảnh (chiếm khoảng 58%) và được sử dụng hoàn toàn cho mục đích chưng cất kiến thức và đa dạng hóa cảnh.

  • Mỗi ảnh được xử lý qua DA3MONO-LARGE để lấy cấu trúc tương đối chi tiết và qua DA3METRIC-LARGE để lấy tỷ lệ theo hệ mét. Một phép khớp affine mạnh mẽ trên từng ảnh sẽ ánh xạ dự đoán đơn mắt sang dự đoán theo hệ mét, và kết quả được lưu dưới dạng tệp PNG milimet 16-bit theo Ultralytics depth format. Xem How the pseudo-labels are generated để biết thêm chi tiết.

  • Không. Nguồn này là một phần của cấu hình huấn luyện hỗn hợp nội bộ đằng sau trọng số YOLO26-Depth đã phát hành và không được phân phối dưới dạng bản tải xuống độc lập. Để xây dựng một tập dữ liệu tương tự, hãy tạo các nhãn giả cho ảnh của riêng bạn bằng một mô hình giáo viên độ sâu và lưu trữ chúng theo bố cục độ sâu tiêu chuẩn.

Những người đóng góp

Bình luận