ImageNet (伪标签) 深度数据集#
ImageNet(伪标注深度)数据集重复使用了 1,281,167 张没有真实深度的 ImageNet-1K 训练图像,并将每张图像与由 Depth Anything 3 教师模型生成的伪深度图配对,结合了其单目和度量检查点。它纯粹用于知识蒸馏以及利用 ImageNet 提供的场景和对象多样性。作为约 219 万张图像的 YOLO26-Depth 预训练混合集中的单一最大来源(约占 58%),加入它对于室内跨域泛化具有决定性作用。
主要特性#
- 1,281,167 张 ImageNet-1K 训练图像,涵盖了极其广泛的对象、场景和上下文。
- 无真实深度:每个深度目标都是由 Depth Anything 3 教师模型配对生成的伪标签(
DA3MONO-LARGE用于场景结构,DA3METRIC-LARGE用于度量尺度)。 - 纯粹用于知识蒸馏和场景/对象多样性,而非作为基准测试。
- 它是约 219 万张图像预训练组合中最大的单一来源(约占 58%),对于室内跨域泛化具有决定性作用。
- 无验证集 —— 验证仅在具有真实地面真值的数据集上进行。
数据集结构#
伪标签 ImageNet 来源由 ImageNet-1K 训练图像组成,每张图像对应一张机器生成的深度图:
- 训练图像:1,281,167 张 ImageNet-1K 训练图像,是约 219 万张图像 YOLO26-Depth 预训练组合中最大的单一组成部分(约占 58%)。
- 验证:无。该来源没有验证集;YOLO26-Depth 的验证仅使用 NYU Depth V2 和 KITTI Eigen 等具有真实地面真值的数据集。
伪标签的生成方式#
由于 ImageNet 发布时没有深度标注,深度目标是通过离线生成而不是测量产生的。组合了两个 Depth Anything 3 检查点,一个用于场景结构,另一个用于绝对尺度:
- 每张 ImageNet 训练图像都会通过
depth-anything/DA3MONO-LARGE(预测高度详细的深度图,但仅定义到未知的每图像尺度和平移)以及depth-anything/DA3METRIC-LARGE(其输出较粗糙但在实际单位中)。 - 每张图像的稳健仿射拟合将单目预测映射到度量预测上,即
label = a * mono + b。因此,每个像素的细节都来自单目检查点,而度量检查点仅设置将地图放置在米轴上的两个标量。不涉及相机内参,因此可以对没有校准的图像进行标注。 - 结果保存为以米为单位的
.npy数组,遵循 Ultralytics depth dataset format,并通过文件主干与源图像配对。这些地图存储为 float16 以将 128 万个文件的磁盘占用减半;数据集加载器在读取时将其转换回 float32,并且 float32 仍然是自定义深度数据集的记录格式。 - 这些伪标签对随后被作为更大训练组合的一个组成部分添加,学生 YOLO26-Depth 模型在这些数据上学习匹配教师模型,同时也在真实的地面真值数据源上进行训练。
由于尺度来自预测而不是测量,每个地图都可能带有全局尺度误差。YOLO26-Depth 使用尺度不变对数 (SILog) 损失加上梯度匹配进行训练,并使用中值对齐进行验证,因此伪标签中的每图像尺度偏移在很大程度上被吸收了。
该伪标签来源是内部混合训练配置的一个组成部分,该配置用于预训练已发布的 YOLO26-Depth 权重,不作为单独的下载包发布。
在 YOLO26-Depth 中的作用#
此来源贡献了 YOLO26-Depth 预训练数据的大部分以及最广泛的场景和对象多样性。通过在超过一百万张图像上蒸馏一个强大的 Depth Anything 3 教师模型,它将广泛的场景先验知识转移给学生模型。在实践中,加入它对于室内跨域泛化具有决定性作用,帮助模型在真实真实训练分布之外的室内场景中表现良好。
用法#
伪标签 ImageNet 数据不会被单独训练;它作为组合深度混合训练的一个组成部分被使用,该混合训练由内部/实验性 YAML 定义,而不是通过公开数据集下载。从概念上讲,在此类混合数据上进行训练的过程如下:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)预训练模型#
预训练的 YOLO26-Depth 模型在首次通过名称引用时从 Ultralytics v8.4.0 资产发布中自动下载:
引用与致谢#
如果你在研究或开发工作中使用 ImageNet 数据集,请引用以下论文:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}我们要感谢 ImageNet 团队创建和维护该数据集,并感谢 Depth Anything 3 的作者提供了用于生成伪深度标签的教师模型。