ImageNet(伪标签)深度数据集#
ImageNet(伪标签深度)数据集复用了 1,281,167 张没有真实深度标注的 ImageNet-1K 训练图像,并为每张图像配对了一张由 Depth Anything 3 教师模型生成的伪深度图,该教师模型结合了单目和度量检查点。该数据集仅用于知识蒸馏,以及利用 ImageNet 提供的场景和物体多样性。在约 219 万张图像的 YOLO26-Depth 预训练混合数据中,它是最大的单一数据源(约占 58%),加入它对室内跨域泛化起到了决定性作用。
主要特性#
- 1,281,167 张 ImageNet-1K 训练图像,涵盖非常广泛的物体、场景和环境。
- 没有真实深度标注:每个深度目标都是由一个 Depth Anything 3 教师模型生成的伪标签,并结合了(
DA3MONO-LARGE用于场景结构,DA3METRIC-LARGE用于度量尺度)。 - 仅用于知识蒸馏以及场景和物体多样性,而不是用作基准。
- 约 219 万张图像预训练混合数据中最大的单一数据源(约 58%),对室内跨域泛化起到了决定性作用。
- 没有验证集划分——验证仅在具有真实深度标注的数据集上进行。
数据集结构#
伪标签 ImageNet 数据源由 ImageNet-1K 训练图像组成,每张图像对应一张机器生成的深度图:
- 训练图像:1,281,167 张 ImageNet-1K 训练图像,是约 219 万张图像 YOLO26-Depth 预训练混合数据中最大的单一组成部分(约 58%)。
- 验证:无。此数据源没有验证集划分;YOLO26-Depth 验证仅使用 NYU Depth V2 和 KITTI Eigen 等具有真实深度标注的数据集。
伪标签的生成方式#
由于 ImageNet 发布时不包含深度标注,因此深度目标是在离线环境中生成的,而不是通过测量获得的。系统结合了两个 Depth Anything 3 检查点,一个用于场景结构,另一个用于绝对尺度:
- 每张 ImageNet 训练图像都会经过
depth-anything/DA3MONO-LARGE处理,该模型预测一张细节非常丰富的深度图,但其结果仅在未知的每图像尺度和偏移下定义;同时也会经过depth-anything/DA3METRIC-LARGE处理,后者的输出较为粗糙,但使用真实单位。 - 通过逐图像的稳健仿射拟合,将单目预测映射到度量预测
label = a * mono + b。因此,每个像素的细节都来自单目检查点,而度量检查点只设置两个标量,用于将深度图定位到米制尺度上。整个过程不涉及相机内参,因此无需标定即可为图像生成标签。 - 结果会按照 Ultralytics 深度数据集格式保存为 16 位毫米 PNG 文件,并通过文件主干名与源图像配对。
- 随后,这些伪标签图像对会作为更大训练混合数据的一个组成部分加入其中,学生 YOLO26-Depth 模型在真实深度标注数据源上训练的同时,学习匹配教师模型。
由于尺度来自预测而非测量,因此每张深度图都可能带有全局尺度误差。YOLO26-Depth 使用尺度不变对数(SILog)损失并结合梯度匹配进行训练,同时通过中值对齐进行验证,因此伪标签中的逐图像尺度偏移在很大程度上可以被吸收。
此伪标签数据源是用于预训练已发布 YOLO26-Depth 权重的内部混合训练配置的组成部分,不会作为独立下载提供。
在 YOLO26-Depth 中的作用#
此数据源贡献了 YOLO26-Depth 预训练数据的主体,以及最广泛的场景和物体多样性。通过在超过一百万张图像上蒸馏强大的 Depth Anything 3 教师模型,它将广泛的场景先验迁移到学生模型中。在实践中,加入该数据源对室内跨域泛化起到了决定性作用,帮助模型在真实深度标注训练分布之外的室内场景上也取得良好表现。
使用方法#
伪标签 ImageNet 数据并不是单独用于训练的;它作为组合深度混合数据的一个组成部分被使用,该混合数据由内部/实验 YAML 定义,而不是通过公开数据集下载获得。从概念上看,在这种混合数据上训练如下所示:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)预训练模型#
首次按名称引用时,预训练的 YOLO26-Depth 模型会自动从 Ultralytics v8.4.0 资源发布版本下载:
引用和致谢#
如果你在研究或开发工作中使用 ImageNet 数据集,请引用以下论文:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}我们谨此感谢 ImageNet 团队创建并维护该数据集,也感谢 Depth Anything 3 的作者提供用于生成伪深度标签的教师模型。
常见问题#
它复用了没有实测深度的 1,281,167 张 ImageNet-1K 训练图像,并为每张图像配对了一个由 Depth Anything 3 教师模型预测的深度图。它是大约 219 万张图像的 YOLO26-Depth 预训练混合集中最大的单一来源(约占 58%),纯粹用于知识蒸馏和场景多样性。
每张图像都会通过
DA3MONO-LARGE获取详细的相对结构,并通过DA3METRIC-LARGE获取公制尺度。逐图像的稳健仿射拟合将单目预测映射到公制预测上,结果以 16 位毫米 PNG 格式保存于 Ultralytics 深度格式中。详情请参阅伪标签的生成方式。不可以。该数据源是已发布的 YOLO26-Depth 权重背后的内部混合训练配置的一部分,不会作为独立下载分发。要构建类似的数据集,请使用深度教师模型为你自己的图像生成伪标签,并将其存储在标准深度布局中。