ImageNet(伪标注)深度数据集#
ImageNet(伪标注深度)数据集复用了 1,281,167 张 ImageNet-1K 训练图像,这些图像没有深度真值;数据集为每张图像配上由 Depth Anything 3 教师模型生成的伪深度图,并结合其单目和度量检查点。该数据集仅用于知识蒸馏,以及利用 ImageNet 提供的场景和物体多样性。在约 2.19M 张图像的 YOLO26-Depth 预训练混合数据中,它是最大的单一数据源(约占 58%),对于提升室内跨域泛化能力至关重要。
主要功能#
- 1,281,167 张 ImageNet-1K 训练图像,涵盖范围广泛的物体、场景和上下文。
- 没有深度真值:每个深度目标都是由 Depth Anything 3 教师模型配对生成的伪标签(
DA3MONO-LARGE用于场景结构,DA3METRIC-LARGE用于度量尺度)。 - 仅用于知识蒸馏和场景/物体多样性,不用作基准。
- 它是约 ~2.19M 张图像的预训练混合数据中最大的单一数据源(约 ~58%),对于提升室内跨域泛化能力至关重要。
- 没有验证集划分——验证仅使用具有真实真值的数据集。
数据集结构#
伪标注 ImageNet 数据源由 ImageNet-1K 训练图像组成,每张图像配有一张机器生成的深度图:
- 训练图像:1,281,167 张 ImageNet-1K 训练图像,是约 ~2.19M 张图像的 YOLO26-Depth 预训练混合数据中最大的单一组成部分(约 ~58%)。
- 验证集:无。该数据源没有验证集划分;YOLO26-Depth 验证仅使用 NYU Depth V2 和 KITTI Eigen 等真实真值数据集。
伪标签的生成方式#
由于 ImageNet 不提供深度标注,深度目标是通过离线生成而非测量获得的。这里结合了两个 Depth Anything 3 检查点,一个用于场景结构,另一个用于绝对尺度:
- 每张 ImageNet 训练图像都会输入
depth-anything/DA3MONO-LARGE,该检查点会预测一张细节丰富的深度图,但图中的深度仅在未知的逐图尺度和平移下有定义;图像也会输入depth-anything/DA3METRIC-LARGE,其输出较为粗略,但采用真实单位。 - 通过逐图鲁棒仿射拟合,将单目预测映射到度量预测
label = a * mono + b。因此,所有逐像素细节都来自单目检查点,而度量检查点只负责确定两个标量,将深度图映射到米制坐标轴上。整个过程不涉及相机内参,因此无需相机标定的图像也可以进行标注。 - 结果会按照 Ultralytics 深度数据集格式保存为 16 位毫米 PNG,并使用文件名主干与源图像配对。
- 随后,伪标注图像对会作为一个组成部分加入更大的训练混合数据中;学生 YOLO26-Depth 模型一边学习匹配教师模型的输出,一边使用真实真值数据源进行训练。
由于尺度来自预测而非测量,每张深度图都可能存在全局尺度误差。YOLO26-Depth 使用尺度不变对数(SILog)损失和梯度匹配进行训练,并通过中值对齐进行验证,因此伪标签中的逐图尺度偏差大多可以被抵消。
该伪标注数据源是用于预训练已发布 YOLO26-Depth 权重的内部混合训练配置的一部分,不作为独立下载内容分发。
在 YOLO26-Depth 中的作用#
该数据源为 YOLO26-Depth 预训练提供了大部分数据,以及最多样化的场景和物体。通过在超过一百万张图像上蒸馏强大的 Depth Anything 3 教师模型,它将广泛的场景先验知识迁移给学生模型。实践证明,加入该数据源对于提升室内跨域泛化能力至关重要,可帮助模型在真实真值训练分布之外的室内场景中取得良好表现。
用法#
伪标注 ImageNet 数据不会单独用于训练,而是作为一个组成部分加入组合深度混合数据中;该混合数据由内部/实验用 YAML 定义,而不是通过公开数据集下载提供。从概念上讲,使用此类混合数据进行训练如下所示:
from ultralytics import YOLO
# 加载预训练的深度模型
model = YOLO("yolo26n-depth.pt")
# 使用组合深度混合数据训练(你自己的多数据源数据集 YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)预训练模型#
首次通过名称引用预训练 YOLO26-Depth 模型时,会从 Ultralytics v8.4.0 资源发布页自动下载:
引用与致谢#
如果你在研究或开发工作中使用 ImageNet 数据集,请引用以下论文:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}我们感谢 ImageNet 团队创建并维护该数据集,也感谢 Depth Anything 3 的作者提供用于生成伪深度标签的教师模型。
常见问题#
该数据集复用了 1,281,167 张 ImageNet-1K 训练图像,这些图像没有实测深度,并为每张图像配对一张由 Depth Anything 3 教师模型预测的深度图。它是约 219 万张图像的 YOLO26-Depth 预训练混合数据中占比最大的单一来源(约 58%),仅用于知识蒸馏和场景多样性提升。
每张图像都会经过
DA3MONO-LARGE,以获取详细的相对结构信息,并经过DA3METRIC-LARGE,以获取度量尺度。针对每张图像进行稳健仿射拟合,将单目预测映射到度量预测上,并将结果保存为 16 位毫米单位 PNG,格式为 Ultralytics 深度格式。详情请参阅伪标签的生成方式。不能。该数据源属于已发布 YOLO26-Depth 权重背后的内部混合训练配置,不会作为独立下载内容分发。如需构建类似的数据集,请使用深度教师模型为你自己的图像生成伪标签,并按标准深度布局存储。