YOLO Vision 2026:

ImageNet (伪标签) 深度数据集#

ImageNet(伪标注深度)数据集重复使用了 1,281,167 张没有真实深度的 ImageNet-1K 训练图像,并将每张图像与由 Depth Anything 3 教师模型生成的伪深度图配对,结合了其单目和度量检查点。它纯粹用于知识蒸馏以及利用 ImageNet 提供的场景和对象多样性。作为约 219 万张图像的 YOLO26-Depth 预训练混合集中的单一最大来源(约占 58%),加入它对于室内跨域泛化具有决定性作用。

主要特性#

  • 1,281,167 张 ImageNet-1K 训练图像,涵盖了极其广泛的对象、场景和上下文。
  • 无真实深度:每个深度目标都是由 Depth Anything 3 教师模型配对生成的伪标签(DA3MONO-LARGE 用于场景结构,DA3METRIC-LARGE 用于度量尺度)。
  • 纯粹用于知识蒸馏和场景/对象多样性,而非作为基准测试。
  • 它是约 219 万张图像预训练组合中最大的单一来源(约占 58%),对于室内跨域泛化具有决定性作用。
  • 无验证集 —— 验证仅在具有真实地面真值的数据集上进行。

数据集结构#

伪标签 ImageNet 来源由 ImageNet-1K 训练图像组成,每张图像对应一张机器生成的深度图:

  1. 训练图像:1,281,167 张 ImageNet-1K 训练图像,是约 219 万张图像 YOLO26-Depth 预训练组合中最大的单一组成部分(约占 58%)。
  2. 验证:无。该来源没有验证集;YOLO26-Depth 的验证仅使用 NYU Depth V2 和 KITTI Eigen 等具有真实地面真值的数据集。

伪标签的生成方式#

由于 ImageNet 发布时没有深度标注,深度目标是通过离线生成而不是测量产生的。组合了两个 Depth Anything 3 检查点,一个用于场景结构,另一个用于绝对尺度:

  1. 每张 ImageNet 训练图像都会通过 depth-anything/DA3MONO-LARGE(预测高度详细的深度图,但仅定义到未知的每图像尺度和平移)以及 depth-anything/DA3METRIC-LARGE(其输出较粗糙但在实际单位中)。
  2. 每张图像的稳健仿射拟合将单目预测映射到度量预测上,即 label = a * mono + b。因此,每个像素的细节都来自单目检查点,而度量检查点仅设置将地图放置在米轴上的两个标量。不涉及相机内参,因此可以对没有校准的图像进行标注。
  3. 结果保存为以米为单位的 .npy 数组,遵循 Ultralytics depth dataset format,并通过文件主干与源图像配对。这些地图存储为 float16 以将 128 万个文件的磁盘占用减半;数据集加载器在读取时将其转换回 float32,并且 float32 仍然是自定义深度数据集的记录格式。
  4. 这些伪标签对随后被作为更大训练组合的一个组成部分添加,学生 YOLO26-Depth 模型在这些数据上学习匹配教师模型,同时也在真实的地面真值数据源上进行训练。

由于尺度来自预测而不是测量,每个地图都可能带有全局尺度误差。YOLO26-Depth 使用尺度不变对数 (SILog) 损失加上梯度匹配进行训练,并使用中值对齐进行验证,因此伪标签中的每图像尺度偏移在很大程度上被吸收了。

该伪标签来源是内部混合训练配置的一个组成部分,该配置用于预训练已发布的 YOLO26-Depth 权重,不作为单独的下载包发布。

在 YOLO26-Depth 中的作用#

此来源贡献了 YOLO26-Depth 预训练数据的大部分以及最广泛的场景和对象多样性。通过在超过一百万张图像上蒸馏一个强大的 Depth Anything 3 教师模型,它将广泛的场景先验知识转移给学生模型。在实践中,加入它对于室内跨域泛化具有决定性作用,帮助模型在真实真实训练分布之外的室内场景中表现良好。

用法#

伪标签 ImageNet 数据不会被单独训练;它作为组合深度混合训练的一个组成部分被使用,该混合训练由内部/实验性 YAML 定义,而不是通过公开数据集下载。从概念上讲,在此类混合数据上进行训练的过程如下:

训练示例
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

预训练模型#

预训练的 YOLO26-Depth 模型在首次通过名称引用时从 Ultralytics v8.4.0 资产发布中自动下载:

引用与致谢#

如果你在研究或开发工作中使用 ImageNet 数据集,请引用以下论文:

引用
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

我们要感谢 ImageNet 团队创建和维护该数据集,并感谢 Depth Anything 3 的作者提供了用于生成伪深度标签的教师模型。

评论