Ultralytics YOLO27:

ETH3D 深度数据集#

ETH3D 是一个高分辨率多视图立体基准数据集,用于单目深度估计。它提供覆盖室内和室外场景的测量级激光扫描仪真值数据。

主要特性#

  • 使用高精度激光扫描仪采集的测量级深度真值数据。
  • 涵盖室内和室外场景的高分辨率图像。
  • 深度范围最高约为 60 米。
  • 评估在 423 张图像上进行。
  • 一个具有高质量和精确稠密真值数据的多视图立体基准数据集。

在 YOLO26-Depth 中的作用#

ETH3D 是 YOLO26-Depth 系列的零样本评估基准;已发布的模型未在该数据集上训练。其兼具室内和室外场景,并配有精确的激光扫描仪真值数据,因此能够有效测试跨域泛化能力。

评估采用多尺度和水平翻转测试时增强(TTA),然后在计算指标前,对预测深度图与真值深度图进行对数最小二乘尺度对齐。

结果#

下表按模型规模报告了 ETH3D 评估图像上的 delta1 准确率(1.25× 阈值内像素所占的百分比,数值越高越好)。

模型delta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

评估#

ETH3D 未随附数据集 YAML 文件。评估通过专用评估脚本进行,该脚本会加载 ETH3D 图像和激光扫描仪深度真值数据,应用标准 TTA 和对数最小二乘尺度对齐,并报告深度指标。

使用方法#

ETH3D 是一个外部基准数据集,因此通常使用 predict 在其图像上运行模型。如需查看可用参数的完整列表,请参阅模型的预测页面。

预测示例
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

预训练模型#

YOLO26 深度系列在 ETH3D 基准数据集上进行零样本评估。这些模型会从最新的 Ultralytics 版本自动下载,例如来自 v8.4.0 的 YOLO26x-depth,并提供多种规模(yolo26n/s/m/l/x-depth),以满足不同的精度和资源需求。

引用和致谢#

如果你在研究或开发工作中使用 ETH3D 数据集,请引用以下论文:

引用
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

我们谨此感谢创建和维护这一宝贵资源的作者,他们为计算机视觉社区作出了贡献。

常见问题#

  • ETH3D 是一个零样本评估基准。发布的 YOLO26-Depth 模型未在其上进行训练,因此其包含测绘级激光扫描仪深度的 423 张室内和室外图像可用于测量大约 60 米以内的跨域泛化能力。最大的模型 YOLO26x-depth 在此基准测试中达到了 0.953 的 delta1。

  • 没有。ETH3D 使用专用脚本进行评估,该脚本应用多尺度和翻转测试时增强,然后进行对数最小二乘尺度对齐。要自行在 ETH3D 图像上运行模型,请使用预测模式,如用法部分所示。

  • YOLO26-Depth 系列也在 NYU Depth V2Make3DiBims-1 以及 KITTI Eigen 划分上进行零样本评估,后者的训练驱动是预训练组合的一部分。深度估计任务页面总结了这五个基准的结果。

评论