ETH3D 深度数据集#
ETH3D 是一个用于单目深度估计的高分辨率多视图立体视觉基准。它为室内和室外场景提供测量级激光扫描仪真值。
主要功能#
- 使用高精度激光扫描仪采集的测量级深度真值。
- 覆盖室内和室外场景的高分辨率图像。
- 深度范围最大约为 60 m。
- 使用 423 张图像进行评估。
- 具有准确稠密真值的高质量多视图立体视觉基准。
在 YOLO26-Depth 中的作用#
ETH3D 是 YOLO26-Depth 系列的零样本评估基准;已发布模型未在其上训练。该基准包含具有准确激光扫描仪真值的室内和室外场景,是检验跨领域泛化能力的有力测试。
评估使用多尺度和水平翻转测试时增强(TTA),随后在计算指标前对预测深度图和真值深度图进行对数最小二乘尺度对齐。
结果#
下表按模型尺寸报告 ETH3D 评估图像上的 delta1 准确率(像素值处于 1.25× 阈值内的比例,越高越好)。
| 模型 | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
评估#
ETH3D 不附带数据集 YAML 文件。评估通过专用评估脚本进行,该脚本会加载 ETH3D 图像和激光扫描仪深度真值,应用标准 TTA 和对数最小二乘尺度对齐,并报告深度指标。
用法#
ETH3D 是外部基准,因此通常使用 predict 对其图像运行模型。可在模型的预测页面查看所有可用参数。
from ultralytics import YOLO
# 加载模型
model = YOLO("yolo26x-depth.pt") # 加载预训练深度模型
# 预测 ETH3D 图像的深度
results = model.predict("path/to/eth3d/images")预训练模型#
YOLO26 深度系列在 ETH3D 基准上进行零样本评估。这些模型在首次使用时会从 Ultralytics v8.4.0 资源发布页自动下载,例如 YOLO26x-depth,并提供多种尺寸(yolo26n/s/m/l/x-depth),以满足不同的精度和资源需求。
引用与致谢#
如果你在研究或开发工作中使用 ETH3D 数据集,请引用以下论文:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}我们感谢作者为计算机视觉社区创建并维护这一宝贵资源。
常见问题#
ETH3D 是一个零样本评估基准。已发布的 YOLO26-Depth 模型没有在该基准上训练,因此其中 423 张室内和室外图像以及测量级激光扫描仪深度数据,可用于衡量模型在约 60 m 范围内的跨域泛化能力。最大型号 YOLO26x-depth 在此基准上的 delta1 达到 0.953。
YOLO26-Depth 系列还会在 NYU Depth V2、Make3D 和 iBims-1 上进行零样本评估,也会在 KITTI Eigen 划分上进行评估;该划分中的训练行程属于预训练混合数据的一部分。深度估计任务页面汇总了全部五个基准的结果。