ETH3D 깊이 데이터셋#
ETH3D는 단안 깊이 추정에 사용되는 고해상도 다중 뷰 스테레오 벤치마크입니다. 실내와 실외 장면 모두에 대해 측량급 레이저 스캐너 ground truth를 제공합니다.
주요 기능#
- 고정밀 레이저 스캐너로 캡처한 측량급 깊이 ground truth입니다.
- 실내 및 실외 장면을 포함하는 고해상도 이미지입니다.
- 깊이 범위는 약 60m까지입니다.
- 423개의 이미지에서 평가가 수행됩니다.
- 정확하고 조밀한 ground truth를 제공하는 고품질 다중 뷰 스테레오 벤치마크입니다.
YOLO26-Depth에서의 역할#
ETH3D는 YOLO26-Depth 제품군을 위한 zero-shot 평가 벤치마크이며, 공개된 모델은 ETH3D로 학습되지 않았습니다. 정확한 레이저 스캐너 ground truth를 포함하는 실내 및 실외 장면의 조합을 통해 도메인 간 일반화 성능을 강력하게 테스트할 수 있습니다.
평가에는 멀티 스케일 및 수평 플립 테스트 시점 증강(TTA)이 사용되며, 지표를 계산하기 전에 예측 깊이 맵과 ground truth 깊이 맵 간에 로그 최소제곱 스케일 정렬을 수행합니다.
Results#
아래 표는 모델 크기별 ETH3D 평가 이미지에서 delta1 정확도(1.25× 임계값 이내에 있는 픽셀의 비율이며, 높을수록 좋음)를 보여줍니다.
| 모델 | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
평가#
ETH3D는 번들 데이터셋 YAML과 함께 제공되지 않습니다. ETH3D 이미지와 레이저 스캐너 깊이 ground truth를 로드하고, 표준 TTA 및 로그 최소제곱 스케일 정렬을 적용한 다음 깊이 지표를 보고하는 전용 평가 스크립트를 통해 평가됩니다.
사용법#
ETH3D는 외부 벤치마크이므로 일반적으로 해당 이미지에 predict을 사용하여 모델을 실행합니다. 사용 가능한 인자의 전체 목록은 모델 Prediction 페이지를 참조하십시오.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")사전 학습 모델#
YOLO26 깊이 제품군은 ETH3D 벤치마크에서 zero-shot 방식으로 평가됩니다. 이러한 모델은 최신 Ultralytics 릴리스에서 자동으로 다운로드되며, 예를 들어 v8.4.0의 YOLO26x-depth를 사용할 수 있습니다. 또한 서로 다른 정확도 및 리소스 요구 사항에 대응하도록 다양한 크기(yolo26n/s/m/l/x-depth)로 제공됩니다.
인용 및 감사의 글#
연구 또는 개발 작업에서 ETH3D 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오.
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}컴퓨터 비전 커뮤니티를 위해 이 귀중한 리소스를 제작하고 유지 관리해 주신 저자분들께 감사드립니다.
FAQ#
ETH3D는 제로샷 평가 벤치마크입니다. 공개된 YOLO26-Depth 모델은 이 데이터셋으로 학습되지 않았으므로, 측량 등급의 레이저 스캐너 깊이 정보를 포함한 423장의 실내 및 실외 이미지는 약 60m까지의 도메인 간 일반화 능력을 측정합니다. 가장 큰 모델인 YOLO26x-depth는 이 벤치마크에서 0.953의 delta1을 달성합니다.
아니요. ETH3D는 멀티스케일 및 플립 테스트 타임 증강(TTA)을 적용한 후 로그 최소 자승 스케일 정렬을 수행하는 전용 스크립트로 평가됩니다. 직접 ETH3D 이미지에서 모델을 실행하려면 Usage 섹션에 표시된 대로 predict mode를 사용하십시오.
YOLO26-Depth 패밀리는 NYU Depth V2, Make3D, iBims-1 및 사전 학습 믹스에 학습 드라이브가 포함된 KITTI Eigen 분할에서도 제로샷으로 평가됩니다. Depth Estimation task page에서 다섯 가지 모든 벤치마크의 결과를 요약해 볼 수 있습니다.