Dataset de profundidad ETH3D#
ETH3D es un punto de referencia de multiestereo de alta resolución utilizado para la estimación de profundidad monocular. Proporciona datos de verdad terreno de escáner láser de calidad topográfica tanto en escenas de interior como de exterior.
Características clave#
- Verdad fundamental de profundidad de grado topográfico capturada con un escáner láser de alta precisión.
- Imágenes de alta resolución que cubren tanto escenas de interior como de exterior.
- Rango de profundidad de hasta aproximadamente 60 m.
- La evaluación se realiza sobre 423 imágenes.
- Un benchmark de estéreo multivista de alta calidad con una verdad fundamental densa y precisa.
Rol en YOLO26-Depth#
ETH3D es un benchmark de evaluación zero-shot para la familia YOLO26-Depth; los modelos publicados no están entrenados en él. Su mezcla de escenas de interior y exterior con una verdad fundamental de escáner láser precisa lo convierte en una prueba sólida de generalización entre dominios.
La evaluación utiliza aumento de datos durante la inferencia (TTA) a multiescala y con inversión horizontal, seguido de una alineación de escala log-mínimos cuadrados entre los mapas de profundidad predichos y los de verdad fundamental antes de calcular las métricas.
Resultados#
La tabla siguiente muestra la precisión de delta1 (porcentaje de píxeles dentro de un umbral de 1,25×, cuanto mayor sea, mejor) en las imágenes de evaluación de ETH3D según el tamaño del modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Evaluación#
ETH3D no se entrega con un archivo YAML de dataset incluido. Se evalúa a través de un script de evaluación dedicado que carga las imágenes y la verdad fundamental de profundidad de escáner láser de ETH3D, aplica el TTA estándar y la alineación de escala mediante logaritmos de mínimos cuadrados, y reporta las métricas de profundidad.
Uso#
ETH3D es un punto de referencia externo, por lo que los modelos normalmente se ejecutan con predict en sus imágenes. Para ver una lista completa de los argumentos disponibles, consulta la página de Predicción del modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")Modelos preentrenados#
La familia de profundidad YOLO26 se evalúa sin entrenamiento previo (zero-shot) en el punto de referencia ETH3D. Estos modelos se descargan automáticamente desde la última versión de Ultralytics, por ejemplo YOLO26x-depth a partir de v8.4.0, y abarcan una gama de tamaños (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisión y recursos.
Citas y agradecimientos#
Si utilizas el dataset ETH3D en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Queremos agradecer a los autores por crear y mantener este valioso recurso para la comunidad de visión por computador.