Conjunto de datos de profundidad ETH3D#
ETH3D es un benchmark de estéreo multivista y alta resolución que se utiliza para la estimación monocular de profundidad. Proporciona datos de referencia de precisión topográfica, capturados con escáner láser en escenas tanto interiores como exteriores.
Características principales#
- Datos de referencia de profundidad de precisión topográfica, capturados con un escáner láser de alta precisión.
- Imágenes de alta resolución que abarcan escenas tanto interiores como exteriores.
- Rango de profundidad de hasta aproximadamente 60 m.
- La evaluación se realiza con 423 imágenes.
- Un benchmark de estéreo multivista de gran calidad con datos de referencia densos y precisos.
Papel de YOLO26-Depth#
ETH3D es un benchmark de evaluación zero-shot para la familia YOLO26-Depth; los modelos publicados no se entrenan con este conjunto. Su combinación de escenas interiores y exteriores con datos de referencia precisos capturados con escáner láser lo convierte en una prueba exigente de generalización entre dominios.
La evaluación utiliza aumento de datos de prueba (TTA) multiescala y volteo horizontal, seguido de una alineación de escala por mínimos cuadrados en el dominio logarítmico entre los mapas de profundidad predichos y los de referencia, antes de calcular las métricas.
Resultados#
La siguiente tabla muestra la precisión delta1 (fracción de píxeles dentro de un umbral de 1,25×; cuanto más alta, mejor) en las imágenes de evaluación de ETH3D, por tamaño de modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Evaluación#
ETH3D no se distribuye con un YAML de conjunto de datos incluido. Se evalúa mediante un script específico que carga las imágenes de ETH3D y los datos de referencia de profundidad del escáner láser, aplica la TTA estándar y la alineación de escala por mínimos cuadrados en el dominio logarítmico, y presenta las métricas de profundidad.
Uso#
ETH3D es un benchmark externo, por lo que normalmente se ejecutan los modelos con predict sobre sus imágenes. Consulta la página de predicción del modelo para ver una lista completa de los argumentos disponibles.
from ultralytics import YOLO
# Cargar un modelo
model = YOLO("yolo26x-depth.pt") # cargar un modelo de profundidad preentrenado
# predecir la profundidad en imágenes de ETH3D
results = model.predict("path/to/eth3d/images")Modelos preentrenados#
La familia de modelos de profundidad YOLO26 se evalúa sin entrenamiento específico en el benchmark ETH3D. Estos modelos se descargan automáticamente la primera vez que se usan desde la versión de recursos v8.4.0 de Ultralytics, por ejemplo YOLO26x-depth, y están disponibles en varios tamaños (yolo26n/s/m/l/x-depth) para distintos requisitos de precisión y recursos.
Citas y agradecimientos#
Si utilizas el conjunto de datos ETH3D en tu investigación o trabajo de desarrollo, cita el siguiente artículo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Queremos agradecer a los autores la creación y el mantenimiento de este valioso recurso para la comunidad de visión artificial.
Preguntas frecuentes#
ETH3D es un benchmark de evaluación sin entrenamiento específico. Los modelos YOLO26-Depth publicados no se entrenan con él, por lo que sus 423 imágenes de interiores y exteriores, con datos de profundidad de un escáner láser de precisión topográfica, miden la generalización entre dominios hasta aproximadamente 60 m. El modelo más grande, YOLO26x-depth, alcanza un delta1 de 0,953 en este benchmark.
No. ETH3D se evalúa con un script específico que aplica aumento de datos de prueba en tiempo de inferencia con varias escalas y volteos, seguido de una alineación de escala por mínimos cuadrados en el dominio logarítmico. Para ejecutar tú mismo un modelo en imágenes de ETH3D, usa el modo de predicción, como se muestra en la sección Uso.
La familia YOLO26-Depth también se evalúa sin entrenamiento específico en NYU Depth V2, Make3D e iBims-1, y en la partición KITTI Eigen, cuyas secuencias de entrenamiento forman parte de la mezcla de preentrenamiento. La página de la tarea de estimación de profundidad resume los resultados de los cinco benchmarks.