Ultralytics YOLO27:

Dataset de profundidad ETH3D#

ETH3D es un benchmark de estéreo multivista de alta resolución utilizado para la estimación de profundidad monocular. Proporciona datos de referencia de profundidad de calidad topográfica obtenidos con escáner láser tanto en escenas interiores como exteriores.

Características principales#

  • Datos de referencia de profundidad de calidad topográfica capturados con un escáner láser de alta precisión.
  • Imágenes de alta resolución que cubren escenas tanto interiores como exteriores.
  • Rango de profundidad de hasta aproximadamente 60 m.
  • La evaluación se realiza en 423 imágenes.
  • Un benchmark de estéreo multivista de alta calidad con datos de referencia densos y precisos.

Papel en YOLO26-Depth#

ETH3D es un benchmark de evaluación zero-shot para la familia YOLO26-Depth; los modelos publicados no se han entrenado con él. Su combinación de escenas interiores y exteriores con datos de referencia precisos obtenidos mediante escáner láser lo convierte en una prueba exigente de generalización entre dominios.

La evaluación utiliza aumento de datos en tiempo de prueba (TTA) multiescala y con volteo horizontal, seguido de un alineamiento de escala por mínimos cuadrados logarítmicos entre los mapas de profundidad predichos y los de referencia antes de calcular las métricas.

Resultados#

La tabla siguiente muestra la precisión delta1 (porcentaje de píxeles dentro de un umbral de 1.25×; cuanto mayor, mejor) en las imágenes de evaluación de ETH3D según el tamaño del modelo.

Modelodelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Evaluación#

ETH3D no se distribuye con un archivo YAML de dataset incluido. Se evalúa mediante un script de evaluación específico que carga las imágenes de ETH3D y los datos de referencia de profundidad del escáner láser, aplica el TTA estándar y el alineamiento de escala por mínimos cuadrados logarítmicos, y muestra las métricas de profundidad.

Uso#

ETH3D es un benchmark externo, por lo que normalmente los modelos se ejecutan con predict en sus imágenes. Para consultar una lista completa de los argumentos disponibles, visita la página de Predicción del modelo.

Ejemplo de predicción
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

Modelos preentrenados#

La familia de modelos de profundidad YOLO26 se evalúa en modo zero-shot en el benchmark ETH3D. Estos modelos se descargan automáticamente desde la versión más reciente de Ultralytics; por ejemplo, YOLO26x-depth desde v8.4.0, y abarcan distintos tamaños (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisión y recursos.

Citas y agradecimientos#

Si utilizas el dataset ETH3D en tu trabajo de investigación o desarrollo, cita el siguiente artículo:

Cita
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Queremos agradecer a los autores la creación y el mantenimiento de este valioso recurso para la comunidad de visión por computador.

Preguntas frecuentes#

  • ETH3D es una referencia de evaluación sin entrenamiento previo. Los modelos YOLO26-Depth publicados no se han entrenado con este conjunto de datos, por lo que sus 423 imágenes de interiores y exteriores con profundidad medida mediante escáner láser de precisión topográfica evalúan la generalización entre dominios hasta aproximadamente 60 m. El modelo más grande, YOLO26x-depth, alcanza un delta1 de 0,953 en esta referencia.

  • No. ETH3D se evalúa con un script dedicado que aplica aumento de datos en el tiempo de inferencia con multi-escala e inversión, seguido de una alineación de escalas por mínimos cuadrados logarítmicos. Para ejecutar un modelo con imágenes de ETH3D por tu cuenta, utiliza el modo de predicción como se muestra en la sección de Uso.

  • La familia YOLO26-Depth también se evalúa sin entrenamiento previo en NYU Depth V2, Make3D y iBims-1, así como en la división KITTI Eigen, cuyas rutas de entrenamiento forman parte de la mezcla de preentrenamiento. La página de la tarea de estimación de profundidad resume los resultados de las cinco.

Comentarios