YOLO Vision 2026:

Conjunto de datos de profundidad Make3D#

Make3D es un benchmark clásico para exteriores enfocado en la monocular depth estimation. Contiene imágenes de escenas de campus combinadas con mapas de profundidad reales capturados por un escáner láser 3D personalizado, y se utiliza ampliamente para evaluar la generalización fuera de la distribución.

Características clave#

  • Verdad fundamental de profundidad capturada con un escáner láser 3D personalizado.
  • Cubre escenas exteriores reales de campus.
  • Rango de profundidad de hasta aproximadamente 70 m.
  • La evaluación se realiza en el conjunto de prueba estándar de 134 imágenes.
  • Un punto de referencia clásico de generalización fuera de la distribución.

Rol en YOLO26-Depth#

Make3D es un zero-shot evaluation benchmark para la familia YOLO26-Depth; los modelos publicados no se han entrenado en él. Al tratarse de un conjunto para exteriores fuera de la distribución, es el benchmark más difícil para todos los modelos, y los valores absolutos de delta1 son bajos en general, algo que se espera para este dataset.

La evaluación utiliza aumento de datos durante la inferencia (TTA) a multiescala y con inversión horizontal, seguido de una alineación de escala log-mínimos cuadrados entre los mapas de profundidad predichos y los de verdad fundamental antes de calcular las métricas.

Resultados#

La siguiente tabla muestra la precisión de delta1 (porcentaje de píxeles dentro de un umbral de 1,25×, cuanto mayor sea, mejor) en el conjunto de prueba de Make3D según el tamaño del modelo.

Modelodelta1
YOLO26n-depth0.307
YOLO26s-depth0.311
YOLO26m-depth0.293
YOLO26l-depth0.297
YOLO26x-depth0.299

Evaluación#

Make3D no se envía con un YAML de conjunto de datos incluido. Se evalúa a través de un script de evaluación dedicado que carga las imágenes de Make3D y la verdad fundamental de profundidad del escáner láser, aplica la TTA estándar y la alineación de escala log-least-squares, y reporta las métricas de profundidad.

Uso#

Make3D es un benchmark externo, por lo que los modelos se ejecutan normalmente con predict en sus imágenes. Para obtener una lista completa de los argumentos disponibles, consulta la página de Prediction del modelo.

Ejemplo de predicción
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")

Modelos preentrenados#

La familia de modelos de profundidad YOLO26 se evalúa en modo zero-shot en el benchmark Make3D. Estos modelos se descargan automáticamente desde la versión más reciente de Ultralytics, por ejemplo YOLO26x-depth a partir de v8.4.0, y abarcan una variedad de tamaños (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisión y recursos.

Citas y agradecimientos#

Si utilizas el conjunto de datos Make3D en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:

Cita
@article{saxena2009make3d,
      title={Make3D: Learning 3D Scene Structure from a Single Still Image},
      author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
      journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
      year={2009}
}

Queremos agradecer a los autores por crear y mantener este valioso recurso para la comunidad de visión por computador.

Comentarios