Link to this sectionConjunto de datos de profundidad Make3D#
Make3D es un punto de referencia clásico de exteriores para la estimación de profundidad monocular. Contiene imágenes de escenas de campus junto con la verdad fundamental de profundidad capturada por un escáner láser 3D personalizado, y se utiliza ampliamente para evaluar la generalización fuera de la distribución.
Link to this sectionCaracterísticas clave#
- Verdad fundamental de profundidad capturada con un escáner láser 3D personalizado.
- Cubre escenas exteriores reales de campus.
- Rango de profundidad de hasta aproximadamente 70 m.
- La evaluación se realiza en el conjunto de prueba estándar de 134 imágenes.
- Un punto de referencia clásico de generalización fuera de la distribución.
Link to this sectionRol en YOLO26-Depth#
Make3D es un punto de referencia de evaluación zero-shot para la familia YOLO26-Depth; los modelos publicados no están entrenados con él. Como conjunto de exteriores fuera de la distribución, es el punto de referencia más difícil para todos los modelos, y los valores absolutos de delta1 son bajos en general, lo cual es esperable para este conjunto de datos.
La evaluación utiliza aumento de datos durante el tiempo de inferencia (TTA) multiescala y de volteo horizontal, seguido de una alineación de escala mediante logaritmos de mínimos cuadrados entre los mapas de profundidad predichos y los de la verdad fundamental antes de calcular las métricas.
Link to this sectionResultados#
La siguiente tabla muestra la precisión delta1 (porcentaje de píxeles dentro de un umbral de 1.25×, cuanto más alto, mejor) en el conjunto de prueba de Make3D por tamaño de modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Link to this sectionEvaluación#
Make3D no se envía con un YAML de conjunto de datos incluido. Se evalúa a través de un script de evaluación dedicado que carga las imágenes de Make3D y la verdad fundamental de profundidad del escáner láser, aplica la TTA estándar y la alineación de escala log-least-squares, y reporta las métricas de profundidad.
Link to this sectionUso#
Make3D es un punto de referencia externo, por lo que los modelos normalmente se ejecutan con predict en sus imágenes. Para obtener una lista completa de los argumentos disponibles, consulta la página de Predicción del modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")Link to this sectionModelos preentrenados#
La familia de profundidad YOLO26 se evalúa zero-shot en el punto de referencia Make3D. Estos modelos se descargan automáticamente desde la última versión de Ultralytics, por ejemplo YOLO26x-depth de la v8.4.0, y abarcan una gama de tamaños (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisión y recursos.
Link to this sectionCitas y agradecimientos#
Si utilizas el conjunto de datos Make3D en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Nos gustaría agradecer a los autores por crear y mantener este valioso recurso para la comunidad de visión artificial.