Conjunto de dados de profundidade Make3D#
Make3D é um benchmark clássico ao ar livre para estimativa monocular de profundidade. Ele contém imagens de cenas de campus associadas a dados de referência de profundidade capturados por um scanner a laser 3D personalizado e é amplamente utilizado para avaliar a generalização fora da distribuição.
Principais funcionalidades#
- Dados de referência de profundidade capturados com um scanner a laser 3D personalizado.
- Abrange cenas reais de campus ao ar livre.
- Alcance de profundidade de até aproximadamente 70 m.
- A avaliação é realizada no conjunto de teste padrão de 134 imagens.
- Um benchmark clássico de generalização fora da distribuição.
Função no YOLO26-Depth#
Make3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados nele. Como conjunto ao ar livre fora da distribuição, é o benchmark mais difícil para todos os modelos, e os valores absolutos de delta1 são baixos em todos os casos, como esperado para este conjunto de dados.
A avaliação utiliza aumento de dados em tempo de teste (TTA) multiescala e com inversão horizontal, seguido de alinhamento de escala por mínimos quadrados logarítmicos entre os mapas de profundidade previstos e os mapas de ground truth antes do cálculo das métricas.
Resultados#
A tabela abaixo apresenta a precisão de delta1 (percentagem de píxeis dentro de um limiar de 1.25×; quanto maior, melhor) no conjunto de teste Make3D, por tamanho do modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Avaliação#
Make3D não é distribuído com um YAML de conjunto de dados incluído. A avaliação é realizada através de um script de avaliação dedicado que carrega as imagens Make3D e os dados de referência de profundidade do scanner a laser, aplica a TTA padrão e o alinhamento de escala por mínimos quadrados logarítmicos e apresenta as métricas de profundidade.
Utilização#
Make3D é um benchmark externo, portanto os modelos são normalmente executados com predict nas respetivas imagens. Para obter uma lista completa dos argumentos disponíveis, consulta a página de Predição do modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")Modelos pré-treinados#
A família de profundidade YOLO26 é avaliada em modo zero-shot no benchmark Make3D. Estes modelos são descarregados automaticamente a partir da versão mais recente do Ultralytics, por exemplo YOLO26x-depth a partir da v8.4.0, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.
Citações e agradecimentos#
Se utilizares o conjunto de dados Make3D no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Gostaríamos de agradecer aos autores por criarem e manterem este recurso valioso para a comunidade de visão computacional.
Perguntas frequentes#
O Make3D é uma referência externa de zero-shot e fora da distribuição de 134 imagens de campus com profundidade de scanner a laser personalizado até cerca de 70 m. Os modelos YOLO26-Depth lançados não são treinados nele, por isso mede quão bem eles generalizam para cenas externas desconhecidas.
O Make3D é o mais difícil das cinco referências de avaliação para cada modelo porque as suas cenas e estatísticas de profundidade diferem fortemente dos dados de treino. Valores absolutos de delta1 em torno de 0,3 são esperados para este conjunto de dados, e a comparação relativa entre os modelos é o que importa.
Não. O Make3D é avaliado com um script dedicado utilizando aumento de tempo de teste de multi-escala e inversão e alinhamento de escala de quadrados mínimos logarítmicos. Para executar um modelo em imagens do Make3D, usa o predict mode conforme mostrado na secção Usage.