Ultralytics YOLO27:

Conjunto de dados de profundidade Make3D#

Make3D é um benchmark clássico ao ar livre para estimativa monocular de profundidade. Ele contém imagens de cenas de campus associadas a dados de referência de profundidade capturados por um scanner a laser 3D personalizado e é amplamente utilizado para avaliar a generalização fora da distribuição.

Principais funcionalidades#

  • Dados de referência de profundidade capturados com um scanner a laser 3D personalizado.
  • Abrange cenas reais de campus ao ar livre.
  • Alcance de profundidade de até aproximadamente 70 m.
  • A avaliação é realizada no conjunto de teste padrão de 134 imagens.
  • Um benchmark clássico de generalização fora da distribuição.

Função no YOLO26-Depth#

Make3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados nele. Como conjunto ao ar livre fora da distribuição, é o benchmark mais difícil para todos os modelos, e os valores absolutos de delta1 são baixos em todos os casos, como esperado para este conjunto de dados.

A avaliação utiliza aumento de dados em tempo de teste (TTA) multiescala e com inversão horizontal, seguido de alinhamento de escala por mínimos quadrados logarítmicos entre os mapas de profundidade previstos e os mapas de ground truth antes do cálculo das métricas.

Resultados#

A tabela abaixo apresenta a precisão de delta1 (percentagem de píxeis dentro de um limiar de 1.25×; quanto maior, melhor) no conjunto de teste Make3D, por tamanho do modelo.

Modelodelta1
YOLO26n-depth0.307
YOLO26s-depth0.311
YOLO26m-depth0.293
YOLO26l-depth0.297
YOLO26x-depth0.299

Avaliação#

Make3D não é distribuído com um YAML de conjunto de dados incluído. A avaliação é realizada através de um script de avaliação dedicado que carrega as imagens Make3D e os dados de referência de profundidade do scanner a laser, aplica a TTA padrão e o alinhamento de escala por mínimos quadrados logarítmicos e apresenta as métricas de profundidade.

Utilização#

Make3D é um benchmark externo, portanto os modelos são normalmente executados com predict nas respetivas imagens. Para obter uma lista completa dos argumentos disponíveis, consulta a página de Predição do modelo.

Exemplo de predição
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")

Modelos pré-treinados#

A família de profundidade YOLO26 é avaliada em modo zero-shot no benchmark Make3D. Estes modelos são descarregados automaticamente a partir da versão mais recente do Ultralytics, por exemplo YOLO26x-depth a partir da v8.4.0, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.

Citações e agradecimentos#

Se utilizares o conjunto de dados Make3D no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:

Citação
@article{saxena2009make3d,
      title={Make3D: Learning 3D Scene Structure from a Single Still Image},
      author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
      journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
      year={2009}
}

Gostaríamos de agradecer aos autores por criarem e manterem este recurso valioso para a comunidade de visão computacional.

Perguntas frequentes#

  • O Make3D é uma referência externa de zero-shot e fora da distribuição de 134 imagens de campus com profundidade de scanner a laser personalizado até cerca de 70 m. Os modelos YOLO26-Depth lançados não são treinados nele, por isso mede quão bem eles generalizam para cenas externas desconhecidas.

  • O Make3D é o mais difícil das cinco referências de avaliação para cada modelo porque as suas cenas e estatísticas de profundidade diferem fortemente dos dados de treino. Valores absolutos de delta1 em torno de 0,3 são esperados para este conjunto de dados, e a comparação relativa entre os modelos é o que importa.

  • Não. O Make3D é avaliado com um script dedicado utilizando aumento de tempo de teste de multi-escala e inversão e alinhamento de escala de quadrados mínimos logarítmicos. Para executar um modelo em imagens do Make3D, usa o predict mode conforme mostrado na secção Usage.

Comentários