YOLO Vision 2026:

Conjunto de dados de profundidade Make3D#

Make3D é um benchmark externo clássico para estimativa de profundidade monocular. Ele contém imagens de cenas de campus combinadas com dados reais de profundidade capturados por um scanner a laser 3D personalizado, sendo amplamente utilizado para testar a generalização fora da distribuição.

Principais recursos#

  • Profundidade ground truth capturada com um scanner a laser 3D personalizado.
  • Cobre cenas reais de campus ao ar livre.
  • Alcance de profundidade de aproximadamente até 70 m.
  • A avaliação é realizada no conjunto de teste padrão de 134 imagens.
  • Um benchmark clássico de generalização fora da distribuição.

Papel no YOLO26-Depth#

O Make3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados nele. Como um conjunto externo ao ar livre fora da distribuição, é o benchmark mais difícil para todos os modelos, e os valores absolutos de delta1 são baixos em geral, o que é esperado para este conjunto de dados.

A avaliação utiliza aumento de dados no momento do teste (TTA) de múltiplas escalas e inversão horizontal, seguido por alinhamento de escala de log-mínimos quadrados entre os mapas de profundidade previstos e os de referência antes que as métricas sejam calculadas.

Resultados#

A tabela abaixo apresenta a precisão de delta1 (porcentagem de pixels dentro de um limite de 1,25×, sendo maior o melhor) no conjunto de teste do Make3D por tamanho de modelo.

Modelodelta1
YOLO26n-depth0.307
YOLO26s-depth0.311
YOLO26m-depth0.293
YOLO26l-depth0.297
YOLO26x-depth0.299

Avaliação#

O Make3D não é fornecido com um YAML de conjunto de dados incluído. Ele é avaliado por meio de um script de avaliação dedicado que carrega as imagens do Make3D e a profundidade ground truth do scanner a laser, aplica o TTA padrão e o alinhamento de escala log-least-squares, e reporta as métricas de profundidade.

Uso#

O Make3D é um benchmark externo, portanto, os modelos geralmente são executados com predict em suas imagens. Para obter uma lista abrangente de argumentos disponíveis, consulte a página de Previsão do modelo.

Exemplo de Previsão
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")

Modelos pré-treinados#

A família de profundidade YOLO26 é avaliada no modo zero-shot no benchmark Make3D. Esses modelos são baixados automaticamente a partir do lançamento mais recente da Ultralytics, por exemplo, YOLO26x-depth a partir da v8.4.0, e abrangem uma variedade de tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.

Citações e Agradecimentos#

Se você usar o conjunto de dados Make3D em seu trabalho de pesquisa ou desenvolvimento, por favor cite o seguinte artigo:

Citação
@article{saxena2009make3d,
      title={Make3D: Learning 3D Scene Structure from a Single Still Image},
      author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
      journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
      year={2009}
}

Gostaríamos de agradecer aos autores pela criação e manutenção deste recurso valioso para a comunidade de visão computacional.

Comentários