Ultralytics YOLO27:

Conjunto de dados de profundidade ETH3D#

ETH3D é um benchmark de estéreo multivista em alta resolução usado para estimativa monocular de profundidade. Ele fornece ground truth de nível topográfico, obtido com scanner a laser, para cenas internas e externas.

Principais funcionalidades#

  • Ground truth de profundidade de nível topográfico, capturado com um scanner a laser de alta precisão.
  • Imagens de alta resolução que abrangem cenas internas e externas.
  • Faixa de profundidade de até aproximadamente 60 m.
  • A avaliação é realizada em 423 imagens.
  • Um benchmark de estéreo multivista de alta qualidade, com ground truth denso e preciso.

Papel no YOLO26-Depth#

O ETH3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados com ele. A combinação de cenas internas e externas com ground truth preciso obtido por scanner a laser o torna um teste rigoroso de generalização entre domínios.

A avaliação usa aumento de dados de teste (TTA) com várias escalas e inversão horizontal, seguido de alinhamento de escala por mínimos quadrados em log entre os mapas de profundidade previstos e os de ground truth antes do cálculo das métricas.

Resultados#

A tabela abaixo apresenta a precisão delta1 (fração de pixels dentro de um limite de 1,25×; quanto maior, melhor) nas imagens de avaliação ETH3D, por tamanho de modelo.

Modelodelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Avaliação#

O ETH3D não é fornecido com um arquivo YAML de conjunto de dados incluído. A avaliação é feita por meio de um script dedicado, que carrega as imagens ETH3D e o ground truth de profundidade obtido por scanner a laser, aplica a TTA padrão e o alinhamento de escala por mínimos quadrados em log e apresenta as métricas de profundidade.

Uso#

O ETH3D é um benchmark externo; portanto, os modelos geralmente são executados com predict nas imagens dele. Para ver a lista completa de argumentos disponíveis, consulte a página de predição do modelo.

Exemplo de predição
from ultralytics import YOLO

# Carregar um modelo
model = YOLO("yolo26x-depth.pt")  # carregar um modelo de profundidade pré-treinado

# Prever profundidade em imagens ETH3D
results = model.predict("path/to/eth3d/images")

Modelos pré-treinados#

A família de modelos de profundidade YOLO26 é avaliada sem treinamento específico no benchmark ETH3D. Esses modelos são baixados automaticamente na primeira utilização a partir da versão de assets v8.4.0 do Ultralytics, por exemplo, YOLO26x-depth, e abrange vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.

Citações e agradecimentos#

Se usares o conjunto de dados ETH3D na tua pesquisa ou no teu trabalho de desenvolvimento, cita o seguinte artigo:

Citação
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Agradecemos aos autores por criarem e manterem este valioso recurso para a comunidade de visão computacional.

Perguntas frequentes#

  • O ETH3D é um benchmark de avaliação sem treinamento específico. Os modelos YOLO26-Depth disponibilizados não são treinados com ele; assim, as suas 423 imagens internas e externas, com dados de profundidade obtidos por scanner a laser de precisão topográfica, medem a generalização entre domínios até cerca de 60 m. O maior modelo, YOLO26x-depth, alcança delta1 de 0,953 neste benchmark.

  • Não. O ETH3D é avaliado com um script dedicado que aplica aumento de dados de teste multiescala e com inversão, seguido de alinhamento de escala por mínimos quadrados logarítmicos. Para executar tu mesmo um modelo nas imagens ETH3D, usa o modo de previsão, conforme mostrado na secção Utilização.

  • A família YOLO26-Depth também é avaliada sem treinamento específico em NYU Depth V2, Make3D e iBims-1, e na divisão KITTI Eigen, cujas sequências de condução usadas no treinamento fazem parte da combinação de pré-treinamento. A página da tarefa de estimativa de profundidade resume os resultados nos cinco benchmarks.

Comentários