YOLO Vision 2026:

Conjunto de dados de profundidade ETH3D#

ETH3D é um benchmark multi-view-stereo de alta resolução usado para monocular depth estimation. Ele fornece verdade fundamental de varredura a laser com precisão de levantamento topográfico em cenas internas e externas.

Principais recursos#

  • Dados de referência de profundidade de nível topográfico capturados com um laser scanner de alta precisão.
  • Imagens de alta resolução abrangendo cenas internas e externas.
  • Alcance de profundidade de até aproximadamente 60 m.
  • A avaliação é realizada em 423 imagens.
  • Um benchmark de estéreo de múltiplas vistas de alta qualidade com dados de referência densos e precisos.

Papel no YOLO26-Depth#

O ETH3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados nele. Sua mistura de cenas internas e externas com dados de referência precisos de laser scanner o torna um teste robusto de generalização entre domínios.

A avaliação utiliza aumento de dados no momento do teste (TTA) de múltiplas escalas e inversão horizontal, seguido por alinhamento de escala de log-mínimos quadrados entre os mapas de profundidade previstos e os de referência antes que as métricas sejam calculadas.

Resultados#

A tabela abaixo relata a precisão de delta1 (porcentagem de pixels dentro de um limite de 1,25×, quanto maior, melhor) nas imagens de avaliação do ETH3D por tamanho de modelo.

Modelodelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Avaliação#

O ETH3D não é fornecido com um YAML de conjunto de dados empacotado. Ele é avaliado através de um script de avaliação dedicado que carrega as imagens do ETH3D e os dados de referência de profundidade do laser scanner, aplica o TTA padrão e o alinhamento de escala de log-mínimos quadrados, e relata as métricas de profundidade.

Uso#

O ETH3D é um benchmark externo, portanto os modelos são normalmente executados com predict em suas imagens. Para obter uma lista abrangente de argumentos disponíveis, consulta a página de Prediction do modelo.

Exemplo de Previsão
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

Modelos pré-treinados#

A família de profundidade YOLO26 é avaliada sem treinamento prévio (zero-shot) no benchmark ETH3D. Esses modelos são baixados automaticamente da versão mais recente da Ultralytics, por exemplo, YOLO26x-depth a partir da v8.4.0, e abrangem uma variedade de tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.

Citações e Agradecimentos#

Se você utilizar o conjunto de dados ETH3D em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:

Citação
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Gostaríamos de agradecer aos autores pela criação e manutenção deste recurso valioso para a comunidade de visão computacional.

Comentários