Conjunto de dados de profundidade ETH3D#
ETH3D é um benchmark multi-view-stereo de alta resolução usado para monocular depth estimation. Ele fornece verdade fundamental de varredura a laser com precisão de levantamento topográfico em cenas internas e externas.
Principais recursos#
- Dados de referência de profundidade de nível topográfico capturados com um laser scanner de alta precisão.
- Imagens de alta resolução abrangendo cenas internas e externas.
- Alcance de profundidade de até aproximadamente 60 m.
- A avaliação é realizada em 423 imagens.
- Um benchmark de estéreo de múltiplas vistas de alta qualidade com dados de referência densos e precisos.
Papel no YOLO26-Depth#
O ETH3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados nele. Sua mistura de cenas internas e externas com dados de referência precisos de laser scanner o torna um teste robusto de generalização entre domínios.
A avaliação utiliza aumento de dados no momento do teste (TTA) de múltiplas escalas e inversão horizontal, seguido por alinhamento de escala de log-mínimos quadrados entre os mapas de profundidade previstos e os de referência antes que as métricas sejam calculadas.
Resultados#
A tabela abaixo relata a precisão de delta1 (porcentagem de pixels dentro de um limite de 1,25×, quanto maior, melhor) nas imagens de avaliação do ETH3D por tamanho de modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Avaliação#
O ETH3D não é fornecido com um YAML de conjunto de dados empacotado. Ele é avaliado através de um script de avaliação dedicado que carrega as imagens do ETH3D e os dados de referência de profundidade do laser scanner, aplica o TTA padrão e o alinhamento de escala de log-mínimos quadrados, e relata as métricas de profundidade.
Uso#
O ETH3D é um benchmark externo, portanto os modelos são normalmente executados com predict em suas imagens. Para obter uma lista abrangente de argumentos disponíveis, consulta a página de Prediction do modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")Modelos pré-treinados#
A família de profundidade YOLO26 é avaliada sem treinamento prévio (zero-shot) no benchmark ETH3D. Esses modelos são baixados automaticamente da versão mais recente da Ultralytics, por exemplo, YOLO26x-depth a partir da v8.4.0, e abrangem uma variedade de tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.
Citações e Agradecimentos#
Se você utilizar o conjunto de dados ETH3D em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Gostaríamos de agradecer aos autores pela criação e manutenção deste recurso valioso para a comunidade de visão computacional.