Dataset de profundidade ETH3D#
ETH3D é um benchmark de estéreo multivista de alta resolução utilizado para estimativa de profundidade monocular. Fornece ground truth de qualidade de levantamento obtido com scanner laser em cenas interiores e exteriores.
Principais funcionalidades#
- Ground truth de profundidade de qualidade de levantamento capturado com um scanner laser de alta precisão.
- Imagens de alta resolução que abrangem cenas interiores e exteriores.
- Alcance de profundidade de aproximadamente 60 m.
- A avaliação é realizada em 423 imagens.
- Um benchmark de estéreo multivista de alta qualidade com ground truth denso e preciso.
Função no YOLO26-Depth#
ETH3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados com este dataset. A combinação de cenas interiores e exteriores com ground truth preciso obtido por scanner laser torna-o um teste robusto de generalização entre domínios.
A avaliação utiliza aumento de dados em tempo de teste (TTA) multiescala e com inversão horizontal, seguido de alinhamento de escala por mínimos quadrados logarítmicos entre os mapas de profundidade previstos e os mapas de ground truth antes do cálculo das métricas.
Resultados#
A tabela abaixo apresenta a precisão delta1 (percentagem de píxeis dentro de um limiar de 1.25×; quanto maior, melhor) nas imagens de avaliação ETH3D, por tamanho do modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Avaliação#
ETH3D não é distribuído com um ficheiro YAML de dataset incluído. É avaliado através de um script de avaliação dedicado que carrega as imagens ETH3D e o ground truth de profundidade obtido por scanner laser, aplica o TTA padrão e o alinhamento de escala por mínimos quadrados logarítmicos, e apresenta as métricas de profundidade.
Utilização#
ETH3D é um benchmark externo, pelo que os modelos são normalmente executados com predict nas suas imagens. Para obter uma lista completa dos argumentos disponíveis, consulta a página de Predição do modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")Modelos pré-treinados#
A família de profundidade YOLO26 é avaliada em modo zero-shot no benchmark ETH3D. Estes modelos são descarregados automaticamente a partir da versão mais recente do Ultralytics, por exemplo YOLO26x-depth da v8.4.0, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.
Citações e agradecimentos#
Se utilizares o dataset ETH3D no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Gostaríamos de agradecer aos autores por criarem e manterem este recurso valioso para a comunidade de visão computacional.
Perguntas frequentes#
O ETH3D é um benchmark de avaliação zero-shot. Os modelos YOLO26-Depth lançados não são treinados nele, portanto suas 423 imagens internas e externas com profundidade obtida por scanner a laser de precisão de agrimensura medem a generalização entre domínios até aproximadamente 60 m. O maior modelo, YOLO26x-depth, alcança um delta1 de 0.953 neste benchmark.
Não. O ETH3D é avaliado com um script dedicado que aplica aumento em tempo de teste com multi-escala e inversão seguido de alinhamento de escala por mínimos quadrados logarítmicos. Para executar um modelo em imagens do ETH3D por conta própria, usa o modo de previsão conforme mostrado na seção Uso.
A família YOLO26-Depth também é avaliada em zero-shot no NYU Depth V2, Make3D e iBims-1, e na divisão KITTI Eigen, cujas unidades de treinamento fazem parte da composição de pré-treinamento. A página da tarefa de Estimativa de Profundidade resume os resultados em todos os cinco.