Ultralytics YOLO27:

Dataset de profundidade ETH3D#

ETH3D é um benchmark de estéreo multivista de alta resolução utilizado para estimativa de profundidade monocular. Fornece ground truth de qualidade de levantamento obtido com scanner laser em cenas interiores e exteriores.

Principais funcionalidades#

  • Ground truth de profundidade de qualidade de levantamento capturado com um scanner laser de alta precisão.
  • Imagens de alta resolução que abrangem cenas interiores e exteriores.
  • Alcance de profundidade de aproximadamente 60 m.
  • A avaliação é realizada em 423 imagens.
  • Um benchmark de estéreo multivista de alta qualidade com ground truth denso e preciso.

Função no YOLO26-Depth#

ETH3D é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados com este dataset. A combinação de cenas interiores e exteriores com ground truth preciso obtido por scanner laser torna-o um teste robusto de generalização entre domínios.

A avaliação utiliza aumento de dados em tempo de teste (TTA) multiescala e com inversão horizontal, seguido de alinhamento de escala por mínimos quadrados logarítmicos entre os mapas de profundidade previstos e os mapas de ground truth antes do cálculo das métricas.

Resultados#

A tabela abaixo apresenta a precisão delta1 (percentagem de píxeis dentro de um limiar de 1.25×; quanto maior, melhor) nas imagens de avaliação ETH3D, por tamanho do modelo.

Modelodelta1
YOLO26n-depth0.905
YOLO26s-depth0.876
YOLO26m-depth0.943
YOLO26l-depth0.945
YOLO26x-depth0.953

Avaliação#

ETH3D não é distribuído com um ficheiro YAML de dataset incluído. É avaliado através de um script de avaliação dedicado que carrega as imagens ETH3D e o ground truth de profundidade obtido por scanner laser, aplica o TTA padrão e o alinhamento de escala por mínimos quadrados logarítmicos, e apresenta as métricas de profundidade.

Utilização#

ETH3D é um benchmark externo, pelo que os modelos são normalmente executados com predict nas suas imagens. Para obter uma lista completa dos argumentos disponíveis, consulta a página de Predição do modelo.

Exemplo de predição
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26x-depth.pt")  # load a pretrained depth model

# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")

Modelos pré-treinados#

A família de profundidade YOLO26 é avaliada em modo zero-shot no benchmark ETH3D. Estes modelos são descarregados automaticamente a partir da versão mais recente do Ultralytics, por exemplo YOLO26x-depth da v8.4.0, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.

Citações e agradecimentos#

Se utilizares o dataset ETH3D no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:

Citação
@inproceedings{schops2017eth3d,
      title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
      author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2017}
}

Gostaríamos de agradecer aos autores por criarem e manterem este recurso valioso para a comunidade de visão computacional.

Perguntas frequentes#

  • O ETH3D é um benchmark de avaliação zero-shot. Os modelos YOLO26-Depth lançados não são treinados nele, portanto suas 423 imagens internas e externas com profundidade obtida por scanner a laser de precisão de agrimensura medem a generalização entre domínios até aproximadamente 60 m. O maior modelo, YOLO26x-depth, alcança um delta1 de 0.953 neste benchmark.

  • Não. O ETH3D é avaliado com um script dedicado que aplica aumento em tempo de teste com multi-escala e inversão seguido de alinhamento de escala por mínimos quadrados logarítmicos. Para executar um modelo em imagens do ETH3D por conta própria, usa o modo de previsão conforme mostrado na seção Uso.

  • A família YOLO26-Depth também é avaliada em zero-shot no NYU Depth V2, Make3D e iBims-1, e na divisão KITTI Eigen, cujas unidades de treinamento fazem parte da composição de pré-treinamento. A página da tarefa de Estimativa de Profundidade resume os resultados em todos os cinco.

Comentários