Dataset de profundidade iBims-1#
iBims-1 (imagens de referência independentes e digitalizações correspondentes) é um benchmark de alta qualidade para ambientes interiores destinado à estimativa monocular de profundidade. Combina imagens RGB com ground truth de qualidade topográfica obtido por scanner laser e foi concebido para testar contornos de profundidade nítidos e superfícies planas.
Principais funcionalidades#
- Ground truth de profundidade de alta qualidade capturado com um scanner laser de qualidade topográfica.
- Abrange cenas reais interiores.
- Alcance de profundidade até aproximadamente 10 m.
- A avaliação é realizada em 100 imagens.
- Concebido especificamente para avaliar contornos de profundidade nítidos e a qualidade de superfícies planas.
Função no YOLO26-Depth#
O iBims-1 é um benchmark de avaliação zero-shot para a família YOLO26-Depth; os modelos publicados não são treinados com ele. O seu foco em descontinuidades de profundidade nítidas e regiões planas torna-o um teste preciso da qualidade dos mapas de profundidade, para além da precisão agregada.
A avaliação utiliza aumento de dados em tempo de teste (TTA) multiescala e com inversão horizontal, seguido de alinhamento de escala por mínimos quadrados logarítmicos entre os mapas de profundidade previstos e os mapas de ground truth antes do cálculo das métricas.
Resultados#
A tabela abaixo apresenta a precisão delta1 (percentagem de píxeis dentro de um limiar de 1.25×; quanto maior, melhor) nas imagens de avaliação do iBims-1, por tamanho do modelo.
| Modelo | delta1 |
|---|---|
| YOLO26n-depth | 0.923 |
| YOLO26s-depth | 0.899 |
| YOLO26m-depth | 0.953 |
| YOLO26l-depth | 0.952 |
| YOLO26x-depth | 0.961 |
Avaliação#
O iBims-1 não é fornecido com um ficheiro YAML de dataset integrado. É avaliado através de um script de avaliação dedicado que carrega as imagens do iBims-1 e o ground truth de profundidade do scanner laser, aplica o TTA padrão e o alinhamento de escala por mínimos quadrados logarítmicos e reporta as métricas de profundidade.
Utilização#
O iBims-1 é um benchmark externo, pelo que os modelos são normalmente executados com predict nas respetivas imagens. Para obter uma lista completa dos argumentos disponíveis, consulta a página de Prediction do modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on iBims-1 images
results = model.predict("path/to/ibims1/images")Modelos pré-treinados#
A família de profundidade YOLO26 é avaliada em modo zero-shot no benchmark iBims-1. Estes modelos são transferidos automaticamente a partir da versão mais recente do Ultralytics, por exemplo YOLO26x-depth da v8.4.0, e abrangem vários tamanhos (yolo26n/s/m/l/x-depth) para diferentes requisitos de precisão e recursos.
Citações e agradecimentos#
Se utilizares o dataset iBims-1 no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@inproceedings{koch2018ibims,
title={Evaluation of CNN-based Single-Image Depth Estimation Methods},
author={Koch, Tobias and Liebel, Lukas and Fraundorfer, Friedrich and K{\"o}rner, Marco},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV) Workshops},
year={2018}
}Gostaríamos de agradecer aos autores por criarem e manterem este recurso valioso para a comunidade de visão computacional.
Perguntas frequentes#
O iBims-1 é um benchmark interno de 100 imagens com profundidade de scanner a laser de nível de levantamento topográfico, projetado para testar bordas de profundidade acentuadas e superfícies planares, indo além da precisão agregada para investigar a qualidade do mapa de profundidade. Os modelos YOLO26-Depth são avaliados nele de forma zero-shot, com o YOLO26x-depth alcançando um delta1 de 0,961.
Não. O iBims-1 é fornecido sem um YAML empacotado e é pontuado por meio de um script de avaliação dedicado com augmentação em tempo de teste multi-escala e de inversão e alinhamento de escala de mínimos quadrados logarítmicos. Usa o predict mode em suas imagens conforme mostrado na seção Usage.
Os modelos lançados também são avaliados de forma zero-shot no NYU Depth V2, ETH3D e Make3D, e na divisão KITTI Eigen, cujas unidades de treinamento fazem parte da mixagem de pré-treinamento; consulta a Depth Estimation task page para os resultados combinados.