Dataset di profondità iBims-1#
iBims-1 (immagini benchmark indipendenti e scansioni corrispondenti) è un benchmark indoor di alta qualità per la stima della profondità monoculare. Abbina immagini RGB a ground truth ottenuti con scanner laser di livello topografico ed è progettato per testare bordi di profondità netti e superfici planari.
Funzionalità principali#
- Ground truth della profondità di alta qualità acquisiti con uno scanner laser di livello topografico.
- Copre scene indoor reali.
- Intervallo di profondità fino a circa 10 m.
- La valutazione viene eseguita su 100 immagini.
- Progettato specificamente per valutare bordi di profondità netti e la qualità delle superfici planari.
Ruolo in YOLO26-Depth#
iBims-1 è un benchmark di valutazione zero-shot per la famiglia YOLO26-Depth; i modelli pubblicati non sono addestrati su questo dataset. La sua attenzione alle discontinuità nette della profondità e alle regioni planari lo rende un test preciso della qualità delle mappe di profondità, oltre la precisione aggregata.
La valutazione utilizza l'augmentation di test-time multi-scala e con ribaltamento orizzontale (TTA), seguita dall'allineamento della scala ai minimi quadrati logaritmici tra le mappe di profondità predette e quelle di ground truth prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza delta1 (percentuale di pixel entro una soglia di 1.25×; valori più alti sono migliori) sulle immagini di valutazione iBims-1, suddivise per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.923 |
| YOLO26s-depth | 0.899 |
| YOLO26m-depth | 0.953 |
| YOLO26l-depth | 0.952 |
| YOLO26x-depth | 0.961 |
Valutazione#
iBims-1 non viene distribuito con un file YAML del dataset incluso. Viene valutato tramite uno script di valutazione dedicato che carica le immagini iBims-1 e il ground truth della profondità ottenuto con scanner laser, applica la TTA standard e l'allineamento della scala ai minimi quadrati logaritmici, quindi riporta le metriche della profondità.
Utilizzo#
iBims-1 è un benchmark esterno, quindi in genere i modelli vengono eseguiti con predict sulle sue immagini. Per un elenco completo degli argomenti disponibili, consulta la pagina Prediction del modello.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on iBims-1 images
results = model.predict("path/to/ibims1/images")Modelli pre-addestrati#
La famiglia di modelli di profondità YOLO26 viene valutata zero-shot sul benchmark iBims-1. Questi modelli vengono scaricati automaticamente dall'ultima release di Ultralytics, ad esempio YOLO26x-depth dalla v8.4.0, e coprono diverse dimensioni (yolo26n/s/m/l/x-depth) per differenti requisiti di accuratezza e risorse.
Citazioni e ringraziamenti#
Se utilizzi il dataset iBims-1 nel tuo lavoro di ricerca o sviluppo, cita il seguente articolo:
@inproceedings{koch2018ibims,
title={Evaluation of CNN-based Single-Image Depth Estimation Methods},
author={Koch, Tobias and Liebel, Lukas and Fraundorfer, Friedrich and K{\"o}rner, Marco},
booktitle={Proceedings of the European Conference on Computer Vision (ECCV) Workshops},
year={2018}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.
FAQ#
iBims-1 è un benchmark per interni composto da 100 immagini con profondità ottenuta tramite laser scanner di livello topografico, progettato per testare bordi di profondità netti e superfici planari, andando oltre l'accuratezza aggregata per esaminare la qualità della mappa di profondità. I modelli YOLO26-Depth vengono valutati su di esso in modalità zero-shot, con YOLO26x-depth che raggiunge un delta1 di 0,961.
No. iBims-1 viene fornito senza un YAML incluso e viene valutato tramite uno script di valutazione dedicato con augmentations in fase di test multiscala e con flip (TTA) e allineamento di scala log-least-squares. Usa la modalità predict sulle sue immagini come mostrato nella sezione Utilizzo.
I modelli rilasciati vengono inoltre valutati in modalità zero-shot su NYU Depth V2, ETH3D e Make3D, e sullo split KITTI Eigen, i cui percorsi di guida di addestramento fanno parte del mix di pre-addestramento; consulta la pagina del task Depth Estimation per i risultati combinati.