Dataset di profondità ETH3D#
ETH3D è un benchmark stereo multi-vista ad alta risoluzione utilizzato per la stima della profondità monoculare. Fornisce una ground truth acquisita con scanner laser di livello topografico per scene sia interne che esterne.
Funzionalità principali#
- Ground truth della profondità di livello topografico acquisita con uno scanner laser ad alta precisione.
- Immagini ad alta risoluzione che coprono scene sia interne che esterne.
- Intervallo di profondità fino a circa 60 m.
- La valutazione viene eseguita su 423 immagini.
- Un benchmark stereo multi-vista di alta qualità con una ground truth densa e accurata.
Ruolo in YOLO26-Depth#
ETH3D è un benchmark di valutazione zero-shot per la famiglia YOLO26-Depth; i modelli pubblicati non sono addestrati su questo dataset. La combinazione di scene interne ed esterne con una ground truth accurata acquisita con scanner laser ne fa un test efficace della generalizzazione tra domini.
La valutazione utilizza l'augmentation di test-time multi-scala e con ribaltamento orizzontale (TTA), seguita dall'allineamento della scala ai minimi quadrati logaritmici tra le mappe di profondità predette e quelle di ground truth prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza delta1 (percentuale di pixel entro una soglia di 1.25×; valori più alti sono migliori) sulle immagini di valutazione ETH3D, suddivise per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Valutazione#
ETH3D non viene fornito con un file YAML del dataset incluso. Viene valutato tramite uno script di valutazione dedicato che carica le immagini ETH3D e la ground truth della profondità acquisita con scanner laser, applica la TTA standard e l'allineamento della scala ai minimi quadrati logaritmici, quindi restituisce le metriche della profondità.
Utilizzo#
ETH3D è un benchmark esterno, quindi in genere i modelli vengono eseguiti con predict sulle sue immagini. Per un elenco completo degli argomenti disponibili, consulta la pagina Prediction del modello.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")Modelli pre-addestrati#
La famiglia di modelli di profondità YOLO26 viene valutata zero-shot sul benchmark ETH3D. Questi modelli vengono scaricati automaticamente dall'ultima release di Ultralytics, ad esempio YOLO26x-depth dalla v8.4.0, e coprono diverse dimensioni (yolo26n/s/m/l/x-depth) per requisiti differenti di accuratezza e risorse.
Citazioni e ringraziamenti#
Se utilizzi il dataset ETH3D nel tuo lavoro di ricerca o sviluppo, cita il seguente articolo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.
FAQ#
ETH3D è un benchmark di valutazione zero-shot. I modelli YOLO26-Depth rilasciati non sono addestrati su di esso, quindi le sue 423 immagini di interni ed esterni con profondità rilevata tramite laser scanner di livello topografico misurano la generalizzazione cross-domain fino a circa 60 m. Il modello più grande, YOLO26x-depth, raggiunge un delta1 di 0,953 su questo benchmark.
No. ETH3D viene valutato con uno script dedicato che applica l'aumento dei dati in fase di test multiscala e di ribaltamento seguito dall'allineamento della scala log-minimi quadrati. Per eseguire un modello sulle immagini di ETH3D in autonomia, usa la modalità predict come mostrato nella sezione Utilizzo.
La famiglia YOLO26-Depth viene anche valutata in modalità zero-shot su NYU Depth V2, Make3D e iBims-1, e sulla suddivisione KITTI Eigen, le cui guide di addestramento fanno parte del mix di pre-addestramento. La pagina dell'attività di stima della profondità riassume i risultati in tutti e cinque.