Dataset di profondità ETH3D#
ETH3D è un benchmark stereo multi-vista ad alta risoluzione usato per la stima monoculare della profondità. Fornisce ground truth di livello topografico acquisita con scanner laser in scene sia indoor sia outdoor.
Funzionalità principali#
- Ground truth di profondità di livello topografico, acquisita con uno scanner laser ad alta precisione.
- Immagini ad alta risoluzione che coprono scene sia indoor sia outdoor.
- Intervallo di profondità fino a circa 60 m.
- La valutazione viene eseguita su 423 immagini.
- Un benchmark stereo multi-vista di alta qualità con ground truth densa e accurata.
Ruolo in YOLO26-Depth#
ETH3D è un benchmark di valutazione zero-shot per la famiglia YOLO26-Depth; i modelli pubblicati non vengono addestrati su questo dataset. La combinazione di scene indoor e outdoor con ground truth accurata acquisita con scanner laser lo rende un test rigoroso per la generalizzazione tra domini.
La valutazione usa un test-time augmentation (TTA) multi-scala e con ribaltamento orizzontale, seguito dall'allineamento della scala ai minimi quadrati in logaritmi tra le mappe di profondità predette e quelle ground truth, prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza delta1 (frazione di pixel entro una soglia di 1,25×; più è alta, meglio è) sulle immagini di valutazione ETH3D, suddivisa per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Valutazione#
ETH3D non viene fornito con uno YAML del dataset incluso. La valutazione viene eseguita tramite uno script dedicato che carica le immagini ETH3D e la ground truth di profondità acquisita con scanner laser, applica la TTA standard e l'allineamento della scala ai minimi quadrati in logaritmi, quindi riporta le metriche di profondità.
Utilizzo#
ETH3D è un benchmark esterno, quindi in genere i modelli vengono eseguiti sulle sue immagini con predict. Per un elenco completo degli argomenti disponibili, consulta la pagina Predizione del modello.
from ultralytics import YOLO
# Carica un modello
model = YOLO("yolo26x-depth.pt") # carica un modello di profondità preaddestrato
# Stima la profondità sulle immagini ETH3D
results = model.predict("path/to/eth3d/images")Modelli preaddestrati#
La famiglia YOLO26 depth viene valutata zero-shot sul benchmark ETH3D. Al primo utilizzo, questi modelli vengono scaricati automaticamente dalla release degli asset v8.4.0 di Ultralytics; ad esempio YOLO26x-depth. I modelli coprono diverse dimensioni (yolo26n/s/m/l/x-depth) per soddisfare requisiti diversi in termini di accuratezza e risorse.
Citazioni e ringraziamenti#
Se utilizzi il dataset ETH3D nelle tue attività di ricerca o sviluppo, cita il seguente articolo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.
Domande frequenti#
ETH3D è un benchmark di valutazione zero-shot. I modelli YOLO26-Depth rilasciati non sono addestrati su questo dataset; le sue 423 immagini di ambienti interni ed esterni, con profondità rilevata tramite scanner laser di precisione topografica, misurano la generalizzazione tra domini fino a circa 60 m. Il modello più grande, YOLO26x-depth, raggiunge un delta1 di 0.953 su questo benchmark.
No. ETH3D viene valutato con uno script dedicato che applica l'augmentation di test-time multi-scala e con ribaltamento, seguita dall'allineamento di scala ai minimi quadrati dei logaritmi. Per eseguire personalmente un modello sulle immagini ETH3D, usa la modalità di predizione come illustrato nella sezione Utilizzo.
La famiglia YOLO26-Depth viene valutata zero-shot anche su NYU Depth V2, Make3D e iBims-1, oltre che sulla partizione KITTI Eigen, le cui sequenze di guida per l'addestramento fanno parte della miscela di preaddestramento. La pagina dell'attività di stima della profondità riassume i risultati di tutti e cinque i benchmark.