Dataset di profondità ETH3D#
ETH3D è un benchmark stereo multi-vista ad alta risoluzione utilizzato per la stima della profondità monoculare. Fornisce una verità di terra da scanner laser di livello topografico sia in ambienti interni che esterni.
Caratteristiche principali#
- Ground truth di profondità di livello topografico acquisita con un laser scanner ad alta precisione.
- Immagini ad alta risoluzione che coprono scene sia in interni che in esterni.
- Intervallo di profondità fino a circa 60 m.
- La valutazione viene eseguita su 423 immagini.
- Un benchmark multi-view stereo di alta qualità con una ground truth densa e accurata.
Ruolo in YOLO26-Depth#
ETH3D è un benchmark di valutazione zero-shot per la famiglia YOLO26-Depth; i modelli pubblicati non sono addestrati su di esso. Il suo mix di scene in interni ed esterni con un'accurata ground truth da laser scanner lo rende un solido test di generalizzazione cross-domain.
La valutazione utilizza l'augmentation test-time (TTA) multi-scala e orizzontale, seguita dall'allineamento di scala log-least-squares tra le mappe di profondità previste e quelle ground truth prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza di delta1 (percentuale di pixel entro una soglia di 1.25×, più alto è meglio) sulle immagini di valutazione di ETH3D per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.905 |
| YOLO26s-depth | 0.876 |
| YOLO26m-depth | 0.943 |
| YOLO26l-depth | 0.945 |
| YOLO26x-depth | 0.953 |
Valutazione#
ETH3D non viene fornito con un dataset YAML integrato. Viene valutato tramite uno script di valutazione dedicato che carica le immagini ETH3D e la ground truth di profondità del laser scanner, applica la TTA standard e l'allineamento di scala log-least-squares, e riporta le metriche di profondità.
Utilizzo#
ETH3D è un benchmark esterno, quindi i modelli vengono solitamente eseguiti con predict sulle sue immagini. Per un elenco completo degli argomenti disponibili, fai riferimento alla pagina Predizione del modello.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on ETH3D images
results = model.predict("path/to/eth3d/images")Modelli pre-addestrati#
La famiglia di modelli di profondità YOLO26 viene valutata zero-shot sul benchmark ETH3D. Questi modelli si scaricano automaticamente dall'ultima release di Ultralytics, ad esempio YOLO26x-depth da v8.4.0, e coprono una gamma di dimensioni (yolo26n/s/m/l/x-depth) per diverse esigenze di accuratezza e risorse.
Citazioni e riconoscimenti#
Se utilizzi il dataset ETH3D nel tuo lavoro di ricerca o sviluppo, ti preghiamo di citare il seguente articolo:
@inproceedings{schops2017eth3d,
title={A Multi-View Stereo Benchmark with High-Resolution Images and Multi-Camera Videos},
author={Sch{\"o}ps, Thomas and Sch{\"o}nberger, Johannes L. and Galliani, Silvano and Sattler, Torsten and Schindler, Konrad and Pollefeys, Marc and Geiger, Andreas},
booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2017}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.