Dataset di profondità Make3D#
Make3D è un benchmark outdoor classico per la stima monoculare della profondità. Contiene immagini di scene universitarie abbinate a ground truth di profondità acquisito con uno scanner laser 3D personalizzato ed è ampiamente utilizzato per valutare la generalizzazione fuori distribuzione.
Funzionalità principali#
- Ground truth di profondità acquisito con uno scanner laser 3D personalizzato.
- Comprende scene universitarie reali outdoor.
- Portata della profondità fino a circa 70 m.
- La valutazione viene eseguita sul set di test standard di 134 immagini.
- Un benchmark classico per la generalizzazione fuori distribuzione.
Ruolo in YOLO26-Depth#
Make3D è un benchmark di valutazione zero-shot per la famiglia YOLO26-Depth; i modelli pubblicati non sono stati addestrati su questo dataset. Essendo un set outdoor fuori distribuzione, è il benchmark più difficile per tutti i modelli e i valori assoluti di delta1 sono bassi per tutti, come previsto per questo dataset.
La valutazione usa un test-time augmentation (TTA) multi-scala e con ribaltamento orizzontale, seguito dall'allineamento della scala ai minimi quadrati in logaritmi tra le mappe di profondità predette e quelle ground truth, prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza delta1 (frazione di pixel entro una soglia di 1,25×; i valori più alti sono migliori) sul set di test Make3D, suddivisa per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Valutazione#
Make3D non viene fornito con un file YAML del dataset incluso. La valutazione viene eseguita tramite uno script dedicato che carica le immagini Make3D e il ground truth di profondità dello scanner laser, applica la TTA standard e l'allineamento della scala ai minimi quadrati in scala logaritmica e riporta le metriche di profondità.
Utilizzo#
Make3D è un benchmark esterno, quindi in genere i modelli vengono eseguiti con predict sulle relative immagini. Per un elenco completo degli argomenti disponibili, consulta la pagina Predizione del modello.
from ultralytics import YOLO
# Carica un modello
model = YOLO("yolo26x-depth.pt") # carica un modello di profondità preaddestrato
# Predici la profondità nelle immagini Make3D
results = model.predict("path/to/make3d/images")Modelli preaddestrati#
La famiglia di modelli di profondità YOLO26 viene valutata zero-shot sul benchmark Make3D. Al primo utilizzo, questi modelli vengono scaricati automaticamente dalla release degli asset v8.4.0 di Ultralytics, ad esempio YOLO26x-depth, e sono disponibili in diverse dimensioni (yolo26n/s/m/l/x-depth) per soddisfare requisiti diversi di accuratezza e risorse.
Citazioni e ringraziamenti#
Se utilizzi il dataset Make3D nella tua attività di ricerca o sviluppo, cita il seguente articolo:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.
Domande frequenti#
Make3D è un benchmark outdoor zero-shot e fuori distribuzione composto da 134 immagini di ambienti universitari, con profondità acquisita tramite scanner laser personalizzato fino a circa 70 m. I modelli YOLO26-Depth rilasciati non sono stati addestrati su questo dataset, che misura quindi la loro capacità di generalizzare a scene outdoor non familiari.
Make3D è il più difficile dei cinque benchmark di valutazione per ogni modello, perché le sue scene e le statistiche di profondità differiscono notevolmente dai dati di addestramento. Per questo dataset sono previsti valori delta1 assoluti intorno a 0,3; ciò che conta è il confronto relativo tra i modelli.
No. Make3D viene valutato con uno script dedicato che utilizza l'aumento dei dati in fase di test con più scale e ribaltamenti, insieme all'allineamento della scala ai minimi quadrati in scala logaritmica. Per eseguire un modello sulle immagini Make3D, usa la modalità predict, come mostrato nella sezione Utilizzo.