Dataset di profondità Make3D#
Make3D è un benchmark classico per la stima della profondità monoculare in ambienti esterni. Contiene immagini di scene di campus abbinate a dati di riferimento della profondità acquisiti con uno scanner laser 3D personalizzato ed è ampiamente utilizzato per valutare la capacità di generalizzazione fuori distribuzione.
Funzionalità principali#
- Dati di riferimento della profondità acquisiti con uno scanner laser 3D personalizzato.
- Include scene reali di campus all'aperto.
- Intervallo di profondità fino a circa 70 m.
- La valutazione viene eseguita sul set di test standard composto da 134 immagini.
- Un benchmark classico per la generalizzazione fuori distribuzione.
Ruolo in YOLO26-Depth#
Make3D è un benchmark di valutazione zero-shot per la famiglia YOLO26-Depth; i modelli pubblicati non sono addestrati su questo dataset. Essendo un set esterno fuori distribuzione, è il benchmark più difficile per tutti i modelli e i valori assoluti di delta1 sono bassi in tutti i casi, come previsto per questo dataset.
La valutazione utilizza l'augmentation di test-time multi-scala e con ribaltamento orizzontale (TTA), seguita dall'allineamento della scala ai minimi quadrati logaritmici tra le mappe di profondità predette e quelle di ground truth prima del calcolo delle metriche.
Risultati#
La tabella seguente riporta l'accuratezza delta1 (percentuale di pixel entro una soglia di 1.25×; valori più alti sono migliori) sul set di test Make3D, suddivisa per dimensione del modello.
| Modello | delta1 |
|---|---|
| YOLO26n-depth | 0.307 |
| YOLO26s-depth | 0.311 |
| YOLO26m-depth | 0.293 |
| YOLO26l-depth | 0.297 |
| YOLO26x-depth | 0.299 |
Valutazione#
Make3D non viene distribuito con un file YAML del dataset incluso. La valutazione viene eseguita tramite uno script dedicato che carica le immagini Make3D e i dati di riferimento della profondità acquisiti dallo scanner laser, applica la TTA standard e l'allineamento della scala ai minimi quadrati dei logaritmi, quindi restituisce le metriche di profondità.
Utilizzo#
Make3D è un benchmark esterno, quindi in genere i modelli vengono eseguiti con predict sulle sue immagini. Per un elenco completo degli argomenti disponibili, consulta la pagina Previsione del modello.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26x-depth.pt") # load a pretrained depth model
# Predict depth on Make3D images
results = model.predict("path/to/make3d/images")Modelli pre-addestrati#
La famiglia di modelli di profondità YOLO26 viene valutata in modalità zero-shot sul benchmark Make3D. Questi modelli vengono scaricati automaticamente dall'ultima release di Ultralytics; ad esempio YOLO26x-depth dalla v8.4.0. La famiglia comprende diverse dimensioni (yolo26n/s/m/l/x-depth) per soddisfare requisiti diversi in termini di accuratezza e risorse.
Citazioni e ringraziamenti#
Se utilizzi il dataset Make3D nelle tue attività di ricerca o sviluppo, cita il seguente articolo:
@article{saxena2009make3d,
title={Make3D: Learning 3D Scene Structure from a Single Still Image},
author={Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
year={2009}
}Desideriamo ringraziare gli autori per aver creato e mantenuto questa preziosa risorsa per la comunità della computer vision.
FAQ#
Make3D è un benchmark esterno di 134 immagini di campus fuori distribuzione e zero-shot, dotato di profondità con scanner laser personalizzato fino a circa 70 m. I modelli YOLO26-Depth rilasciati non sono addestrati su Make3D, quindi misura quanto bene i modelli YOLO26-Depth si generalizzano a scene all'aperto non familiari.
Make3D è il più difficile dei cinque benchmark di valutazione per ogni modello perché le scene e le statistiche di profondità di Make3D differiscono fortemente dai dati di addestramento. Valori assoluti di delta1 intorno a 0,3 sono previsti per questo dataset, e il confronto relativo tra i modelli è ciò che conta.
No. Make3D viene valutato con uno script dedicato che utilizza l'aumento dei dati in fase di test con multi-scala e capovolgimento e l'allineamento della scala dei minimi quadrati logaritmici. Per eseguire un modello sulle immagini di Make3D, usa la predict mode come mostrato nella sezione Usage.