Ultralytics YOLO27:
Get Started

Dataset di profondità ImageNet (con etichette pseudo)#

Il dataset ImageNet di profondità pseudo-etichettata riutilizza le 1.281.167 immagini di addestramento di ImageNet-1K, prive di annotazioni di profondità di riferimento, e abbina a ciascuna immagine una mappa di profondità pseudo-etichettata generata da un modello insegnante Depth Anything 3, che combina i checkpoint monoculari e metrici. Viene utilizzato esclusivamente per la distillazione della conoscenza e per la varietà di scene e oggetti offerta da ImageNet. Essendo la singola fonte più grande nel mix di preaddestramento YOLO26-Depth di circa 2,19 milioni di immagini (circa il 58%), la sua aggiunta è stata decisiva per la generalizzazione tra domini in ambienti interni.

Funzionalità principali#

  • 1,281,167 immagini di addestramento ImageNet-1K, con una vasta varietà di oggetti, scene e contesti.
  • Nessuna profondità di verità fondamentale: ogni target di profondità è un'etichetta pseudo generata automaticamente associando le predizioni di un modello insegnante Depth Anything 3 (DA3MONO-LARGE per la struttura della scena, DA3METRIC-LARGE per la scala metrica).
  • Utilizzato esclusivamente per la distillazione della conoscenza e per la varietà di scene e oggetti, non come benchmark.
  • La singola fonte più grande nella miscela di preaddestramento di ~2.19M immagini (~58%), decisiva per la generalizzazione tra domini in ambienti interni.
  • Nessuna partizione di convalida: la convalida viene eseguita solo su dataset reali con dati di verità fondamentale.

Struttura del dataset#

La fonte ImageNet con etichette pseudo è costituita dalle immagini di addestramento ImageNet-1K, ciascuna associata a una mappa di profondità generata automaticamente:

  1. Immagini di addestramento: 1,281,167 immagini di addestramento ImageNet-1K, il singolo componente più grande (~58%) della miscela di preaddestramento YOLO26-Depth di ~2.19M immagini.
  2. Convalida: nessuna. Questa fonte non ha una partizione di convalida; la convalida di YOLO26-Depth utilizza solo dataset reali con dati di verità fondamentale, come NYU Depth V2 e KITTI Eigen.

Come vengono generate le etichette pseudo#

Poiché ImageNet non include annotazioni di profondità, i target di profondità vengono generati offline anziché misurati. Si combinano due checkpoint Depth Anything 3: uno per la struttura della scena e uno per la scala assoluta:

  1. Ogni immagine di addestramento ImageNet viene elaborata da depth-anything/DA3MONO-LARGE, che predice una mappa di profondità molto dettagliata, definita solo fino a una scala e a uno spostamento per immagine sconosciuti, e da depth-anything/DA3METRIC-LARGE, il cui output è più grossolano ma espresso in unità reali.
  2. Un adattamento affine robusto per immagine mappa la predizione monoculare su quella metrica, label = a * mono + b. Ogni dettaglio per pixel deriva quindi dal checkpoint monoculare, mentre il checkpoint metrico imposta solo i due scalari che collocano la mappa sull'asse dei metri. Non vengono utilizzati parametri intrinseci della fotocamera, perciò è possibile assegnare etichette anche alle immagini non calibrate.
  3. Il risultato viene salvato come PNG a 16 bit in millimetri, secondo il formato dei dataset di profondità di Ultralytics, e associato all'immagine sorgente tramite il nome base del file.
  4. Le coppie con etichette pseudo vengono quindi aggiunte come componente di una miscela di addestramento più ampia, in cui un modello YOLO26-Depth allievo impara a riprodurre le predizioni del modello insegnante e viene addestrato anche su fonti reali con dati di verità fondamentale.

Poiché la scala deriva da una predizione anziché da una misurazione, ogni mappa può presentare un errore di scala globale. YOLO26-Depth viene addestrato con una loss SILog (logaritmica invariante alla scala), oltre alla corrispondenza dei gradienti, e viene convalidato con l'allineamento alla mediana: l'offset di scala per immagine nelle etichette pseudo viene quindi in gran parte assorbito.

Questa fonte con etichette pseudo è un componente della configurazione interna di addestramento misto utilizzata per preaddestrare i pesi YOLO26-Depth rilasciati e non è distribuita come download autonomo.

Ruolo in YOLO26-Depth#

Questa fonte fornisce la maggior parte dei dati di preaddestramento di YOLO26-Depth e la più ampia varietà di scene e oggetti. Distillando un modello insegnante Depth Anything 3 avanzato su oltre un milione di immagini, trasferisce ampie conoscenze sulle scene al modello allievo. In pratica, la sua aggiunta è stata decisiva per la generalizzazione tra domini in ambienti interni, aiutando il modello a ottenere buone prestazioni su scene indoor che non rientrano nelle distribuzioni dei dati reali con verità fondamentale usati per l'addestramento.

Utilizzo#

I dati ImageNet con etichette pseudo non vengono utilizzati da soli per l'addestramento: sono impiegati come componente di una miscela di profondità combinata, definita da un file YAML interno o sperimentale anziché da un download pubblico del dataset. In linea di principio, l'addestramento con una miscela simile si svolge così:

Esempio di addestramento
from ultralytics import YOLO

# Carica un modello di profondità preaddestrato
model = YOLO("yolo26n-depth.pt")

# Addestramento su una miscela di profondità combinata (file YAML personalizzato per un dataset multi-sorgente)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modelli preaddestrati#

I modelli YOLO26-Depth preaddestrati vengono scaricati automaticamente dalla release degli asset v8.4.0 di Ultralytics quando vengono richiamati per nome per la prima volta:

Citazioni e ringraziamenti#

Se utilizzi il dataset ImageNet nella tua attività di ricerca o sviluppo, cita il seguente articolo:

Citazione
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Desideriamo ringraziare il team di ImageNet per aver creato e mantenuto il dataset e gli autori di Depth Anything 3 per i modelli insegnanti utilizzati per generare le etichette di profondità pseudo-etichettate.

Domande frequenti#

  • Riutilizza le 1.281.167 immagini di addestramento di ImageNet-1K, che non hanno una profondità misurata, e abbina a ciascuna una mappa di profondità predetta da un modello insegnante Depth Anything 3. È la singola fonte più grande del mix di preaddestramento YOLO26-Depth, composto da circa 2,19 milioni di immagini (circa il 58%), ed è utilizzato esclusivamente per la distillazione della conoscenza e la diversità delle scene.

  • Ogni immagine viene elaborata da DA3MONO-LARGE per ottenere una struttura relativa dettagliata e da DA3METRIC-LARGE per ricavare la scala metrica. Un adattamento affine robusto per immagine mappa la previsione monoculare su quella metrica e il risultato viene salvato come PNG a 16 bit in millimetri nel formato di profondità Ultralytics. Per i dettagli, consulta Come vengono generate le pseudo-etichette.

  • No. Questa fonte fa parte della configurazione interna di addestramento misto alla base dei pesi YOLO26-Depth rilasciati e non viene distribuita come download indipendente. Per creare un set simile, genera pseudo-etichette per le tue immagini con un modello insegnante di profondità e salvale nella struttura standard dei dati di profondità.

Commenti