Ultralytics YOLO27:

Dataset di profondità ImageNet (con etichette pseudo-generate)#

Il dataset ImageNet (profondità con etichette pseudo-generate) riutilizza le 1,281,167 immagini di addestramento di ImageNet-1K, che non dispongono di profondità ground truth, e abbina ogni immagine a una mappa di profondità pseudo-generata da un teacher Depth Anything 3, combinando i suoi checkpoint monoculare e metrico. Viene usato esclusivamente per la distillazione della conoscenza e per la diversità di scene e oggetti offerta da ImageNet. Essendo la fonte singola più grande nel mix di pretraining YOLO26-Depth di circa 2,19 milioni di immagini (circa il 58%), la sua aggiunta è stata decisiva per la generalizzazione cross-domain in ambienti interni.

Funzionalità principali#

  • 1,281,167 immagini di addestramento ImageNet-1K che coprono una gamma molto ampia di oggetti, scene e contesti.
  • Nessuna profondità ground truth: ogni target di profondità è un'etichetta pseudo-generata da un teacher Depth Anything 3 che combina (DA3MONO-LARGE per la struttura della scena, DA3METRIC-LARGE per la scala metrica).
  • Utilizzato esclusivamente per la distillazione della conoscenza e la diversità di scene e oggetti, non come benchmark.
  • La fonte singola più grande nel mix di pretraining di ~2,19 milioni di immagini (~58%), decisiva per la generalizzazione cross-domain in ambienti interni.
  • Nessuno split di validazione: la validazione viene eseguita solo su dataset reali con profondità ground truth.

Struttura del dataset#

La fonte ImageNet con etichette pseudo-generate è costituita dalle immagini di addestramento ImageNet-1K, con una mappa di profondità generata automaticamente per ogni immagine:

  1. Immagini di addestramento: 1,281,167 immagini di addestramento ImageNet-1K, il componente singolo più grande (~58%) del mix di pretraining YOLO26-Depth di ~2,19 milioni di immagini.
  2. Validazione: nessuna. Questa fonte non dispone di uno split di validazione; la validazione di YOLO26-Depth utilizza solo dataset reali con profondità ground truth, come NYU Depth V2 e KITTI Eigen.

Come vengono generate le pseudo-etichette#

Poiché ImageNet viene distribuito senza annotazioni di profondità, i target di profondità vengono prodotti offline anziché misurati. Vengono combinati due checkpoint Depth Anything 3, uno per la struttura della scena e uno per la scala assoluta:

  1. Ogni immagine di addestramento ImageNet viene elaborata da depth-anything/DA3MONO-LARGE, che predice una mappa di profondità molto dettagliata, definita solo fino a una scala e a uno shift per immagine sconosciuti, e da depth-anything/DA3METRIC-LARGE, il cui output è più grossolano ma espresso in unità reali.
  2. Un fit affine robusto per immagine mappa la predizione monoculare su quella metrica, label = a * mono + b. Ogni dettaglio per pixel proviene quindi dal checkpoint monoculare, mentre il checkpoint metrico imposta solo i due scalari che collocano la mappa sull'asse dei metri. Non vengono utilizzati i parametri intrinseci della camera, quindi è possibile applicare le etichette anche alle immagini prive di calibrazione.
  3. Il risultato viene salvato come PNG a 16 bit in millimetri, seguendo il formato dei dataset di profondità Ultralytics, e associato all'immagine sorgente tramite il nome base del file.
  4. Le coppie con etichette pseudo-generate vengono quindi aggiunte come componente di un mix di addestramento più ampio, in cui un modello studente YOLO26-Depth impara a replicare il teacher, addestrandosi al contempo su fonti reali con profondità ground truth.

Poiché la scala deriva da una predizione anziché da una misurazione, ogni mappa può contenere un errore di scala globale. YOLO26-Depth viene addestrato con una loss logaritmica invariante alla scala (SILog), oltre al gradient matching, e viene validato con l'allineamento mediano; di conseguenza, uno scostamento di scala per immagine nelle pseudo-etichette viene in gran parte assorbito.

Questa fonte con etichette pseudo-generate è un componente della configurazione interna di addestramento misto utilizzata per il pretraining dei pesi YOLO26-Depth rilasciati e non viene distribuita come download autonomo.

Ruolo in YOLO26-Depth#

Questa fonte fornisce la maggior parte dei dati di pretraining YOLO26-Depth e la più ampia diversità di scene e oggetti. Distillando un teacher Depth Anything 3 avanzato su oltre un milione di immagini, trasferisce ampie conoscenze preliminari sulle scene al modello studente. In pratica, la sua aggiunta è stata decisiva per la generalizzazione cross-domain in ambienti interni, aiutando il modello a ottenere buone prestazioni su scene interne oltre le distribuzioni di addestramento reali con profondità ground truth.

Utilizzo#

I dati ImageNet con etichette pseudo-generate non vengono utilizzati per l'addestramento in isolamento; vengono impiegati come componente di un mix di profondità combinato, definito da un file YAML interno/di esperimento anziché da un download pubblico del dataset. Concettualmente, l'addestramento su un mix di questo tipo è simile al seguente:

Esempio di addestramento
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modelli pre-addestrati#

I modelli YOLO26-Depth preaddestrati vengono scaricati automaticamente dagli asset della release v8.4.0 di Ultralytics quando vengono referenziati per nome per la prima volta:

Citazioni e ringraziamenti#

Se utilizzi il dataset ImageNet nelle tue attività di ricerca o sviluppo, cita il seguente articolo:

Citazione
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Desideriamo ringraziare il team di ImageNet per aver creato e mantenuto il dataset e gli autori di Depth Anything 3 per i modelli teacher utilizzati per generare le pseudo-etichette di profondità.

FAQ#

  • Riutilizza le 1.281.167 immagini di addestramento di ImageNet-1K, che non hanno una profondità misurata, e associa ciascuna a una mappa di profondità prevista da un teacher Depth Anything 3. È la singola fonte più grande nel mix di pre-addestramento YOLO26-Depth di circa 2,19 milioni di immagini (circa il 58%) ed è utilizzata puramente per la distillazione della conoscenza e la diversità delle scene.

  • Ogni immagine viene elaborata tramite DA3MONO-LARGE per la struttura relativa dettagliata e DA3METRIC-LARGE per la scala metrica. Un adattamento affine robusto per immagine mappa la previsione monoculare su quella metrica, e il risultato viene salvato come PNG in millimetri a 16 bit nel formato di profondità Ultralytics. Vedi Come vengono generate le pseudo-etichette per i dettagli.

  • No. Questa fonte fa parte della configurazione interna di addestramento misto dietro i pesi rilasciati di YOLO26-Depth e non viene distribuita come download autonomo. Per creare un set simile, genera pseudo etichette per le tue immagini con un teacher di profondità e memorizzale nel layout di profondità standard.

Commenti