Link to this sectionDataset di profondità ImageNet (pseudo-etichettato)#
Il dataset ImageNet (profondità pseudo-etichettata) riutilizza 1.281.167 immagini di addestramento di ImageNet-1K, prive di ground-truth di profondità, e associa ogni immagine a una pseudo-mappa di profondità prodotta da un modello insegnante Depth Anything V3 (monoculare e metrico). Viene utilizzato esclusivamente per la distillazione della conoscenza e per la varietà di scene e oggetti offerta da ImageNet. Essendo la singola fonte più ampia nel mix di pre-addestramento YOLO26-Depth di circa 2,19 milioni di immagini (circa il 58%), la sua aggiunta è stata decisiva per la generalizzazione cross-dominio in ambienti interni.
Link to this sectionCaratteristiche principali#
- 1.281.167 immagini di addestramento ImageNet-1K che coprono una gamma molto ampia di oggetti, scene e contesti.
- Nessun ground-truth di profondità: ogni target di profondità è una pseudo-etichetta generata da un insegnante Depth Anything V3 (monoculare, metrico).
- Utilizzato esclusivamente per la distillazione della conoscenza e per la varietà di scene/oggetti, non come benchmark.
- La singola fonte più ampia nel mix di pre-addestramento di circa 2,19 milioni di immagini (~58%), decisiva per la generalizzazione cross-dominio in ambienti interni.
- Nessuno split di validazione: la validazione viene eseguita solo su dataset con ground-truth reale.
Link to this sectionStruttura del dataset#
La fonte ImageNet pseudo-etichettata consiste nelle immagini di addestramento ImageNet-1K con una mappa di profondità generata automaticamente per immagine:
- Immagini di addestramento: 1.281.167 immagini di addestramento ImageNet-1K, il componente singolo più grande (~58%) del mix di pre-addestramento YOLO26-Depth di circa 2,19 milioni di immagini.
- Validazione: nessuna. Questa fonte non ha uno split di validazione; la validazione di YOLO26-Depth utilizza solo dataset con ground-truth reale come NYU Depth V2 e KITTI Eigen.
Link to this sectionCome vengono generate le pseudo-etichette#
Poiché ImageNet viene distribuito senza annotazioni di profondità, i target di profondità vengono prodotti offline anziché misurati:
- Ogni immagine di addestramento ImageNet viene elaborata tramite un modello insegnante pre-addestrato Depth Anything V3 per prevedere una mappa di profondità metrica per pixel.
- La previsione dell'insegnante viene salvata come un array float32
.npyin metri, seguendo il formato del dataset di profondità Ultralytics, e associata alla sua immagine sorgente tramite il nome del file. - Le coppie pseudo-etichettate vengono quindi aggiunte come componente di un mix di addestramento più ampio, in cui un modello studente YOLO26-Depth impara a imitare l'insegnante mentre si addestra anche su sorgenti con ground-truth reale.
Questa fonte pseudo-etichettata è un componente della configurazione di addestramento misto interna utilizzata per pre-addestrare i pesi YOLO26-Depth rilasciati e non viene distribuita come download autonomo.
Link to this sectionRuolo in YOLO26-Depth#
Questa fonte contribuisce alla maggior parte dei dati di pre-addestramento di YOLO26-Depth e alla più ampia varietà di scene e oggetti. Distillando un potente insegnante Depth Anything V3 su oltre un milione di immagini, trasferisce ampi prior di scena allo studente. In pratica, la sua aggiunta è stata decisiva per la generalizzazione cross-dominio in ambienti interni, aiutando il modello a ottenere buone prestazioni su scene al chiuso oltre le distribuzioni di addestramento con ground-truth reale.
Link to this sectionUtilizzo#
I dati ImageNet pseudo-etichettati non vengono addestrati isolatamente; vengono utilizzati come un componente di un mix di profondità combinato, definito da uno YAML interno/sperimentale anziché da un download di dataset pubblico. Concettualmente, l'addestramento su un tale mix appare così:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionModelli pre-addestrati#
I modelli YOLO26-Depth pre-addestrati si scaricano automaticamente dalla release degli asset v8.4.0 di Ultralytics quando vengono citati per nome per la prima volta:
Link to this sectionCitazioni e riconoscimenti#
Se utilizzi il dataset ImageNet nella tua attività di ricerca o sviluppo, ti preghiamo di citare il seguente documento:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Desideriamo ringraziare il team di ImageNet per aver creato e mantenuto il dataset, e gli autori di Depth Anything per il modello insegnante utilizzato per generare le pseudo-etichette di profondità.