Sicurezza pronta per le aziende: Conformità ISO 27001 + SOC 2 Type I.

Link to this sectionDataset di profondità ImageNet (pseudo-etichettato)#

Il dataset ImageNet (profondità pseudo-etichettata) riutilizza 1.281.167 immagini di addestramento di ImageNet-1K, prive di ground-truth di profondità, e associa ogni immagine a una pseudo-mappa di profondità prodotta da un modello insegnante Depth Anything V3 (monoculare e metrico). Viene utilizzato esclusivamente per la distillazione della conoscenza e per la varietà di scene e oggetti offerta da ImageNet. Essendo la singola fonte più ampia nel mix di pre-addestramento YOLO26-Depth di circa 2,19 milioni di immagini (circa il 58%), la sua aggiunta è stata decisiva per la generalizzazione cross-dominio in ambienti interni.

Link to this sectionCaratteristiche principali#

  • 1.281.167 immagini di addestramento ImageNet-1K che coprono una gamma molto ampia di oggetti, scene e contesti.
  • Nessun ground-truth di profondità: ogni target di profondità è una pseudo-etichetta generata da un insegnante Depth Anything V3 (monoculare, metrico).
  • Utilizzato esclusivamente per la distillazione della conoscenza e per la varietà di scene/oggetti, non come benchmark.
  • La singola fonte più ampia nel mix di pre-addestramento di circa 2,19 milioni di immagini (~58%), decisiva per la generalizzazione cross-dominio in ambienti interni.
  • Nessuno split di validazione: la validazione viene eseguita solo su dataset con ground-truth reale.

Link to this sectionStruttura del dataset#

La fonte ImageNet pseudo-etichettata consiste nelle immagini di addestramento ImageNet-1K con una mappa di profondità generata automaticamente per immagine:

  1. Immagini di addestramento: 1.281.167 immagini di addestramento ImageNet-1K, il componente singolo più grande (~58%) del mix di pre-addestramento YOLO26-Depth di circa 2,19 milioni di immagini.
  2. Validazione: nessuna. Questa fonte non ha uno split di validazione; la validazione di YOLO26-Depth utilizza solo dataset con ground-truth reale come NYU Depth V2 e KITTI Eigen.

Link to this sectionCome vengono generate le pseudo-etichette#

Poiché ImageNet viene distribuito senza annotazioni di profondità, i target di profondità vengono prodotti offline anziché misurati:

  1. Ogni immagine di addestramento ImageNet viene elaborata tramite un modello insegnante pre-addestrato Depth Anything V3 per prevedere una mappa di profondità metrica per pixel.
  2. La previsione dell'insegnante viene salvata come un array float32 .npy in metri, seguendo il formato del dataset di profondità Ultralytics, e associata alla sua immagine sorgente tramite il nome del file.
  3. Le coppie pseudo-etichettate vengono quindi aggiunte come componente di un mix di addestramento più ampio, in cui un modello studente YOLO26-Depth impara a imitare l'insegnante mentre si addestra anche su sorgenti con ground-truth reale.

Questa fonte pseudo-etichettata è un componente della configurazione di addestramento misto interna utilizzata per pre-addestrare i pesi YOLO26-Depth rilasciati e non viene distribuita come download autonomo.

Link to this sectionRuolo in YOLO26-Depth#

Questa fonte contribuisce alla maggior parte dei dati di pre-addestramento di YOLO26-Depth e alla più ampia varietà di scene e oggetti. Distillando un potente insegnante Depth Anything V3 su oltre un milione di immagini, trasferisce ampi prior di scena allo studente. In pratica, la sua aggiunta è stata decisiva per la generalizzazione cross-dominio in ambienti interni, aiutando il modello a ottenere buone prestazioni su scene al chiuso oltre le distribuzioni di addestramento con ground-truth reale.

Link to this sectionUtilizzo#

I dati ImageNet pseudo-etichettati non vengono addestrati isolatamente; vengono utilizzati come un componente di un mix di profondità combinato, definito da uno YAML interno/sperimentale anziché da un download di dataset pubblico. Concettualmente, l'addestramento su un tale mix appare così:

Esempio di Addestramento
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Link to this sectionModelli pre-addestrati#

I modelli YOLO26-Depth pre-addestrati si scaricano automaticamente dalla release degli asset v8.4.0 di Ultralytics quando vengono citati per nome per la prima volta:

Link to this sectionCitazioni e riconoscimenti#

Se utilizzi il dataset ImageNet nella tua attività di ricerca o sviluppo, ti preghiamo di citare il seguente documento:

Citazione
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

Desideriamo ringraziare il team di ImageNet per aver creato e mantenuto il dataset, e gli autori di Depth Anything per il modello insegnante utilizzato per generare le pseudo-etichette di profondità.

Contributori

Commenti