Conjunto de Dados de Profundidade (Pseudo-Rotulado) do ImageNet#
O conjunto de dados ImageNet (com profundidade rotulada por pseudorroֻtulo) reutiliza as 1.281.167 imagens de treino do ImageNet-1K, que não têm profundidade real (ground-truth), e associa cada imagem a um pseudomapa de profundidade produzido por um modelo de ensino Depth Anything 3, combinando os seus pontos de controlo (checkpoints) monocular e métrico. É utilizado puramente para destilação de conhecimento e para a diversidade de cenas e objetos que o ImageNet fornece. Sendo a maior fonte única na mistura de pré-treino de aproximadamente 2,19M de imagens do YOLO26-Depth (cerca de 58%), a sua adição foi decisiva para a generalização cross-domain em interiores.
Principais recursos#
- 1.281.167 imagens de treino do ImageNet-1K cobrindo uma gama muito ampla de objetos, cenas e contextos.
- Sem profundidade real (ground-truth): cada alvo de profundidade é um pseudorrótulo gerado por um modelo de ensino Depth Anything 3 emparelhando (
DA3MONO-LARGEpara a estrutura da cena,DA3METRIC-LARGEpara a escala métrica). - Usado puramente para destilação de conhecimento e diversidade de cena/objeto, não como um benchmark.
- A maior fonte individual na mistura de pré-treino de ~2,19M de imagens (~58%), decisiva para a generalização entre domínios em ambientes internos.
- Sem divisão de validação — a validação é realizada apenas em conjuntos de dados reais de ground-truth.
Estrutura do Dataset#
A fonte ImageNet pseudo-rotulada consiste nas imagens de treino do ImageNet-1K com um mapa de profundidade gerado por máquina por imagem:
- Imagens de treino: 1.281.167 imagens de treino do ImageNet-1K, o maior componente individual (~58%) da mistura de pré-treino de ~2,19M de imagens do YOLO26-Depth.
- Validação: nenhuma. Esta fonte não possui divisão de validação; a validação do YOLO26-Depth usa apenas conjuntos de dados reais de ground-truth, como NYU Depth V2 e KITTI Eigen.
Como os pseudo-rótulos são gerados#
Como o ImageNet é fornecido sem anotações de profundidade, os alvos de profundidade são produzidos offline em vez de medidos. Dois pontos de controlo (checkpoints) do Depth Anything 3 são combinados, um para a estrutura da cena e outro para a escala absoluta:
- Cada imagem de treino do ImageNet passa por
depth-anything/DA3MONO-LARGE, que previne um mapa de profundidade altamente detalhado que apenas é definido até uma escala e deslocamento (shift) desconhecidos por imagem, e pordepth-anything/DA3METRIC-LARGE, cuja saída é mais grosseira mas em unidades reais. - Um ajuste afim robusto por imagem mapeia a previsão monocular na métrica,
label = a * mono + b. Portanto, cada detalhe por pixel provém do ponto de controlo (checkpoint) monocular, enquanto o ponto de controlo (checkpoint) métrico define apenas os dois escalares que colocam o mapa no eixo dos metros. Não são envolvidos parâmetros intrínsecos da câmara, pelo que imagens sem calibração podem ser rotuladas. - O resultado é salvo como um PNG de 16 bits em milímetros, seguindo o formato de dataset de profundidade do Ultralytics, e emparelhado com sua imagem de origem pelo nome do arquivo.
- Os pares pseudo-rotulados são então adicionados como um componente de uma mistura de treino maior, onde um modelo aluno YOLO26-Depth aprende a corresponder ao professor enquanto também treina em fontes reais de ground-truth.
Como a escala provém de uma previsão e não de uma medição, cada mapa pode conter um erro de escala global. O YOLO26-Depth treina com uma perda logarítmica invariável à escala (SILog) mais correspondência de gradientes e valida com alinhamento de mediana, pelo que um desvio de escala por imagem nos pseudorrótulos é amplamente absorvido.
Esta fonte pseudo-rotulada é um componente da configuração de treino misto interno usada para pré-treinar os pesos do YOLO26-Depth lançados e não é distribuída como um download independente.
Papel no YOLO26-Depth#
Esta fonte contribui com a maior parte dos dados de pré-treino do YOLO26-Depth e com a maior diversidade de cenas e objetos. Ao destilar um forte professor Depth Anything 3 ao longo de mais de um milhão de imagens, transfere amplos priores de cena para o aluno. Na prática, a sua adição foi decisiva para a generalização cross-domain em interiores, ajudando o modelo a ter um bom desempenho em cenas de interior para além das distribuições reais de treino ground-truth.
Uso#
Os dados do ImageNet pseudo-rotulados não são treinados isoladamente; eles são consumidos como um componente de uma mistura de profundidade combinada, definida por um YAML interno/de experimento em vez de um download de conjunto de dados público. Conceitualmente, o treino em tal mistura parece o seguinte:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Modelos pré-treinados#
Os modelos pré-treinados YOLO26-Depth são baixados automaticamente do lançamento de ativos v8.4.0 da Ultralytics quando referenciados pela primeira vez pelo nome:
Citações e Agradecimentos#
Se você usar o conjunto de dados ImageNet em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Gostaríamos de agradecer à equipa do ImageNet por criar e manter o conjunto de dados, e aos autores do Depth Anything 3 pelos modelos de professores utilizados para gerar os pseudorrótulos de profundidade.