Conjunto de dados de profundidade ImageNet (com rótulos pseudoanotados)#
O conjunto de dados ImageNet (profundidade pseudoanotada) reutiliza as 1,281,167 imagens de treinamento do ImageNet-1K, que não têm valores de referência de profundidade, e associa cada imagem a um mapa de profundidade pseudoanotado produzido por um modelo professor Depth Anything 3, que combina os seus checkpoints monocular e métrico. É usado exclusivamente para destilação de conhecimento e para aproveitar a diversidade de cenas e objetos fornecida pelo ImageNet. Como a maior fonte individual na combinação de pré-treinamento do YOLO26-Depth, com cerca de 2.19M de imagens (aproximadamente 58%), a sua inclusão foi decisiva para a generalização entre domínios em ambientes internos.
Principais funcionalidades#
- 1,281,167 imagens de treinamento do ImageNet-1K, abrangendo uma variedade muito ampla de objetos, cenas e contextos.
- Sem valores de referência de profundidade: cada alvo de profundidade é um rótulo pseudoanotado gerado por um modelo professor Depth Anything 3 que combina (
DA3MONO-LARGEpara a estrutura da cena eDA3METRIC-LARGEpara a escala métrica). - Usado exclusivamente para destilação de conhecimento e diversidade de cenas e objetos, não como benchmark.
- A maior fonte individual na combinação de pré-treinamento com ~2.19M de imagens (~58%), decisiva para a generalização entre domínios em ambientes internos.
- Não há divisão de validação — a validação é feita apenas com conjuntos de dados reais com valores de referência.
Estrutura do conjunto de dados#
A fonte pseudoanotada ImageNet consiste nas imagens de treinamento do ImageNet-1K, cada uma com um mapa de profundidade gerado por máquina:
- Imagens de treinamento: 1,281,167 imagens de treinamento do ImageNet-1K, o maior componente individual (~58%) da combinação de pré-treinamento do YOLO26-Depth, com ~2.19M de imagens.
- Validação: nenhuma. Esta fonte não tem uma divisão de validação; a validação do YOLO26-Depth usa apenas conjuntos de dados reais com valores de referência, como NYU Depth V2 e KITTI Eigen.
Como são gerados os rótulos pseudoanotados#
Como o ImageNet não inclui anotações de profundidade, os alvos de profundidade são gerados offline em vez de serem medidos. São combinados dois checkpoints do Depth Anything 3: um para a estrutura da cena e outro para a escala absoluta:
- Cada imagem de treinamento do ImageNet é processada com
depth-anything/DA3MONO-LARGE, que prevê um mapa de profundidade altamente detalhado, definido apenas até uma escala e um desvio desconhecidos por imagem, e comdepth-anything/DA3METRIC-LARGE, cuja saída é mais grosseira, mas está expressa em unidades reais. - Um ajuste afim robusto por imagem mapeia a previsão monocular para a previsão métrica,
label = a * mono + b. Assim, todos os detalhes por píxel vêm do checkpoint monocular, enquanto o checkpoint métrico define apenas os dois escalares que posicionam o mapa no eixo dos metros. Não são necessárias intrínsecas da câmara, pelo que é possível atribuir rótulos a imagens sem calibração. - O resultado é guardado como um PNG de 16 bits em milímetros, de acordo com o formato de conjunto de dados de profundidade do Ultralytics, e associado à imagem de origem pelo nome-base do ficheiro.
- Os pares pseudoanotados são então adicionados como um componente de uma combinação de treinamento maior, na qual um modelo aluno YOLO26-Depth aprende a reproduzir o modelo professor enquanto também é treinado com fontes reais com valores de referência.
Como a escala vem de uma previsão, e não de uma medição, cada mapa pode apresentar um erro de escala global. O YOLO26-Depth é treinado com uma função de perda logarítmica invariante à escala (SILog), além da correspondência de gradientes, e é validado com alinhamento pela mediana; por isso, um desvio de escala por imagem nos rótulos pseudoanotados é, em grande parte, absorvido.
Esta fonte pseudoanotada é um componente da configuração interna de treinamento combinado usada para pré-treinar os pesos YOLO26-Depth disponibilizados e não é distribuída como uma transferência independente.
Papel no YOLO26-Depth#
Esta fonte fornece a maior parte dos dados de pré-treinamento do YOLO26-Depth e a maior diversidade de cenas e objetos. Ao destilar um modelo professor Depth Anything 3 robusto em mais de um milhão de imagens, transfere conhecimentos gerais sobre cenas para o modelo aluno. Na prática, a sua inclusão foi decisiva para a generalização entre domínios em ambientes internos, ajudando o modelo a ter um bom desempenho em cenas internas fora das distribuições reais de treinamento com valores de referência.
Uso#
Os dados ImageNet pseudoanotados não são usados isoladamente no treinamento; são consumidos como um componente de uma combinação de profundidade, definida por um YAML interno ou experimental, em vez de uma transferência pública do conjunto de dados. Em termos conceptuais, o treinamento com essa combinação é semelhante ao seguinte:
from ultralytics import YOLO
# Carrega um modelo de profundidade pré-treinado
model = YOLO("yolo26n-depth.pt")
# Treinar com uma combinação de profundidade (o teu próprio YAML de conjunto de dados com várias fontes)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Modelos pré-treinados#
Os modelos YOLO26-Depth pré-treinados são transferidos automaticamente da versão de assets v8.4.0 do Ultralytics quando são referenciados pelo nome pela primeira vez:
Citações e agradecimentos#
Se usares o conjunto de dados ImageNet no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Agradecemos à equipa do ImageNet por criar e manter o conjunto de dados, e aos autores de Depth Anything 3 pelos modelos professores utilizados para gerar os rótulos de profundidade pseudo-rotulados.
Perguntas frequentes#
Reutiliza as 1,281,167 imagens de treino do ImageNet-1K, que não têm profundidade medida, e associa cada uma a um mapa de profundidade previsto por um modelo professor Depth Anything 3. É a maior fonte individual da combinação de pré-treino de aproximadamente 2.19M de imagens do YOLO26-Depth (cerca de 58%) e é utilizada exclusivamente para destilação de conhecimento e diversidade de cenas.
Cada imagem é processada por
DA3MONO-LARGEpara obter uma estrutura relativa detalhada e porDA3METRIC-LARGEpara obter a escala métrica. Um ajuste afim robusto por imagem mapeia a previsão monocular para a previsão métrica, e o resultado é guardado como um PNG de 16 bits em milímetros no formato de profundidade da Ultralytics. Consulta Como são gerados os rótulos pseudo-rotulados para obteres mais detalhes.Não. Esta fonte faz parte da configuração interna de treino misto que está na base dos pesos YOLO26-Depth disponibilizados e não é distribuída como transferência autónoma. Para criar um conjunto semelhante, gera rótulos pseudo-rotulados para as tuas próprias imagens com um modelo professor de profundidade e guarda-os no esquema de profundidade padrão.