Link to this sectionConjunto de Dados de Profundidade (Pseudo-Rotulado) do ImageNet#
O conjunto de dados ImageNet (profundidade pseudo-rotulada) reutiliza as 1.281.167 imagens de treino do ImageNet-1K, que não possuem profundidade real (ground-truth), e emparelha cada imagem com um mapa de pseudo-profundidade produzido por um modelo professor Depth Anything V3 (monocular e métrico). Ele é usado puramente para destilação de conhecimento e pela diversidade de cenas e objetos que o ImageNet oferece. Como a maior fonte individual na mistura de pré-treino de aproximadamente 2,19M de imagens do YOLO26-Depth (cerca de 58%), adicioná-lo foi decisivo para a generalização entre domínios em ambientes internos.
Link to this sectionPrincipais recursos#
- 1.281.167 imagens de treino do ImageNet-1K cobrindo uma gama muito ampla de objetos, cenas e contextos.
- Sem profundidade ground-truth: cada alvo de profundidade é um pseudo-rótulo gerado por um professor Depth Anything V3 (monocular, métrico).
- Usado puramente para destilação de conhecimento e diversidade de cena/objeto, não como um benchmark.
- A maior fonte individual na mistura de pré-treino de ~2,19M de imagens (~58%), decisiva para a generalização entre domínios em ambientes internos.
- Sem divisão de validação — a validação é realizada apenas em conjuntos de dados reais de ground-truth.
Link to this sectionEstrutura do Dataset#
A fonte ImageNet pseudo-rotulada consiste nas imagens de treino do ImageNet-1K com um mapa de profundidade gerado por máquina por imagem:
- Imagens de treino: 1.281.167 imagens de treino do ImageNet-1K, o maior componente individual (~58%) da mistura de pré-treino de ~2,19M de imagens do YOLO26-Depth.
- Validação: nenhuma. Esta fonte não possui divisão de validação; a validação do YOLO26-Depth usa apenas conjuntos de dados reais de ground-truth, como NYU Depth V2 e KITTI Eigen.
Link to this sectionComo os pseudo-rótulos são gerados#
Como o ImageNet é disponibilizado sem anotações de profundidade, os alvos de profundidade são produzidos offline em vez de medidos:
- Cada imagem de treino do ImageNet é processada por um modelo professor Depth Anything V3 pré-treinado para prever um mapa de profundidade métrico por pixel.
- A previsão do professor é salva como um array
.npyfloat32 em metros, seguindo o formato de conjunto de dados de profundidade da Ultralytics, e emparelhada com sua imagem de origem pelo nome do arquivo. - Os pares pseudo-rotulados são então adicionados como um componente de uma mistura de treino maior, onde um modelo aluno YOLO26-Depth aprende a corresponder ao professor enquanto também treina em fontes reais de ground-truth.
Esta fonte pseudo-rotulada é um componente da configuração de treino misto interno usada para pré-treinar os pesos do YOLO26-Depth lançados e não é distribuída como um download independente.
Link to this sectionPapel no YOLO26-Depth#
Esta fonte contribui com a maior parte dos dados de pré-treino do YOLO26-Depth e a maior diversidade de cenas e objetos. Ao destilar um professor forte Depth Anything V3 em mais de um milhão de imagens, ela transfere amplos priors de cena para o aluno. Na prática, adicioná-la foi decisivo para a generalização entre domínios em ambientes internos, ajudando o modelo a ter um bom desempenho em cenas internas além das distribuições reais de treino de ground-truth.
Link to this sectionUso#
Os dados do ImageNet pseudo-rotulados não são treinados isoladamente; eles são consumidos como um componente de uma mistura de profundidade combinada, definida por um YAML interno/de experimento em vez de um download de conjunto de dados público. Conceitualmente, o treino em tal mistura parece o seguinte:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionModelos pré-treinados#
Modelos YOLO26-Depth pré-treinados baixam automaticamente do lançamento de ativos v8.4.0 da Ultralytics quando referenciados pelo nome pela primeira vez:
Link to this sectionCitações e Agradecimentos#
Se você usar o conjunto de dados ImageNet em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Gostaríamos de agradecer à equipe do ImageNet pela criação e manutenção do conjunto de dados, e aos autores do Depth Anything pelo modelo professor usado para gerar os pseudo-rótulos de profundidade.