Segurança pronta para empresas: Em conformidade com ISO 27001 + SOC 2 Tipo I.

Link to this sectionConjunto de Dados de Profundidade (Pseudo-Rotulado) do ImageNet#

O conjunto de dados ImageNet (profundidade pseudo-rotulada) reutiliza as 1.281.167 imagens de treino do ImageNet-1K, que não possuem profundidade real (ground-truth), e emparelha cada imagem com um mapa de pseudo-profundidade produzido por um modelo professor Depth Anything V3 (monocular e métrico). Ele é usado puramente para destilação de conhecimento e pela diversidade de cenas e objetos que o ImageNet oferece. Como a maior fonte individual na mistura de pré-treino de aproximadamente 2,19M de imagens do YOLO26-Depth (cerca de 58%), adicioná-lo foi decisivo para a generalização entre domínios em ambientes internos.

Link to this sectionPrincipais recursos#

  • 1.281.167 imagens de treino do ImageNet-1K cobrindo uma gama muito ampla de objetos, cenas e contextos.
  • Sem profundidade ground-truth: cada alvo de profundidade é um pseudo-rótulo gerado por um professor Depth Anything V3 (monocular, métrico).
  • Usado puramente para destilação de conhecimento e diversidade de cena/objeto, não como um benchmark.
  • A maior fonte individual na mistura de pré-treino de ~2,19M de imagens (~58%), decisiva para a generalização entre domínios em ambientes internos.
  • Sem divisão de validação — a validação é realizada apenas em conjuntos de dados reais de ground-truth.

Link to this sectionEstrutura do Dataset#

A fonte ImageNet pseudo-rotulada consiste nas imagens de treino do ImageNet-1K com um mapa de profundidade gerado por máquina por imagem:

  1. Imagens de treino: 1.281.167 imagens de treino do ImageNet-1K, o maior componente individual (~58%) da mistura de pré-treino de ~2,19M de imagens do YOLO26-Depth.
  2. Validação: nenhuma. Esta fonte não possui divisão de validação; a validação do YOLO26-Depth usa apenas conjuntos de dados reais de ground-truth, como NYU Depth V2 e KITTI Eigen.

Link to this sectionComo os pseudo-rótulos são gerados#

Como o ImageNet é disponibilizado sem anotações de profundidade, os alvos de profundidade são produzidos offline em vez de medidos:

  1. Cada imagem de treino do ImageNet é processada por um modelo professor Depth Anything V3 pré-treinado para prever um mapa de profundidade métrico por pixel.
  2. A previsão do professor é salva como um array .npy float32 em metros, seguindo o formato de conjunto de dados de profundidade da Ultralytics, e emparelhada com sua imagem de origem pelo nome do arquivo.
  3. Os pares pseudo-rotulados são então adicionados como um componente de uma mistura de treino maior, onde um modelo aluno YOLO26-Depth aprende a corresponder ao professor enquanto também treina em fontes reais de ground-truth.

Esta fonte pseudo-rotulada é um componente da configuração de treino misto interno usada para pré-treinar os pesos do YOLO26-Depth lançados e não é distribuída como um download independente.

Link to this sectionPapel no YOLO26-Depth#

Esta fonte contribui com a maior parte dos dados de pré-treino do YOLO26-Depth e a maior diversidade de cenas e objetos. Ao destilar um professor forte Depth Anything V3 em mais de um milhão de imagens, ela transfere amplos priors de cena para o aluno. Na prática, adicioná-la foi decisivo para a generalização entre domínios em ambientes internos, ajudando o modelo a ter um bom desempenho em cenas internas além das distribuições reais de treino de ground-truth.

Link to this sectionUso#

Os dados do ImageNet pseudo-rotulados não são treinados isoladamente; eles são consumidos como um componente de uma mistura de profundidade combinada, definida por um YAML interno/de experimento em vez de um download de conjunto de dados público. Conceitualmente, o treino em tal mistura parece o seguinte:

Exemplo de Treinamento
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Link to this sectionModelos pré-treinados#

Modelos YOLO26-Depth pré-treinados baixam automaticamente do lançamento de ativos v8.4.0 da Ultralytics quando referenciados pelo nome pela primeira vez:

Link to this sectionCitações e Agradecimentos#

Se você usar o conjunto de dados ImageNet em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:

Citação
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

Gostaríamos de agradecer à equipe do ImageNet pela criação e manutenção do conjunto de dados, e aos autores do Depth Anything pelo modelo professor usado para gerar os pseudo-rótulos de profundidade.

Contribuidores

Comentários