Ultralytics YOLO27:

Conjunto de dados de profundidade ImageNet (com rótulos pseudoanotados)#

O conjunto de dados ImageNet (profundidade pseudoanotada) reutiliza as 1,281,167 imagens de treinamento do ImageNet-1K, que não têm valores de referência de profundidade, e associa cada imagem a um mapa de profundidade pseudoanotado produzido por um modelo professor Depth Anything 3, que combina os seus checkpoints monocular e métrico. É usado exclusivamente para destilação de conhecimento e para aproveitar a diversidade de cenas e objetos fornecida pelo ImageNet. Como a maior fonte individual na combinação de pré-treinamento do YOLO26-Depth, com cerca de 2.19M de imagens (aproximadamente 58%), a sua inclusão foi decisiva para a generalização entre domínios em ambientes internos.

Principais funcionalidades#

  • 1,281,167 imagens de treinamento do ImageNet-1K, abrangendo uma variedade muito ampla de objetos, cenas e contextos.
  • Sem valores de referência de profundidade: cada alvo de profundidade é um rótulo pseudoanotado gerado por um modelo professor Depth Anything 3 que combina (DA3MONO-LARGE para a estrutura da cena e DA3METRIC-LARGE para a escala métrica).
  • Usado exclusivamente para destilação de conhecimento e diversidade de cenas e objetos, não como benchmark.
  • A maior fonte individual na combinação de pré-treinamento com ~2.19M de imagens (~58%), decisiva para a generalização entre domínios em ambientes internos.
  • Não há divisão de validação — a validação é feita apenas com conjuntos de dados reais com valores de referência.

Estrutura do conjunto de dados#

A fonte pseudoanotada ImageNet consiste nas imagens de treinamento do ImageNet-1K, cada uma com um mapa de profundidade gerado por máquina:

  1. Imagens de treinamento: 1,281,167 imagens de treinamento do ImageNet-1K, o maior componente individual (~58%) da combinação de pré-treinamento do YOLO26-Depth, com ~2.19M de imagens.
  2. Validação: nenhuma. Esta fonte não tem uma divisão de validação; a validação do YOLO26-Depth usa apenas conjuntos de dados reais com valores de referência, como NYU Depth V2 e KITTI Eigen.

Como são gerados os rótulos pseudoanotados#

Como o ImageNet não inclui anotações de profundidade, os alvos de profundidade são gerados offline em vez de serem medidos. São combinados dois checkpoints do Depth Anything 3: um para a estrutura da cena e outro para a escala absoluta:

  1. Cada imagem de treinamento do ImageNet é processada com depth-anything/DA3MONO-LARGE, que prevê um mapa de profundidade altamente detalhado, definido apenas até uma escala e um desvio desconhecidos por imagem, e com depth-anything/DA3METRIC-LARGE, cuja saída é mais grosseira, mas está expressa em unidades reais.
  2. Um ajuste afim robusto por imagem mapeia a previsão monocular para a previsão métrica, label = a * mono + b. Assim, todos os detalhes por píxel vêm do checkpoint monocular, enquanto o checkpoint métrico define apenas os dois escalares que posicionam o mapa no eixo dos metros. Não são necessárias intrínsecas da câmara, pelo que é possível atribuir rótulos a imagens sem calibração.
  3. O resultado é guardado como um PNG de 16 bits em milímetros, de acordo com o formato de conjunto de dados de profundidade do Ultralytics, e associado à imagem de origem pelo nome-base do ficheiro.
  4. Os pares pseudoanotados são então adicionados como um componente de uma combinação de treinamento maior, na qual um modelo aluno YOLO26-Depth aprende a reproduzir o modelo professor enquanto também é treinado com fontes reais com valores de referência.

Como a escala vem de uma previsão, e não de uma medição, cada mapa pode apresentar um erro de escala global. O YOLO26-Depth é treinado com uma função de perda logarítmica invariante à escala (SILog), além da correspondência de gradientes, e é validado com alinhamento pela mediana; por isso, um desvio de escala por imagem nos rótulos pseudoanotados é, em grande parte, absorvido.

Esta fonte pseudoanotada é um componente da configuração interna de treinamento combinado usada para pré-treinar os pesos YOLO26-Depth disponibilizados e não é distribuída como uma transferência independente.

Papel no YOLO26-Depth#

Esta fonte fornece a maior parte dos dados de pré-treinamento do YOLO26-Depth e a maior diversidade de cenas e objetos. Ao destilar um modelo professor Depth Anything 3 robusto em mais de um milhão de imagens, transfere conhecimentos gerais sobre cenas para o modelo aluno. Na prática, a sua inclusão foi decisiva para a generalização entre domínios em ambientes internos, ajudando o modelo a ter um bom desempenho em cenas internas fora das distribuições reais de treinamento com valores de referência.

Uso#

Os dados ImageNet pseudoanotados não são usados isoladamente no treinamento; são consumidos como um componente de uma combinação de profundidade, definida por um YAML interno ou experimental, em vez de uma transferência pública do conjunto de dados. Em termos conceptuais, o treinamento com essa combinação é semelhante ao seguinte:

Exemplo de treino
from ultralytics import YOLO

# Carrega um modelo de profundidade pré-treinado
model = YOLO("yolo26n-depth.pt")

# Treinar com uma combinação de profundidade (o teu próprio YAML de conjunto de dados com várias fontes)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modelos pré-treinados#

Os modelos YOLO26-Depth pré-treinados são transferidos automaticamente da versão de assets v8.4.0 do Ultralytics quando são referenciados pelo nome pela primeira vez:

Citações e agradecimentos#

Se usares o conjunto de dados ImageNet no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:

Citação
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Agradecemos à equipa do ImageNet por criar e manter o conjunto de dados, e aos autores de Depth Anything 3 pelos modelos professores utilizados para gerar os rótulos de profundidade pseudo-rotulados.

Perguntas frequentes#

  • Reutiliza as 1,281,167 imagens de treino do ImageNet-1K, que não têm profundidade medida, e associa cada uma a um mapa de profundidade previsto por um modelo professor Depth Anything 3. É a maior fonte individual da combinação de pré-treino de aproximadamente 2.19M de imagens do YOLO26-Depth (cerca de 58%) e é utilizada exclusivamente para destilação de conhecimento e diversidade de cenas.

  • Cada imagem é processada por DA3MONO-LARGE para obter uma estrutura relativa detalhada e por DA3METRIC-LARGE para obter a escala métrica. Um ajuste afim robusto por imagem mapeia a previsão monocular para a previsão métrica, e o resultado é guardado como um PNG de 16 bits em milímetros no formato de profundidade da Ultralytics. Consulta Como são gerados os rótulos pseudo-rotulados para obteres mais detalhes.

  • Não. Esta fonte faz parte da configuração interna de treino misto que está na base dos pesos YOLO26-Depth disponibilizados e não é distribuída como transferência autónoma. Para criar um conjunto semelhante, gera rótulos pseudo-rotulados para as tuas próprias imagens com um modelo professor de profundidade e guarda-os no esquema de profundidade padrão.

Comentários