Ultralytics YOLO27:

Dataset de profundidade ImageNet (com rótulos pseudo-rotulados)#

O dataset ImageNet (profundidade com rótulos pseudo-rotulados) reutiliza as 1,281,167 imagens de treino do ImageNet-1K, que não têm profundidade de referência, e associa cada imagem a um mapa de profundidade pseudo-rotulado produzido por um professor Depth Anything 3, combinando os seus checkpoints monocular e métrico. É utilizado exclusivamente para destilação de conhecimento e pela diversidade de cenas e objetos fornecida pelo ImageNet. Sendo a maior fonte individual na mistura de pré-treino do YOLO26-Depth, com cerca de 2,19 milhões de imagens (aproximadamente 58%), a sua inclusão foi decisiva para a generalização entre domínios em ambientes interiores.

Principais funcionalidades#

  • 1,281,167 imagens de treino do ImageNet-1K, abrangendo uma variedade muito ampla de objetos, cenas e contextos.
  • Sem profundidade de referência: cada alvo de profundidade é um rótulo pseudo-rotulado gerado por um professor Depth Anything 3 que combina (DA3MONO-LARGE para a estrutura da cena, DA3METRIC-LARGE para a escala métrica).
  • Utilizado exclusivamente para destilação de conhecimento e diversidade de cenas/objetos, não como benchmark.
  • A maior fonte individual na mistura de pré-treino de ~2,19 milhões de imagens (~58%), decisiva para a generalização entre domínios em ambientes interiores.
  • Sem divisão de validação — a validação é realizada apenas em datasets reais com valores de referência.

Estrutura do Conjunto de Dados#

A fonte ImageNet com rótulos pseudo-rotulados consiste nas imagens de treino do ImageNet-1K, com um mapa de profundidade gerado por máquina para cada imagem:

  1. Imagens de treino: 1,281,167 imagens de treino do ImageNet-1K, o maior componente individual (~58%) da mistura de pré-treino do YOLO26-Depth, com ~2,19 milhões de imagens.
  2. Validação: nenhuma. Esta fonte não tem divisão de validação; a validação do YOLO26-Depth utiliza apenas datasets reais com valores de referência, como NYU Depth V2 e KITTI Eigen.

Como os rótulos pseudo-rotulados são gerados#

Como o ImageNet é distribuído sem anotações de profundidade, os alvos de profundidade são produzidos offline, em vez de medidos. São combinados dois checkpoints do Depth Anything 3, um para a estrutura da cena e outro para a escala absoluta:

  1. Cada imagem de treino do ImageNet é processada pelo depth-anything/DA3MONO-LARGE, que prevê um mapa de profundidade altamente detalhado, definido apenas até uma escala e uma translação desconhecidas por imagem, e pelo depth-anything/DA3METRIC-LARGE, cuja saída é mais grosseira, mas está em unidades reais.
  2. Um ajuste afim robusto por imagem mapeia a previsão monocular para a métrica, label = a * mono + b. Assim, todos os detalhes por pixel provêm do checkpoint monocular, enquanto o checkpoint métrico apenas define os dois escalares que posicionam o mapa no eixo dos metros. Não são utilizados parâmetros intrínsecos da câmara, pelo que imagens sem calibração podem ser rotuladas.
  3. O resultado é guardado como um PNG de 16 bits em milímetros, seguindo o formato de dataset de profundidade da Ultralytics, e associado à sua imagem de origem pelo nome-base do ficheiro.
  4. Os pares com rótulos pseudo-rotulados são então adicionados como um componente de uma mistura de treino maior, na qual um modelo YOLO26-Depth aluno aprende a reproduzir o professor, enquanto também treina com fontes reais com valores de referência.

Como a escala provém de uma previsão e não de uma medição, cada mapa pode conter um erro de escala global. O YOLO26-Depth treina com uma perda de logaritmo invariante à escala (SILog), além de correspondência de gradientes, e valida com alinhamento pela mediana, pelo que um desvio de escala por imagem nos rótulos pseudo-rotulados é, em grande medida, absorvido.

Esta fonte com rótulos pseudo-rotulados é um componente da configuração interna de treino misto utilizada para pré-treinar os pesos YOLO26-Depth disponibilizados e não é distribuída como um download autónomo.

Função no YOLO26-Depth#

Esta fonte contribui com a maior parte dos dados de pré-treino do YOLO26-Depth e com a maior diversidade de cenas e objetos. Ao destilar um professor Depth Anything 3 robusto em mais de um milhão de imagens, transfere priors de cena abrangentes para o aluno. Na prática, a sua inclusão foi decisiva para a generalização entre domínios em ambientes interiores, ajudando o modelo a ter um bom desempenho em cenas interiores além das distribuições de treino reais com valores de referência.

Utilização#

Os dados ImageNet com rótulos pseudo-rotulados não são utilizados para treino de forma isolada; são consumidos como um componente de uma mistura de profundidade combinada, definida por um YAML interno/experimental e não por um download público do dataset. Conceptualmente, o treino com uma mistura deste tipo é semelhante ao seguinte:

Exemplo de treino
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modelos pré-treinados#

Os modelos YOLO26-Depth pré-treinados são descarregados automaticamente a partir da versão de lançamento de assets v8.4.0 da Ultralytics quando são referenciados pela primeira vez pelo nome:

Citações e agradecimentos#

Se utilizares o dataset ImageNet no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:

Citação
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Gostaríamos de agradecer à equipa do ImageNet por criar e manter o dataset, bem como aos autores do Depth Anything 3 pelos modelos de professor utilizados para gerar os rótulos de profundidade pseudo-rotulados.

Perguntas frequentes#

  • Ele reutiliza as 1.281.167 imagens de treinamento do ImageNet-1K, que não possuem profundidade medida, e emparelha cada uma delas com um mapa de profundidade previsto por um professor Depth Anything 3. Ele é a maior fonte única na mistura de pré-treinamento YOLO26-Depth de aproximadamente 2,19 milhões de imagens (cerca de 58%) e é usado puramente para destilação de conhecimento e diversidade de cenas.

  • Cada imagem é processada por DA3MONO-LARGE para obter a estrutura relativa detalhada e por DA3METRIC-LARGE para a escala métrica. Um ajuste afim robusto por imagem mapeia a previsão monocular para a métrica, e o resultado é salvo como um PNG de 16 bits em milímetros no Ultralytics depth format. Consulta How the pseudo-labels are generated para obter detalhes.

  • Não. Esta fonte faz parte da configuração interna de treinamento misto por trás dos pesos YOLO26-Depth lançados e não é distribuída como um descarregamento independente. Para construir um conjunto semelhante, gera pseudo-rótulos para as tuas próprias imagens com um professor de profundidade e armazena-os no layout de profundidade padrão.

Comentários