Ultralytics YOLO27:

Conjunto de datos de profundidad ImageNet (con etiquetas seudogeneradas)#

El conjunto de datos ImageNet (profundidad pseudoetiquetada) reutiliza las 1,281,167 imágenes de entrenamiento de ImageNet-1K, que no disponen de datos de profundidad de referencia, y empareja cada imagen con un mapa de profundidad pseudoetiquetado generado por un modelo de Depth Anything 3 que actúa como profesor y combina sus checkpoints monoculares y métricos. Se utiliza exclusivamente para la destilación de conocimiento y para aprovechar la diversidad de escenas y objetos que aporta ImageNet. En la mezcla de preentrenamiento de YOLO26-Depth, formada por aproximadamente 2.19M de imágenes, este conjunto es la fuente individual más grande (cerca del 58 %), y su incorporación fue decisiva para la generalización entre dominios en interiores.

Características principales#

  • 1,281,167 imágenes de entrenamiento de ImageNet-1K, que abarcan una gran variedad de objetos, escenas y contextos.
  • Sin datos de referencia de profundidad: cada objetivo de profundidad es una etiqueta seudogenerada por un modelo profesor Depth Anything 3 que combina (DA3MONO-LARGE para la estructura de la escena y DA3METRIC-LARGE para la escala métrica).
  • Se utiliza exclusivamente para la destilación de conocimiento y la diversidad de escenas y objetos, no como benchmark.
  • La mayor fuente de la mezcla de preentrenamiento de ~2.19M imágenes (~58 %), decisiva para la generalización entre dominios en interiores.
  • No hay partición de validación: la validación se realiza únicamente con conjuntos de datos reales que incluyen datos de referencia.

Estructura del conjunto de datos#

La fuente ImageNet con etiquetas seudogeneradas consiste en las imágenes de entrenamiento de ImageNet-1K, cada una con un mapa de profundidad generado por máquina:

  1. Imágenes de entrenamiento: 1,281,167 imágenes de entrenamiento de ImageNet-1K, el componente individual más grande (~58 %) de la mezcla de preentrenamiento de YOLO26-Depth, de ~2.19M de imágenes.
  2. Validación: ninguna. Esta fuente no tiene partición de validación; YOLO26-Depth se valida únicamente con conjuntos de datos reales que incluyen datos de referencia, como NYU Depth V2 y KITTI Eigen.

Cómo se generan las etiquetas seudogeneradas#

Como ImageNet no incluye anotaciones de profundidad, los objetivos de profundidad se generan sin conexión en lugar de medirse. Se combinan dos checkpoints de Depth Anything 3: uno para la estructura de la escena y otro para la escala absoluta:

  1. Cada imagen de entrenamiento de ImageNet se procesa con depth-anything/DA3MONO-LARGE, que predice un mapa de profundidad muy detallado definido solo hasta una escala y un desplazamiento desconocidos por imagen, y con depth-anything/DA3METRIC-LARGE, cuya salida es más aproximada, pero está expresada en unidades reales.
  2. Un ajuste afín robusto por imagen transforma la predicción monocular para ajustarla a la predicción métrica, label = a * mono + b. Por tanto, todos los detalles por píxel proceden del checkpoint monocular, mientras que el checkpoint métrico solo establece los dos escalares que sitúan el mapa en el eje de metros. No se utilizan parámetros intrínsecos de la cámara, por lo que se pueden etiquetar imágenes sin calibración.
  3. El resultado se guarda como un PNG de 16 bits en milímetros, según el formato de conjunto de datos de profundidad de Ultralytics, y se empareja con su imagen de origen mediante el nombre base del archivo.
  4. A continuación, se añaden los pares con etiquetas seudogeneradas como un componente de una mezcla de entrenamiento más amplia, en la que un modelo YOLO26-Depth alumno aprende a reproducir el modelo profesor y también se entrena con fuentes reales que incluyen datos de referencia.

Como la escala procede de una predicción y no de una medición, cada mapa puede tener un error de escala global. YOLO26-Depth se entrena con una pérdida logarítmica invariante a la escala (SILog), además de una pérdida de correspondencia de gradientes, y se valida con alineación de medianas; así, se absorbe en gran medida el desplazamiento de escala por imagen de las etiquetas seudogeneradas.

Esta fuente con etiquetas seudogeneradas forma parte de la configuración interna de entrenamiento combinado que se utiliza para preentrenar los pesos publicados de YOLO26-Depth y no se distribuye como descarga independiente.

Papel de YOLO26-Depth#

Esta fuente aporta la mayor parte de los datos de preentrenamiento de YOLO26-Depth y la máxima diversidad de escenas y objetos. Al destilar un modelo profesor sólido de Depth Anything 3 en más de un millón de imágenes, transfiere al modelo alumno conocimientos previos amplios sobre las escenas. En la práctica, su incorporación fue decisiva para la generalización entre dominios en interiores y ayuda al modelo a rendir bien en escenas interiores que quedan fuera de las distribuciones de entrenamiento con datos reales de referencia.

Uso#

Los datos de ImageNet con etiquetas seudogeneradas no se utilizan para entrenar de forma aislada, sino como un componente de una mezcla de profundidad combinada, definida mediante un YAML interno/de experimentación en lugar de una descarga pública del conjunto de datos. A nivel conceptual, el entrenamiento con una mezcla de este tipo es similar a lo siguiente:

Ejemplo de entrenamiento
from ultralytics import YOLO

# Carga un modelo de profundidad preentrenado
model = YOLO("yolo26n-depth.pt")

# entrenar con una mezcla de profundidad combinada (tu propio YAML de conjunto de datos con varias fuentes)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Modelos preentrenados#

Los modelos YOLO26-Depth preentrenados se descargan automáticamente desde la versión de recursos v8.4.0 de Ultralytics cuando se hace referencia a ellos por primera vez:

Citas y agradecimientos#

Si utilizas el conjunto de datos ImageNet en tu investigación o trabajo de desarrollo, cita el siguiente artículo:

Cita
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Queremos dar las gracias al equipo de ImageNet por crear y mantener el conjunto de datos, y a los autores de Depth Anything 3 por los modelos docentes utilizados para generar las etiquetas de profundidad seud etiquetadas.

Preguntas frecuentes#

  • Reutiliza las 1.281.167 imágenes de entrenamiento de ImageNet-1K, que no tienen mediciones de profundidad, y empareja cada una con un mapa de profundidad predicho por un modelo docente de Depth Anything 3. Es la fuente más grande, con diferencia, de la combinación de preentrenamiento de YOLO26-Depth, de unos 2,19 millones de imágenes (alrededor del 58 %), y se utiliza exclusivamente para la destilación de conocimiento y la diversidad de escenas.

  • Cada imagen se procesa con DA3MONO-LARGE para obtener una estructura relativa detallada y con DA3METRIC-LARGE para obtener la escala métrica. Un ajuste afín robusto por imagen adapta la predicción monocular a la métrica, y el resultado se guarda como PNG de 16 bits en milímetros con el formato de profundidad de Ultralytics. Consulta Cómo se generan las seudoetiquetas para obtener más detalles.

  • No. Esta fuente forma parte de la configuración interna de entrenamiento mixto utilizada para los pesos publicados de YOLO26-Depth y no se distribuye como descarga independiente. Para crear un conjunto similar, genera seudoetiquetas para tus propias imágenes con un modelo docente de profundidad y guárdalas en la estructura estándar de profundidad.

Comentarios