Conjunto de datos de profundidad ImageNet (con pseudoetiquetas)#
El conjunto de datos ImageNet (con profundidad etiquetada de forma pseudo) reutiliza las 1.281.167 imágenes de entrenamiento de ImageNet-1K, que no tienen profundidad real, y empareja cada imagen con un mapa de profundidad pseudo producido por un profesor Depth Anything 3, combinando sus puntos de control monoculares y métricos. Se utiliza exclusivamente para la destilación de conocimientos y para la diversidad de escenas y objetos que ofrece ImageNet. Al ser la mayor fuente individual en la mezcla de preentrenamiento de YOLO26-Depth de aproximadamente 2,19 millones de imágenes (cerca del 58 %), su incorporación fue decisiva para la generalización transdominio en interiores.
Características clave#
- 1.281.167 imágenes de entrenamiento de ImageNet-1K que cubren una gama muy amplia de objetos, escenas y contextos.
- Sin profundidad real: cada objetivo de profundidad es una pseudoetiqueta generada por un profesor Depth Anything 3 que empareja (
DA3MONO-LARGEpara la estructura de la escena,DA3METRIC-LARGEpara la escala métrica). - Utilizado exclusivamente para la destilación de conocimiento y la diversidad de escenas/objetos, no como un benchmark.
- La mayor fuente individual en la mezcla de preentrenamiento de ~2,19 millones de imágenes (~58%), decisiva para la generalización interdominio en interiores.
- Sin división de validación: la validación se realiza solo en conjuntos de datos con profundidad real.
Estructura del dataset#
La fuente ImageNet con pseudoetiquetas consiste en las imágenes de entrenamiento de ImageNet-1K con un mapa de profundidad generado por máquina por imagen:
- Imágenes de entrenamiento: 1.281.167 imágenes de entrenamiento de ImageNet-1K, el componente individual más grande (~58%) de la mezcla de preentrenamiento de ~2,19 millones de imágenes de YOLO26-Depth.
- Validación: ninguna. Esta fuente no tiene una división de validación; la validación de YOLO26-Depth utiliza solo conjuntos de datos con profundidad real como NYU Depth V2 y KITTI Eigen.
Cómo se generan las pseudoetiquetas#
Debido a que ImageNet se distribuye sin anotaciones de profundidad, los objetivos de profundidad se producen sin conexión en lugar de medirse. Se combinan dos puntos de control de Depth Anything 3, uno para la estructura de la escena y otro para la escala absoluta:
- Cada imagen de entrenamiento de ImageNet se procesa a través de
depth-anything/DA3MONO-LARGE, que predice un mapa de profundidad muy detallado que solo se define hasta una escala y desplazamiento desconosidos por imagen, y a través dedepth-anything/DA3METRIC-LARGE, cuya salida es más tosca pero en unidades reales. - Un ajuste afín robusto por imagen mapea la predicción monocular sobre la métrica,
label = a * mono + b. Por lo tanto, cada detalle por píxel proviene del punto de control monocular, mientras que el punto de control métrico solo establece los dos escalares que sitúan el mapa en el eje de metros. No intervienen parámetros intrínsecos de la cámara, por lo que se pueden etiquetar imágenes sin calibración. - El resultado se guarda como un PNG de 16 bits en milímetros, siguiendo el formato de conjunto de datos de profundidad de Ultralytics, y se empareja con su imagen de origen por el nombre base del archivo.
- Los pares con pseudoetiquetas se añaden luego como un componente de una mezcla de entrenamiento mayor, donde un modelo estudiante YOLO26-Depth aprende a igualar al profesor mientras también se entrena con fuentes de profundidad real.
Debido a que la escala proviene de una predicción en lugar de una medición, cada mapa puede tener un error de escala global. YOLO26-Depth entrena con una pérdida logarítmica invariante a la escala (SILog) más coincidencia de gradientes y valida con alineación de la mediana, por lo que un desfase de escala por imagen en las pseudoetiquetas se absorbe en gran medida.
Esta fuente con pseudoetiquetas es un componente de la configuración de entrenamiento mixto interno utilizado para preentrenar los pesos publicados de YOLO26-Depth y no se distribuye como una descarga independiente.
Rol en YOLO26-Depth#
Esta fuente aporta la mayor parte de los datos de preentrenamiento de YOLO26-Depth y la mayor diversidad de escenas y objetos. Al destilar un profesor Depth Anything 3 potente en más de un millón de imágenes, transfiere amplios conocimientos previos de la escena al alumno. En la práctica, su adición fue decisiva para la generalización transdominio en interiores, ayudando al modelo a funcionar bien en escenas de interiores más allá de las distribuciones de entrenamiento reales con datos reales.
Uso#
Los datos de ImageNet con pseudoetiquetas no se utilizan de forma aislada; se consumen como un componente de una mezcla de profundidad combinada, definida por un archivo YAML interno/de experimento en lugar de una descarga de conjunto de datos pública. Conceptualmente, el entrenamiento en dicha mezcla se ve así:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Modelos preentrenados#
Los modelos preentrenados YOLO26-Depth se descargan automáticamente desde el lanzamiento de assets v8.4.0 de Ultralytics cuando se hace referencia a ellos por primera vez por su nombre:
Citas y agradecimientos#
Si utilizas el conjunto de datos ImageNet en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Queremos agradecer al equipo de ImageNet por crear y mantener el conjunto de datos, y a los autores de Depth Anything 3 por los modelos de profesor utilizados para generar las etiquetas de pseudo profundidad.