Conjunto de datos de profundidad de ImageNet (con pseudoetiquetas)#
El conjunto de datos de ImageNet (profundidad con pseudoetiquetas) reutiliza las 1,281,167 imágenes de entrenamiento de ImageNet-1K, que no tienen profundidad de referencia, y empareja cada imagen con un mapa de profundidad pseudoetiquetado generado por un modelo profesor Depth Anything 3, combinando sus checkpoints monocular y métrico. Se utiliza exclusivamente para la destilación de conocimiento y por la diversidad de escenas y objetos que proporciona ImageNet. Como la mayor fuente individual de la mezcla de preentrenamiento de YOLO26-Depth, de aproximadamente 2,19 millones de imágenes (alrededor del 58 %), su incorporación fue decisiva para la generalización entre dominios en interiores.
Características principales#
- 1,281,167 imágenes de entrenamiento de ImageNet-1K que abarcan una variedad muy amplia de objetos, escenas y contextos.
- Sin profundidad de referencia: cada objetivo de profundidad es una pseudoetiqueta generada por un modelo profesor Depth Anything 3 que combina (
DA3MONO-LARGEpara la estructura de la escena yDA3METRIC-LARGEpara la escala métrica). - Se utiliza exclusivamente para la destilación de conocimiento y la diversidad de escenas y objetos, no como benchmark.
- La mayor fuente individual de la mezcla de preentrenamiento de ~2,19 millones de imágenes (~58 %), decisiva para la generalización entre dominios en interiores.
- No hay división de validación; la validación se realiza únicamente en conjuntos de datos reales con profundidad de referencia.
Estructura del dataset#
La fuente de ImageNet con pseudoetiquetas consta de las imágenes de entrenamiento de ImageNet-1K, con un mapa de profundidad generado por máquina para cada imagen:
- Imágenes de entrenamiento: 1,281,167 imágenes de entrenamiento de ImageNet-1K, el mayor componente individual (~58 %) de la mezcla de preentrenamiento de YOLO26-Depth de ~2,19 millones de imágenes.
- Validación: ninguna. Esta fuente no tiene división de validación; la validación de YOLO26-Depth utiliza únicamente conjuntos de datos reales con profundidad de referencia, como NYU Depth V2 y KITTI Eigen.
Cómo se generan las pseudoetiquetas#
Como ImageNet se distribuye sin anotaciones de profundidad, los objetivos de profundidad se generan sin conexión en lugar de medirse. Se combinan dos checkpoints de Depth Anything 3: uno para la estructura de la escena y otro para la escala absoluta:
- Cada imagen de entrenamiento de ImageNet se procesa con
depth-anything/DA3MONO-LARGE, que predice un mapa de profundidad muy detallado definido únicamente hasta una escala y un desplazamiento desconocidos por imagen, y condepth-anything/DA3METRIC-LARGE, cuya salida es más tosca, pero está expresada en unidades reales. - Un ajuste afín robusto por imagen adapta la predicción monocular a la métrica,
label = a * mono + b. Por tanto, todos los detalles por píxel proceden del checkpoint monocular, mientras que el checkpoint métrico solo establece los dos escalares que sitúan el mapa en el eje de los metros. No intervienen los parámetros intrínsecos de la cámara, por lo que se pueden etiquetar imágenes sin calibración. - El resultado se guarda como un PNG de milímetros de 16 bits, siguiendo el formato de conjuntos de datos de profundidad de Ultralytics, y se empareja con su imagen de origen mediante el nombre base del archivo.
- A continuación, los pares con pseudoetiquetas se añaden como un componente de una mezcla de entrenamiento más amplia, en la que un modelo estudiante YOLO26-Depth aprende a imitar al modelo profesor mientras también se entrena con fuentes reales con profundidad de referencia.
Como la escala procede de una predicción y no de una medición, cada mapa puede contener un error de escala global. YOLO26-Depth se entrena con una pérdida de logaritmo invariante a la escala (SILog), además de la correspondencia de gradientes, y valida mediante alineación de la mediana, por lo que un desplazamiento de escala por imagen en las pseudoetiquetas se absorbe en gran medida.
Esta fuente con pseudoetiquetas es un componente de la configuración interna de entrenamiento mixto utilizada para preentrenar los pesos de YOLO26-Depth publicados y no se distribuye como descarga independiente.
Papel en YOLO26-Depth#
Esta fuente aporta la mayor parte de los datos de preentrenamiento de YOLO26-Depth y la mayor diversidad de escenas y objetos. Al destilar un modelo profesor Depth Anything 3 potente en más de un millón de imágenes, transfiere al estudiante amplios priors de escena. En la práctica, su incorporación fue decisiva para la generalización entre dominios en interiores, ya que ayuda al modelo a rendir bien en escenas interiores que van más allá de las distribuciones de entrenamiento reales con profundidad de referencia.
Uso#
Los datos de ImageNet con pseudoetiquetas no se utilizan para entrenar de forma aislada; se consumen como un componente de una mezcla de profundidad combinada, definida por un YAML interno o experimental, no por una descarga pública del conjunto de datos. Conceptualmente, el entrenamiento con una mezcla de este tipo tiene el siguiente aspecto:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Modelos preentrenados#
Los modelos YOLO26-Depth preentrenados se descargan automáticamente desde la versión de recursos v8.4.0 de Ultralytics cuando se hace referencia a ellos por nombre por primera vez:
Citas y agradecimientos#
Si utilizas el conjunto de datos ImageNet en tu trabajo de investigación o desarrollo, cita el siguiente artículo:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Queremos reconocer al equipo de ImageNet por crear y mantener el conjunto de datos, y a los autores de Depth Anything 3 por los modelos profesor utilizados para generar las etiquetas de profundidad pseudoetiquetadas.
Preguntas frecuentes#
Reutiliza los 1.281.167 imágenes de entrenamiento de ImageNet-1K, que no tienen profundidad medida, y empareja cada una con un mapa de profundidad predicho por un profesor de Depth Anything 3. Es la mayor fuente individual en la mezcla de preentrenamiento de YOLO26-Depth de aproximadamente 2,19 millones de imágenes (casi el 58 %) y se utiliza exclusivamente para la destilación de conocimientos y la diversidad de escenas.
Cada imagen se procesa a través de
DA3MONO-LARGEpara obtener una estructura relativa detallada y a través deDA3METRIC-LARGEpara la escala métrica. Un ajuste afín robusto por imagen asigna la predicción monocular a la métrica, y el resultado se guarda como un PNG de 16 bits en milímetros en el Ultralytics depth format. Consulta How the pseudo-labels are generated para obtener más detalles.No. Esta fuente forma parte de la configuración de entrenamiento mixto interno detrás de los pesos de YOLO26-Depth publicados y no se distribuye como una descarga independiente. Para construir un conjunto similar, genera pseudoetiquetas para tus propias imágenes con un profesor de profundidad y almacénalas en el diseño de profundidad estándar.