Link to this sectionConjunto de datos de profundidad ImageNet (con pseudoetiquetas)#
El conjunto de datos ImageNet (profundidad con pseudoetiquetas) reutiliza las 1.281.167 imágenes de entrenamiento de ImageNet-1K, que no tienen profundidad real, y empareja cada imagen con un mapa de profundidad pseudo generado por un modelo profesor Depth Anything V3 (monocular y métrico). Se utiliza exclusivamente para la destilación de conocimiento y por la diversidad de escenas y objetos que ofrece ImageNet. Al ser la mayor fuente individual en la mezcla de preentrenamiento de YOLO26-Depth de aproximadamente 2,19 millones de imágenes (alrededor del 58%), su incorporación fue decisiva para la generalización interdominio en interiores.
Link to this sectionCaracterísticas clave#
- 1.281.167 imágenes de entrenamiento de ImageNet-1K que cubren una gama muy amplia de objetos, escenas y contextos.
- Sin profundidad real: cada objetivo de profundidad es una pseudoetiqueta generada por un profesor Depth Anything V3 (monocular, métrico).
- Utilizado exclusivamente para la destilación de conocimiento y la diversidad de escenas/objetos, no como un benchmark.
- La mayor fuente individual en la mezcla de preentrenamiento de ~2,19 millones de imágenes (~58%), decisiva para la generalización interdominio en interiores.
- Sin división de validación: la validación se realiza solo en conjuntos de datos con profundidad real.
Link to this sectionEstructura del dataset#
La fuente ImageNet con pseudoetiquetas consiste en las imágenes de entrenamiento de ImageNet-1K con un mapa de profundidad generado por máquina por imagen:
- Imágenes de entrenamiento: 1.281.167 imágenes de entrenamiento de ImageNet-1K, el componente individual más grande (~58%) de la mezcla de preentrenamiento de ~2,19 millones de imágenes de YOLO26-Depth.
- Validación: ninguna. Esta fuente no tiene una división de validación; la validación de YOLO26-Depth utiliza solo conjuntos de datos con profundidad real como NYU Depth V2 y KITTI Eigen.
Link to this sectionCómo se generan las pseudoetiquetas#
Debido a que ImageNet se envía sin anotaciones de profundidad, los objetivos de profundidad se producen sin conexión en lugar de medirse:
- Cada imagen de entrenamiento de ImageNet se procesa a través de un modelo profesor preentrenado Depth Anything V3 para predecir un mapa de profundidad métrico por píxel.
- La predicción del profesor se guarda como una matriz float32
.npyen metros, siguiendo el formato de conjunto de datos de profundidad de Ultralytics, y se empareja con su imagen original mediante el nombre del archivo. - Los pares con pseudoetiquetas se añaden luego como un componente de una mezcla de entrenamiento mayor, donde un modelo estudiante YOLO26-Depth aprende a igualar al profesor mientras también se entrena con fuentes de profundidad real.
Esta fuente con pseudoetiquetas es un componente de la configuración de entrenamiento mixto interno utilizado para preentrenar los pesos publicados de YOLO26-Depth y no se distribuye como una descarga independiente.
Link to this sectionRol en YOLO26-Depth#
Esta fuente aporta la mayor parte de los datos de preentrenamiento de YOLO26-Depth y la mayor diversidad de escenas y objetos. Al destilar un profesor sólido Depth Anything V3 a través de más de un millón de imágenes, transfiere priores de escenas amplios al estudiante. En la práctica, añadirla fue decisivo para la generalización interdominio en interiores, ayudando al modelo a funcionar bien en escenas de interior más allá de las distribuciones de entrenamiento con profundidad real.
Link to this sectionUso#
Los datos de ImageNet con pseudoetiquetas no se utilizan de forma aislada; se consumen como un componente de una mezcla de profundidad combinada, definida por un archivo YAML interno/de experimento en lugar de una descarga de conjunto de datos pública. Conceptualmente, el entrenamiento en dicha mezcla se ve así:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionModelos preentrenados#
Los modelos YOLO26-Depth preentrenados se descargan automáticamente desde el lanzamiento de activos v8.4.0 de Ultralytics cuando se hace referencia a ellos por primera vez por su nombre:
Link to this sectionCitas y agradecimientos#
Si utilizas el conjunto de datos ImageNet en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Nos gustaría agradecer al equipo de ImageNet por crear y mantener el conjunto de datos, y a los autores de Depth Anything por el modelo profesor utilizado para generar las pseudoetiquetas de profundidad.