Link to this sectionНабор данных ImageNet (с псевдоразметкой глубины)#
Набор данных ImageNet (с псевдоразметкой глубины) повторно использует 1 281 167 обучающих изображений ImageNet-1K, у которых нет истинной глубины, и дополняет каждое изображение картой псевдоглубины, созданной моделью-учителем Depth Anything V3 (монокулярной и метрической). Он используется исключительно для дистилляции знаний, а также благодаря разнообразию сцен и объектов, предоставляемому ImageNet. Являясь крупнейшим источником в наборе для предварительного обучения YOLO26-Depth, насчитывающем около 2,19 млн изображений (около 58%), его добавление стало решающим для обобщения в помещениях между разными доменами.
Link to this sectionКлючевые особенности#
- 1 281 167 обучающих изображений ImageNet-1K, охватывающих самый широкий спектр объектов, сцен и контекстов.
- Отсутствие истинной глубины (ground-truth): каждая цель по глубине — это псевдометка, созданная учителем Depth Anything V3 (монокулярным, метрическим).
- Используется исключительно для дистилляции знаний и разнообразия сцен/объектов, а не в качестве эталона.
- Крупнейший источник в наборе для предварительного обучения (~2,19 млн изображений, ~58%), решающий фактор для обобщения в помещениях между разными доменами.
- Отсутствует проверочная выборка — проверка выполняется только на наборах данных с реальными истинными значениями.
Link to this sectionСтруктура набора данных#
Источник ImageNet с псевдоразметкой состоит из обучающих изображений ImageNet-1K с одной машинной картой глубины для каждого изображения:
- Обучающие изображения: 1 281 167 обучающих изображений ImageNet-1K, крупнейший отдельный компонент (~58%) набора для предварительного обучения YOLO26-Depth (~2,19 млн изображений).
- Проверка (Validation): нет. У этого источника нет проверочной выборки; для проверки YOLO26-Depth используются только наборы данных с реальными истинными значениями, такие как NYU Depth V2 и KITTI Eigen.
Link to this sectionКак генерируются псевдометки#
Поскольку ImageNet поставляется без аннотаций глубины, целевые значения глубины создаются офлайн, а не измеряются:
- Каждое обучающее изображение ImageNet пропускается через предварительно обученную модель-учитель Depth Anything V3 для прогнозирования пиксельной метрической карты глубины.
- Прогноз учителя сохраняется как массив float32 в формате
.npyв метрах, следуя формату набора данных глубины Ultralytics, и связывается с исходным изображением по имени файла. - Затем пары с псевдоразметкой добавляются как один из компонентов более крупного набора для обучения, где модель-ученик YOLO26-Depth учится имитировать учителя, одновременно обучаясь на источниках с реальными истинными значениями.
Этот источник с псевдоразметкой является компонентом внутренней конфигурации смешанного обучения, используемой для предварительного обучения выпущенных весов YOLO26-Depth, и не распространяется как отдельная загрузка.
Link to this sectionРоль в YOLO26-Depth#
Этот источник вносит основной вклад в данные для предварительного обучения YOLO26-Depth и обеспечивает наибольшее разнообразие сцен и объектов. Дистиллируя знания сильного учителя Depth Anything V3 на более чем миллионе изображений, он передает ученику широкие априорные знания о сценах. На практике его добавление стало решающим для обобщения в помещениях между разными доменами, помогая модели хорошо работать со сценами в помещениях, выходящими за рамки распределений реальных обучающих данных с истинными значениями.
Link to this sectionИспользование#
Данные ImageNet с псевдоразметкой не используются для обучения изолированно; они потребляются как один из компонентов комбинированного набора данных для глубины, определенного внутренним/экспериментальным YAML-файлом, а не публичной загрузкой набора данных. Концептуально обучение на такой смеси выглядит следующим образом:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionПредварительно обученные модели#
Предварительно обученные модели YOLO26-Depth автоматически загружаются из релиза активов v8.4.0 Ultralytics при первом обращении по имени:
Link to this sectionЦитирование и благодарности#
Если ты используешь набор данных ImageNet в своих исследованиях или разработках, пожалуйста, сошлися на следующую статью:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Мы хотели бы поблагодарить команду ImageNet за создание и поддержку этого набора данных, а также авторов Depth Anything за модель-учитель, использованную для генерации псевдометок глубины.