Датасет глубины ImageNet (с псевдоразметкой)#
Датасет ImageNet повторно использует 1 281 167 обучающих изображений ImageNet-1K, для которых отсутствует истинная разметка глубины, и сопоставляет каждое изображение с псевдокартой глубины, созданной учителем Depth Anything 3 с объединением его моноскопических и метрических чекпойнтов. Он используется исключительно для дистилляции знаний и обеспечения разнообразия сцен и объектов, которое предоставляет ImageNet. Будучи крупнейшим источником в смеси предобучения YOLO26-Depth объёмом около 2,19 млн изображений (примерно 58%), он сыграл решающую роль в междоменной генерализации на внутренних сценах.
Ключевые особенности#
- 1 281 167 обучающих изображений ImageNet-1K, охватывающих чрезвычайно широкий спектр объектов, сцен и контекстов.
- Без истинной разметки глубины: каждая целевая глубина представляет собой псевдоразметку, созданную учителем Depth Anything 3 с использованием (
DA3MONO-LARGEдля структуры сцены,DA3METRIC-LARGEдля метрического масштаба). - Используется исключительно для дистилляции знаний и разнообразия сцен и объектов, а не в качестве бенчмарка.
- Крупнейший отдельный источник в смеси предобучения объёмом ~2,19 млн изображений (~58%), сыгравший решающую роль в междоменной генерализации на внутренних сценах.
- Без валидационной выборки — валидация выполняется только на датасетах с реальной истинной разметкой.
Структура датасета#
Источник ImageNet с псевдоразметкой состоит из обучающих изображений ImageNet-1K и одной автоматически созданной карты глубины для каждого изображения:
- Обучающие изображения: 1 281 167 обучающих изображений ImageNet-1K — крупнейший отдельный компонент (~58%) смеси предобучения YOLO26-Depth объёмом ~2,19 млн изображений.
- Валидация: отсутствует. У этого источника нет валидационной выборки; при валидации YOLO26-Depth используются только датасеты с реальной истинной разметкой, такие как NYU Depth V2 и KITTI Eigen.
Как создаётся псевдоразметка#
Поскольку ImageNet поставляется без аннотаций глубины, целевые значения глубины создаются офлайн, а не измеряются. Объединяются два чекпойнта Depth Anything 3: один для структуры сцены, другой для абсолютного масштаба:
- Каждое обучающее изображение ImageNet пропускается через
depth-anything/DA3MONO-LARGE, который предсказывает подробную карту глубины, определённую лишь с точностью до неизвестных масштаба и сдвига для конкретного изображения, а также черезdepth-anything/DA3METRIC-LARGE, выход которого более грубый, но выражен в реальных единицах. - Для каждого изображения выполняется устойчивая аффинная подгонка, которая отображает моноскопическое предсказание на метрическое,
label = a * mono + b. Поэтому все попиксельные детали поступают из моноскопического чекпойнта, а метрический чекпойнт задаёт только два скаляра, размещающие карту на метрической шкале. Параметры внутренней камеры не используются, поэтому можно размечать изображения без калибровки. - Результат сохраняется в виде 16-битного PNG в миллиметрах в соответствии с форматом датасетов глубины Ultralytics и сопоставляется с исходным изображением по имени файла без расширения.
- Затем пары с псевдоразметкой добавляются как один из компонентов более крупной обучающей смеси, в которой студенческая модель YOLO26-Depth учится соответствовать учителю и одновременно обучается на источниках с реальной истинной разметкой.
Поскольку масштаб берётся из предсказания, а не из измерения, каждая карта может содержать глобальную ошибку масштаба. YOLO26-Depth обучается с функцией потерь логарифма, инвариантной к масштабу (SILog), дополненной сопоставлением градиентов, а валидация выполняется с выравниванием по медиане, поэтому смещение масштаба псевдоразметки для отдельного изображения в значительной степени компенсируется.
Этот источник с псевдоразметкой является компонентом внутренней конфигурации смешанного обучения, используемой для предобучения опубликованных весов YOLO26-Depth, и не распространяется в виде отдельной загрузки.
Роль в YOLO26-Depth#
Этот источник предоставляет основную часть данных для предобучения YOLO26-Depth и самое широкое разнообразие сцен и объектов. Дистиллируя знания сильного учителя Depth Anything 3 на более чем миллионе изображений, он передаёт ученику обширные априорные представления о сценах. На практике его добавление сыграло решающую роль в междоменной генерализации на внутренних сценах, помогая модели хорошо работать на внутренних сценах, выходящих за пределы распределений реальных обучающих данных с истинной разметкой.
Использование#
Данные ImageNet с псевдоразметкой не используются для обучения изолированно; они применяются как один из компонентов объединённой смеси глубины, определённой внутренним/экспериментальным YAML-файлом, а не общедоступной загрузкой датасета. Концептуально обучение на такой смеси выглядит следующим образом:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Предварительно обученные модели#
Предобученные модели YOLO26-Depth автоматически загружаются из релиза ресурсов Ultralytics v8.4.0 при первом обращении к ним по имени:
Цитирование и благодарности#
Если ты используешь датасет ImageNet в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Мы хотели бы поблагодарить команду ImageNet за создание и поддержку датасета, а также авторов Depth Anything 3 за модели-учителя, использованные для создания псевдоразметки глубины.
Часто задаваемые вопросы#
В нем повторно используются 1 281 167 обучающих изображений ImageNet-1K, у которых нет измерений глубины, и каждое из них сопрягается с картой глубины, предсказанной учителем Depth Anything 3. Это крупнейший источник в обучающем миксе YOLO26-Depth объемом примерно 2,19 млн изображений (около 58%), который используется исключительно для дистилляции знаний и разнообразия сцен.
Каждое изображение пропускается через
DA3MONO-LARGEдля получения подробной относительной структуры и черезDA3METRIC-LARGEдля получения метрического масштаба. Попиксельная надежная аффинная подгонка сопоставляет монокулярное предсказание с метрическим, и результат сохраняется как 16-битный миллиметровый PNG в формате глубины Ultralytics. Подробности см. в разделе Как генерируются псевдометки.Нет. Этот источник является частью внутренней конфигурации смешанного обучения, лежащей в основе выпущенных весов YOLO26-Depth, и не распространяется в виде отдельной загрузки. Чтобы создать аналогичный набор, сгенерируй псевдометки для собственных изображений с помощью учителя глубины и сохрани их в стандартной структуре глубины.