Ultralytics YOLO27:

Датасет глубины ImageNet (с псевдоразметкой)#

Датасет ImageNet повторно использует 1 281 167 обучающих изображений ImageNet-1K, для которых отсутствует истинная разметка глубины, и сопоставляет каждое изображение с псевдокартой глубины, созданной учителем Depth Anything 3 с объединением его моноскопических и метрических чекпойнтов. Он используется исключительно для дистилляции знаний и обеспечения разнообразия сцен и объектов, которое предоставляет ImageNet. Будучи крупнейшим источником в смеси предобучения YOLO26-Depth объёмом около 2,19 млн изображений (примерно 58%), он сыграл решающую роль в междоменной генерализации на внутренних сценах.

Ключевые особенности#

  • 1 281 167 обучающих изображений ImageNet-1K, охватывающих чрезвычайно широкий спектр объектов, сцен и контекстов.
  • Без истинной разметки глубины: каждая целевая глубина представляет собой псевдоразметку, созданную учителем Depth Anything 3 с использованием (DA3MONO-LARGE для структуры сцены, DA3METRIC-LARGE для метрического масштаба).
  • Используется исключительно для дистилляции знаний и разнообразия сцен и объектов, а не в качестве бенчмарка.
  • Крупнейший отдельный источник в смеси предобучения объёмом ~2,19 млн изображений (~58%), сыгравший решающую роль в междоменной генерализации на внутренних сценах.
  • Без валидационной выборки — валидация выполняется только на датасетах с реальной истинной разметкой.

Структура датасета#

Источник ImageNet с псевдоразметкой состоит из обучающих изображений ImageNet-1K и одной автоматически созданной карты глубины для каждого изображения:

  1. Обучающие изображения: 1 281 167 обучающих изображений ImageNet-1K — крупнейший отдельный компонент (~58%) смеси предобучения YOLO26-Depth объёмом ~2,19 млн изображений.
  2. Валидация: отсутствует. У этого источника нет валидационной выборки; при валидации YOLO26-Depth используются только датасеты с реальной истинной разметкой, такие как NYU Depth V2 и KITTI Eigen.

Как создаётся псевдоразметка#

Поскольку ImageNet поставляется без аннотаций глубины, целевые значения глубины создаются офлайн, а не измеряются. Объединяются два чекпойнта Depth Anything 3: один для структуры сцены, другой для абсолютного масштаба:

  1. Каждое обучающее изображение ImageNet пропускается через depth-anything/DA3MONO-LARGE, который предсказывает подробную карту глубины, определённую лишь с точностью до неизвестных масштаба и сдвига для конкретного изображения, а также через depth-anything/DA3METRIC-LARGE, выход которого более грубый, но выражен в реальных единицах.
  2. Для каждого изображения выполняется устойчивая аффинная подгонка, которая отображает моноскопическое предсказание на метрическое, label = a * mono + b. Поэтому все попиксельные детали поступают из моноскопического чекпойнта, а метрический чекпойнт задаёт только два скаляра, размещающие карту на метрической шкале. Параметры внутренней камеры не используются, поэтому можно размечать изображения без калибровки.
  3. Результат сохраняется в виде 16-битного PNG в миллиметрах в соответствии с форматом датасетов глубины Ultralytics и сопоставляется с исходным изображением по имени файла без расширения.
  4. Затем пары с псевдоразметкой добавляются как один из компонентов более крупной обучающей смеси, в которой студенческая модель YOLO26-Depth учится соответствовать учителю и одновременно обучается на источниках с реальной истинной разметкой.

Поскольку масштаб берётся из предсказания, а не из измерения, каждая карта может содержать глобальную ошибку масштаба. YOLO26-Depth обучается с функцией потерь логарифма, инвариантной к масштабу (SILog), дополненной сопоставлением градиентов, а валидация выполняется с выравниванием по медиане, поэтому смещение масштаба псевдоразметки для отдельного изображения в значительной степени компенсируется.

Этот источник с псевдоразметкой является компонентом внутренней конфигурации смешанного обучения, используемой для предобучения опубликованных весов YOLO26-Depth, и не распространяется в виде отдельной загрузки.

Роль в YOLO26-Depth#

Этот источник предоставляет основную часть данных для предобучения YOLO26-Depth и самое широкое разнообразие сцен и объектов. Дистиллируя знания сильного учителя Depth Anything 3 на более чем миллионе изображений, он передаёт ученику обширные априорные представления о сценах. На практике его добавление сыграло решающую роль в междоменной генерализации на внутренних сценах, помогая модели хорошо работать на внутренних сценах, выходящих за пределы распределений реальных обучающих данных с истинной разметкой.

Использование#

Данные ImageNet с псевдоразметкой не используются для обучения изолированно; они применяются как один из компонентов объединённой смеси глубины, определённой внутренним/экспериментальным YAML-файлом, а не общедоступной загрузкой датасета. Концептуально обучение на такой смеси выглядит следующим образом:

Пример обучения
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Предварительно обученные модели#

Предобученные модели YOLO26-Depth автоматически загружаются из релиза ресурсов Ultralytics v8.4.0 при первом обращении к ним по имени:

Цитирование и благодарности#

Если ты используешь датасет ImageNet в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:

Цитата
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Мы хотели бы поблагодарить команду ImageNet за создание и поддержку датасета, а также авторов Depth Anything 3 за модели-учителя, использованные для создания псевдоразметки глубины.

Часто задаваемые вопросы#

  • В нем повторно используются 1 281 167 обучающих изображений ImageNet-1K, у которых нет измерений глубины, и каждое из них сопрягается с картой глубины, предсказанной учителем Depth Anything 3. Это крупнейший источник в обучающем миксе YOLO26-Depth объемом примерно 2,19 млн изображений (около 58%), который используется исключительно для дистилляции знаний и разнообразия сцен.

  • Каждое изображение пропускается через DA3MONO-LARGE для получения подробной относительной структуры и через DA3METRIC-LARGE для получения метрического масштаба. Попиксельная надежная аффинная подгонка сопоставляет монокулярное предсказание с метрическим, и результат сохраняется как 16-битный миллиметровый PNG в формате глубины Ultralytics. Подробности см. в разделе Как генерируются псевдометки.

  • Нет. Этот источник является частью внутренней конфигурации смешанного обучения, лежащей в основе выпущенных весов YOLO26-Depth, и не распространяется в виде отдельной загрузки. Чтобы создать аналогичный набор, сгенерируй псевдометки для собственных изображений с помощью учителя глубины и сохрани их в стандартной структуре глубины.

Участники

Комментарии