Ultralytics YOLO27:

Набор данных глубины ImageNet (с псевдоразметкой)#

Набор данных ImageNet (глубина с псевдоразметкой) повторно использует 1 281 167 обучающих изображений ImageNet-1K, для которых нет эталонных данных о глубине. Каждому изображению сопоставлена псевдокарта глубины, созданная моделью-учителем Depth Anything 3 с объединением монокулярного и метрического чекпойнтов. Этот набор используется исключительно для дистилляции знаний и разнообразия сцен и объектов, которое даёт ImageNet. Будучи крупнейшим источником в обучающей смеси YOLO26-Depth объёмом примерно 2.19 млн изображений (около 58%), он сыграл решающую роль в обобщении на другие домены помещений.

Основные особенности#

  • 1 281 167 обучающих изображений ImageNet-1K с широким разнообразием объектов, сцен и контекстов.
  • Эталонных данных о глубине нет: для каждого изображения целевое значение глубины — это псевдометка, созданная моделью-учителем Depth Anything 3, объединяющей предсказания (DA3MONO-LARGE для структуры сцены, DA3METRIC-LARGE для метрического масштаба).
  • Используется исключительно для дистилляции знаний и разнообразия сцен и объектов, а не как бенчмарк.
  • Крупнейший источник в обучающей смеси объёмом ~2.19 млн изображений (~58%); сыграл решающую роль в обобщении на другие домены помещений.
  • Валидационного сплита нет — валидация проводится только на реальных наборах данных с эталонными значениями.

Структура набора данных#

Источник ImageNet с псевдоразметкой состоит из обучающих изображений ImageNet-1K, каждому из которых соответствует созданная машиной карта глубины:

  1. Обучающие изображения: 1 281 167 обучающих изображений ImageNet-1K — крупнейшая отдельная часть (~58%) обучающей смеси YOLO26-Depth объёмом ~2.19 млн изображений.
  2. Валидация: отсутствует. У этого источника нет валидационного сплита; при валидации YOLO26-Depth используются только реальные наборы данных с эталонными значениями, например NYU Depth V2 и KITTI Eigen.

Как создаются псевдометки#

В ImageNet нет разметки глубины, поэтому целевые значения глубины получают офлайн, а не измеряют. Объединяются два чекпойнта Depth Anything 3: один для структуры сцены, другой для абсолютного масштаба:

  1. Каждое обучающее изображение ImageNet обрабатывается с помощью depth-anything/DA3MONO-LARGE, которая предсказывает подробную карту глубины с неизвестными масштабом и смещением для каждого изображения, а также depth-anything/DA3METRIC-LARGE, дающей более грубый результат, но в реальных единицах.
  2. Для каждого изображения выполняется робастная аффинная аппроксимация, которая сопоставляет монокулярное предсказание с метрическим: label = a * mono + b. Таким образом, все попиксельные детали берутся из монокулярного чекпойнта, а метрический чекпойнт задаёт только два скалярных параметра, размещающих карту на шкале в метрах. Внутренние параметры камеры не используются, поэтому можно размечать изображения без калибровки.
  3. Результат сохраняется в виде 16-битного PNG-файла со значениями в миллиметрах, в соответствии с форматом набора данных глубины Ultralytics, и сопоставляется с исходным изображением по имени файла без расширения.
  4. Затем пары с псевдоразметкой добавляются в качестве одного из компонентов более крупной обучающей смеси. На этой смеси модель YOLO26-Depth-ученик учится воспроизводить предсказания модели-учителя и одновременно обучается на реальных источниках с эталонными значениями.

Поскольку масштаб получается из предсказания, а не измерения, каждая карта может содержать глобальную ошибку масштаба. YOLO26-Depth обучается с использованием логарифмической функции потерь, инвариантной к масштабу (SILog), и сопоставления градиентов, а при валидации применяется выравнивание по медиане. Поэтому смещение масштаба псевдометок для отдельного изображения в значительной степени компенсируется.

Этот источник с псевдоразметкой входит во внутреннюю конфигурацию обучения на смеси данных, которая используется для предварительного обучения выпущенных весов YOLO26-Depth, и не распространяется как отдельный набор данных.

Роль в YOLO26-Depth#

Этот источник даёт основную часть данных для предварительного обучения YOLO26-Depth и обеспечивает максимальное разнообразие сцен и объектов. Дистилляция знаний от мощной модели-учителя Depth Anything 3 на более чем миллионе изображений позволяет передать ученику общие представления о сценах. На практике добавление этого источника сыграло решающую роль в обобщении на другие домены помещений и помогло модели хорошо работать на сценах помещений, которые не представлены в распределениях реальных обучающих данных с эталонными значениями.

Использование#

Данные ImageNet с псевдоразметкой не используются для обучения изолированно: это один из компонентов объединённой смеси данных для оценки глубины, заданной внутренним YAML-файлом эксперимента, а не общедоступной загрузкой набора данных. В общих чертах обучение на такой смеси выглядит следующим образом:

Пример обучения
from ultralytics import YOLO

# Загрузить предварительно обученную модель оценки глубины
model = YOLO("yolo26n-depth.pt")

# Обучение на объединённой смеси данных для оценки глубины (собственный YAML-файл набора данных из нескольких источников)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Предварительно обученные модели#

При первом упоминании по имени предварительно обученные модели YOLO26-Depth автоматически загружаются из релиза ресурсов Ultralytics v8.4.0:

Цитирование и благодарности#

Если ты используешь набор данных ImageNet в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:

Цитата
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Мы хотели бы поблагодарить команду ImageNet за создание и поддержку набора данных, а также авторов Depth Anything 3 — за модели-учителя, использованные для генерации псевдоразметки глубины.

Часто задаваемые вопросы#

  • В него повторно включены 1 281 167 обучающих изображений ImageNet-1K без измеренной глубины, каждому из которых сопоставлена карта глубины, предсказанная моделью-учителем Depth Anything 3. Это крупнейший отдельный источник в смеси для предварительного обучения YOLO26-Depth объёмом около 2,19 млн изображений (примерно 58%); он используется исключительно для дистилляции знаний и разнообразия сцен.

  • Каждое изображение обрабатывается моделью DA3MONO-LARGE для получения подробной относительной структуры и моделью DA3METRIC-LARGE для определения метрического масштаба. Для каждой пары изображений выполняется робастная аффинная подгонка, которая переносит монокулярное предсказание на метрическое, а результат сохраняется как 16-битный PNG в миллиметрах в формате глубины Ultralytics. Подробности см. в разделе Как генерируется псевдоразметка.

  • Нет. Этот источник входит во внутреннюю конфигурацию смешанного обучения, на которой основаны выпущенные веса YOLO26-Depth, и не распространяется для отдельной загрузки. Чтобы создать аналогичный набор, сгенерируй псевдоразметку для собственных изображений с помощью модели-учителя глубины и сохрани её в стандартной структуре данных глубины.

Участники

Комментарии