YOLO Vision 2026:

Набор данных ImageNet (с псевдоразметкой глубины)#

Датасет ImageNet (с псевдоразметкой глубины) повторно использует 1 281 167 обучающих изображений ImageNet-1K, у которых нет эталонной глубины, и связывает каждое изображение с псевдокартой глубины, созданной учителем Depth Anything 3, объединяя его монокулярные и метрические чекпоинты. Он используется исключительно для дистилляции знаний и ради разнообразия сцен и объектов, которое обеспечивает ImageNet. Будучи крупнейшим отдельным источником в претренировочном миксе YOLO26-Depth размером примерно 2,19 млн изображений (около 58%), его добавление стало решающим для междоменной генерализации в помещении.

Ключевые особенности#

  • 1 281 167 обучающих изображений ImageNet-1K, охватывающих самый широкий спектр объектов, сцен и контекстов.
  • Отсутствие эталонной глубины: каждая цель глубины — это псевдометка, сгенерированная учителем Depth Anything 3, объединяющим (DA3MONO-LARGE для структуры сцены, DA3METRIC-LARGE для метрического масштаба).
  • Используется исключительно для дистилляции знаний и разнообразия сцен/объектов, а не в качестве эталона.
  • Крупнейший источник в наборе для предварительного обучения (~2,19 млн изображений, ~58%), решающий фактор для обобщения в помещениях между разными доменами.
  • Отсутствует проверочная выборка — проверка выполняется только на наборах данных с реальными истинными значениями.

Структура набора данных#

Источник ImageNet с псевдоразметкой состоит из обучающих изображений ImageNet-1K с одной машинной картой глубины для каждого изображения:

  1. Обучающие изображения: 1 281 167 обучающих изображений ImageNet-1K, крупнейший отдельный компонент (~58%) набора для предварительного обучения YOLO26-Depth (~2,19 млн изображений).
  2. Проверка (Validation): нет. У этого источника нет проверочной выборки; для проверки YOLO26-Depth используются только наборы данных с реальными истинными значениями, такие как NYU Depth V2 и KITTI Eigen.

Как генерируются псевдометки#

Поскольку ImageNet поставляется без аннотаций глубины, цели глубины создаются оффлайн, а не измеряются. Объединяются два чекпоинта Depth Anything 3: один для структуры сцены, а другой для абсолютного масштаба:

  1. Каждое обучающее изображение ImageNet пропускается через depth-anything/DA3MONO-LARGE, который предсказывает высокодетализированную карту глубины, определенную лишь с точностью до неизвестного для каждого изображения масштаба и сдвига, а также через depth-anything/DA3METRIC-LARGE, чей вывод является более грубым, но выражен в реальных единицах.
  2. Надежная аффинная подгонка для каждого изображения сопоставляет монокулярное предсказание с метрическим, label = a * mono + b. Следовательно, каждая детальность на пиксель берется из монокулярного чекпоинта, в то время как метрический чекпоинт задает лишь два скаляра, которые располагают карту на метровой оси. Внутренние параметры камеры не задействуются, поэтому изображения без калибровки могут быть размечаны.
  3. Результат сохраняется в виде 16-битного миллиметрового PNG в соответствии с форматом наборов данных глубины Ultralytics и сопоставляется с исходным изображением по имени файла.
  4. Затем пары с псевдоразметкой добавляются как один из компонентов более крупного набора для обучения, где модель-ученик YOLO26-Depth учится имитировать учителя, одновременно обучаясь на источниках с реальными истинными значениями.

Поскольку масштаб берется из предсказания, а не из измерения, каждая карта может содержать глобальную ошибку масштаба. YOLO26-Depth обучается с использованием масштабно-инвариантной логарифмической функции потерь (SILog) плюс согласование градиентов и проверяется с помощью медианного выравнивания, поэтому смещение масштаба для каждого изображения в псевдометках в значительной степени сглаживается.

Этот источник с псевдоразметкой является компонентом внутренней конфигурации смешанного обучения, используемой для предварительного обучения выпущенных весов YOLO26-Depth, и не распространяется как отдельная загрузка.

Роль в YOLO26-Depth#

Этот источник составляет основную часть претренировочных данных YOLO26-Depth и обеспечивает наибольшее разнообразие сцен и объектов. Дистиллируя сильного учителя Depth Anything 3 на более чем миллионе изображений, он переносит широкие априорные представления о сцене в ученика. На практике его добавление оказалось решающим для междоменной генерализации в помещении, помогая модели хорошо справляться с внутренними сценами за пределами реальных распределений эталонного обучения.

Использование#

Данные ImageNet с псевдоразметкой не используются для обучения изолированно; они потребляются как один из компонентов комбинированного набора данных для глубины, определенного внутренним/экспериментальным YAML-файлом, а не публичной загрузкой набора данных. Концептуально обучение на такой смеси выглядит следующим образом:

Пример обучения
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Предварительно обученные модели#

Предобученные модели YOLO26-Depth автоматически скачиваются из релиза ассетов v8.4.0 компании Ultralytics при первом обращении по имени:

Цитирование и благодарности#

Если ты используешь набор данных ImageNet в своих исследованиях или разработках, пожалуйста, сошлися на следующую статью:

Цитата
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Мы хотели бы выразить признательность команде ImageNet за создание и поддержку датасета, а также авторам Depth Anything 3 за модели-учителя, использованные для генерации псевдометок глубины.

Участники

Комментарии