Безопасность корпоративного уровня: Соответствует ISO 27001 + SOC 2 Type I.

Link to this sectionНабор данных ImageNet (с псевдоразметкой глубины)#

Набор данных ImageNet (с псевдоразметкой глубины) повторно использует 1 281 167 обучающих изображений ImageNet-1K, у которых нет истинной глубины, и дополняет каждое изображение картой псевдоглубины, созданной моделью-учителем Depth Anything V3 (монокулярной и метрической). Он используется исключительно для дистилляции знаний, а также благодаря разнообразию сцен и объектов, предоставляемому ImageNet. Являясь крупнейшим источником в наборе для предварительного обучения YOLO26-Depth, насчитывающем около 2,19 млн изображений (около 58%), его добавление стало решающим для обобщения в помещениях между разными доменами.

Link to this sectionКлючевые особенности#

  • 1 281 167 обучающих изображений ImageNet-1K, охватывающих самый широкий спектр объектов, сцен и контекстов.
  • Отсутствие истинной глубины (ground-truth): каждая цель по глубине — это псевдометка, созданная учителем Depth Anything V3 (монокулярным, метрическим).
  • Используется исключительно для дистилляции знаний и разнообразия сцен/объектов, а не в качестве эталона.
  • Крупнейший источник в наборе для предварительного обучения (~2,19 млн изображений, ~58%), решающий фактор для обобщения в помещениях между разными доменами.
  • Отсутствует проверочная выборка — проверка выполняется только на наборах данных с реальными истинными значениями.

Link to this sectionСтруктура набора данных#

Источник ImageNet с псевдоразметкой состоит из обучающих изображений ImageNet-1K с одной машинной картой глубины для каждого изображения:

  1. Обучающие изображения: 1 281 167 обучающих изображений ImageNet-1K, крупнейший отдельный компонент (~58%) набора для предварительного обучения YOLO26-Depth (~2,19 млн изображений).
  2. Проверка (Validation): нет. У этого источника нет проверочной выборки; для проверки YOLO26-Depth используются только наборы данных с реальными истинными значениями, такие как NYU Depth V2 и KITTI Eigen.

Link to this sectionКак генерируются псевдометки#

Поскольку ImageNet поставляется без аннотаций глубины, целевые значения глубины создаются офлайн, а не измеряются:

  1. Каждое обучающее изображение ImageNet пропускается через предварительно обученную модель-учитель Depth Anything V3 для прогнозирования пиксельной метрической карты глубины.
  2. Прогноз учителя сохраняется как массив float32 в формате .npy в метрах, следуя формату набора данных глубины Ultralytics, и связывается с исходным изображением по имени файла.
  3. Затем пары с псевдоразметкой добавляются как один из компонентов более крупного набора для обучения, где модель-ученик YOLO26-Depth учится имитировать учителя, одновременно обучаясь на источниках с реальными истинными значениями.

Этот источник с псевдоразметкой является компонентом внутренней конфигурации смешанного обучения, используемой для предварительного обучения выпущенных весов YOLO26-Depth, и не распространяется как отдельная загрузка.

Link to this sectionРоль в YOLO26-Depth#

Этот источник вносит основной вклад в данные для предварительного обучения YOLO26-Depth и обеспечивает наибольшее разнообразие сцен и объектов. Дистиллируя знания сильного учителя Depth Anything V3 на более чем миллионе изображений, он передает ученику широкие априорные знания о сценах. На практике его добавление стало решающим для обобщения в помещениях между разными доменами, помогая модели хорошо работать со сценами в помещениях, выходящими за рамки распределений реальных обучающих данных с истинными значениями.

Link to this sectionИспользование#

Данные ImageNet с псевдоразметкой не используются для обучения изолированно; они потребляются как один из компонентов комбинированного набора данных для глубины, определенного внутренним/экспериментальным YAML-файлом, а не публичной загрузкой набора данных. Концептуально обучение на такой смеси выглядит следующим образом:

Пример обучения
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Link to this sectionПредварительно обученные модели#

Предварительно обученные модели YOLO26-Depth автоматически загружаются из релиза активов v8.4.0 Ultralytics при первом обращении по имени:

Link to this sectionЦитирование и благодарности#

Если ты используешь набор данных ImageNet в своих исследованиях или разработках, пожалуйста, сошлися на следующую статью:

Цитата
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

Мы хотели бы поблагодарить команду ImageNet за создание и поддержку этого набора данных, а также авторов Depth Anything за модель-учитель, использованную для генерации псевдометок глубины.

Участники

Комментарии