Ultralytics YOLO27:

Датасет ImageNet#

Датасет Ultralytics ImageNet (data="imagenet") — это подмножество ImageNet-1k / ILSVRC-2012, используемое для обучения и тестирования моделей классификации изображений. Он содержит 1 000 классов объектов, 1 281 167 обучающих изображений и 50 000 валидационных изображений; обычно модели обучают с размером изображения 224x224, а загрузка занимает около 144 GB. Более широкая база данных ImageNet намного больше: более 14 миллионов изображений высокого разрешения, размеченных синсетами WordNet и относящихся более чем к 20 000 категориям. Однако Ultralytics обучает модели на стандартизированном подмножестве ILSVRC из 1 000 классов, ставшем фактическим бенчмарком для глубокого обучения в сфере компьютерного зрения.

Предобученные модели ImageNet#

Модельразмер
(пиксели)
точ
top1
точ
top5
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B) при 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

Основные особенности#

  • Датасет Ultralytics imagenet содержит 1 000 классов, 1 281 167 обучающих и 50 000 валидационных изображений (ILSVRC-2012) и служит стандартным бенчмарком для предварительного обучения моделей классификации изображений.
  • Классы организованы по иерархии WordNet, где каждому классу соответствует синсет (набор синонимичных терминов).
  • Для обучения используются изображения размером 224x224, а загрузка всего датасета занимает примерно ~144 GB.
  • Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) сыграл важную роль в развитии исследований компьютерного зрения.

Структура набора данных#

В датасете Ultralytics ImageNet используется разбиение ILSVRC-2012:

ПодвыборкаИзображенияКлассы
Обучение1,281,1671,000
Валидация50,0001,000

Изображения хранятся в папках для каждого класса, названных по идентификатору синсета WordNet (например, n01440764), — именно такую структуру ожидает обучение классификации в Ultralytics. Каждому из 1 000 классов соответствует синсет WordNet; отдельной тестовой выборки нет, поэтому для измерения точности используется валидационная выборка из 50 000 изображений.

Размер загрузки

Загрузка ImageNet-1k занимает примерно ~144 GB, поэтому перед обучением убедись, что на диске достаточно места. Для быстрых экспериментов можно взять уменьшенные подмножества ImageNette и ImageNet10: они используют тот же формат папок и обучаются за малую долю этого времени.

Конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#

Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) позволял исследователям тестировать алгоритмы на крупном стандартизированном датасете с единообразными метриками оценки. Конкурс способствовал значительным достижениям в глубоком обучении для классификации изображений, обнаружения объектов и других задач компьютерного зрения — особенно победа AlexNet в 2012 году, которая помогла начать современную эпоху глубокого обучения.

Применение#

Датасет ImageNet широко используют для обучения и оценки моделей глубокого обучения в задачах классификации изображений, обнаружения и локализации объектов. Такие знаковые архитектуры, как AlexNet, VGG и ResNet, были разработаны и протестированы на ImageNet, а веса, предобученные на ImageNet, остаются распространенной отправной точкой для переноса обучения в различных задачах компьютерного зрения.

Использование#

Чтобы обучить модель YOLO для классификации на ImageNet в течение 100 эпох с размером изображения 224x224, используй приведенные ниже фрагменты кода. Полный список доступных аргументов смотри на странице обучения модели.

Пример обучения
from ultralytics import YOLO

# Загрузить модель
model = YOLO("yolo26n-cls.pt")  # загрузить предварительно обученную модель (рекомендуется для обучения)

# Обучить модель
results = model.train(data="imagenet", epochs=100, imgsz=224)

Ты также можешь управлять датасетами для классификации и запускать обучение в облаке с помощью Ultralytics Platform.

Примеры изображений и аннотаций#

Датасет ImageNet охватывает 1 000 классов ILSVRC-2012 и представляет собой разнообразный обширный ресурс для обучения и оценки моделей компьютерного зрения. Вот несколько примеров изображений из датасета:

Примеры изображений из датасета ImageNet для классификации

Цитирование и благодарности#

Если ты используешь набор данных ImageNet в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:

Цитата
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Мы хотели бы поблагодарить команду ImageNet, которой руководили Olga Russakovsky, Jia Deng и Li Fei-Fei, за создание и поддержку датасета ImageNet — ценного ресурса для сообщества исследователей в области машинного обучения и компьютерного зрения. Подробнее о датасете ImageNet и его создателях читай на сайте ImageNet.

Часто задаваемые вопросы#

  • Датасет ImageNet — это крупная база изображений, основная коллекция которой содержит более 14 миллионов изображений высокого разрешения, размеченных синсетами WordNet. В Ultralytics модель data="imagenet" обучается на стандартизированном подмножестве ILSVRC-2012 из 1 000 классов, которое служит фактическим бенчмарком для предварительного обучения моделей классификации изображений. Знаковые модели, такие как AlexNet, VGG и ResNet, обучались и тестировались на ImageNet, что подчеркивает роль датасета в развитии компьютерного зрения.

  • Датасет Ultralytics imagenet использует подмножество ILSVRC-2012: 1 000 классов, 1 281 167 обучающих изображений и 50 000 валидационных изображений; обычно модели обучают с размером изображения 224x224, а загрузка занимает около 144 GB. Полная база ImageNet значительно больше: более 14 миллионов изображений, распределенных по более чем 20 000 синсетам WordNet. Однако для обучения классификации и тестирования используют именно подмножество из 1 000 классов.

  • Чтобы обучить модель Ultralytics YOLO на ImageNet, загрузи предобученную модель классификации и укажи для data путь imagenet:

    Пример обучения
    from ultralytics import YOLO
    
    # Загрузить модель
    model = YOLO("yolo26n-cls.pt")  # загрузить предварительно обученную модель (рекомендуется для обучения)
    
    # Обучить модель
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Подробные инструкции по обучению смотри на нашей странице обучения.

  • Предобученные модели Ultralytics YOLO26 обеспечивают передовую скорость и точность в различных задачах компьютерного зрения. Например, модель YOLO26n-cls с точностью top-1 71.4% и top-5 90.1% оптимизирована для приложений реального времени. Предобученные модели снижают вычислительные ресурсы, необходимые для обучения с нуля, и ускоряют циклы разработки. Подробнее о метриках производительности моделей YOLO26 читай в разделе «Предобученные модели ImageNet».

  • Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) способствовал развитию компьютерного зрения, предоставляя конкурентную площадку для оценки алгоритмов на крупном стандартизированном датасете. Единообразные метрики оценки стимулировали инновации в классификации изображений, обнаружении объектов и сегментации изображений, постоянно расширяя возможности глубокого обучения и компьютерного зрения.

Комментарии