Ultralytics YOLO27:

Набор данных ImageNet#

Набор данных Ultralytics ImageNet (data="imagenet") — это подмножество ImageNet-1k / ILSVRC-2012, используемое для обучения и тестирования моделей классификации изображений. Он содержит 1 000 классов объектов, 1 281 167 изображений для обучения и 50 000 изображений для валидации размером 224x224, а его загрузка занимает около 144 ГБ. Более широкая база данных ImageNet значительно больше — более 14 миллионов изображений высокого разрешения, размеченных синонимными наборами WordNet и охватывающих более 20 000 категорий, — однако Ultralytics обучает модели на стандартизированном подмножестве ILSVRC из 1 000 классов, которое стало фактическим бенчмарком для глубокого обучения в области компьютерного зрения.

Предобученные модели ImageNet#

Модельразмер
(пиксели)
точность
top1
точность
top5
Скорость
CPU ONNX
(мс)
Скорость
T4 TensorRT10
(мс)
параметры
(M)
FLOPs
(B) при 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

Ключевые особенности#

  • Набор данных Ultralytics imagenet содержит 1 000 классов, 1 281 167 изображений для обучения и 50 000 изображений для валидации (ILSVRC-2012) и служит стандартным бенчмарком для предобучения моделей классификации изображений.
  • Классы организованы согласно иерархии WordNet, где каждому классу соответствует синсет (набор синонимичных терминов).
  • Изображения используются для обучения в размере 224x224, а загрузка полного набора данных занимает около ~144 ГБ.
  • Ежегодный конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC) сыграл важную роль в развитии исследований в области компьютерного зрения.

Структура датасета#

Набор данных Ultralytics ImageNet использует разбиение ILSVRC-2012:

ВыборкаИзображенияКлассы
Обучение1,281,1671,000
Валидация50,0001,000

Изображения хранятся в папках отдельных классов, названных по идентификатору синсета WordNet (например, n01440764), — именно такую структуру ожидает Ultralytics при обучении моделей классификации. Каждый из 1 000 классов соответствует синсету WordNet, а отдельного тестового разбиения нет, поэтому набор из 50 000 изображений для валидации используется для измерения точности.

Размер загрузки

Загрузка ImageNet-1k занимает около ~144 ГБ, поэтому перед обучением убедись, что на диске достаточно свободного места. Для быстрых экспериментов меньшие подмножества ImageNette и ImageNet10 используют тот же формат папок и обучаются за значительно меньшее время.

Конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC)#

Ежегодный конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC) позволял исследователям сравнивать алгоритмы на крупном стандартизированном наборе данных с единообразными метриками оценки. Он способствовал значительному прогрессу в глубоком обучении для классификации изображений, обнаружения объектов и других задач компьютерного зрения — особенно благодаря победе AlexNet в 2012 году, которая помогла начать современную эру глубокого обучения.

Применения#

Набор данных ImageNet широко используется для обучения и оценки моделей глубокого обучения в задачах классификации изображений, обнаружения объектов и локализации объектов. Такие знаковые архитектуры, как AlexNet, VGG и ResNet, были разработаны и протестированы на ImageNet, а веса, предобученные на ImageNet, по-прежнему часто используются как отправная точка для трансферного обучения в различных задачах компьютерного зрения.

Использование#

Чтобы обучить модель классификации YOLO на ImageNet в течение 100 эпох с размером изображения 224x224, используй приведенные ниже фрагменты кода. Полный список доступных аргументов см. на странице обучения модели.

Пример обучения
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Ты также можешь управлять наборами данных для классификации и запускать обучение в облаке с помощью Ultralytics Platform.

Примеры изображений и аннотаций#

Набор данных ImageNet охватывает 1 000 классов ILSVRC-2012 и предоставляет разнообразный и обширный ресурс для обучения и оценки моделей компьютерного зрения. Ниже приведены примеры изображений из набора данных:

Примеры изображений из набора данных классификации ImageNet

Цитирование и благодарности#

Если ты используешь датасет ImageNet в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:

Цитата
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Мы хотели бы поблагодарить команду ImageNet, возглавляемую Ольгой Руссаковской, Цзя Дэном и Ли Фэй-Фэй, за создание и поддержку набора данных ImageNet как ценного ресурса для сообщества исследователей машинного обучения и компьютерного зрения. Дополнительную информацию о наборе данных ImageNet и его создателях можно найти на веб-сайте ImageNet.

Часто задаваемые вопросы#

  • Набор данных ImageNet — это крупномасштабная база изображений, полная коллекция которой содержит более 14 миллионов изображений высокого разрешения, размеченных синсетами WordNet. В Ultralytics модель data="imagenet" обучается на стандартизированном подмножестве ILSVRC-2012 из 1 000 классов, которое является фактическим бенчмарком для предобучения моделей классификации изображений. Такие знаковые модели, как AlexNet, VGG и ResNet, обучались и тестировались на ImageNet, что подчеркивает его роль в развитии компьютерного зрения.

  • Набор данных Ultralytics imagenet использует подмножество ILSVRC-2012, включающее 1 000 классов, 1 281 167 изображений для обучения и 50 000 изображений для валидации размером 224x224; загрузка занимает около 144 ГБ. Полная база данных ImageNet значительно больше: в ней более 14 миллионов изображений, распределенных по более чем 20 000 синсетам WordNet, однако подмножество из 1 000 классов используется для обучения и тестирования моделей классификации.

  • Чтобы обучить модель Ultralytics YOLO на ImageNet, загрузи предобученную модель классификации и укажи для data путь к imagenet:

    Пример обучения
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Более подробные инструкции по обучению см. на нашей странице обучения.

  • Предобученные модели Ultralytics YOLO26 обеспечивают передовые показатели скорости и точности в различных задачах компьютерного зрения. Например, модель YOLO26n-cls с точностью top-1 71,4% и точностью top-5 90,1% оптимизирована для приложений реального времени. Предобученные модели сокращают вычислительные ресурсы, необходимые для обучения с нуля, и ускоряют циклы разработки. Подробнее о показателях производительности моделей YOLO26 см. в разделе «Предобученные модели ImageNet».

  • Ежегодный конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC) способствовал развитию компьютерного зрения, предоставляя конкурентную платформу для оценки алгоритмов на крупном стандартизированном наборе данных. Единообразные метрики оценки стимулировали инновации в классификации изображений, обнаружении объектов и сегментации изображений, постоянно расширяя границы глубокого обучения и компьютерного зрения.

Комментарии