Набор данных ImageNet#
Набор данных Ultralytics ImageNet (data="imagenet") — это подмножество ImageNet-1k / ILSVRC-2012, используемое для обучения и тестирования моделей классификации изображений. Он содержит 1 000 классов объектов, 1 281 167 изображений для обучения и 50 000 изображений для валидации размером 224x224, а его загрузка занимает около 144 ГБ. Более широкая база данных ImageNet значительно больше — более 14 миллионов изображений высокого разрешения, размеченных синонимными наборами WordNet и охватывающих более 20 000 категорий, — однако Ultralytics обучает модели на стандартизированном подмножестве ILSVRC из 1 000 классов, которое стало фактическим бенчмарком для глубокого обучения в области компьютерного зрения.
Предобученные модели ImageNet#
| Модель | размер (пиксели) | точность top1 | точность top5 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (M) | FLOPs (B) при 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
Ключевые особенности#
- Набор данных Ultralytics
imagenetсодержит 1 000 классов, 1 281 167 изображений для обучения и 50 000 изображений для валидации (ILSVRC-2012) и служит стандартным бенчмарком для предобучения моделей классификации изображений. - Классы организованы согласно иерархии WordNet, где каждому классу соответствует синсет (набор синонимичных терминов).
- Изображения используются для обучения в размере 224x224, а загрузка полного набора данных занимает около ~144 ГБ.
- Ежегодный конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC) сыграл важную роль в развитии исследований в области компьютерного зрения.
Структура датасета#
Набор данных Ultralytics ImageNet использует разбиение ILSVRC-2012:
| Выборка | Изображения | Классы |
|---|---|---|
| Обучение | 1,281,167 | 1,000 |
| Валидация | 50,000 | 1,000 |
Изображения хранятся в папках отдельных классов, названных по идентификатору синсета WordNet (например, n01440764), — именно такую структуру ожидает Ultralytics при обучении моделей классификации. Каждый из 1 000 классов соответствует синсету WordNet, а отдельного тестового разбиения нет, поэтому набор из 50 000 изображений для валидации используется для измерения точности.
Загрузка ImageNet-1k занимает около ~144 ГБ, поэтому перед обучением убедись, что на диске достаточно свободного места. Для быстрых экспериментов меньшие подмножества ImageNette и ImageNet10 используют тот же формат папок и обучаются за значительно меньшее время.
Конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC)#
Ежегодный конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC) позволял исследователям сравнивать алгоритмы на крупном стандартизированном наборе данных с единообразными метриками оценки. Он способствовал значительному прогрессу в глубоком обучении для классификации изображений, обнаружения объектов и других задач компьютерного зрения — особенно благодаря победе AlexNet в 2012 году, которая помогла начать современную эру глубокого обучения.
Применения#
Набор данных ImageNet широко используется для обучения и оценки моделей глубокого обучения в задачах классификации изображений, обнаружения объектов и локализации объектов. Такие знаковые архитектуры, как AlexNet, VGG и ResNet, были разработаны и протестированы на ImageNet, а веса, предобученные на ImageNet, по-прежнему часто используются как отправная точка для трансферного обучения в различных задачах компьютерного зрения.
Использование#
Чтобы обучить модель классификации YOLO на ImageNet в течение 100 эпох с размером изображения 224x224, используй приведенные ниже фрагменты кода. Полный список доступных аргументов см. на странице обучения модели.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)Ты также можешь управлять наборами данных для классификации и запускать обучение в облаке с помощью Ultralytics Platform.
Примеры изображений и аннотаций#
Набор данных ImageNet охватывает 1 000 классов ILSVRC-2012 и предоставляет разнообразный и обширный ресурс для обучения и оценки моделей компьютерного зрения. Ниже приведены примеры изображений из набора данных:

Цитирование и благодарности#
Если ты используешь датасет ImageNet в исследовательской или разработческой работе, пожалуйста, процитируй следующую статью:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Мы хотели бы поблагодарить команду ImageNet, возглавляемую Ольгой Руссаковской, Цзя Дэном и Ли Фэй-Фэй, за создание и поддержку набора данных ImageNet как ценного ресурса для сообщества исследователей машинного обучения и компьютерного зрения. Дополнительную информацию о наборе данных ImageNet и его создателях можно найти на веб-сайте ImageNet.
Часто задаваемые вопросы#
Набор данных ImageNet — это крупномасштабная база изображений, полная коллекция которой содержит более 14 миллионов изображений высокого разрешения, размеченных синсетами WordNet. В Ultralytics модель
data="imagenet"обучается на стандартизированном подмножестве ILSVRC-2012 из 1 000 классов, которое является фактическим бенчмарком для предобучения моделей классификации изображений. Такие знаковые модели, как AlexNet, VGG и ResNet, обучались и тестировались на ImageNet, что подчеркивает его роль в развитии компьютерного зрения.Набор данных Ultralytics
imagenetиспользует подмножество ILSVRC-2012, включающее 1 000 классов, 1 281 167 изображений для обучения и 50 000 изображений для валидации размером 224x224; загрузка занимает около 144 ГБ. Полная база данных ImageNet значительно больше: в ней более 14 миллионов изображений, распределенных по более чем 20 000 синсетам WordNet, однако подмножество из 1 000 классов используется для обучения и тестирования моделей классификации.Чтобы обучить модель Ultralytics YOLO на ImageNet, загрузи предобученную модель классификации и укажи для
dataпуть кimagenet:Пример обученияfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)Более подробные инструкции по обучению см. на нашей странице обучения.
Предобученные модели Ultralytics YOLO26 обеспечивают передовые показатели скорости и точности в различных задачах компьютерного зрения. Например, модель YOLO26n-cls с точностью top-1 71,4% и точностью top-5 90,1% оптимизирована для приложений реального времени. Предобученные модели сокращают вычислительные ресурсы, необходимые для обучения с нуля, и ускоряют циклы разработки. Подробнее о показателях производительности моделей YOLO26 см. в разделе «Предобученные модели ImageNet».
Ежегодный конкурс ImageNet по распознаванию изображений в большом масштабе (ILSVRC) способствовал развитию компьютерного зрения, предоставляя конкурентную платформу для оценки алгоритмов на крупном стандартизированном наборе данных. Единообразные метрики оценки стимулировали инновации в классификации изображений, обнаружении объектов и сегментации изображений, постоянно расширяя границы глубокого обучения и компьютерного зрения.