Набор данных ImageNet#
Датасет Ultralytics ImageNet (data="imagenet") представляет собой подмножество ImageNet-1k / ILSVRC-2012, используемое для обучения и бенчмаркинга моделей классификации изображений. Он содержит 1 000 классов объектов с 1 281 167 изображениями для обучения и 50 000 изображениями для валидации при размере изображения 224x224, а его размер для скачивания составляет около 144 ГБ. Более широкая база данных ImageNet намного больше — более 14 миллионов изображений высокого разрешения, аннотированных синсетами WordNet по более чем 20 000 категориям, — однако Ultralytics обучает модели на стандартизированном 1 000-классовом подмножестве ILSVRC, которое стало де-факто бенчмарком для глубокого обучения в компьютерном зрении.
Предобученные модели ImageNet#
| Модель | размер (пиксели) | acc top1 | acc top5 | Скорость CPU ONNX (мс) | Скорость T4 TensorRT10 (мс) | параметры (М) | FLOPs (B) при 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.5 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.6 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.9 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.2 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.6 |
Ключевые особенности#
- Датасет Ultralytics
imagenetпредоставляет 1 000 классов с 1 281 167 изображениями для обучения и 50 000 изображениями для валидации (ILSVRC-2012), что является стандартным бенчмарком предварительного обучения для классификации изображений. - Классы организованы в соответствии с иерархией WordNet, где каждый класс соответствует синсету (набору синонимичных терминов).
- Изображения обучаются при размере 224x224, а полный набор данных требует загрузки около ~144 ГБ.
- Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) сыграл важную роль в развитии исследований в области компьютерного зрения.
Структура набора данных#
Набор данных Ultralytics ImageNet использует разделение ILSVRC-2012:
| Split | Изображения | Классы |
|---|---|---|
| Обучение | 1,281,167 | 1,000 |
| Validation | 50,000 | 1,000 |
Изображения хранятся в папках для каждого класса, названных по ID синсета WordNet (например, n01440764) — такой формат структуры ожидает обучение классификации Ultralytics. Каждый из 1 000 классов сопоставляется с синсетом WordNet, а отдельного тестового сплита нет, поэтому набор данных для валидации размером 50 000 изображений используется для измерения точности.
ImageNet-1k весит около ~144 ГБ при скачивании, поэтому убедись, что у тебя достаточно свободного места на диске перед началом обучения. Для быстрых экспериментов меньшие подмножества ImageNette и ImageNet10 используют тот же формат папок и обучаются за малую долю времени.
Конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#
Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) позволил исследователям оценивать алгоритмы на крупномасштабном стандартизированном датасете с последовательными метриками оценки. Он подтолкнул к значительным достижениям в глубоком обучении для классификации изображений, обнаружения объектов и других задач компьютерного зрения — наиболее примечательна победа AlexNet в 2012 году, которая помогла запустить эру современного глубокого обучения.
Применение#
Датасет ImageNet широко используется для обучения и оценки моделей глубокого обучения для классификации изображений, обнаружения и локализации объектов. Знаковые архитектуры, такие как AlexNet, VGG и ResNet, были разработаны и протестированы на ImageNet, а предобученные на ImageNet веса остаются обычной отправной точкой для трансферного обучения в различных задачах компьютерного зрения.
Использование#
Чтобы обучить модель классификации YOLO на ImageNet в течение 100 эпох при размере изображения 224x224, используй приведенные ниже фрагменты кода. Полный список доступных аргументов см. на странице обучения модели.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)Ты также можешь управлять датасетами классификации и запускать обучение в облаке с помощью Ultralytics Platform.
Примеры изображений и аннотации#
Набор данных ImageNet охватывает 1 000 классов ILSVRC-2012, предоставляя разнообразный и обширный ресурс для обучения и оценки моделей компьютерного зрения. Вот несколько примеров изображений из этого набора:

Цитирование и благодарности#
Если ты используешь набор данных ImageNet в своих исследованиях или разработках, пожалуйста, сошлися на следующую статью:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Мы хотели бы выразить признательность команде ImageNet во главе с Ольгой Русаковской, Цзя Денем и Ли Фэйфэй за создание и поддержку датасета ImageNet в качестве ценного ресурса для исследовательского сообщества в области машинного обучения и компьютерного зрения. Для получения дополнительной информации о датасете ImageNet и его создателях посети веб-сайт ImageNet.
FAQ#
Датасет ImageNet представляет собой крупномасштабную базу данных изображений, чья общая коллекция содержит более 14 миллионов изображений высокого разрешения, аннотированных синсетами WordNet. В Ultralytics
data="imagenet"обучается на стандартизированном подмножестве ILSVRC-2012 из 1 000 классов, которое является де-факто бенчмарком для предварительного обучения классификации изображений. Знаковые модели, такие как AlexNet, VGG и ResNet, обучались и оценивались на ImageNet, подчеркивая его роль в развитии компьютерного зрения.Датасет Ultralytics
imagenetиспользует подмножество ILSVRC-2012 с 1 000 классов, 1 281 167 изображениями для обучения и 50 000 изображениями для валидации при размере изображения 224x224, что составляет примерно 144 ГБ общего объема для скачивания. Полная база данных ImageNet намного больше (более 14 миллионов изображений в более чем 20 000 синсетах WordNet), но подмножество из 1 000 классов используется для обучения классификации и бенчмаркинга.Чтобы обучить модель Ultralytics YOLO на ImageNet, загрузи предобученную модель классификации и укажи
dataпуть кimagenet:Пример обученияfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)Более подробные инструкции по обучению см. на нашей странице обучения.
Предобученные модели Ultralytics YOLO26 обеспечивают передовую производительность по скорости и точности для различных задач компьютерного зрения. Например, модель YOLO26n-cls с точностью top-1 71,4% и точностью top-5 90,1% оптимизирована для приложений реального времени. Предобученные модели снижают вычислительные ресурсы, необходимые для обучения с нуля, и ускоряют циклы разработки. Узнай больше о метриках производительности моделей YOLO26 в разделе предобученных моделей ImageNet.
Ежегодный конкурс ImageNet Large Scale Visual Recognition Challenge (ILSVRC) стимулировал развитие компьютерного зрения, предоставив конкурентную платформу для оценки алгоритмов на крупномасштабном стандартизированном датасете. Его последовательные метрики оценки способствовали инновациям в классификации изображений, обнаружении объектов и сегментации изображений, постоянно расширяя границы глубокого обучения и компьютерного зрения.