ImageNet 数据集#
Ultralytics ImageNet 数据集(data="imagenet")是用于训练和基准测试图像分类模型的 ImageNet-1k / ILSVRC-2012 子集。它包含 1,000 个目标类别、1,281,167 张训练图像和 50,000 张验证图像,图像尺寸为 224x224,下载数据量约为 144 GB。更广泛的 ImageNet 数据库规模大得多,包含超过 1,400 万张带有 WordNet synset 标注的高分辨率图像,涵盖 20,000 多个类别;但 Ultralytics 使用标准化的 1,000 类 ILSVRC 子集进行训练,该子集已成为深度学习和计算机视觉领域事实上的基准。
ImageNet 预训练模型#
| 模型 | 尺寸 (像素) | acc top1 | acc top5 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (毫秒) | 参数量 (M) | FLOPs (B),输入尺寸 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
主要特性#
- Ultralytics
imagenet数据集包含 1,000 个类别、1,281,167 张训练图像和 50,000 张验证图像(ILSVRC-2012),是图像分类的标准预训练基准。 - 类别按照 WordNet 层级结构组织,每个类别对应一个 synset(同义词术语集合)。
- 图像以 224x224 的尺寸进行训练,完整数据集的下载量约为 ~144 GB。
- 年度 ImageNet 大规模视觉识别挑战赛(ILSVRC)在推动计算机视觉研究发展方面发挥了重要作用。
数据集结构#
Ultralytics ImageNet 数据集使用 ILSVRC-2012 划分:
| 划分 | 图像 | 类别 |
|---|---|---|
| 训练 | 1,281,167 | 1,000 |
| 验证 | 50,000 | 1,000 |
图像存储在按 WordNet synset ID 命名的类别文件夹中(例如 n01440764),这种目录布局符合 Ultralytics 分类训练的要求。1,000 个类别中的每一个都映射到一个 WordNet synset,且没有单独的测试集,因此使用包含 50,000 张图像的验证集来衡量准确率。
ImageNet-1k 的下载量约为 ~144 GB,因此训练前请确保磁盘空间充足。如需快速实验,可以使用规模更小的 ImageNette 和 ImageNet10 子集;它们采用相同的文件夹格式,训练时间只需很短一部分。
ImageNet 大规模视觉识别挑战赛(ILSVRC)#
年度 ImageNet 大规模视觉识别挑战赛(ILSVRC) 让研究人员能够在大规模、标准化的数据集上,使用一致的评估指标对算法进行基准测试。该赛事推动了深度学习在图像分类、目标检测和其他视觉任务方面的重大进步,其中最著名的是 AlexNet 在 2012 年的夺冠,这一成果助力开启了现代深度学习时代。
应用#
ImageNet 数据集广泛用于训练和评估图像分类、目标检测和目标定位深度学习模型。AlexNet、VGG 和 ResNet 等具有里程碑意义的架构都在 ImageNet 上开发并进行基准测试,而 ImageNet 预训练权重仍是各种视觉任务进行迁移学习时常用的起点。
使用方法#
要在 ImageNet 上训练 YOLO 分类模型 100 个训练轮次,并使用 224x224 的图像尺寸,请使用下面的代码片段。有关可用参数的完整列表,请参阅模型训练页面。
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)你还可以通过 Ultralytics Platform 管理分类数据集并在云端运行训练。
示例图像和标注#
ImageNet 数据集涵盖 ILSVRC-2012 的 1,000 个类别,为训练和评估计算机视觉模型提供了多样且规模广泛的资源。下面是数据集中的一些示例图像:

引用和致谢#
如果你在研究或开发工作中使用 ImageNet 数据集,请引用以下论文:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}我们感谢由 Olga Russakovsky、Jia Deng 和 Li Fei-Fei 领导的 ImageNet 团队,他们创建并维护了 ImageNet 数据集,为机器学习和计算机视觉研究社区提供了宝贵资源。有关 ImageNet 数据集及其创建者的更多信息,请访问 ImageNet 网站。
常见问题#
ImageNet 数据集是一个大规模图像数据库,其更广泛的图像集合包含超过 1,400 万张带有 WordNet synset 标注的高分辨率图像。在 Ultralytics 中,
data="imagenet"使用标准化的 1,000 类 ILSVRC-2012 子集进行训练,该子集是图像分类预训练的事实标准基准。AlexNet、VGG 和 ResNet 等具有里程碑意义的模型都在 ImageNet 上训练并进行基准测试,彰显了其在推动计算机视觉发展中的作用。Ultralytics
imagenet数据集使用 ILSVRC-2012 子集,包含 1,000 个类别、1,281,167 张训练图像和 50,000 张验证图像,图像尺寸为 224x224,下载量总计约 144 GB。完整的 ImageNet 数据库规模大得多(包含超过 1,400 万张图像,涵盖 20,000 多个 WordNet synset),但用于分类训练和基准测试的是其中的 1,000 类子集。要在 ImageNet 上训练 Ultralytics YOLO 模型,请加载一个预训练分类模型,并将
data指向imagenet:训练示例from ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)如需更深入的训练说明,请参阅我们的训练页面。
Ultralytics YOLO26 预训练模型在各种计算机视觉任务中兼具领先的速度和准确率。例如,YOLO26n-cls 模型的 top-1 准确率为 71.4%,top-5 准确率为 90.1%,针对实时应用进行了优化。预训练模型可以减少从头开始训练所需的计算资源,并加快开发周期。要详细了解 YOLO26 模型的性能指标,请参阅 ImageNet 预训练模型部分。
年度 ImageNet 大规模视觉识别挑战赛(ILSVRC) 通过提供一个在大规模、标准化数据集上评估算法的竞争平台,推动了计算机视觉的发展。其一致的评估指标促进了图像分类、目标检测和图像分割领域的创新,不断拓展深度学习和计算机视觉的边界。