ImageNet 数据集#
Ultralytics ImageNet 数据集(data="imagenet")是用于训练和基准测试图像分类模型的 ImageNet-1k / ILSVRC-2012 子集。它包含 1,000 个对象类别,其中有 1,281,167 张训练图像和 50,000 张验证图像,通常以 224x224 的图像尺寸训练,下载数据约为 144 GB。更广泛的 ImageNet 数据库规模大得多,包含超过 1,400 万张高分辨率图像,按 WordNet 同义词集标注,类别超过 20,000 个;但 Ultralytics 使用标准化的 1,000 类 ILSVRC 子集进行训练,该子集已成为计算机视觉领域深度学习的事实标准基准。
ImageNet 预训练模型#
| 模型 | 尺寸 (像素) | acc top1 | acc top5 | 速度 CPU ONNX (毫秒) | 速度 T4 TensorRT10 (ms) | 参数 (M) | FLOPs (B),输入尺寸为 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
主要功能#
- Ultralytics
imagenet数据集包含 1,000 个类别、1,281,167 张训练图像和 50,000 张验证图像(ILSVRC-2012),是图像分类的标准预训练基准。 - 类别按照 WordNet 层级组织,每个类别对应一个同义词集(synset,即一组同义词)。
- 图像训练尺寸为 224x224,完整数据集的下载量约为 ~144 GB。
- 年度 ImageNet 大规模视觉识别挑战赛 (ILSVRC) 对推动计算机视觉研究发挥了重要作用。
数据集结构#
Ultralytics ImageNet 数据集使用 ILSVRC-2012 划分:
| 划分 | 图像 | 类别 |
|---|---|---|
| 训练 | 1,281,167 | 1,000 |
| 验证 | 50,000 | 1,000 |
图像存储在按 WordNet 同义词集 ID 命名的分类文件夹中(例如 n01440764),这种目录结构符合 Ultralytics 分类训练的要求。1,000 个类别各自映射到一个 WordNet 同义词集。由于没有单独的测试集,因此使用 50,000 张图像的验证集来衡量准确率。
ImageNet-1k 的下载量约为 ~144 GB,因此训练前请确保磁盘空间充足。若要快速试验,可以使用较小的 ImageNette 和 ImageNet10 子集;它们采用相同的文件夹格式,训练时间只需一小部分。
ImageNet 大规模视觉识别挑战赛 (ILSVRC)#
年度 ImageNet 大规模视觉识别挑战赛 (ILSVRC)让研究人员能够在大型标准化数据集上使用一致的评估指标对算法进行基准测试。该赛事推动了深度学习在图像分类、对象检测及其他视觉任务上的重大进展,其中最著名的是 AlexNet 在 2012 年获胜,这场胜利助力开启了现代深度学习时代。
应用场景#
ImageNet 数据集广泛用于训练和评估图像分类、对象检测和对象定位的深度学习模型。AlexNet、VGG 和 ResNet 等里程碑式架构都在 ImageNet 上开发并进行基准测试,而 ImageNet 预训练权重仍是视觉任务迁移学习的常见起点。
用法#
要在 ImageNet 上训练 YOLO 分类模型 100 个训练轮次,并将图像尺寸设为 224x224,请使用下面的代码片段。有关可用参数的完整列表,请参阅模型的训练页面。
from ultralytics import YOLO
# 加载模型
model = YOLO("yolo26n-cls.pt") # 加载预训练模型(推荐用于训练)
# 训练模型
results = model.train(data="imagenet", epochs=100, imgsz=224)你也可以使用 Ultralytics Platform管理分类数据集,并在云端运行训练。
示例图像和标注#
ImageNet 数据集涵盖 ILSVRC-2012 的 1,000 个类别,为训练和评估计算机视觉模型提供了丰富而多样的资源。以下是数据集中的一些示例图像:

引用与致谢#
如果你在研究或开发工作中使用 ImageNet 数据集,请引用以下论文:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}我们谨向由 Olga Russakovsky、Jia Deng 和 Li Fei-Fei 领导的 ImageNet 团队致谢,感谢他们创建并维护 ImageNet 数据集,为机器学习和计算机视觉研究社区提供了宝贵资源。有关 ImageNet 数据集及其创建者的更多信息,请访问 ImageNet 网站。
常见问题#
ImageNet 数据集是一个大型图像数据库,其完整集合包含超过 1,400 万张按 WordNet 同义词集标注的高分辨率图像。在 Ultralytics 中,
data="imagenet"使用标准化的 ILSVRC-2012 1,000 类子集进行训练;该子集是图像分类预训练的事实标准基准。AlexNet、VGG 和 ResNet 等里程碑式模型均在 ImageNet 上训练并进行基准测试,充分体现了 ImageNet 在推动计算机视觉发展方面的作用。Ultralytics
imagenet数据集使用 ILSVRC-2012 子集,包含 1,000 个类别、1,281,167 张训练图像和 50,000 张验证图像,通常以 224x224 的图像尺寸训练,下载量约为 144 GB。完整的 ImageNet 数据库规模大得多(包含超过 1,400 万张图像和超过 20,000 个 WordNet 同义词集),但用于分类训练和基准测试的是这个 1,000 类子集。要在 ImageNet 上训练 Ultralytics YOLO 模型,请加载预训练分类模型,并将
data指向imagenet:训练示例from ultralytics import YOLO # 加载模型 model = YOLO("yolo26n-cls.pt") # 加载预训练模型(推荐用于训练) # 训练模型 results = model.train(data="imagenet", epochs=100, imgsz=224)如需更深入的训练说明,请参阅我们的训练页面。
Ultralytics YOLO26 预训练模型在多种计算机视觉任务中提供先进的速度和准确率。例如,YOLO26n-cls 模型的 top-1 准确率为 71.4%,top-5 准确率为 90.1%,针对实时应用进行了优化。预训练模型可以减少从头开始训练所需的计算资源,并加快开发周期。你可以在 ImageNet 预训练模型部分了解 YOLO26 模型的性能指标。
年度 ImageNet 大规模视觉识别挑战赛 (ILSVRC)通过提供竞争平台,让研究人员能够在大型标准化数据集上评估算法,从而推动计算机视觉发展。一致的评估指标促进了图像分类、对象检测和图像分割领域的创新,不断拓展深度学习和计算机视觉的边界。