YOLO Vision 2026:

ImageNetデータセット#

Ultralytics ImageNet データセット (data="imagenet") は、画像分類モデルのトレーニングとベンチマークに使用される ImageNet-1k / ILSVRC-2012 サブセットです。画像サイズ 224x2241,000 個のオブジェクトクラス1,281,167 枚のトレーニング画像50,000 枚の検証画像を含み、約 144 GB のデータとしてダウンロードされます。広範な ImageNet データベースはさらに大規模であり、20,000 以上のカテゴリにわたる WordNet シンセットでアノテーションされた 1,400 万枚以上の高解像度画像が含まれていますが、Ultralytics は、コンピュータビジョンにおけるディープラーニングの事実上のベンチマークとなった標準化された 1,000 クラスの ILSVRC サブセットでトレーニングを行います。

ImageNet事前学習済みモデル#

モデルサイズ
(ピクセル)
精度
top1
精度
top5
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B) at 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.5
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.6
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.9
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.2
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.6

主な特徴#

  • Ultralytics imagenet データセットは、画像分類の標準的な事前学習ベンチマークである 1,000 クラス(1,281,167 枚のトレーニング画像および 50,000 枚の検証画像、ILSVRC-2012)を提供します。
  • クラスはWordNetの階層に従って構成されており、各クラスはシンセット(同義語の集合)に対応しています。
  • 画像は224x224でトレーニングされ、データセット全体は約144 GBの大きなダウンロードサイズとなります。
  • 毎年開催されるImageNet Large Scale Visual Recognition Challenge (ILSVRC)は、コンピュータビジョン研究の進歩に貢献してきました。

データセットの構造#

Ultralytics ImageNet データセットは、ILSVRC-2012の分割を使用します:

分割画像クラス
トレーニング1,281,1671,000
バリデーション50,0001,000

画像は、WordNet シンスセット ID によって命名されたクラスごとのフォルダ(例: n01440764)に保存されます。これは Ultralytics の分類トレーニングが想定するレイアウトです。1,000 のクラスのそれぞれが WordNet シンスセットにマッピングされており、個別のテスト分割はないため、50,000 枚の検証セットを使用して 精度 を測定します。

ダウンロードサイズ

ImageNet-1k は約 144 GB のダウンロードとなるため、トレーニング前に十分なディスク容量があることを確認してください。簡単な実験には、より小規模な ImageNette および ImageNet10 サブセットを使用できます。これらは同じフォルダ形式を採用しており、わずかな時間でトレーニングが完了します。

ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#

年次開催の ImageNet Large Scale Visual Recognition Challenge (ILSVRC) により、研究者は一貫した評価指標を備えた大規模で標準化されたデータセット上でアルゴリズムのベンチマークを行うことができるようになりました。これは、画像分類、物体検出、およびその他のビジョンタスクにおけるディープラーニングの大きな進歩を推進しました。最も特筆すべきは 2012 年の AlexNet の勝利であり、これが現代のディープラーニング時代の幕開けを支援しました。

アプリケーション#

ImageNet データセットは、画像分類、物体検出、および物体ローカリゼーションのためのディープラーニングモデルのトレーニングと評価に広く使用されています。AlexNetVGGResNet などの画期的なアーキテクチャはすべて ImageNet で開発およびベンチマークが行われ、ImageNet で事前学習された重みは、ビジョンタスク全体の転移学習における一般的な出発点であり続けています。

使用方法#

ImageNet で 100 エポック、224x224 の画像サイズで YOLO 分類モデルをトレーニングするには、以下のコードスニペットを使用します。利用可能な引数の詳細なリストについては、モデルの トレーニング ページを参照してください。

学習例
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Ultralytics Platform を使用して、クラウドで分類データセットの管理やトレーニングの実行を行うこともできます。

サンプル画像とアノテーション#

ImageNet データセットは1,000の ILSVRC-2012 クラスにまたがっており、コンピュータビジョンモデルのトレーニングと評価のための多様で広範なリソースを提供します。以下はデータセットの画像例です:

ImageNet classification dataset sample images

引用と謝辞#

研究や開発活動でImageNetデータセットを使用する場合は、以下の論文を引用してください。

引用
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

機械学習およびコンピュータビジョン研究コミュニティにとって貴重なリソースである ImageNet データセットを作成および維持してくださっている、Olga Russakovsky、Jia Deng、Li Fei-Fei が率いる ImageNet チームに感謝いたします。ImageNet データセットとその作成者の詳細については、ImageNet ウェブサイトをご覧ください。

よくある質問 (FAQ)#

ImageNetデータセットとは何ですか?また、どのようにコンピュータビジョンで使用されますか?#

ImageNet データセットは大規模な画像データベースであり、そのより広範なコレクションには、WordNet シンスセットでアノテーションされた 1,400 万枚以上の高解像度画像が格納されています。Ultralytics では、data="imagenet" は、画像分類 事前学習の事実上の標準ベンチマークである、標準化された 1,000 クラスの ILSVRC-2012 サブセットでトレーニングを行います。AlexNet、VGG、ResNet などの画期的なモデルは ImageNet でトレーニングおよびベンチマークされ、コンピュータビジョンの発展におけるその役割を裏付けています。

ImageNet データセットにはいくつのクラスと画像がありますか?#

Ultralytics imagenet データセットは、1,000 クラス1,281,167 枚のトレーニング画像50,000 枚の検証画像(224x224 の画像サイズ)を持つ ILSVRC-2012 サブセットを使用しており、総ダウンロードサイズは約 144 GB です。完全な ImageNet データベースははるかに大規模(20,000 以上の WordNet シンスセットにわたる 1,400 万枚以上の画像)ですが、分類のトレーニングとベンチマークには 1,000 クラスのサブセットが使用されます。

ImageNet データセットで画像分類を行うために YOLO モデルをトレーニングするにはどうすればよいですか?#

ImageNet で Ultralytics YOLO モデルをトレーニングするには、事前学習済みの分類モデルをロードし、dataimagenet に指定します。

学習例
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

より詳細なトレーニング手順については、トレーニングページを参照してください。

ImageNetデータセットプロジェクトにUltralytics YOLO26事前学習済みモデルを使用すべき理由は何ですか?#

Ultralytics YOLO26 事前学習済みモデルは、さまざまなコンピュータビジョンタスクにおいて、速度と 精度 の面で最先端のパフォーマンスを提供します。たとえば、トップ1精度 71.4%、トップ5精度 90.1% を誇る YOLO26n-cls モデルは、リアルタイムアプリケーション向けに最適化されています。事前学習済みモデルにより、ゼロからのトレーニングに必要な計算リソースが削減され、開発サイクルが加速されます。YOLO26 モデルのパフォーマンス指標の詳細については、ImageNet 事前学習済みモデルセクションをご覧ください。

ImageNet Large Scale Visual Recognition Challenge (ILSVRC)は、コンピュータビジョンにおいてどのような役割を果たしていますか?#

年次開催の ImageNet Large Scale Visual Recognition Challenge (ILSVRC) は、大規模かつ標準化されたデータセット上でアルゴリズムを評価するための競争プラットフォームを提供することにより、コンピュータビジョンの進歩を推進しました。その一貫した評価指標は、画像分類、物体検出、および画像セグメンテーションにおけるイノベーションを促進し、ディープラーニングとコンピュータビジョンの限界を継続的に押し広げました。

コメント