Ultralytics YOLO27:

ImageNet 데이터셋#

Ultralytics ImageNet 데이터셋(data="imagenet")은 이미지 분류 모델을 학습하고 벤치마킹하는 데 사용되는 ImageNet-1k / ILSVRC-2012 하위 집합입니다. 이 데이터셋에는 1,000개의 객체 클래스, 1,281,167개의 학습 이미지, 50,000개의 검증 이미지가 포함되어 있으며, 이미지 크기는 224x224이고 약 144 GB의 데이터가 다운로드됩니다. 더 광범위한 ImageNet 데이터베이스는 20,000개가 넘는 카테고리에 걸쳐 WordNet synset으로 주석이 지정된 1,400만 개 이상의 고해상도 이미지를 포함하여 훨씬 더 규모가 크지만, Ultralytics는 컴퓨터 비전 분야의 딥러닝에서 사실상 표준 벤치마크가 된 표준화된 1,000개 클래스의 ILSVRC 하위 집합으로 학습합니다.

ImageNet 사전 학습 모델#

모델크기
(픽셀)
acc
top1
acc
top5
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B) at 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

주요 기능#

  • Ultralytics imagenet 데이터셋은 이미지 분류를 위한 표준 사전 학습 벤치마크인 ILSVRC-2012의 1,000개 클래스, 1,281,167개의 학습 이미지 및 50,000개의 검증 이미지를 제공합니다.
  • 클래스는 WordNet 계층 구조에 따라 구성되며, 각 클래스는 synset(동의어 용어 집합)에 해당합니다.
  • 이미지는 224x224 크기로 학습되며, 전체 데이터셋을 다운로드하려면 ~144 GB의 용량이 필요합니다.
  • 매년 개최되는 ImageNet 대규모 시각 인식 챌린지(ILSVRC)는 컴퓨터 비전 연구 발전에 중요한 역할을 해왔습니다.

데이터셋 구조#

Ultralytics ImageNet 데이터셋은 다음과 같은 ILSVRC-2012 분할을 사용합니다:

분할이미지클래스
학습1,281,1671,000
검증50,0001,000

이미지는 WordNet synset ID(예: n01440764)로 이름이 지정된 클래스별 폴더에 저장되며, 이는 Ultralytics 분류 학습에서 요구하는 구조입니다. 1,000개 클래스 각각은 WordNet synset에 매핑되며 별도의 테스트 분할은 없으므로, 50,000개 이미지로 구성된 검증 세트를 사용하여 정확도를 측정합니다.

다운로드 크기

ImageNet-1k는 약 ~144 GB를 다운로드해야 하므로 학습 전에 디스크 공간이 충분한지 확인하십시오. 빠른 실험을 위해 더 작은 ImageNetteImageNet10 하위 집합을 사용할 수 있으며, 동일한 폴더 형식을 사용하고 훨씬 짧은 시간에 학습할 수 있습니다.

ImageNet 대규모 시각 인식 챌린지(ILSVRC)#

매년 개최되는 ImageNet 대규모 시각 인식 챌린지(ILSVRC)는 연구자들이 대규모 표준화 데이터셋에서 일관된 평가 지표를 사용하여 알고리즘을 벤치마킹할 수 있도록 했습니다. 이 대회는 이미지 분류, 객체 감지 및 기타 비전 작업의 딥러닝 발전을 크게 촉진했으며, 특히 현대 딥러닝 시대를 여는 데 기여한 AlexNet의 2012년 우승이 대표적입니다.

응용 분야#

ImageNet 데이터셋은 이미지 분류, 객체 감지 및 객체 위치 추정을 위한 딥러닝 모델을 학습하고 평가하는 데 널리 사용됩니다. AlexNet, VGG, ResNet과 같은 대표적인 아키텍처는 모두 ImageNet에서 개발되고 벤치마킹되었으며, ImageNet 사전 학습 가중치는 다양한 비전 작업에서 전이 학습을 시작하는 일반적인 출발점으로 여전히 사용됩니다.

사용법#

ImageNet에서 224x224 이미지 크기로 100 에포크 동안 YOLO 분류 모델을 학습하려면 아래 코드 스니펫을 사용하십시오. 사용 가능한 인자 전체 목록은 모델 학습 페이지를 참조하십시오.

학습 예제
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Ultralytics Platform을 사용하면 클라우드에서 분류 데이터셋을 관리하고 학습을 실행할 수도 있습니다.

샘플 이미지 및 주석#

ImageNet 데이터셋은 1,000개의 ILSVRC-2012 클래스를 포함하며, 컴퓨터 비전 모델을 학습하고 평가하는 데 사용할 수 있는 다양하고 광범위한 리소스를 제공합니다. 다음은 데이터셋의 예시 이미지입니다:

ImageNet 분류 데이터셋 샘플 이미지

인용 및 감사의 글#

연구 또는 개발 작업에서 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오:

인용문
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

ImageNet 데이터셋을 귀중한 머신러닝 및 컴퓨터 비전 연구 커뮤니티 리소스로 만들고 유지해 온 Olga Russakovsky, Jia Deng, Li Fei-Fei가 이끄는 ImageNet 팀에 감사를 표합니다. ImageNet 데이터셋과 제작자에 대한 자세한 내용은 ImageNet 웹사이트를 방문하십시오.

FAQ#

  • ImageNet 데이터셋은 WordNet 동의어 집합으로 주석이 지정된 1,400만 개 이상의 고해상도 이미지를 포함하는 대규모 이미지 데이터베이스입니다. Ultralytics에서는 data="imagenet"이 사실상 이미지 분류 사전 학습의 벤치마크로 사용되는 표준화된 1,000개 클래스의 ILSVRC-2012 하위 집합으로 학습합니다. AlexNet, VGG, ResNet과 같은 주요 모델은 ImageNet을 기반으로 학습되고 벤치마킹되었으며, 이는 컴퓨터 비전 발전에서 ImageNet이 수행한 역할을 잘 보여줍니다.

  • Ultralytics imagenet 데이터셋은 224x224 이미지 크기의 ILSVRC-2012 하위 집합을 사용하며, 1,000개 클래스, 1,281,167개의 학습 이미지, 50,000개의 검증 이미지로 구성되고 전체 다운로드 크기는 약 144 GB입니다. 전체 ImageNet 데이터베이스는 20,000개가 넘는 WordNet synset에 걸쳐 1,400만 개 이상의 이미지를 포함하여 훨씬 더 규모가 크지만, 분류 학습 및 벤치마킹에는 1,000개 클래스의 하위 집합이 사용됩니다.

  • ImageNet에서 Ultralytics YOLO 모델을 학습하려면 사전 학습된 분류 모델을 로드하고 dataimagenet에 지정하십시오:

    학습 예제
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    더 자세한 학습 지침은 학습 페이지를 참조하십시오.

  • Ultralytics YOLO26 사전 학습 모델은 다양한 컴퓨터 비전 작업에서 속도와 정확도 측면의 최첨단 성능을 제공합니다. 예를 들어 YOLO26n-cls 모델은 top-1 정확도 71.4%, top-5 정확도 90.1%를 제공하며 실시간 애플리케이션에 최적화되어 있습니다. 사전 학습 모델을 사용하면 처음부터 학습하는 데 필요한 컴퓨팅 리소스를 줄이고 개발 주기를 단축할 수 있습니다. ImageNet 사전 학습 모델 섹션에서 YOLO26 모델의 성능 지표에 대해 자세히 알아보십시오.

  • 매년 개최되는 ImageNet 대규모 시각 인식 챌린지(ILSVRC)는 대규모 표준화 데이터셋에서 알고리즘을 평가할 수 있는 경쟁 플랫폼을 제공하여 컴퓨터 비전의 발전을 이끌었습니다. 일관된 평가 지표는 이미지 분류, 객체 감지 및 이미지 분할의 혁신을 촉진했으며, 딥러닝과 컴퓨터 비전의 한계를 지속적으로 확장했습니다.

댓글