Ultralytics YOLO27:

Dataset ImageNet#

Dataset Ultralytics ImageNet (data="imagenet") là tập con ImageNet-1k / ILSVRC-2012 được sử dụng để huấn luyện và benchmark các model phân loại ảnh. Dataset này chứa 1.000 lớp đối tượng với 1.281.167 ảnh huấn luyện50.000 ảnh validation ở kích thước ảnh 224x224, đồng thời cần tải xuống khoảng 144 GB dữ liệu. Cơ sở dữ liệu ImageNet đầy đủ lớn hơn nhiều — hơn 14 triệu ảnh độ phân giải cao được gán nhãn bằng các synset WordNet trên hơn 20.000 danh mục — nhưng Ultralytics huấn luyện trên tập con ILSVRC chuẩn hóa gồm 1.000 lớp, vốn đã trở thành benchmark de facto cho deep learning trong computer vision.

Các Model được Pretrained trên ImageNet#

Modelkích thước
(pixel)
acc
top1
acc
top5
Tốc độ
CPU ONNX
(ms)
Tốc độ
T4 TensorRT10
(ms)
tham số
(M)
FLOPs
(B) tại 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

Tính năng chính#

  • Dataset imagenet của Ultralytics cung cấp 1.000 lớp với 1.281.167 ảnh huấn luyện và 50.000 ảnh validation (ILSVRC-2012), là benchmark pretraining tiêu chuẩn cho phân loại ảnh.
  • Các lớp được tổ chức theo hệ phân cấp WordNet, trong đó mỗi lớp tương ứng với một synset (một tập hợp các thuật ngữ đồng nghĩa).
  • Ảnh được dùng để huấn luyện ở kích thước 224x224, và toàn bộ dataset cần tải xuống khoảng ~144 GB.
  • Cuộc thi Nhận dạng Hình ảnh Quy mô lớn ImageNet (ILSVRC) thường niên đã đóng vai trò quan trọng trong việc thúc đẩy nghiên cứu computer vision.

Cấu trúc bộ dữ liệu#

Dataset ImageNet của Ultralytics sử dụng tập chia ILSVRC-2012:

SplitẢnhCác lớp
Huấn luyện1,281,1671,000
Validation50,0001,000

Ảnh được lưu trong các thư mục riêng theo từng lớp, được đặt tên bằng ID synset WordNet (ví dụ: n01440764), đúng theo cấu trúc mà quy trình huấn luyện phân loại của Ultralytics yêu cầu. Mỗi trong số 1.000 lớp ánh xạ tới một synset WordNet và không có tập test riêng, vì vậy tập validation gồm 50.000 ảnh được dùng để đo độ chính xác.

Kích thước tải xuống

ImageNet-1k cần tải xuống khoảng ~144 GB, vì vậy hãy đảm bảo bạn có đủ dung lượng đĩa trước khi huấn luyện. Để thử nghiệm nhanh, các tập con ImageNetteImageNet10 nhỏ hơn sử dụng cùng định dạng thư mục và có thể huấn luyện trong thời gian ngắn hơn nhiều.

Cuộc thi Nhận dạng Hình ảnh Quy mô lớn ImageNet (ILSVRC)#

Cuộc thi Nhận dạng Hình ảnh Quy mô lớn ImageNet (ILSVRC) thường niên cho phép các nhà nghiên cứu benchmark các thuật toán trên một dataset quy mô lớn, được chuẩn hóa với các metric đánh giá nhất quán. Cuộc thi này đã thúc đẩy những tiến bộ lớn trong deep learning cho phân loại ảnh, phát hiện đối tượng và các tác vụ thị giác khác — nổi bật nhất là chiến thắng của AlexNet vào năm 2012, góp phần mở đầu kỷ nguyên deep learning hiện đại.

Ứng dụng#

Dataset ImageNet được sử dụng rộng rãi để huấn luyện và đánh giá các model deep learning cho phân loại ảnh, phát hiện đối tượng và định vị đối tượng. Các kiến trúc tiêu biểu như AlexNet, VGGResNet đều được phát triển và benchmark trên ImageNet; các weight được pretrained trên ImageNet vẫn là điểm khởi đầu phổ biến cho transfer learning trên nhiều tác vụ thị giác.

Cách sử dụng#

Để huấn luyện một model phân loại YOLO trên ImageNet trong 100 epoch ở kích thước ảnh 224x224, hãy sử dụng các đoạn code bên dưới. Để xem danh sách đầy đủ các argument khả dụng, hãy tham khảo trang Training của model.

Ví dụ huấn luyện
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Bạn cũng có thể quản lý các dataset phân loại và chạy huấn luyện trên cloud với Ultralytics Platform.

Hình ảnh mẫu và annotation#

Dataset ImageNet bao phủ 1.000 lớp ILSVRC-2012, cung cấp một tài nguyên đa dạng và quy mô lớn để huấn luyện và đánh giá các model computer vision. Dưới đây là một số ảnh mẫu từ dataset:

Ảnh mẫu của dataset phân loại ImageNet

Trích dẫn và ghi nhận đóng góp#

Nếu sử dụng dataset ImageNet trong công việc nghiên cứu hoặc phát triển, vui lòng trích dẫn bài báo sau:

Trích dẫn
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Chúng tôi xin ghi nhận đóng góp của nhóm ImageNet, do Olga Russakovsky, Jia Deng và Li Fei-Fei dẫn dắt, trong việc tạo và duy trì dataset ImageNet như một tài nguyên quý giá cho cộng đồng nghiên cứu machine learning và computer vision. Để biết thêm thông tin về dataset ImageNet và những người tạo ra dataset, hãy truy cập website ImageNet.

FAQ#

  • Dataset ImageNet là một cơ sở dữ liệu ảnh quy mô lớn, trong đó bộ sưu tập đầy đủ chứa hơn 14 triệu ảnh độ phân giải cao được gán nhãn bằng các synset WordNet. Trong Ultralytics, data="imagenet" huấn luyện trên tập con ILSVRC-2012 chuẩn hóa gồm 1.000 lớp, vốn là benchmark de facto cho pretraining phân loại ảnh. Các model tiêu biểu như AlexNet, VGG và ResNet được huấn luyện và benchmark trên ImageNet, cho thấy vai trò của dataset này trong việc thúc đẩy computer vision.

  • Dataset imagenet của Ultralytics sử dụng tập con ILSVRC-2012 với 1.000 lớp, 1.281.167 ảnh huấn luyện50.000 ảnh validation ở kích thước ảnh 224x224, với tổng kích thước tải xuống khoảng 144 GB. Cơ sở dữ liệu ImageNet đầy đủ lớn hơn nhiều (hơn 14 triệu ảnh trên hơn 20.000 synset WordNet), nhưng tập con 1.000 lớp mới là tập được sử dụng để huấn luyện và benchmark phân loại.

  • Để huấn luyện một model YOLO của Ultralytics trên ImageNet, hãy nạp một model phân loại pretrained và trỏ data tới imagenet:

    Ví dụ huấn luyện
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Để xem hướng dẫn huấn luyện chuyên sâu hơn, hãy tham khảo trang Training của chúng tôi.

  • Các model YOLO26 pretrained của Ultralytics cung cấp hiệu năng state-of-the-art về tốc độ và độ chính xác cho nhiều tác vụ computer vision. Ví dụ, model YOLO26n-cls với độ chính xác top-1 là 71,4% và top-5 là 90,1% được tối ưu cho các ứng dụng thời gian thực. Các model pretrained giúp giảm tài nguyên tính toán cần thiết khi huấn luyện từ đầu và rút ngắn chu kỳ phát triển. Tìm hiểu thêm về các metric hiệu năng của model YOLO26 trong phần Các Model được Pretrained trên ImageNet.

  • Cuộc thi Nhận dạng Hình ảnh Quy mô lớn ImageNet (ILSVRC) thường niên đã thúc đẩy những tiến bộ trong computer vision bằng cách cung cấp một nền tảng cạnh tranh để đánh giá các thuật toán trên một dataset quy mô lớn, được chuẩn hóa. Các metric đánh giá nhất quán của cuộc thi đã thúc đẩy đổi mới trong phân loại ảnh, phát hiện đối tượng và phân đoạn ảnh, liên tục mở rộng giới hạn của deep learning và computer vision.

Bình luận