Ultralytics YOLO27:
Get Started
No license

Bộ dữ liệu CIFAR-100#

Bộ dữ liệu CIFAR-100 (Viện Nghiên cứu Tiên tiến Canada) là benchmark phân loại ảnh gồm 60.000 ảnh màu kích thước 32x32, được chia đều thành 100 lớp chi tiết (mỗi lớp 600 ảnh), sau đó được nhóm thành 20 siêu lớp tổng quát. Được tạo bởi Alex Krizhevsky, bộ dữ liệu có sẵn phân chia gồm 50.000 ảnh huấn luyện và 10.000 ảnh kiểm tra, là phiên bản khó hơn, chi tiết hơn của bộ dữ liệu CIFAR-10.

Khám phá CIFAR-100 trên Ultralytics Platform để xem trước các mẫu, kiểm tra số liệu thống kê của bộ dữ liệu và sao chép bộ dữ liệu để huấn luyện.



Xem: Cách huấn luyện model Phân loại ảnh trên CIFAR-100 bằng Ultralytics YOLO

Tính năng chính#

  • CIFAR-100 chứa 60.000 ảnh màu có kích thước 32x32 pixel, được chia đều thành 100 lớp.
  • Mỗi lớp có chính xác 600 ảnh — 500 ảnh huấn luyện và 100 ảnh kiểm tra — nên bộ dữ liệu được cân bằng hoàn hảo.
  • 100 lớp chi tiết được nhóm thành 20 siêu lớp tổng quát để phục vụ phân loại ở cấp độ cao hơn.
  • Bộ dữ liệu có sẵn phân chia huấn luyện/kiểm tra, nên không cần chia thủ công hay tự động.
  • CIFAR-100 là benchmark tiêu chuẩn cho nghiên cứu phân loại ảnh chi tiết và nhận dạng đối tượng.

Cấu trúc dataset#

CIFAR-100 có sẵn phân chia chính thức, nên không cần phân vùng tự động hay thủ công:

  • Các lớp: 100 lớp chi tiết, được nhóm thành 20 siêu lớp tổng quát
  • Tổng số ảnh: 60.000 (ảnh màu 32x32)
  • Tập huấn luyện: 50.000 ảnh (500 ảnh mỗi lớp)
  • Tập kiểm tra: 10.000 ảnh (100 ảnh mỗi lớp)
Tập validation

CIFAR-100 không có thư mục validation riêng, vì vậy theo mặc định, Ultralytics sử dụng tập kiểm tra gồm 10.000 ảnh làm tập validation trong quá trình huấn luyện. Huấn luyện với data="cifar100" giúp model học 100 lớp chi tiết.

Ứng dụng#

CIFAR-100 được sử dụng rộng rãi để huấn luyện và đánh giá các model phân loại ảnh, từ Mạng nơ-ron tích chập (CNNs) và Máy vector hỗ trợ (SVMs) cổ điển đến các kiến trúc deep learning hiện đại. 100 lớp chi tiết và kích thước ảnh nhỏ khiến bộ dữ liệu này trở thành một benchmark đầy thách thức cho nghiên cứu machine learning, so sánh thuật toán và thử nghiệm thị giác máy tính.

Cách sử dụng#

Huấn luyện model YOLO trên CIFAR-100 trong 100 epoch với kích thước ảnh 32. Để xem danh sách đầy đủ các tham số hiện có, hãy tham khảo trang Huấn luyện và hướng dẫn tác vụ phân loại ảnh.

Ví dụ huấn luyện
from ultralytics import YOLO

# Tải model
model = YOLO("yolo26n-cls.pt")  # tải model đã huấn luyện trước (được khuyến nghị khi huấn luyện)

# Huấn luyện model
results = model.train(data="cifar100", epochs=100, imgsz=32)

Hình ảnh mẫu và annotation#

Ảnh mẫu từ bộ dữ liệu CIFAR-100:

Mẫu ảnh từ bộ dữ liệu phân loại ảnh CIFAR-100

Các mẫu cho thấy sự đa dạng của các đối tượng trong bộ dữ liệu CIFAR-100, làm nổi bật giá trị của một bộ dữ liệu đa dạng trong việc huấn luyện các model phân loại ảnh mạnh mẽ.

Trích dẫn và lời cảm ơn#

Nếu sử dụng bộ dữ liệu CIFAR-100 trong nghiên cứu hoặc công việc phát triển, vui lòng trích dẫn bài báo sau:

Trích dẫn
@TECHREPORT{Krizhevsky09learningmultiple,
            author={Alex Krizhevsky},
            title={Learning multiple layers of features from tiny images},
            institution={},
            year={2009}
}

Chúng tôi xin ghi nhận công lao của Alex Krizhevsky trong việc tạo và duy trì bộ dữ liệu CIFAR-100 như một tài nguyên giá trị cho cộng đồng nghiên cứu machine learning và thị giác máy tính. Để biết thêm thông tin về bộ dữ liệu CIFAR-100 và người tạo ra bộ dữ liệu, hãy truy cập trang web bộ dữ liệu CIFAR-100.

Câu hỏi thường gặp#

  • Bộ dữ liệu CIFAR-100 được sử dụng rộng rãi để huấn luyện và đánh giá benchmark cho các model phân loại ảnh chi tiết và nhận dạng đối tượng. Bộ dữ liệu này chứa 60.000 ảnh màu 32x32 thuộc 100 lớp, được nhóm thành 20 siêu lớp, tạo nên benchmark khó hơn CIFAR-10 cho các thuật toán như Mạng nơ-ron tích chập (CNNs) và Máy vector hỗ trợ (SVMs), cũng như để đánh giá các model deep learning được xây dựng bằng Ultralytics YOLO.

  • Để huấn luyện model Ultralytics YOLO trên CIFAR-100, hãy sử dụng các đoạn mã bên dưới. Bộ dữ liệu sẽ tự động tải xuống trong lần sử dụng đầu tiên. Để xem danh sách đầy đủ các tham số, hãy tham khảo trang Huấn luyện của model.

    Ví dụ huấn luyện
    from ultralytics import YOLO
    
    # Tải model
    model = YOLO("yolo26n-cls.pt")  # tải model đã huấn luyện trước (được khuyến nghị khi huấn luyện)
    
    # Huấn luyện model
    results = model.train(data="cifar100", epochs=100, imgsz=32)
  • CIFAR-100 có 100 lớp chi tiết — chẳng hạn như táo, cá heo, cây phong, xe máy và tên lửa — với chính xác 600 ảnh mỗi lớp, tổng cộng 60.000 ảnh. 100 lớp này còn được nhóm thành 20 siêu lớp tổng quát (ví dụ, siêu lớp cây bao gồm phong, sồi, cọ, thông và liễu). Khi huấn luyện bằng data="cifar100", model sử dụng 100 lớp chi tiết.

  • CIFAR-100 đi kèm một cách chia tập được xác định trước gồm 50.000 ảnh huấn luyện và 10.000 ảnh kiểm tra, với chính xác 500 ảnh huấn luyện và 100 ảnh kiểm tra cho mỗi lớp. Khác với các bộ dữ liệu phân loại dựa trên thư mục được Ultralytics tự động chia tập, CIFAR-100 sử dụng nguyên trạng phân vùng chính thức; theo mặc định, tập kiểm tra đóng vai trò tập validation trong quá trình huấn luyện.

  • Có. Ultralytics Platform cho phép bạn quản lý bộ dữ liệu, huấn luyện model phân loại ảnh và triển khai model mà không cần viết nhiều mã. Đây là cách thuận tiện để chạy các thử nghiệm CIFAR-100 trên cloud; bạn cũng có thể khám phá thêm các tùy chọn trong tổng quan về bộ dữ liệu phân loại của chúng tôi.

Bình luận