Bộ dữ liệu CIFAR-100#
Bộ dữ liệu CIFAR-100 (Viện Nghiên cứu Cao cấp Canada) là một benchmark phân loại ảnh gồm 60.000 ảnh màu kích thước 32x32, được phân bổ đồng đều vào 100 lớp chi tiết (mỗi lớp 600 ảnh), sau đó được nhóm thành 20 siêu lớp tổng quát. Được tạo bởi Alex Krizhevsky, bộ dữ liệu đi kèm với phân chia định sẵn gồm 50.000 ảnh huấn luyện và 10.000 ảnh kiểm tra, khiến đây trở thành phiên bản khó hơn và chi tiết hơn của bộ dữ liệu CIFAR-10.
Khám phá CIFAR-100 trên Ultralytics Platform để xem trước các mẫu, kiểm tra thống kê bộ dữ liệu và sao chép bộ dữ liệu để huấn luyện.
Tính năng chính#
- CIFAR-100 chứa 60.000 ảnh màu có kích thước 32x32 pixel, được chia đều thành 100 lớp.
- Mỗi lớp chứa chính xác 600 ảnh — 500 ảnh huấn luyện và 100 ảnh kiểm tra — nên bộ dữ liệu được cân bằng hoàn hảo.
- 100 lớp chi tiết được nhóm thành 20 siêu lớp tổng quát để phục vụ phân loại ở cấp độ cao hơn.
- Bộ dữ liệu đi kèm với phân chia train/test được định nghĩa sẵn, nên không cần phân chia thủ công hoặc tự động.
- CIFAR-100 là benchmark tiêu chuẩn cho nghiên cứu phân loại ảnh chi tiết và nhận dạng đối tượng.
Cấu trúc bộ dữ liệu#
CIFAR-100 đi kèm với phân chia chính thức, định sẵn, vì vậy không cần phân vùng tự động hoặc thủ công:
- Các lớp: 100 lớp chi tiết, được nhóm thành 20 siêu lớp tổng quát
- Tổng số ảnh: 60.000 (màu 32x32)
- Tập huấn luyện: 50.000 ảnh (500 ảnh mỗi lớp)
- Tập kiểm tra: 10.000 ảnh (100 ảnh mỗi lớp)
CIFAR-100 không có thư mục validation riêng, vì vậy theo mặc định Ultralytics sử dụng tập kiểm tra gồm 10.000 ảnh làm tập validation trong quá trình huấn luyện. Huấn luyện với data="cifar100" sẽ học 100 lớp chi tiết.
Ứng dụng#
CIFAR-100 được sử dụng rộng rãi để huấn luyện và đánh giá các model phân loại ảnh, từ Mạng nơ-ron tích chập (CNNs) và Máy vector hỗ trợ (SVMs) kinh điển đến các kiến trúc deep hiện đại. 100 lớp chi tiết và kích thước ảnh nhỏ khiến đây trở thành một benchmark đầy thách thức cho nghiên cứu machine learning, so sánh thuật toán và thử nghiệm computer vision.
Cách sử dụng#
Huấn luyện một model YOLO trên CIFAR-100 trong 100 epoch với kích thước ảnh là 32. Để xem danh sách đầy đủ các đối số khả dụng, hãy tham khảo trang Training và hướng dẫn tác vụ phân loại ảnh.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="cifar100", epochs=100, imgsz=32)Hình ảnh mẫu và annotation#
Ảnh mẫu từ bộ dữ liệu CIFAR-100:

Các mẫu cho thấy sự đa dạng của các đối tượng trong bộ dữ liệu CIFAR-100, nhấn mạnh giá trị của một bộ dữ liệu đa dạng trong việc huấn luyện các model phân loại ảnh mạnh mẽ.
Trích dẫn và ghi nhận đóng góp#
Nếu sử dụng bộ dữ liệu CIFAR-100 trong công việc nghiên cứu hoặc phát triển, vui lòng trích dẫn bài báo sau:
@TECHREPORT{Krizhevsky09learningmultiple,
author={Alex Krizhevsky},
title={Learning multiple layers of features from tiny images},
institution={},
year={2009}
}Chúng tôi xin ghi nhận Alex Krizhevsky vì đã tạo và duy trì bộ dữ liệu CIFAR-100 như một tài nguyên có giá trị cho cộng đồng nghiên cứu machine learning và computer vision. Để biết thêm thông tin về bộ dữ liệu CIFAR-100 và tác giả, hãy truy cập website bộ dữ liệu CIFAR-100.
FAQ#
Bộ dữ liệu CIFAR-100 được sử dụng rộng rãi để huấn luyện và benchmark các model phân loại ảnh chi tiết và nhận dạng đối tượng. Bộ dữ liệu chứa 60.000 ảnh màu 32x32 thuộc 100 lớp được nhóm thành 20 siêu lớp, khiến đây trở thành benchmark thách thức hơn CIFAR-10 đối với các thuật toán như Mạng nơ-ron tích chập (CNNs) và Máy vector hỗ trợ (SVMs), cũng như trong việc đánh giá các model deep learning được xây dựng với Ultralytics YOLO.
Để huấn luyện model Ultralytics YOLO trên CIFAR-100, hãy sử dụng các đoạn code bên dưới. Bộ dữ liệu sẽ tự động được tải xuống trong lần sử dụng đầu tiên. Để xem danh sách đầy đủ các đối số, hãy tham khảo trang Training của model.
Ví dụ huấn luyệnfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="cifar100", epochs=100, imgsz=32)CIFAR-100 có 100 lớp chi tiết — chẳng hạn như táo, cá heo, cây phong, xe mô tô và tên lửa — với chính xác 600 ảnh mỗi lớp, tổng cộng 60.000 ảnh. 100 lớp này còn được nhóm thành 20 siêu lớp tổng quát (ví dụ, siêu lớp cây bao gồm cây phong, cây sồi, cây cọ, cây thông và cây liễu). Huấn luyện với
data="cifar100"sử dụng 100 lớp chi tiết.CIFAR-100 đi kèm với phân chia định sẵn gồm 50.000 ảnh huấn luyện và 10.000 ảnh kiểm tra, với chính xác 500 ảnh huấn luyện và 100 ảnh kiểm tra cho mỗi lớp. Không giống các bộ dữ liệu phân loại dựa trên thư mục được Ultralytics tự động chia, phân vùng chính thức của CIFAR-100 được sử dụng nguyên trạng, và theo mặc định tập kiểm tra đóng vai trò là tập validation trong quá trình huấn luyện.
Có. Ultralytics Platform cho phép bạn quản lý bộ dữ liệu, huấn luyện các model phân loại ảnh và triển khai chúng mà không cần viết nhiều code. Đây là một cách thuận tiện để chạy các thử nghiệm CIFAR-100 trên cloud, đồng thời bạn có thể khám phá thêm các tùy chọn trong tổng quan về các bộ dữ liệu phân loại của chúng tôi.



