Tập dữ liệu CIFAR-100#
Bộ dữ liệu CIFAR-100 (Canadian Institute For Advanced Research) là một chuẩn đánh giá image classification gồm 60.000 ảnh màu 32x32 được phân bố đều trên 100 lớp chi tiết (mỗi lớp 600 ảnh), và các lớp này lại được nhóm thành 20 siêu lớp thô. Được tạo ra bởi Alex Krizhevsky, bộ dữ liệu này đi kèm với một tập phân chia xác định trước gồm 50.000 ảnh huấn luyện và 10.000 ảnh kiểm thử, khiến nó trở thành phiên bản khó hơn và chi tiết hơn của bộ dữ liệu CIFAR-10.
Khám phá CIFAR-100 trên Ultralytics Platform để xem trước các mẫu, kiểm tra thống kê bộ dữ liệu và nhân bản nó để huấn luyện.
Tính năng chính#
- CIFAR-100 chứa 60.000 hình ảnh màu kích thước 32x32 pixel, được chia đều thành 100 lớp.
- Mỗi lớp chứa chính xác 600 hình ảnh — 500 ảnh cho huấn luyện và 100 ảnh cho kiểm thử — vì vậy tập dữ liệu này hoàn toàn cân bằng.
- 100 lớp chi tiết được nhóm thành 20 siêu lớp để phân loại ở cấp độ cao hơn.
- Tập dữ liệu đi kèm với phân chia train/test định sẵn, vì vậy không cần thực hiện việc chia dữ liệu thủ công hay tự động.
- CIFAR-100 là một chuẩn đánh giá tiêu chuẩn cho nghiên cứu về image classification chi tiết và nhận diện đối tượng.
Cấu trúc tập dữ liệu#
CIFAR-100 đi kèm với cấu trúc phân tách chính thức được xác định trước, vì vậy không cần phân chia tự động hay thủ công:
- Lớp: 100 lớp chi tiết, được nhóm thành 20 siêu lớp
- Tổng số hình ảnh: 60.000 (màu, kích thước 32x32)
- Tập huấn luyện: 50.000 hình ảnh (500 ảnh mỗi lớp)
- Tập kiểm thử: 10.000 hình ảnh (100 ảnh mỗi lớp)
CIFAR-100 không có thư mục validation riêng, vì vậy Ultralytics sử dụng tập kiểm thử gồm 10.000 ảnh làm tập phân chia validation trong quá trình huấn luyện theo mặc định. Huấn luyện với data="cifar100" sẽ học 100 lớp chi tiết.
Ứng dụng#
CIFAR-100 được sử dụng rộng rãi để huấn luyện và đánh giá các mô hình image classification, từ các Convolutional Neural Networks (CNN) và Support Vector Machines (SVM) cổ điển đến các kiến trúc sâu hiện đại. 100 lớp chi tiết và kích thước ảnh nhỏ biến nó thành một chuẩn đánh giá khắt khe cho nghiên cứu machine learning, so sánh thuật toán và thử nghiệm computer vision.
Cách sử dụng#
Huấn luyện một mô hình YOLO trên CIFAR-100 trong 100 epochs với kích thước ảnh là 32. Để có danh sách đầy đủ các tham số có sẵn, hãy xem trang Training và hướng dẫn tác vụ image classification.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="cifar100", epochs=100, imgsz=32)Hình ảnh mẫu và chú thích#
Các hình ảnh mẫu từ tập dữ liệu CIFAR-100:

Các mẫu này cho thấy sự đa dạng của các đối tượng trong tập dữ liệu CIFAR-100, nhấn mạnh giá trị của một tập dữ liệu đa dạng đối với việc huấn luyện các mô hình phân loại hình ảnh mạnh mẽ.
Trích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu CIFAR-100 trong công trình nghiên cứu hoặc phát triển của mình, vui lòng trích dẫn bài báo sau:
@TECHREPORT{Krizhevsky09learningmultiple,
author={Alex Krizhevsky},
title={Learning multiple layers of features from tiny images},
institution={},
year={2009}
}Chúng tôi xin gửi lời cảm ơn đến Alex Krizhevsky vì đã tạo ra và duy trì bộ dữ liệu CIFAR-100 như một tài nguyên có giá trị cho cộng đồng nghiên cứu machine learning và computer vision. Để biết thêm thông tin về bộ dữ liệu CIFAR-100 và tác giả của nó, hãy truy cập CIFAR-100 dataset website.
Câu hỏi thường gặp#
Bộ dữ liệu CIFAR-100 được sử dụng rộng rãi để huấn luyện và làm chuẩn đánh giá cho các mô hình image classification và nhận diện đối tượng chi tiết. Nó chứa 60.000 ảnh màu 32x32 trên 100 lớp được nhóm thành 20 siêu lớp, biến nó thành một chuẩn đánh giá thách thức hơn CIFAR-10 đối với các thuật toán như Convolutional Neural Networks (CNN) và Support Vector Machines (SVM), cũng như để đánh giá các mô hình deep learning được xây dựng bằng Ultralytics YOLO.
Để huấn luyện một mô hình Ultralytics YOLO trên CIFAR-100, hãy sử dụng các đoạn mã bên dưới. Bộ dữ liệu sẽ tự động tải xuống trong lần sử dụng đầu tiên. Để có danh sách đầy đủ các tham số, hãy xem trang Training của mô hình.
Ví dụ về Trainingfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="cifar100", epochs=100, imgsz=32)CIFAR-100 có 100 lớp chi tiết — chẳng hạn như quả táo, cá heo, cây phong, xe máy và tên lửa — với đúng 600 ảnh mỗi lớp, tổng cộng là 60.000 ảnh. 100 lớp này bổ sung được nhóm thành 20 siêu lớp thô (ví dụ, siêu lớp cây bao gồm cây phong, sồi, cọ, thông và liễu). Huấn luyện với
data="cifar100"sử dụng 100 lớp chi tiết.CIFAR-100 đi kèm với cấu trúc phân tách được xác định trước gồm 50.000 ảnh huấn luyện và 10.000 ảnh kiểm thử, với chính xác 500 ảnh huấn luyện và 100 ảnh kiểm thử mỗi lớp. Không giống như các tập dữ liệu phân loại dựa trên thư mục mà Ultralytics tự động phân tách, cấu trúc phân tách chính thức của CIFAR-100 được sử dụng nguyên trạng, và tập kiểm thử đóng vai trò là tập validation trong quá trình huấn luyện theo mặc định.
Có. Ultralytics Platform cho phép bạn quản lý các bộ dữ liệu, huấn luyện các mô hình image classification và triển khai chúng mà không cần viết quá nhiều mã nguồn. Đây là một cách tiện lợi để chạy các thí nghiệm CIFAR-100 trên đám mây, và bạn có thể khám phá thêm nhiều tùy chọn khác trong classification datasets overview của chúng tôi.



