Tập dữ liệu MNIST#
Bộ dữ liệu MNIST (Modified National Institute of Standards and Technology) là một chuẩn đánh giá image classification gồm 70.000 ảnh thang xám 28x28 chứa chữ số viết tay trải dài trên 10 lớp — các chữ số từ 0 đến 9. Bộ dữ liệu đi kèm với phân chia định sẵn gồm 60.000 ảnh huấn luyện và 10.000 ảnh kiểm thử, từ lâu đã đóng vai trò là chuẩn đánh giá tiêu chuẩn để đánh giá các thuật toán machine learning và computer vision. Để tìm phiên bản tương đương khó hơn về hình ảnh quần áo, hãy xem bộ dữ liệu Fashion-MNIST có liên quan; đối với hình ảnh màu, hãy xem CIFAR-10.
Khám phá MNIST trên Ultralytics Platform để xem trước các mẫu, kiểm tra thống kê dataset và nhân bản nó để huấn luyện.
Tính năng chính#
- MNIST chứa 60.000 hình ảnh huấn luyện và 10.000 hình ảnh kiểm tra của các chữ số viết tay, với tổng cộng 70.000 hình ảnh.
- Mỗi hình ảnh là một bức ảnh thang xám 28x28 của một chữ số đơn lẻ, được chuẩn hóa và khử răng cưa thành một bounding box 28x28 cố định.
- 10 lớp bao gồm các chữ số 0–9, với số lượng hình ảnh mỗi lớp gần như cân bằng.
- Nó đi kèm với một phân tách train/test được xác định trước, vì vậy không cần phải phân tách thủ công hoặc tự động.
- MNIST là một chuẩn đánh giá tiêu chuẩn cho nghiên cứu về image classification và deep learning.
Cấu trúc tập dữ liệu#
MNIST đi kèm với một phân tách chính thức được xác định trước, vì vậy không cần phân vùng tự động hoặc thủ công:
- Lớp: 10 (chữ số viết tay 0–9)
- Tổng số ảnh: 70.000 (28x28 thang độ xám)
- Tập huấn luyện: 60.000 hình ảnh
- Tập kiểm tra: 10.000 hình ảnh
MNIST không có thư mục xác thực riêng biệt, vì vậy Ultralytics sử dụng tập kiểm tra gồm 10.000 hình ảnh làm tập xác thực trong quá trình huấn luyện theo mặc định.
Mỗi hình ảnh được dán nhãn với chữ số tương ứng của nó (0–9), khiến MNIST trở thành một tập dữ liệu có giám sát lý tưởng cho các tác vụ phân loại.
Ứng dụng#
MNIST được sử dụng rộng rãi để huấn luyện và đánh giá các mô hình image classification, từ các Convolutional Neural Networks (CNN) và Support Vector Machines (SVM) cổ điển đến các kiến trúc deep learning hiện đại. Các hình ảnh thang xám nhỏ và 10 lớp chữ số của nó tạo thành một chuẩn đánh giá nhanh, có thể tái tạo để so sánh thuật toán và thử nghiệm computer vision.
Một số ứng dụng phổ biến bao gồm:
- Đánh giá các thuật toán phân loại mới
- Mục đích giáo dục để giảng dạy các khái niệm học máy
- Tạo mẫu nhanh cho các hệ thống nhận diện ảnh
- Kiểm tra các kỹ thuật tối ưu hóa model
Cách sử dụng#
Huấn luyện một mô hình phân loại YOLO trên MNIST trong 100 epochs ở kích thước ảnh 28. Bộ dữ liệu sẽ tự động tải xuống và lưu vào bộ nhớ đệm trong lần sử dụng đầu tiên; nếu bạn thích kiểm soát hoàn toàn quá trình tiền xử lý, các kho lưu trữ gzip gốc cũng có sẵn từ MNIST database. Để xem danh sách đầy đủ các tham số có sẵn, hãy xem trang Training và hướng dẫn tác vụ image classification.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="mnist", epochs=100, imgsz=28)Ultralytics cũng cung cấp data="mnist160", một lát cắt 160 ảnh chứa tám ảnh đầu tiên của mỗi chữ số (0–9) từ cả tập phân chia huấn luyện và kiểm thử. Nó phản ánh cấu trúc thư mục MNIST, vì vậy bạn có thể hoán đổi các tập dữ liệu mà không cần thay đổi bất kỳ tham số nào khác — rất lý tưởng cho các đường ống CI hoặc kiểm tra tính hợp lý trước khi cam kết sử dụng toàn bộ bộ dữ liệu 70.000 ảnh.
yolo classify train data=mnist160 model=yolo26n-cls.pt epochs=5 imgsz=28Hình ảnh mẫu và chú thích#
Hình ảnh mẫu từ tập dữ liệu MNIST:

Các mẫu hiển thị phạm vi phong cách chữ viết tay mà tập dữ liệu thu thập được trên 10 lớp chữ số.
Trích dẫn và Ghi nhận#
Nếu bạn sử dụng tập dữ liệu MNIST trong nghiên cứu hoặc công việc phát triển của mình, vui lòng trích dẫn bài báo sau:
@article{lecun2010mnist,
title={MNIST handwritten digit database},
author={LeCun, Yann and Cortes, Corinna and Burges, CJ},
journal={ATT Labs [Online]},
volume={2},
year={2010}
}Chúng tôi xin cảm ơn Yann LeCun, Corinna Cortes và Christopher J.C. Burges vì đã tạo và duy trì bộ dữ liệu MNIST như một nguồn tài nguyên quý giá cho cộng đồng nghiên cứu machine learning và computer vision. Để biết thêm thông tin về bộ dữ liệu MNIST và những người tạo ra nó, hãy truy cập MNIST dataset website.
Câu hỏi thường gặp#
Bộ dữ liệu MNIST là một chuẩn đánh giá gồm 70.000 ảnh thang xám 28x28 chứa chữ số viết tay, được chia thành 60.000 ảnh huấn luyện và 10.000 ảnh kiểm thử trên 10 lớp 0–9. Đây là tài liệu tham khảo tiêu chuẩn để đánh giá các thuật toán image classification — định dạng nhỏ, đồng nhất của nó cho phép các nhà nghiên cứu và kỹ sư so sánh các phương pháp và theo dõi tiến độ với thiết lập tối thiểu, đó là lý do tại sao nó vẫn là một chuẩn đánh giá đầu tiên phổ biến trong machine learning.
MNIST có 10 lớp — các chữ số viết tay từ 0 đến 9 — và tổng cộng 70.000 hình ảnh thang độ xám, mỗi hình ảnh có kích thước 28x28 pixel. Nó đi kèm với một phân tách được xác định trước gồm 60.000 hình ảnh huấn luyện và 10.000 hình ảnh kiểm tra, với số lượng ví dụ gần như bằng nhau cho mỗi chữ số.
Để huấn luyện mô hình Ultralytics YOLO trên MNIST, hãy sử dụng các đoạn mã bên dưới. Bộ dữ liệu sẽ tự động tải xuống trong lần sử dụng đầu tiên. Để có danh sách chi tiết các tham số huấn luyện có sẵn, hãy tham khảo trang Training.
Ví dụ về Trainingfrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="mnist", epochs=100, imgsz=28)MNIST đi kèm với một phân tách được xác định trước gồm 60.000 hình ảnh huấn luyện và 10.000 hình ảnh kiểm tra. Không giống như các tập dữ liệu phân loại dựa trên thư mục mà Ultralytics tự động phân tách, phân vùng chính thức của MNIST được sử dụng nguyên trạng và tập kiểm tra đóng vai trò là tập xác thực trong quá trình huấn luyện theo mặc định.
Tập dữ liệu MNIST chỉ chứa các chữ số viết tay, trong khi tập dữ liệu EMNIST (Extended MNIST) bao gồm cả chữ số và chữ cái viết hoa và viết thường. EMNIST được phát triển như một phiên bản kế nhiệm của MNIST và sử dụng cùng định dạng 28x28 pixel, giúp nó tương thích với các công cụ và mô hình được thiết kế cho tập dữ liệu MNIST gốc. Phạm vi ký tự rộng hơn này làm cho EMNIST hữu ích cho nhiều ứng dụng học máy hơn.
Có. Ultralytics Platform cho phép bạn tải lên các tập dữ liệu, huấn luyện các mô hình image classification và triển khai chúng mà không cần viết quá nhiều mã nguồn. Đây là một cách thuận tiện để chạy các thử nghiệm MNIST trên đám mây — hãy xem classification datasets overview để biết các tùy chọn liên quan.
MNIST đơn giản hơn nhiều bộ dữ liệu hiện đại như CIFAR-10 hay ImageNet, làm cho nó trở nên lý tưởng cho người mới bắt đầu và thử nghiệm nhanh. Mặc dù các tập dữ liệu phức tạp hơn mang lại nhiều thử thách hơn với hình ảnh màu và các danh mục đối tượng đa dạng, MNIST vẫn có giá trị nhờ tính đơn giản, kích thước tệp nhỏ và ý nghĩa lịch sử trong sự phát triển của các thuật toán machine learning. Để có sự thay thế trực tiếp khó hơn với cùng cấu trúc, hãy xem Fashion-MNIST, có các mặt hàng quần áo thay vì các chữ số.



