Jeu de données MNIST#
Le jeu de données MNIST (Institut national des normes et de la technologie modifié) est une référence d'classification d'images composée de 70 000 images en niveaux de gris de 28x28 représentant des chiffres manuscrits répartis en 10 classes — les chiffres de 0 à 9. Il est fourni avec une séparation prédéfinie de 60 000 images d'entraînement et 10 000 images de test, et sert depuis longtemps de référence standard pour évaluer les algorithmes d'apprentissage automatique et de vision par ordinateur. Pour un équivalent plus difficile composé d'images de vêtements, consulte le jeu de données Fashion-MNIST associé ; pour des images en couleur, consulte CIFAR-10.
Explore MNIST sur Ultralytics Platform pour prévisualiser des échantillons, examiner les statistiques du jeu de données et le cloner pour l'entraînement.
Fonctionnalités clés#
- MNIST contient 60 000 images d'entraînement et 10 000 images de test de chiffres manuscrits, soit 70 000 images au total.
- Chaque image est une représentation en niveaux de gris de 28x28 d'un seul chiffre, normalisée et anticrénelée dans une boîte englobante fixe de 28x28.
- Les 10 classes couvrent les chiffres de 0 à 9, avec un nombre d'images par classe approximativement équilibré.
- Il est fourni avec une séparation entraînement/test prédéfinie ; aucune séparation manuelle ou automatique n'est donc nécessaire.
- MNIST est une référence standard pour la recherche en classification d'images et en apprentissage profond.
Structure du jeu de données#
MNIST est fourni avec une séparation officielle prédéfinie ; aucun partitionnement automatique ou manuel n'est donc nécessaire :
- Classes : 10 (chiffres manuscrits de 0 à 9)
- Images au total : 70 000 (28x28 en niveaux de gris)
- Jeu d'entraînement : 60 000 images
- Jeu de test : 10 000 images
MNIST ne possède pas de dossier de validation distinct ; Ultralytics utilise donc par défaut le jeu de test de 10 000 images comme séparation de validation pendant l'entraînement.
Chaque image est annotée avec le chiffre correspondant (0–9), ce qui fait de MNIST un jeu de données supervisé idéal pour les tâches de classification.
Applications#
MNIST est largement utilisé pour entraîner et évaluer des modèles de classification d'images, des réseaux neuronaux convolutifs (CNNs) et des machines à vecteurs de support (SVMs) classiques aux architectures profondes modernes. Ses petites images en niveaux de gris et ses 10 classes de chiffres en font une référence rapide et reproductible pour comparer les algorithmes et expérimenter en vision par ordinateur.
Voici quelques applications courantes :
- Évaluer de nouveaux algorithmes de classification
- Utilisation pédagogique pour enseigner les concepts de l'apprentissage automatique
- Prototyper des systèmes de reconnaissance d'images
- Tester des techniques d'optimisation de modèles
Utilisation#
Entraîne un modèle de classification YOLO sur MNIST pendant 100 époques avec une taille d'image de 28. Le jeu de données est téléchargé et mis en cache automatiquement lors de la première utilisation ; si tu préfères garder un contrôle total sur le prétraitement, les archives gzip originales sont également disponibles dans la base de données MNIST. Pour consulter la liste complète des arguments disponibles, consulte la page Entraînement et le guide de la tâche de classification d'images.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="mnist", epochs=100, imgsz=28)Ultralytics propose également data="mnist160", un extrait de 160 images contenant les huit premières images de chaque chiffre (0–9) provenant des séparations d'entraînement et de test. Il reprend la structure des répertoires de MNIST, ce qui te permet de remplacer les jeux de données sans modifier les autres arguments — idéal pour les pipelines de CI ou les vérifications de cohérence avant de passer au jeu de données complet de 70 000 images.
yolo classify train data=mnist160 model=yolo26n-cls.pt epochs=5 imgsz=28Exemples d’images et d’annotations#
Exemples d'images du jeu de données MNIST :

Les exemples illustrent la diversité des styles d'écriture couverts par le jeu de données dans les 10 classes de chiffres.
Citations et remerciements#
Si tu utilises le jeu de données MNIST dans tes travaux de recherche ou de développement, cite l'article suivant :
@article{lecun2010mnist,
title={MNIST handwritten digit database},
author={LeCun, Yann and Cortes, Corinna and Burges, CJ},
journal={ATT Labs [Online]},
volume={2},
year={2010}
}Nous souhaitons remercier Yann LeCun, Corinna Cortes et Christopher J.C. Burges pour avoir créé et maintenu le jeu de données MNIST, une ressource précieuse pour la communauté de recherche en apprentissage automatique et en vision par ordinateur. Pour plus d'informations sur le jeu de données MNIST et ses créateurs, consulte le site web du jeu de données MNIST.
FAQ#
Le jeu de données MNIST est une référence composée de 70 000 images en niveaux de gris de 28x28 représentant des chiffres manuscrits, réparties entre 60 000 images d'entraînement et 10 000 images de test dans les 10 classes 0–9. Il constitue la référence standard pour évaluer les algorithmes de classification d'images — son format réduit et uniforme permet aux chercheurs et aux ingénieurs de comparer les méthodes et de suivre les progrès avec une configuration minimale, raison pour laquelle il reste une référence initiale courante en apprentissage automatique.
MNIST comporte 10 classes — les chiffres manuscrits de 0 à 9 — et 70 000 images en niveaux de gris au total, chacune mesurant 28x28 pixels. Il est fourni avec une séparation prédéfinie de 60 000 images d'entraînement et 10 000 images de test, avec un nombre d'exemples approximativement égal pour chaque chiffre.
MNIST est fourni avec une séparation prédéfinie de 60 000 images d'entraînement et 10 000 images de test. Contrairement aux jeux de données de classification fondés sur des dossiers qu'Ultralytics sépare automatiquement, la partition officielle de MNIST est utilisée telle quelle et le jeu de test sert par défaut de séparation de validation pendant l'entraînement.
Le jeu de données MNIST contient uniquement des chiffres manuscrits, tandis que le jeu de données Extended MNIST (EMNIST) comprend également des lettres majuscules et minuscules. EMNIST a été développé comme successeur de MNIST et utilise le même format de 28x28 pixels, ce qui le rend compatible avec les outils et modèles conçus pour le jeu de données MNIST original. Cette gamme élargie de caractères rend EMNIST utile pour une plus grande variété d'applications d'apprentissage automatique.
Oui. Ultralytics Platform te permet de téléverser des jeux de données, d'entraîner des modèles de classification d'images et de les déployer sans devoir écrire beaucoup de code. C'est un moyen pratique d'exécuter des expériences MNIST dans le cloud — consulte la présentation des jeux de données de classification pour découvrir les options associées.
MNIST est plus simple que de nombreux jeux de données modernes comme CIFAR-10 ou ImageNet, ce qui le rend idéal pour les débutants et l'expérimentation rapide. Alors que les jeux de données plus complexes offrent davantage de défis avec des images en couleur et des catégories d'objets variées, MNIST reste précieux pour sa simplicité, sa petite taille de fichier et son importance historique dans le développement des algorithmes d'apprentissage automatique. Pour un remplacement direct plus difficile avec la même structure, consulte Fashion-MNIST, qui contient des vêtements plutôt que des chiffres.




Pour entraîner un modèle Ultralytics YOLO sur MNIST, utilise les extraits de code ci-dessous. Le jeu de données est téléchargé automatiquement lors de la première utilisation. Pour consulter la liste détaillée des arguments d'entraînement disponibles, reporte-toi à la page Entraînement.