Ultralytics YOLO27 :

Jeu de données MNIST#

Le jeu de données MNIST (Institut national des normes et de la technologie modifié) est un banc d’essai de classification d’images composé de 70 000 images en niveaux de gris de 28x28 représentant des chiffres manuscrits répartis en 10 classes — les chiffres de 0 à 9. Il comprend une partition prédéfinie de 60 000 images d’entraînement et 10 000 images de test, et sert depuis longtemps de référence standard pour évaluer les algorithmes d’apprentissage automatique et de vision par ordinateur. Pour son équivalent plus difficile composé d’images de vêtements, consulte le jeu de données Fashion-MNIST ; pour des images en couleur, consulte CIFAR-10.

Explore MNIST sur Ultralytics Platform pour prévisualiser des exemples, examiner les statistiques du jeu de données et le cloner pour l’entraînement.

Fonctionnalités clés#

  • MNIST contient 60 000 images d’entraînement et 10 000 images de test représentant des chiffres manuscrits, soit 70 000 au total.
  • Chaque image est une représentation en niveaux de gris de 28x28 d’un seul chiffre, normalisée en taille et anticrénelée pour tenir dans une zone de 20x20 et être centrée dans le cadre de 28x28.
  • Les 10 classes correspondent aux chiffres de 0 à 9, avec un nombre d’images approximativement équilibré par classe.
  • Le jeu de données comprend une partition prédéfinie entre entraînement et test ; aucune séparation manuelle ou automatique n’est donc nécessaire.
  • MNIST est un banc d’essai standard pour la recherche en classification d’images et en deep learning.

Structure du jeu de données#

MNIST comprend une partition officielle prédéfinie ; aucune séparation automatique ou manuelle n’est donc nécessaire :

  • Classes : 10 (chiffres manuscrits de 0 à 9)
  • Nombre total d’images : 70 000 (28x28 en niveaux de gris)
  • Ensemble d’entraînement : 60 000 images
  • Ensemble de test : 10 000 images
Ensemble de validation

MNIST ne possède pas de dossier de validation distinct ; par défaut, Ultralytics utilise donc l’ensemble de test de 10 000 images comme partition de validation pendant l’entraînement.

Chaque image est étiquetée avec le chiffre correspondant (0–9), ce qui fait de MNIST un jeu de données supervisé idéal pour les tâches de classification.

Applications#

MNIST est largement utilisé pour entraîner et évaluer des modèles de classification d’images, des réseaux de neurones convolutifs (CNN) et des machines à vecteurs de support (SVM) classiques aux architectures profondes modernes. Ses petites images en niveaux de gris et ses 10 classes de chiffres en font un banc d’essai rapide et reproductible pour comparer des algorithmes et mener des expérimentations en vision par ordinateur.

Voici quelques applications courantes :

  • Évaluer de nouveaux algorithmes de classification
  • Enseigner les concepts d’apprentissage automatique à des fins pédagogiques
  • Prototyper des systèmes de reconnaissance d’images
  • Tester des techniques d’optimisation de modèles

Utilisation#

Entraîne un modèle de classification YOLO sur MNIST pendant 100 époques, avec une taille d’image de 28. Le jeu de données est téléchargé et mis en cache automatiquement lors de la première utilisation ; si tu préfères contrôler entièrement le prétraitement, les archives gzip d’origine sont également disponibles dans la base de données MNIST. Pour consulter la liste complète des arguments disponibles, consulte la page Entraînement et le guide de la tâche de classification d’images.

Exemple d’entraînement
from ultralytics import YOLO

# Charger un modèle
model = YOLO("yolo26n-cls.pt")  # charger un modèle préentraîné (recommandé pour l’entraînement)

# Entraîner le modèle
results = model.train(data="mnist", epochs=100, imgsz=28)
Tests rapides avec MNIST160

Ultralytics propose également data="mnist160", un sous-ensemble de 160 images comprenant les huit premières images de chaque chiffre (0–9) provenant des partitions d’entraînement et de test. Il reprend la structure de répertoires de MNIST ; tu peux donc changer de jeu de données sans modifier les autres arguments — idéal pour les pipelines CI ou les vérifications rapides avant de te lancer dans le jeu de données complet de 70 000 images.

yolo classify train data=mnist160 model=yolo26n-cls.pt epochs=5 imgsz=28

Exemples d’images et annotations#

Exemples d’images du jeu de données MNIST :

Exemples du jeu de données MNIST de classification de chiffres manuscrits

Les exemples illustrent la diversité des styles d’écriture présents dans les 10 classes de chiffres du jeu de données.

Citations et remerciements#

Si tu utilises le jeu de données MNIST dans tes travaux de recherche ou de développement, cite l’article suivant :

Citation
@article{lecun2010mnist,
         title={MNIST handwritten digit database},
         author={LeCun, Yann and Cortes, Corinna and Burges, CJ},
         journal={ATT Labs [Online]},
         volume={2},
         year={2010}
}

Nous souhaitons remercier Yann LeCun, Corinna Cortes et Christopher J.C. Burges d’avoir créé et maintenu le jeu de données MNIST, une ressource précieuse pour la communauté de recherche en apprentissage automatique et en vision par ordinateur. Pour en savoir plus sur le jeu de données MNIST et ses créateurs, consulte le site web du jeu de données MNIST.

FAQ#

  • Le jeu de données MNIST est un banc d’essai composé de 70 000 images en niveaux de gris de 28x28 représentant des chiffres manuscrits, réparties entre 60 000 images d’entraînement et 10 000 images de test pour les 10 classes de 0 à 9. Il constitue la référence standard pour évaluer les algorithmes de classification d’images : son format compact et uniforme permet aux chercheurs et aux ingénieurs de comparer des méthodes et de suivre les progrès avec une configuration minimale, ce qui explique pourquoi il reste un banc d’essai initial courant en apprentissage automatique.

  • MNIST compte 10 classes — les chiffres manuscrits de 0 à 9 — et 70 000 images en niveaux de gris au total, chacune mesurant 28x28 pixels. Il comprend une partition prédéfinie de 60 000 images d’entraînement et 10 000 images de test, avec un nombre d’exemples approximativement égal pour chaque chiffre.

  • Pour entraîner un modèle Ultralytics YOLO sur MNIST, utilise les extraits de code ci-dessous. Le jeu de données est téléchargé automatiquement lors de la première utilisation. Pour obtenir la liste détaillée des arguments d’entraînement disponibles, consulte la page Entraînement.

    Exemple d’entraînement
    from ultralytics import YOLO
    
    # Charger un modèle
    model = YOLO("yolo26n-cls.pt")  # charger un modèle préentraîné (recommandé pour l’entraînement)
    
    # Entraîner le modèle
    results = model.train(data="mnist", epochs=100, imgsz=28)
  • MNIST comprend une partition prédéfinie de 60 000 images d’entraînement et 10 000 images de test. Contrairement aux jeux de données de classification organisés en dossiers qu’Ultralytics sépare automatiquement, la partition officielle de MNIST est utilisée telle quelle, et l’ensemble de test sert par défaut de partition de validation pendant l’entraînement.

  • Le jeu de données MNIST contient uniquement des chiffres manuscrits, tandis que le jeu de données MNIST étendu (EMNIST) comprend des chiffres ainsi que des lettres majuscules et minuscules. EMNIST a été développé comme successeur de MNIST et utilise le même format de 28x28 pixels ; il est donc compatible avec les outils et les modèles conçus pour le jeu de données MNIST d’origine. Cet éventail plus large de caractères rend EMNIST utile pour une plus grande variété d’applications d’apprentissage automatique.

  • Oui. Ultralytics Platform te permet de téléverser des jeux de données, d’entraîner des modèles de classification d’images et de les déployer sans programmation poussée. C’est une solution pratique pour mener des expériences MNIST dans le cloud — consulte l’aperçu des jeux de données de classification pour découvrir d’autres options.

  • MNIST est plus simple que de nombreux jeux de données modernes comme CIFAR-10 ou ImageNet, ce qui le rend idéal pour les débutants et les expérimentations rapides. Les jeux de données plus complexes proposent des défis supplémentaires, avec des images en couleur et des catégories d’objets variées, mais MNIST reste utile grâce à sa simplicité, à la petite taille de ses fichiers et à son importance historique dans le développement des algorithmes d’apprentissage automatique. Pour un remplacement plus difficile ayant la même structure, consulte Fashion-MNIST, qui présente des vêtements plutôt que des chiffres.

Commentaires