YOLO Vision 2026:

Conjunto de Dados MNIST#

O conjunto de dados MNIST (Modified National Institute of Standards and Technology) é uma referência de image classification com 70.000 imagens em escala de cinza de 28x28 de dígitos manuscritos abrangendo 10 classes — os dígitos de 0 a 9. Ele inclui uma divisão predefinida de 60.000 imagens de treino e 10.000 de teste e há muito tempo serve como a referência padrão para avaliar algoritmos de machine learning e computer vision. Para o equivalente mais difícil de imagens de vestuário, consulta o conjunto de dados relacionado Fashion-MNIST; para imagens coloridas, consulta CIFAR-10.

Explora o MNIST on Ultralytics Platform para ver amostras, inspecionar as estatísticas do conjunto de dados e cloná-lo para treino.

Principais recursos#

  • O MNIST contém 60.000 imagens de treino e 10.000 imagens de teste de dígitos escritos à mão, totalizando 70.000.
  • Cada imagem é uma foto em escala de cinza de 28x28 de um único dígito, normalizada e com suavização de serrilhado (anti-aliasing) em uma bounding box fixa de 28x28.
  • As 10 classes abrangem os dígitos 0–9, com um número aproximadamente equilibrado de imagens por classe.
  • Ele é fornecido com uma divisão de treino/teste predefinida, portanto, nenhuma divisão manual ou automática é necessária.
  • O MNIST é uma referência padrão para pesquisas de image classification e deep learning.

Estrutura do Dataset#

O MNIST é fornecido com uma divisão oficial e predefinida, portanto, nenhuma partição automática ou manual é necessária:

  • Classes: 10 (dígitos escritos à mão 0–9)
  • Total de imagens: 70.000 (28x28 em escala de cinza)
  • Conjunto de treino: 60.000 imagens
  • Conjunto de teste: 10.000 imagens
Divisão de validação

O MNIST não tem uma pasta de validação separada, por isso o Ultralytics usa o conjunto de teste de 10.000 imagens como a divisão de validação durante o treinamento por padrão.

Cada imagem é rotulada com seu dígito correspondente (0–9), tornando o MNIST um dataset supervisionado ideal para tarefas de classificação.

Aplicações#

O MNIST é amplamente utilizado para treinar e avaliar modelos de image classification, desde Convolutional Neural Networks (CNNs) e Support Vector Machines (SVMs) clássicas até arquiteturas profundas modernas. As suas pequenas imagens em escala de cinza e 10 classes de dígitos tornam-no uma referência rápida e reprodutível para comparação de algoritmos e experimentação em computer vision.

Algumas aplicações comuns incluem:

  • Benchmarking de novos algoritmos de classificação
  • Propósitos educacionais para ensinar conceitos de aprendizado de máquina
  • Prototipagem de sistemas de reconhecimento de imagem
  • Testar técnicas de otimização de modelos

Uso#

Treina um modelo de classificação YOLO no MNIST durante 100 epochs a um tamanho de imagem de 28. O conjunto de dados transfere-se e armazena-se em cache automaticamente na primeira utilização; se preferes controlo total sobre o pré-processamento, os arquivos gzip originais também estão disponíveis no MNIST database. Para a lista completa de argumentos disponíveis, consulta a página de Training e o guia de tarefas de image classification.

Exemplo de Treinamento
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="mnist", epochs=100, imgsz=28)
Testes rápidos com MNIST160

O Ultralytics também disponibiliza data="mnist160", uma fatia de 160 imagens contendo as primeiras oito imagens de cada dígito (0–9) das divisões de treino e teste. Espelha a estrutura de diretórios do MNIST, para que possas trocar de conjuntos de dados sem alterar quaisquer outros argumentos — ideal para pipelines de CI ou verificações de integridade antes de avançares para o conjunto de dados completo de 70.000 imagens.

yolo classify train data=mnist160 model=yolo26n-cls.pt epochs=5 imgsz=28

Exemplos de Imagens e Anotações#

Exemplos de imagens do dataset MNIST:

MNIST handwritten digit classification dataset samples

As amostras mostram a variedade de estilos de escrita manual que o dataset captura nas 10 classes de dígitos.

Citações e Agradecimentos#

Se usares o conjunto de dados MNIST no teu trabalho de pesquisa ou desenvolvimento, por favor, cita o seguinte artigo:

Citação
@article{lecun2010mnist,
         title={MNIST handwritten digit database},
         author={LeCun, Yann and Cortes, Corinna and Burges, CJ},
         journal={ATT Labs [Online]},
         volume={2},
         year={2010}
}

Gostaríamos de agradecer a Yann LeCun, Corinna Cortes e Christopher J.C. Burges por criarem e manterem o conjunto de dados MNIST como um recurso valioso para a comunidade de investigação em machine learning e computer vision. Para mais informações sobre o conjunto de dados MNIST e os seus criadores, visita o MNIST dataset website.

FAQ#

  • O conjunto de dados MNIST é uma referência de 70.000 imagens em escala de cinza de 28x28 de dígitos manuscritos, divididas em 60.000 imagens de treino e 10.000 de teste nas 10 classes 0–9. É a referência padrão para avaliar algoritmos de image classification — o seu formato pequeno e uniforme permite que investigadores e engenheiros comparem métodos e acompanhem o progresso com uma configuração mínima, razão pela qual continua a ser uma primeira referência comum em machine learning.

  • O MNIST possui 10 classes — os dígitos escritos à mão de 0 a 9 — e 70.000 imagens em tons de cinza no total, cada uma com 28x28 pixels. Ele é fornecido com uma divisão predefinida de 60.000 imagens de treino e 10.000 de teste, com um número aproximadamente igual de exemplos por dígito.

  • Para treinar um modelo Ultralytics YOLO no MNIST, utiliza os trechos de código abaixo. O conjunto de dados transfere-se automaticamente na primeira utilização. Para uma lista detalhada dos argumentos de treino disponíveis, consulta a página de Training.

    Exemplo de Treinamento
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="mnist", epochs=100, imgsz=28)
  • O MNIST é fornecido com uma divisão predefinida de 60.000 imagens de treino e 10.000 de teste. Ao contrário dos datasets de classificação baseados em pastas que o Ultralytics divide automaticamente, a partição oficial do MNIST é usada como está, e o conjunto de teste serve como a divisão de validação durante o treinamento por padrão.

  • O dataset MNIST contém apenas dígitos escritos à mão, enquanto o dataset Extended MNIST (EMNIST) inclui dígitos e letras maiúsculas e minúsculas. O EMNIST foi desenvolvido como um sucessor do MNIST e usa o mesmo formato de 28x28 pixels, tornando-o compatível com ferramentas e modelos projetados para o dataset MNIST original. Essa gama mais ampla de caracteres torna o EMNIST útil para uma maior variedade de aplicações de aprendizado de máquina.

  • Sim. A Ultralytics Platform permite-te carregar conjuntos de dados, treinar modelos de image classification e implementá-los sem programação extensiva. É uma forma conveniente de executar experiências com o MNIST na cloud — consulta a classification datasets overview para opções relacionadas.

  • O MNIST é mais simples do que muitos conjuntos de dados modernos, como o CIFAR-10 ou o ImageNet, tornando-o ideal para principiantes e experimentação rápida. Embora conjuntos de dados mais complexos ofereçam maiores desafios com imagens coloridas e diversas categorias de objetos, o MNIST continua a ser valioso pela sua simplicidade, tamanho de ficheiro pequeno e significado histórico no desenvolvimento de algoritmos de machine learning. Para uma substituição direta mais difícil com a mesma estrutura, consulta Fashion-MNIST, que apresenta artigos de vestuário em vez de dígitos.

Comentários