Ultralytics YOLO27:

Conjunto de dados MNIST#

O conjunto de dados MNIST (Instituto Nacional de Padrões e Tecnologia Modificado) é uma referência de classificação de imagens composta por 70.000 imagens em escala de cinza de 28x28 pixels de dígitos manuscritos, distribuídas em 10 classes — os dígitos de 0 a 9. Ele vem com uma divisão predefinida de 60.000 imagens de treinamento e 10.000 imagens de teste e há muito tempo serve como referência padrão para avaliar algoritmos de aprendizagem automática e visão computacional. Para uma alternativa mais difícil com imagens de roupas, consulte o conjunto de dados relacionado Fashion-MNIST; para imagens coloridas, consulte CIFAR-10.

Explore o MNIST na Ultralytics Platform para pré-visualizar amostras, examinar estatísticas do conjunto de dados e cloná-lo para treinamento.

Principais funcionalidades#

  • O MNIST contém 60.000 imagens de treinamento e 10.000 imagens de teste de dígitos manuscritos, totalizando 70.000 imagens.
  • Cada imagem é uma imagem em escala de cinza de 28x28 pixels com um único dígito, normalizada em tamanho e suavizada para caber em uma área de 20x20 pixels e centralizada no quadro de 28x28 pixels.
  • As 10 classes abrangem os dígitos de 0 a 9, com uma quantidade aproximadamente equilibrada de imagens por classe.
  • O conjunto vem com uma divisão predefinida entre treinamento e teste, portanto, não é necessário fazer a divisão manual ou automática.
  • O MNIST é uma referência padrão para pesquisas de classificação de imagens e aprendizagem profunda.

Estrutura do conjunto de dados#

O MNIST vem com uma divisão oficial predefinida, portanto, não é necessário fazer uma partição automática ou manual:

  • Classes: 10 (dígitos manuscritos de 0 a 9)
  • Total de imagens: 70 000 (28x28 em tons de cinzento)
  • Conjunto de treinamento: 60.000 imagens
  • Conjunto de teste: 10.000 imagens
Divisão de validação

O MNIST não tem uma pasta de validação separada, portanto, por padrão, a Ultralytics usa o conjunto de teste de 10.000 imagens como divisão de validação durante o treinamento.

Cada imagem tem um rótulo correspondente ao seu dígito (0–9), o que torna o MNIST um conjunto de dados supervisionado ideal para tarefas de classificação.

Aplicações#

O MNIST é amplamente usado para treinar e avaliar modelos de classificação de imagens, desde as clássicas redes neurais convolucionais (CNNs) e máquinas de vetores de suporte (SVMs) até arquiteturas profundas modernas. Suas pequenas imagens em escala de cinza e suas 10 classes de dígitos fazem dele uma referência rápida e reproduzível para comparação de algoritmos e experimentação em visão computacional.

Algumas aplicações comuns incluem:

  • Avaliação comparativa de novos algoritmos de classificação
  • Fins educacionais para ensinar conceitos de aprendizagem automática
  • Prototipagem de sistemas de reconhecimento de imagens
  • Teste de técnicas de otimização de modelos

Uso#

Treine um modelo de classificação YOLO no MNIST por 100 épocas, usando imagens de tamanho 28. O conjunto de dados é baixado e armazenado em cache automaticamente no primeiro uso; se preferir ter controle total sobre o pré-processamento, os arquivos gzip originais também estão disponíveis no banco de dados MNIST. Para ver a lista completa de argumentos disponíveis, consulte a página de Treinamento e o guia da tarefa de classificação de imagens.

Exemplo de treino
from ultralytics import YOLO

# Carregar um modelo
model = YOLO("yolo26n-cls.pt")  # carregue um modelo pré-treinado (recomendado para treinamento)

# Treinar o modelo
results = model.train(data="mnist", epochs=100, imgsz=28)
Testes rápidos com MNIST160

A Ultralytics também disponibiliza data="mnist160", um recorte de 160 imagens que contém as primeiras oito imagens de cada dígito (0–9) das divisões de treinamento e teste. Ele reproduz a estrutura de diretórios do MNIST, para que você possa trocar de conjunto de dados sem alterar nenhum outro argumento — ideal para pipelines de CI ou verificações rápidas antes de usar o conjunto completo de 70.000 imagens.

yolo classify train data=mnist160 model=yolo26n-cls.pt epochs=5 imgsz=28

Imagens de exemplo e anotações#

Exemplos de imagens do conjunto de dados MNIST:

Amostras do conjunto de dados MNIST para classificação de dígitos manuscritos

As amostras mostram a variedade de estilos de escrita capturada pelo conjunto de dados nas 10 classes de dígitos.

Citações e agradecimentos#

Se você usar o conjunto de dados MNIST em seu trabalho de pesquisa ou desenvolvimento, cite o seguinte artigo:

Citação
@article{lecun2010mnist,
         title={MNIST handwritten digit database},
         author={LeCun, Yann and Cortes, Corinna and Burges, CJ},
         journal={ATT Labs [Online]},
         volume={2},
         year={2010}
}

Gostaríamos de agradecer a Yann LeCun, Corinna Cortes e Christopher J.C. Burges por criarem e manterem o conjunto de dados MNIST como um recurso valioso para a comunidade de pesquisa em aprendizagem automática e visão computacional. Para saber mais sobre o conjunto de dados MNIST e seus criadores, visite o site do conjunto de dados MNIST.

Perguntas frequentes#

  • O conjunto de dados MNIST é uma referência composta por 70.000 imagens em escala de cinza de 28x28 pixels de dígitos manuscritos, divididas em 60.000 imagens de treinamento e 10.000 imagens de teste entre as 10 classes de 0 a 9. Ele é a referência padrão para avaliar algoritmos de classificação de imagens — seu formato pequeno e uniforme permite que pesquisadores e engenheiros comparem métodos e acompanhem o progresso com configuração mínima, por isso continua sendo uma referência inicial comum em aprendizagem automática.

  • O MNIST tem 10 classes — os dígitos manuscritos de 0 a 9 — e 70.000 imagens em escala de cinza no total, cada uma com 28x28 pixels. Ele vem com uma divisão predefinida de 60.000 imagens de treinamento e 10.000 imagens de teste, com uma quantidade aproximadamente igual de exemplos por dígito.

  • Para treinar um modelo Ultralytics YOLO no MNIST, use os trechos de código abaixo. O conjunto de dados é baixado automaticamente no primeiro uso. Para ver uma lista detalhada dos argumentos de treinamento disponíveis, consulte a página de Treinamento.

    Exemplo de treino
    from ultralytics import YOLO
    
    # Carregar um modelo
    model = YOLO("yolo26n-cls.pt")  # carregue um modelo pré-treinado (recomendado para treinamento)
    
    # Treinar o modelo
    results = model.train(data="mnist", epochs=100, imgsz=28)
  • O MNIST vem com uma divisão predefinida de 60.000 imagens de treinamento e 10.000 imagens de teste. Ao contrário dos conjuntos de dados de classificação baseados em pastas, que a Ultralytics divide automaticamente, a partição oficial do MNIST é usada sem alterações, e, por padrão, o conjunto de teste serve como divisão de validação durante o treinamento.

  • O conjunto de dados MNIST contém apenas dígitos manuscritos, enquanto o MNIST Estendido (EMNIST) inclui dígitos e letras maiúsculas e minúsculas. O EMNIST foi desenvolvido como sucessor do MNIST e usa o mesmo formato de 28x28 pixels, o que o torna compatível com ferramentas e modelos projetados para o conjunto de dados MNIST original. Essa variedade maior de caracteres torna o EMNIST útil para uma gama mais ampla de aplicações de aprendizagem automática.

  • Sim. A Ultralytics Platform permite carregar conjuntos de dados, treinar modelos de classificação de imagens e implantá-los sem programação extensa. É uma maneira prática de executar experimentos com MNIST na nuvem — consulte a visão geral dos conjuntos de dados de classificação para ver opções relacionadas.

  • O MNIST é mais simples do que muitos conjuntos de dados modernos, como CIFAR-10 ou ImageNet, o que o torna ideal para iniciantes e experimentações rápidas. Embora conjuntos de dados mais complexos apresentem desafios maiores, com imagens coloridas e categorias variadas de objetos, o MNIST continua valioso por sua simplicidade, tamanho reduzido dos arquivos e importância histórica no desenvolvimento de algoritmos de aprendizagem automática. Para uma alternativa mais difícil com a mesma estrutura, consulte Fashion-MNIST, que apresenta itens de vestuário em vez de dígitos.

Comentários