O conjunto de dados MNIST

Traduzido do inglês

O banco de dados MNIST é uma grande coleção de 70.000 imagens de dígitos manuscritos, amplamente utilizado para treinar e testar sistemas de aprendizado de máquina e processamento de imagens. Ele foi criado pela remistura de amostras dos conjuntos de dados originais do NIST e se tornou um padrão de referência fundamental na área.

A base de dados MNIST (Modified National Institute of Standards and Technology database, ou banco de dados modificado do Instituto Nacional de Padrões e Tecnologia) é um grande banco de dados de dígitos manuscritos comumente utilizado para treinar vários sistemas de processamento de imagens. Também é amplamente utilizado para treinamento e teste no campo de aprendizado-de-máquina. A base foi criada "recombinando" as amostras dos conjuntos de dados originais do NIST, pois os criadores consideraram que o conjunto de dados original, obtido de funcionários do Departamento do Censo dos EUA, e o conjunto de teste, obtido de estudantes do ensino médio americano, não eram adequados para experimentos de aprendizado de máquina. As imagens em preto e branco do NIST foram normalizadas para caber em uma caixa delimitadora de 28x28 pixels e passaram por suavização (anti-aliasing), o que introduziu níveis de cinza.

A base MNIST contém 60.000 imagens de treinamento e 10.000 imagens de teste. Metade do conjunto de treinamento e metade do conjunto de teste foram retirados do conjunto de treinamento original do NIST, enquanto a outra metade de cada um veio do conjunto de teste original do NIST. Os criadores originais mantêm uma lista de métodos testados na base. Em seu artigo original, eles usaram uma máquina de vetores de suporte para atingir uma taxa de erro de 0,8%.

História

Banco de dados do USPS

Em 1988, um conjunto de dados de dígitos do Serviço Postal dos EUA foi construído. Ele continha 16x16 imagens em escala de cinza de dígitos manuscritos, digitalizadas a partir de códigos postais em envelopes que passavam pelo correio de Buffalo, Nova York. O conjunto de treinamento tinha 7.291 imagens e o conjunto de teste tinha 2.007, totalizando 9.298. Ambos os conjuntos continham dados ambíguos, não classificáveis e classificados incorretamente. Este conjunto de dados foi usado para treinar e avaliar o LeNet de 1989. A tarefa era difícil; no conjunto de teste, dois humanos cometeram erros a uma taxa média de 2,5%.

Banco de dados especial do NIST

No final da década de 1980, o Departamento do Censo estava interessado na digitalização automática de formulários de censo e contratou o Grupo de Reconhecimento de Imagens (IRG) do NIST para avaliar sistemas de OCR. Vários anos de trabalho resultaram em vários "bancos de dados especiais" e referências. De particular importância para o MNIST são o Banco de Dados Especial 1 (SD-1) e o Banco de Dados Especial 3 (SD-3), que contêm dígitos manuscritos. O SD-1 foi lançado em maio de 1990 e contém 58.646 imagens de dígitos de 500 escritores diferentes. O SD-3 foi lançado em fevereiro de 1992 e contém 223.125 imagens de dígitos de 2.100 escritores diferentes. Ambos os conjuntos foram lançados em CD-ROMs ISO 9660. Os dados foram obtidos pedindo aos escritores que preenchessem formulários de censo. Cada escritor preencheu um único formulário. Os formulários continham múltiplos campos de entrada, incluindo campos de nome e data, um campo de cidade/estado, 28 campos de dígitos, um campo de letras maiúsculas, um campo de letras minúsculas e um parágrafo de texto livre. Os formulários foram digitalizados a 300 pontos por polegada (11,8 pontos por milímetro).

O SD-1 e o SD-3 foram construídos a partir do mesmo conjunto de formulários, mas de grupos diferentes de escritores. O SD-1 veio de 500 escritores que eram funcionários do censo, enquanto o SD-3 veio de 2.100 escritores que eram estudantes do ensino médio. Os dígitos no SD-1 foram segmentados automaticamente, enquanto os dígitos no SD-3 foram segmentados manualmente. O SD-7 (ou NIST Test Data 1) foi o conjunto de teste, contendo 58.646 imagens binárias de 128x128 de dígitos escritos por 500 estudantes do ensino médio. Foi lançado em abril de 1992. As imagens foram acompanhadas por um ID inteiro único para a identidade do escritor. O SD-7 foi lançado sem rótulos em CD-ROMs, com os rótulos lançados posteriormente em disquetes. Não continha os formulários HSF. A taxa de erro humano no SD-7 foi de 1,5%.

O SD-3 era muito mais limpo e fácil de reconhecer do que o SD-1. O dígito "7" cruzado (com um traço horizontal) era muito mais abundante no SD-7 do que no SD-3. Suspeitava-se que o SD-3 foi produzido por pessoas mais motivadas do que o SD-1, e que o segmentador de caracteres para o SD-1, um design mais antigo, falhava com mais frequência, filtrando instâncias mais difíceis. Sistemas de aprendizado de máquina treinados e validados no SD-3 sofreram quedas significativas de desempenho no SD-7, com taxas de erro aumentando de menos de 1% para cerca de 10%.

Em 1992, o NIST e o Departamento do Censo patrocinaram uma competição e conferência para determinar o estado da arte. As equipes receberam o SD-3 como conjunto de treinamento e o SD-7 como conjunto de teste, e deveriam enviar seus sistemas para classificar o SD-7 antes de 27 de abril. Um total de 45 algoritmos foi submetido por 26 empresas de 7 países. Em 27 e 28 de maio, todas as partes se reuniram em Gaithersburg, Maryland, na Primeira Conferência de Sistemas de OCR do Censo, com observadores do FBI, IRS e USPS. A entrada vencedora não usou o SD-3 para treinamento, mas sim um conjunto de treinamento proprietário muito maior, evitando a mudança de distribuição. Entre as 25 entradas que usaram o SD-3, a vencedora foi um classificador de vizinhos mais próximos usando uma métrica artesanal invariante a transformações euclidianas.

O SD-19 foi publicado em 1995 como uma compilação do SD-1, SD-3, SD-7 e dados adicionais. Continha 814.255 imagens binárias de caracteres alfanuméricos e 4.169 arquivos HSF, incluindo os 500 HSFs usados para gerar o SD-7. Foi atualizado em 2016.

Construção do MNIST

O MNIST foi construído em algum momento antes do verão de 1994, misturando imagens binárias de 128x128 do SD-3 e do SD-7. Especificamente, os criadores primeiro pegaram todas as imagens do SD-7 e as dividiram em um conjunto de treinamento e um conjunto de teste, cada um com 250 escritores diferentes, resultando em quase 30.000 imagens em cada conjunto. Em seguida, adicionaram mais imagens do SD-3 até que cada conjunto contivesse exatamente 60.000 imagens.

Cada imagem foi redimensionada para caber em uma caixa de 20x20 pixels, preservando a proporção, e passou por suavização (anti-aliasing) para gerar níveis de cinza. Em seguida, foi colocada em uma imagem de 28x28 pixels, centralizando o centro de massa dos pixels no centro da imagem. Os detalhes do procedimento de redução de resolução foram reconstruídos posteriormente.

O conjunto de treinamento e o conjunto de teste originalmente tinham 60.000 amostras cada, mas 50.000 amostras do conjunto de teste foram descartadas, deixando apenas as amostras indexadas de 24.476 a 34.475, resultando em exatamente 10.000 amostras no conjunto de teste.

Versões posteriores

Em 2019, o conjunto de teste completo de 60.000 imagens do MNIST foi restaurado para construir o QMNIST, que tem 60.000 imagens no conjunto de treinamento e 60.000 no conjunto de teste.

O EMNIST (Extended MNIST) é um conjunto de dados mais recente desenvolvido e lançado pelo NIST como sucessor do MNIST, lançado em 2017. Enquanto o MNIST incluía apenas dígitos manuscritos, o EMNIST foi construído a partir de todas as imagens do SD-19, incluindo letras e dígitos, e fornece uma referência mais desafiadora para pesquisa em aprendizado-profundo e inteligência-artificial.

Legado

O MNIST tornou-se uma referência fundamental na educação e pesquisa em aprendizado-de-máquina, frequentemente usado como primeiro teste para novos algoritmos e arquiteturas. Sua simplicidade e tamanho pequeno o tornam ideal para ensinar conceitos de treinamento e avaliação de redes-neurais. A adoção generalizada do conjunto de dados influenciou o desenvolvimento de referências subsequentes e contribuiu para o crescimento do campo, incluindo avanços em aprendizado-profundo e ia-generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·machine-learning·computer-vision·benchmark
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico