MNIST 데이터베이스(Modified National Institute of Standards and Technology database)는 다양한 이미지 처리 시스템을 훈련시키는 데 흔히 사용되는 대규모 손글씨 숫자 데이터베이스이다. 이 데이터베이스는 기계 학습 분야의 훈련 및 테스트에도 널리 사용된다. 이는 NIST의 원본 데이터셋에서 샘플을 "재혼합"하여 만들어졌다. 제작자들은 NIST의 훈련 데이터셋이 미국 인구조사국 직원들로부터, 테스트 데이터셋이 미국 고등학생들로부터 수집되었기 때문에 기계 학습 실험에 적합하지 않다고 판단했다. 또한 NIST의 흑백 이미지는 28x28 픽셀 경계 상자에 맞게 정규화되고 안티앨리어싱되어 회색조 수준이 도입되었다.
MNIST 데이터베이스는 60,000개의 훈련 이미지와 10,000개의 테스트 이미지를 포함한다. 훈련 세트의 절반과 테스트 세트의 절반은 NIST의 훈련 데이터셋에서, 나머지 절반의 훈련 세트와 테스트 세트는 NIST의 테스트 데이터셋에서 가져왔다. 데이터베이스의 원래 제작자들은 이에 대해 테스트된 일부 방법들의 목록을 유지하고 있다. 그들의 원래 논문에서는 서포트 벡터 머신을 사용하여 0.8%의 오류율을 얻었다. 원래 MNIST 데이터셋에는 최소 4개의 잘못된 레이블이 포함되어 있다.
역사
MNIST의 개발은 여러 관련 데이터셋과 벤치마크에 앞서 이루어졌다. 1988년에는 미국 우정청의 숫자 데이터셋이 구축되었으며, 뉴욕 버펄로 우체국을 통과하는 미국 우편물의 손글씨 우편번호에서 디지털화된 16x16 회색조 이미지를 포함했다. 훈련 세트에는 7,291개의 이미지가, 테스트 세트에는 2,007개의 이미지가 있어 총 9,298개였다. 훈련 및 테스트 세트 모두 모호하거나 분류 불가능하거나 잘못 분류된 데이터를 포함했다. 이 데이터셋은 선구적인 신경망인 1989년 LeNet을 훈련하고 벤치마킹하는 데 사용되었다. 테스트 세트에서 두 명의 인간은 평균 2.5%의 오류율을 보였다.
특수 데이터베이스
1980년대 후반, 인구조사국은 손글씨 인구조사 양식의 자동 디지털화에 관심을 가져 NIST의 이미지 인식 그룹(IRG)에 OCR 시스템 평가를 의뢰했다. 수년간의 작업 결과 여러 "특수 데이터베이스"와 벤치마크가 만들어졌다. MNIST에 특히 중요한 것은 1990년 5월에 출시된 특수 데이터베이스 1(SD-1), 1992년 2월에 출시된 특수 데이터베이스 3(SD-3), 그리고 1992년 4월에 출시된 특수 데이터베이스 7(SD-7) 또는 NIST 테스트 데이터 1(TD-1)이다. 이들은 ISO-9660 CD-ROM으로 출시되었다. 이들은 사람들에게 "손글씨 샘플 양식"(HSF)에 쓰도록 요청한 다음 HSF를 디지털화하고 영숫자 문자를 분할하여 얻었다. 각 작성자는 하나의 HSF를 작성했다.
각 HSF에는 사람들이 쓰도록 요청받은 여러 입력 필드가 포함되어 있다. 34개의 필드가 있다: 이름 및 날짜 항목, 도시/주 필드, 28개의 숫자 필드, 하나의 대문자 필드, 하나의 소문자 필드, 그리고 제약 없는 헌법 본문 단락이다. 각 HSF는 300dpi(11.8도트/밀리미터) 해상도로 스캔되었다. SD-1과 SD-3은 1990년 미국 인구조사의 일부로 3,400명의 상주 인구조사 현장 직원 중 2,100명이 작성한 동일한 HSF 세트에서 구축되었다. SD-1은 분할된 데이터 입력 필드를 포함했지만 분할된 영숫자는 포함하지 않았다. SD-3은 분할된 영숫자에서 디지털화된 이진 128x128 이미지를 포함했으며, 223,125개의 숫자, 44,951개의 대문자, 45,313개의 소문자가 있었다.
SD-7 또는 TD-1은 테스트 세트였으며, 메릴랜드주 베데스다의 500명의 고등학생이 작성한 58,646개의 128x128 이진 이미지를 포함했다. 이들은 "수업 중 짧은 연습으로 고등학교의 수학 및 과학 학생들"로 설명되었다. 각 이미지에는 작성자 신원에 대한 고유 정수 ID가 함께 제공된다. SD-7은 레이블 없이 CD-ROM으로 출시되었고, 레이블은 나중에 플로피 드라이브로 출시되었다. HSF는 포함하지 않았다. SD-7은 인간 오류율이 1.5%일 만큼 어려웠다. SD-3은 SD-7의 이미지보다 훨씬 깨끗하고 인식하기 쉬웠다. 유럽식 가로선이 있는 7은 SD-3보다 SD-7에서 훨씬 더 많았다. SD-3은 SD-7을 만든 사람들보다 더 동기 부여된 사람들에 의해 생성된 것으로 의심되었다. 또한 SD-3의 문자 분할기는 SD-7의 것보다 오래된 설계로 더 자주 실패했다. 어려운 인스턴스가 분할기를 통과하지 못해 SD-3 구축에서 걸러진 것으로 의심되었다. SD-3에서 훈련되고 검증된 기계 학습 시스템은 SD-7에서 성능이 크게 저하되어 오류율이 1% 미만에서 약 10%로 떨어지는 것으로 발견되었다.
1992년, NIST와 인구조사국은 이 산업의 최신 기술을 결정하기 위해 경쟁 대회와 회의를 후원했다. 대회에서 팀들은 3월 23일 이전에 SD-3을 훈련 세트로, 4월 13일 이전에 SD-7을 테스트 세트로 받았으며, 4월 27일 이전에 SD-7을 분류하기 위한 하나 이상의 시스템을 제출해야 했다. 총 7개국 26개 회사에서 45개의 알고리즘이 제출되었다. 5월 27일과 28일에 결과를 제출한 모든 당사자가 메릴랜드주 게이더스버그에서 열린 제1차 인구조사 OCR 시스템 회의에 모였다. FBI, IRS, USPS의 참관인도 참석했다. 우승작은 SD-3을 훈련에 사용하지 않고 훨씬 더 큰 독점 훈련 세트를 사용했으므로 분포 변화의 영향을 받지 않았다. SD-3을 훈련에 사용한 25개 항목 중 우승작은 유클리드 변환에 불변하는 수제 메트릭을 사용한 최근접 이웃 분류기였다.
SD-19는 1995년에 SD-1, SD-3, SD-7 및 일부 추가 데이터를 모아 출판되었다. 여기에는 814,255개의 영숫자 이진 이미지와 4,169개의 HSF 이진 이미지가 포함되었으며, SD-7을 생성하는 데 사용된 500개의 HSF도 포함되었다. 2016년에 업데이트되었다.
MNIST
MNIST는 1994년 여름 이전에 구축되었다. SD-3과 SD-7의 128x128 이진 이미지를 혼합하여 만들어졌다. 구체적으로, 먼저 SD-7의 모든 이미지를 가져와 각각 250명의 작성자로 구성된 훈련 세트와 테스트 세트로 나누었다. 이로 인해 각 세트에 약 30,000개의 이미지가 생겼다. 그런 다음 각 세트에 정확히 60,000개의 이미지가 포함될 때까지 SD-3에서 더 많은 이미지를 추가했다.
각 이미지는 종횡비를 유지하면서 20x20 픽셀 상자에 맞게 크기가 정규화되고 회색조로 안티앨리어싱되었다. 그런 다음 픽셀의 질량 중심이 이미지 중앙에 올 때까지 이동하여 28x28 이미지에 배치되었다. 다운샘플링이 진행된 세부 사항은 재구성되었다. 훈련 세트와 테스트 세트는 원래 각각 60,000개의 샘플을 가졌지만, 테스트 세트 샘플 중 50,000개는 폐기되었고 인덱스 24476에서 34475까지의 샘플만 사용되어 테스트 세트에 10,000개의 샘플만 남았다.
추가 버전
2019년에는 MNIST의 전체 60,000개 테스트 세트가 복원되어 QMNIST가 구축되었으며, 훈련 세트에 60,000개, 테스트 세트에 60,000개의 이미지가 있다. 확장 MNIST(EMNIST)는 2017년에 출시된 MNIST의 (최종) 후속작으로 NIST가 개발하고 출시한 최신 데이터셋이다. MNIST는 손글씨 숫자 이미지만 포함했다. EMNIST는 SD-19의 모든 이미지에서 구축되었으며 숫자뿐만 아니라 문자도 포함하고 있어 딥 러닝 및 인공 지능 연구에 더 도전적인 벤치마크를 제공한다.