MNIST 데이터베이스(Modified National Institute of Standards and Technology database)는 다양한 이미지 처리 시스템을 훈련시키는 데 흔히 사용되는 대규모 손글씨 숫자 데이터베이스이다. 또한 기계 학습 분야의 훈련과 테스트에도 널리 사용된다. 이 데이터베이스는 NIST의 원본 데이터셋에서 샘플을 "재혼합"하여 만들어졌는데, 제작자들은 미국 인구조사국 직원에게서 얻은 원본 훈련 데이터셋과 미국 고등학생에게서 얻은 테스트 데이터셋이 기계 학습 실험에 적합하지 않다고 생각했기 때문이다. NIST의 흑백 이미지는 28x28 픽셀 경계 상자에 맞게 정규화되고 안티앨리어싱 처리되어 회색조 수준이 도입되었다.
MNIST 데이터베이스는 60,000개의 훈련 이미지와 10,000개의 테스트 이미지를 포함한다. 훈련 세트의 절반과 테스트 세트의 절반은 NIST의 훈련 데이터셋에서 가져왔고, 각각의 나머지 절반은 NIST의 테스트 데이터셋에서 가져왔다. 원본 제작자들은 이 데이터베이스로 테스트된 방법 목록을 유지 관리한다. 그들의 원본 논문에서는 서포트 벡터 머신을 사용하여 0.8%의 오류율을 달성했다. 원본 MNIST 데이터셋에는 최소한 4개의 잘못된 레이블이 포함되어 있다.
역사
USPS 데이터베이스
1988년에 미국 우정청(US Postal Service)의 숫자 데이터셋이 구축되었다. 여기에는 뉴욕주 버펄로 우체국을 통과하는 미국 우편물에 손으로 쓴 우편번호에서 디지털화된 16×16 회색조 이미지가 포함되어 있었다. 훈련 세트는 7,291개의 이미지, 테스트 세트는 2,007개의 이미지로 총 9,298개였다. 두 세트 모두 모호하거나 분류할 수 없거나 잘못 분류된 데이터를 포함하고 있었다. 이 데이터셋은 1989년 LeNet을 훈련하고 벤치마킹하는 데 사용되었다. 이 작업은 어려웠다. 테스트 세트에서 두 명의 인간이 평균 2.5%의 오류율을 보였다.
특수 데이터베이스
1980년대 후반, 인구조사국은 손으로 작성된 인구조사 양식의 자동 디지털화에 관심을 갖게 되었고 OCR 시스템을 평가하기 위해 NIST의 이미지 인식 그룹(IRG)을 고용했다. 수년간의 작업 끝에 여러 "특수 데이터베이스"와 벤치마크가 만들어졌다. MNIST와 특히 관련이 있는 것은 1990년 5월에 출시된 특수 데이터베이스 1(SD-1), 1992년 2월에 출시된 특수 데이터베이스 3(SD-3), 그리고 1992년 4월에 출시된 특수 데이터베이스 7(SD-7) 또는 NIST 테스트 데이터 1(TD-1)이다. 이들은 ISO-9660 CD-ROM으로 출시되었다. 데이터는 사람들에게 "손글씨 샘플 양식"(HSF)에 쓰도록 요청한 다음 양식을 디지털화하고 영숫자 문자를 분할하여 얻었다. 각 작성자는 HSF 한 장을 작성했다.
각 HSF에는 이름 및 날짜 입력란, 도시/주 입력란, 28개의 숫자 입력란, 대문자 입력란 1개, 소문자 입력란 1개, 그리고 제약 없는 헌법 본문 단락을 포함한 여러 입력 필드가 있다. 각 HSF는 300dpi(밀리미터당 11.8도트) 해상도로 스캔되었다.
SD-1과 SD-3은 1990년 미국 인구조사의 일부로 3,400명의 상주 인구조사 현장 직원 중 2,100명이 작성한 동일한 HSF 세트로 구성되었다. SD-1은 분할된 데이터 입력 필드를 포함했지만 분할된 영숫자는 포함하지 않았다. SD-3은 분할된 영숫자에서 디지털화된 이진 128×128 이미지를 포함했으며, 223,125개의 숫자, 44,951개의 대문자, 45,313개의 소문자가 있었다.
SD-7(또는 TD-1)은 테스트 세트로, 메릴랜드주 베데스다의 고등학생 500명이 "수업 중 짧은 연습으로 고등학교의 수학 및 과학 학생들"로 설명된 학생들이 작성한 58,646개의 128×128 이진 이미지를 포함했다. 각 이미지에는 작성자 신원에 대한 고유한 정수 ID가 함께 제공되었다. SD-7은 레이블 없이 CD-ROM으로 출시되었고, 레이블은 나중에 플로피 드라이브로 출시되었다. HSF는 포함되지 않았다. SD-7에 대한 인간 오류율은 1.5%였다.
SD-3은 SD-7보다 훨씬 깨끗하고 인식하기 쉬웠다. 유럽식 가로선이 있는 7은 SD-7에서 SD-3보다 훨씬 더 많았다. SD-3은 SD-7보다 더 동기 부여된 사람들이 만들었을 가능성이 있고, SD-3용 문자 분할기(더 오래된 설계)가 더 자주 실패하여 더 어려운 사례를 걸러냈을 것으로 의심되었다. SD-3에서 훈련되고 검증된 기계 학습 시스템은 SD-7에서 성능이 크게 저하되어 오류율이 1% 미만에서 약 10%로 떨어졌다.
1992년에 NIST와 인구조사국은 최첨단 기술을 결정하기 위한 경연 대회와 회의를 후원했다. 팀들은 3월 23일 이전에 SD-3을 훈련 세트로, 4월 13일 이전에 SD-7을 테스트 세트로 받았으며, 4월 27일 이전에 SD-7 분류 시스템을 제출해야 했다. 총 45개의 알고리즘이 7개국 26개 회사에서 제출되었다. 5월 27일과 28일에 모든 관계자가 메릴랜드주 게이더스버그에서 열린 제1차 인구조사 OCR 시스템 회의에 모였으며, FBI, IRS, USPS의 참관인이 있었다. 우승작은 SD-3을 훈련에 사용하지 않고 훨씬 더 큰 독점 훈련 세트를 사용하여 분포 이동을 피했다. SD-3을 사용한 25개 항목 중 우승자는 유클리드 변환에 불변하는 수제 메트릭을 사용한 최근접 이웃 분류기였다.
SD-19는 1995년에 SD-1, SD-3, SD-7 및 추가 데이터를 모아 출판되었다. 여기에는 814,255개의 영숫자 이진 이미지와 4,169개의 HSF 이진 이미지가 포함되었으며, SD-7을 생성하는 데 사용된 500개의 HSF도 포함되었다. 2016년에 업데이트되었다.
MNIST의 구축
MNIST는 1994년 여름 이전에 SD-3과 SD-7의 128x128 이진 이미지를 혼합하여 구축되었다. 구체적으로, 제작자들은 먼저 SD-7의 모든 이미지를 가져와 각각 250명의 작성자로 구성된 훈련 세트와 테스트 세트로 나누어 각 세트에 거의 30,000개의 이미지를 만들었다. 그런 다음 각 세트가 정확히 60,000개의 이미지를 포함할 때까지 SD-3에서 더 많은 이미지를 추가했다.
각 이미지는 종횡비를 유지하면서 20x20 픽셀 상자에 맞게 크기가 정규화되고 회색조로 안티앨리어싱 처리되었다. 그런 다음 픽셀의 질량 중심이 이미지 중앙에 올 때까지 이동하여 28x28 이미지에 배치되었다. 다운샘플링 절차의 세부 사항은 나중에 재구성되었다.
훈련 세트와 테스트 세트는 원래 각각 60,000개의 샘플을 가지고 있었지만, 테스트 세트 샘플 중 50,000개가 폐기되어 인덱스 24,476에서 34,475까지의 샘플만 남게 되어 테스트 세트에는 10,000개의 샘플만 남게 되었다.
추가 버전
2019년에 MNIST의 전체 60,000개 테스트 세트가 복원되어 QMNIST가 구축되었으며, 훈련 세트에는 60,000개, 테스트 세트에는 60,000개의 이미지가 있다.
확장 MNIST(EMNIST)는 2017년에 출시된 MNIST의 후속작으로 NIST에서 개발하고 출시한 최신 데이터셋이다. MNIST는 손글씨 숫자만 포함했지만, EMNIST는 SD-19의 모든 이미지(문자와 숫자 포함)로 구성되었으며 딥 러닝 및 인공 지능 연구를 위한 더 어려운 벤치마크를 제공한다.
유산
MNIST는 기계 학습 교육과 연구에서 기본적인 벤치마크가 되었으며, 새로운 알고리즘과 아키텍처의 첫 번째 테스트로 자주 사용된다. 단순성과 작은 크기 덕분에 신경망 훈련 및 평가 개념을 가르치는 데 이상적이다. 이 데이터셋의 광범위한 채택은 이후 벤치마크 개발에 영향을 미쳤고 딥 러닝 및 생성형 AI의 발전을 포함한 해당 분야의 성장에 기여했다.