MNIST 데이터베이스(수정된 국립표준기술연구소 데이터베이스)는 손으로 쓴 숫자 이미지의 대규모 모음으로, 이미지 처리 및 기계 학습 시스템의 훈련과 테스트에 일반적으로 사용됩니다. 원래 NIST 데이터 세트의 샘플을 재혼합하여 만들어졌으며, NIST 훈련 데이터(미국 인구조사국 직원 출처)와 테스트 데이터(미국 고등학생 출처)의 한계를 해결하기 위해 설계되었습니다. 이는 기계 학습 실험에 부적합했기 때문입니다. 흑백 이미지는 28x28 픽셀 경계 상자로 정규화되고 안티앨리어싱되어 회색조 수준이 도입되었습니다.
MNIST는 60,000개의 훈련 이미지와 10,000개의 테스트 이미지를 포함하며, 각 세트의 절반은 NIST 훈련 데이터에서, 나머지 절반은 NIST 테스트 데이터에서 가져왔습니다. 제작자들은 데이터 세트에서 테스트된 방법 목록을 유지 관리하며, 원래 논문에서는 서포트 벡터 머신을 사용하여 0.8%의 오류율을 보고했습니다. 원래 MNIST 데이터 세트에는 최소 4개의 잘못된 레이블이 포함되어 있으며, 이는 잘 알려진 결함입니다.
전신 및 기원
MNIST 이전에, 미국 우편 서비스(USPS) 데이터베이스(1988년)는 미국 우편물의 손으로 쓴 우편 번호에서 추출한 더 작은 숫자 데이터 세트를 제공했습니다. 여기에는 16x16 회색조 이미지가 포함되었으며, 7,291개의 훈련 이미지와 2,007개의 테스트 이미지로 총 9,298개였습니다. 이 데이터 세트는 모호하고 잘못 분류된 샘플을 포함하여 인간 오류율이 평균 2.5%에 달할 정도로 어려웠습니다. 1989년 초기 LeNet 아키텍처를 훈련하는 데 사용되었습니다.
1980년대 후반, 인구조사국은 손으로 쓴 양식 숫자 인식의 자동화를 모색하면서 NIST의 이미지 인식 그룹에 OCR 시스템 평가를 의뢰했습니다. 이 작업은 SD-1(1990년), SD-3(1992년), SD-7(1992년)을 포함한 여러 특수 데이터베이스를 생성했습니다. 이들은 300dpi로 스캔된 손글씨 샘플 양식(HSF)에서 구축되었으며, 이름, 숫자, 문자 등 다양한 필드를 포함했습니다. SD-3는 인구조사국 직원이 작성한 128x128 이진 이미지로 분할된 영숫자 문자(223,125개의 숫자 포함)로 구성되었습니다. SD-7은 500명의 고등학생이 작성한 58,646개의 숫자 이미지로 구성되었습니다. SD-3는 더 깨끗하고 쉬웠지만, SD-3에서 훈련된 기계 학습 시스템은 SD-7에서 약 10%의 오류율로 성능이 크게 저하되어 분포 변화의 영향을 강조했습니다.
1992년 NIST 경쟁에서는 SD-3를 훈련 데이터로, SD-7을 테스트 데이터로 사용하여 26개 회사의 45개 알고리즘을 평가했습니다. 우승 항목은 독점 훈련 데이터를 사용했지만, SD-3 훈련 시스템 중 최고는 불변 메트릭을 사용한 최근접 이웃 분류기였습니다. SD-19(1995년)는 여러 특수 데이터베이스를 결합하여 총 814,255개의 이미지를 포함했습니다.
MNIST의 생성
1994년 여름 이전에, MNIST는 SD-3와 SD-7에서 구축되었습니다. 제작자들은 SD-7의 이미지를 훈련 및 테스트 세트로 나누었고, 각 세트는 250명의 다른 작성자에게서 가져와 총 약 30,000개의 이미지를 만들었습니다. 그런 다음 각 세트에 SD-3의 이미지를 추가하여 훈련 및 테스트 세트당 60,000개의 샘플에 도달했습니다. 모든 이미지는 종횡비를 유지하면서 20x20 픽셀 상자로 크기 정규화되고 회색조로 안티앨리어싱된 다음, 질량 중심을 기준으로 28x28 이미지에 중앙 배치되었습니다. 다운샘플링 세부 사항은 나중에 재구성되었습니다.
처음에는 훈련 및 테스트 세트가 각각 60,000개의 샘플을 가졌지만, 테스트 세트 크기를 줄이기 위해 50,000개의 샘플이 버려져 인덱스 24476에서 34475 사이의 이미지만 남았고, 결과적으로 10,000개의 테스트 이미지가 되었습니다.
평가 및 영향
MNIST는 기계 학습 및 딥러닝 연구의 표준 벤치마크가 되었습니다. 선형 모델에서 복잡한 신경망 모델에 이르기까지 다양한 알고리즘을 비교하는 데 널리 사용됩니다. 데이터 세트의 작은 이미지 크기와 적당한 클래스 수는 프로토타입 제작에 이상적입니다. 공개적으로 이용 가능하고 명확한 벤치마크를 제공하여 일반적인 교육 도구가 되었습니다.
유산 및 후속 작업
확장된 MNIST(EMNIST)는 2017년 NIST에서 개발한 후속 데이터 세트로, MNIST의 구조를 유지하면서 손으로 쓴 숫자와 문자를 포함하여 더 넓은 범주를 다룹니다. 2019년에는 QMNIST가 생성되어 원래 MNIST 테스트 세트의 전체 60,000개 샘플을 복원하여 연구 목적의 더 큰 테스트 세트를 제공했습니다. 이러한 파생 데이터 세트는 MNIST의 유산을 확장하면서 다양성을 높였습니다.
같이 보기
- 인공지능
- 컴퓨터 비전
- 광학 문자 인식
참고 문헌
- Yann LeCun 등의 원래 MNIST 논문, 1998년.
- NIST 특수 데이터베이스 간행물 및 OCR 벤치마크 보고서.