Kuzushiji-MNIST는 기계 학습 및 심층 학습을 위한 이미지 분류 벤치마크 데이터셋이다. 이 데이터셋은 손으로 쓴 일본어 히라가나 문자의 70,000개의 28x28 픽셀 흑백 이미지로 구성되며, 60,000개의 훈련 샘플과 10,000개의 테스트 샘플로 분할된다. 이 데이터셋은 1990년대 후반부터 신경망 알고리즘을 평가하는 데 널리 사용된 손글씨 숫자 데이터셋인 고전 MNIST의 현대적 대안으로 만들어졌다. Kuzushiji-MNIST는 원본 MNIST와 동일한 이미지 크기, 데이터 형식, 클래스 수(10개)를 유지하여, 연구자들이 더 도전적이고 문화적으로 중요한 작업에서 모델을 테스트하려는 경우 직접적인 대체재 역할을 한다.
이 데이터셋은 2018년에 Tarin Clanuwat가 이끄는 도쿄 대학과 일본 국립 문학 연구소의 연구팀에 의해 소개되었다. 이와 함께 두 개의 관련 데이터셋도 공개되었는데, 49개의 히라가나 클래스를 포함하는 Kuzushiji-49와 3,832개의 초서체 한자 클래스를 포함하는 Kuzushiji-Kanji가 그것이다. 주요 동기는 쿠즈시지(kuzushiji)로 알려진 초서체로 쓰인 일본 역사 문서의 광학 문자 인식(OCR) 문제를 해결하는 것이었다. 이 초서체는 8세기부터 19세기까지 널리 사용되었지만, 1900년 교육 개혁 이후 대부분 폐기되어 수백만 개의 역사 텍스트가 현대 일본어 사용자에게 읽히지 못하게 되었다.
설계 및 구축
Kuzushiji-MNIST의 이미지는 스캔된 역사 일본 서적 및 필사본의 대규모 말뭉치에서 파생되었다. 연구자들은 자동 분할과 수동 주석의 조합을 사용하여 이러한 문서에서 개별 문자 이미지를 추출했다. 각 이미지는 28x28 픽셀로 크기가 조정되고 흑백으로 변환되었으며, 픽셀 값은 0(검정)에서 255(흰색)까지의 범위로 원본 MNIST 데이터셋의 형식과 정확히 일치한다. 10개의 클래스는 말뭉치에서 가장 흔한 10개의 히라가나 문자에 해당하며, 이는 'o', 'ki', 'su', 'tsu', 'na', 'ha', 'ma', 'ya', 're', 'wo'이다. 이러한 문자는 클래스 빈도와 시각적 구별성을 균형 있게 맞추기 위해 선택되어, 분류 작업이 사소하지도 않고 지나치게 어렵지도 않도록 보장한다.
데이터셋은 원본 MNIST와 동일한 이진 형식으로 배포되며, 훈련 이미지, 훈련 레이블, 테스트 이미지, 테스트 레이블에 대한 별도의 파일이 포함된다. 이러한 호환성 덕분에 연구자들은 MNIST용으로 설계된 기존 코드와 파이프라인을 수정 없이 사용할 수 있으며, 새 데이터 파일을 교체하기만 하면 된다. 제작자들은 또한 PyTorch 및 TensorFlow와 같은 일반적인 심층 학습 프레임워크에 쉽게 통합할 수 있도록 Python 로더 스크립트와 상세한 README를 제공했다.
벤치마크 성능
출시 이후 Kuzushiji-MNIST는 특히 데이터 증강 및 잔차 네트워크 아키텍처의 맥락에서 이미지 분류 모델을 평가하는 표준 벤치마크가 되었다. 이 작업은 히라가나 문자가 더 큰 클래스 내 변이와 서로 다른 클래스 간의 시각적 유사성을 보이기 때문에 원본 MNIST보다 눈에 띄게 더 어렵다. 예를 들어, 'su'와 'tsu'의 문자는 쿠즈시지에 익숙하지 않은 인간 독자조차 종종 혼동한다. 결과적으로, MNIST에서 거의 완벽한 정확도를 달성하는 단순한 모델은 Kuzushiji-MNIST에서 일반적으로 훨씬 더 나쁜 성능을 보이며, 이는 모델 용량과 일반화의 더 민감한 테스트가 된다.
Kuzushiji-MNIST에서의 최첨단 결과는 배치 정규화 및 드롭아웃 정규화를 사용한 합성곱 신경망(CNN)으로 달성되었다. 2024년 기준, 최고 보고된 테스트 정확도는 약 99.5%로, 광범위한 데이터 증강을 사용한 잔차 네트워크 앙상블에 의해 달성되었다. 그러나 데이터셋은 경량 모델과 수작업 특징에 의존하는 접근 방식에 여전히 도전적이며, 이러한 접근 방식은 종종 95% 미만의 정확도에서 정체된다. 이 벤치마크는 또한 학습률 스케줄 및 가중치 초기화 전략의 효과와 레이블 노이즈에 대한 모델의 견고성을 연구하는 데 사용되었다.
응용 및 영향
Kuzushiji-MNIST의 주요 응용은 역사 일본 문서를 위한 OCR 기술을 발전시키는 연구 도구로서의 역할이다. 이 데이터셋이 파생된 더 넓은 Kuzushiji 프로젝트는 현재 일반 대중이 접근할 수 없는 쿠즈시지로 쓰인 수백만 권의 책과 필사본을 디지털화하고 검색 가능하게 만드는 것을 목표로 한다. 표준화된 벤치마크를 제공함으로써, 데이터셋은 전 세계 연구자들이 초서체 문자 인식 알고리즘을 개발하고 비교할 수 있게 했으며, 이는 이러한 텍스트의 자동 전사로 가는 중요한 단계이다.
직접적인 응용을 넘어, Kuzushiji-MNIST는 기계 학습 교육 및 연구에서 범용 테스트베드로 채택되었다. MNIST와의 유사성 덕분에 이미지 분류에 대한 접근 가능한 입문 자료가 되며, 증가된 난이도는 더 고급 기술의 탐구를 장려한다. 데이터셋은 수백 개의 학술 논문에서 인용되었으며 인기 있는 기계 학습 라이브러리와 강의 자료에 포함된다. 또한 라틴 알파벳이나 중국 문자와 같은 다른 문자 데이터셋에서 훈련된 모델의 전이 가능성을 평가하는 데 사용되어, 교차 문자 일반화에 대한 통찰력을 제공했다.
관련 데이터셋 및 확장
Kuzushiji-MNIST의 제작자들은 또한 모든 49개의 히라가나 문자를 포함하는 Kuzushiji-49와 3,832개의 한자 문자를 다루는 Kuzushiji-Kanji를 공개했다. 이러한 데이터셋은 더 크고 복잡하며, Kuzushiji-Kanji는 140,000개 이상의 이미지를 포함한다. 이들은 더 고급 OCR 작업과 역사 문서에서 발견되는 전체 문자 범위를 처리할 수 있는 모델 훈련을 위해 설계되었다. 또한, Kuzushiji 프로젝트는 문자 수준 경계 상자가 있는 전체 페이지 이미지를 포함하는 대규모 주석 말뭉치인 Kuzushiji Dataset을 발표했다. 이 리소스는 엔드투엔드 전사 시스템을 개발하기 위한 경쟁 및 협력 연구 노력에 사용되었다.
기계 학습 커뮤니티에서 Kuzushiji-MNIST는 손글씨 문자를 위한 EMNIST 데이터셋과 의류 이미지를 위한 Fashion-MNIST 데이터셋과 같은 문화적으로 다양한 벤치마크를 만드는 유사한 노력에 영감을 주었다. 이러한 데이터셋은 원본 MNIST와 동일한 형식과 크기를 공유하여, 서로 다른 도메인에서 모델 성능의 직접 비교를 가능하게 한다. Kuzushiji-MNIST의 성공은 역사적 문자 체계의 보존과 디지털화의 가치를 강조했으며, 문화 유산 보존과 현대 인공 지능 연구 사이의 다리 역할을 계속하고 있다.