Kuzushiji-MNIST(KMNIST)는 손으로 쓴 일본어 히라가나 문자의 70,000개 회색조 이미지로 구성된 데이터셋으로, 각 이미지는 28x28 픽셀입니다. 이 데이터셋은 손으로 쓴 숫자를 포함하는 기존 MNIST 데이터셋보다 더 도전적인 대안으로 만들어졌습니다. KMNIST는 머신러닝 벤치마크에서 MNIST의 대체재로 설계되어, 연구자들이 유사한 구조를 가지지만 히라가나의 필기체 특성으로 인해 시각적 복잡성이 더 큰 작업에서 모델을 테스트할 수 있게 합니다.
이 데이터셋은 2018년 도쿄 대학의 연구팀(Tarin Clanuwat, Mikel Bober-Irizar, Asanobu Kitamoto, Alex Lamb 포함)에 의해 소개되었습니다. 이는 고전 일본 문학의 140,000개 이상의 이미지를 포함하는 Kuzushiji 데이터셋에서 파생되었습니다. KMNIST 하위 집합은 10개의 히라가나 문자에 초점을 맞추며, 각 문자는 7,000개의 이미지(훈련용 6,000개, 테스트용 1,000개)로 표현되어 MNIST의 정확한 분할을 반영합니다.
데이터셋 구조
KMNIST는 MNIST와 동일한 형식을 따릅니다: 각 이미지는 28x28 픽셀 회색조 배열이며, 픽셀 값은 0에서 255까지입니다. 데이터셋은 60,000개의 훈련 이미지와 10,000개의 테스트 이미지로 분할됩니다. 포함된 10개의 문자는 'o', 'ki', 'su', 'tsu', 'na', 'ha', 'ma', 'ya', 're', 'wo'입니다. 이 문자들은 원래 Kuzushiji 데이터셋에서 가장 흔한 것들 중 하나이며 균형 잡힌 분류 과제를 제공하기 때문에 선택되었습니다.
제작자들은 의도적으로 MNIST 숫자와 동일한 문자를 사용하지 않아, KMNIST에서 훈련된 모델이 숫자 인식에서 학습된 특징을 단순히 전이할 수 없도록 했습니다. 히라가나 문자는 더 복잡한 획 패턴과 곡률을 가지고 있어 전통적인 머신러닝 모델에게 더 어려운 작업을 만듭니다.
벤치마킹 및 성능
KMNIST는 Machine learning 커뮤니티, 특히 Neural network 아키텍처를 평가하는 데 있어 표준 벤치마크가 되었습니다. 원래 MNIST에서는 많은 모델이 99% 이상의 정확도를 달성하지만, KMNIST는 상당히 더 어렵습니다. 예를 들어, 간단한 Residual Network (ResNet)는 MNIST에서 약 99%를 달성할 수 있지만 KMNIST에서는 약 95%에 그칠 수 있습니다. 이는 KMNIST가 단순한 작업에서 잘 수행되는 모델과 더 복잡한 패턴으로 일반화되는 모델을 구별하는 데 유용하게 만듭니다.
연구자들은 Data Augmentation, Dropout, Batch Normalization을 포함한 다양한 기술을 테스트하기 위해 KMNIST를 사용했습니다. 이 데이터셋은 PyTorch 및 TensorFlow와 같은 인기 있는 머신러닝 라이브러리에도 포함되어 기존 파이프라인에 쉽게 통합할 수 있습니다.
관련 데이터셋
KMNIST는 Fashion-MNIST(의류 항목) 및 EMNIST(문자 및 숫자)를 포함하는 MNIST 유사 데이터셋 계열의 일부입니다. 이러한 데이터셋은 동일한 이미지 형식과 분할을 공유하여 서로 다른 도메인에서 모델 성능을 직접 비교할 수 있게 합니다. KMNIST는 비라틴 문자에 초점을 맞춘다는 점에서 독특하며, 다른 데이터셋이 제공하지 않는 문화적 및 언어적 도전을 제공합니다.
KMNIST가 파생된 원래 Kuzushiji 데이터셋은 4,000개 이상의 서로 다른 문자를 포함하며 역사적 문서 분석에 사용됩니다. KMNIST는 이를 10클래스 문제로 단순화하여 교육 목적과 빠른 실험에 접근 가능하게 만듭니다.
응용 및 영향
KMNIST는 Deep learning 연구 및 교육에서 널리 채택되었습니다. 이는 Convolutional neural network 설계를 가르치는 입문 과정에서 자주 사용되며, MNIST보다 더 정교한 아키텍처를 요구합니다. 이 데이터셋은 또한 Transfer learning 및 도메인 적응 연구에서 사용되었으며, MNIST에서 사전 훈련된 모델이 KMNIST에서 미세 조정됩니다.
벤치마킹 외에도 KMNIST는 일본 문화 유산의 보존과 연구에 기여했습니다. 고전 히라가나 문자를 기계가 읽을 수 있는 형식으로 제공함으로써 역사적 문서의 자동 분석을 가능하게 하며, 이는 역사가와 언어학자에게 가치가 있습니다.
한계 및 향후 방향
유용성에도 불구하고 KMNIST에는 한계가 있습니다. 10개의 문자는 전체 히라가나 음절의 작은 부분만을 나타내며, 이미지는 MNIST 형식에 맞게 전처리되어 원래 획 정보의 일부가 손실될 수 있습니다. 또한 데이터셋은 현대의 대규모 데이터셋에 비해 상대적으로 작아 매우 깊은 모델을 훈련하는 데 제한이 있을 수 있습니다.
향후 작업은 KMNIST를 더 많은 문자로 확장하거나 다른 전처리 방식의 변형을 만드는 것을 포함할 수 있습니다. 2025년 현재 KMNIST는 여전히 표준 벤치마크로 남아 있지만, 연구자들은 최첨단 모델을 평가하기 위해 CIFAR-10 또는 ImageNet과 같은 더 복잡한 데이터셋으로 점점 전환하고 있습니다. 그럼에도 불구하고 KMNIST는 빠른 프로토타이핑과 교육 목적을 위한 귀중한 도구로 계속 사용되고 있습니다.