Kuzushiji-MNIST(KMNIST)は、手書き日本語のひらがな文字の28x28ピクセルのグレースケール画像70,000枚からなるデータセットである。これは、手書き数字を含む古典的なMNISTデータセットよりも難しい代替として作成された。KMNISTは、機械学習ベンチマークにおいてMNISTのドロップイン置換として設計されており、研究者が類似した構造を持つが、ひらがなの筆記体の性質により視覚的複雑性が高いタスクでモデルをテストできるようにする。
このデータセットは、2018年に東京大学の研究者チーム(Tarin Clanuwat、Mikel Bober-Irizar、Asanobu Kitamoto、Alex Lambを含む)によって紹介された。これは、古典的な日本文学の140,000枚以上の画像を含むKuzushijiデータセットから派生したものである。KMNISTサブセットは、10種類のひらがな文字に焦点を当てており、各文字は7,000枚の画像(トレーニング用6,000枚、テスト用1,000枚)で表され、MNISTの正確な分割を反映している。
データセット構造
KMNISTはMNISTと同じ形式に従う:各画像は28x28ピクセルのグレースケール配列で、ピクセル値は0から255の範囲である。データセットは、60,000枚のトレーニング画像と10,000枚のテスト画像に分割される。含まれる10文字は、'o'、'ki'、'su'、'tsu'、'na'、'ha'、'ma'、'ya'、're'、'wo'である。これらの文字は、元のKuzushijiデータセットで最も一般的であり、バランスの取れた分類課題を提供するため選ばれた。
作成者は意図的にMNISTの数字と同じ文字を避け、KMNISTで訓練されたモデルが数字認識から学習した特徴を単純に転移できないようにした。ひらがな文字はより複雑な筆運びパターンと曲線を持ち、伝統的な機械学習モデルにとってタスクを難しくしている。
ベンチマークとパフォーマンス
KMNISTはMachine learningコミュニティ、特にNeural networkアーキテクチャの評価において標準的なベンチマークとなっている。元のMNISTでは、多くのモデルが99%以上の精度を達成するが、KMNISTは著しく難しい。例えば、単純なResidual Network (ResNet)はMNISTで約99%を達成するかもしれないが、KMNISTでは約95%にとどまる。これにより、KMNISTは単純なタスクでよく機能するモデルと複雑なパターンに一般化するモデルを区別するのに役立つ。
研究者は、Data Augmentation、Dropout、Batch Normalizationなど、さまざまな技術をテストするためにKMNISTを使用してきた。このデータセットは、PyTorchやTensorFlowなどの一般的な機械学習ライブラリにも含まれており、既存のパイプラインへの統合を容易にしている。
関連データセット
KMNISTは、Fashion-MNIST(衣料品)やEMNIST(文字と数字)を含むMNIST様データセットのファミリーの一部である。これらのデータセットは同じ画像形式と分割を共有し、異なるドメイン間でのモデルパフォーマンスの直接比較を可能にする。KMNISTは非ラテン文字に焦点を当てている点で独自であり、他のデータセットにはない文化的・言語的課題を提供する。
KMNISTの基となる元のKuzushijiデータセットには4,000以上の異なる文字が含まれ、歴史的文書解析に使用される。KMNISTはこれを10クラスの問題に簡略化し、教育目的や迅速な実験にアクセスしやすくしている。
応用と影響
KMNISTはDeep learningの研究と教育で広く採用されている。これは、MNISTよりも洗練されたアーキテクチャを必要とするため、Convolutional neural network設計を教える入門コースでよく使用される。このデータセットは、MNISTで事前訓練されたモデルをKMNISTで微調整するTransfer learningやドメイン適応の研究にも使用されてきた。
ベンチマークに加えて、KMNISTは日本の文化遺産の保存と研究に貢献してきた。古典的なひらがな文字を機械可読形式でアクセス可能にすることで、歴史的文書の自動解析を可能にし、これは歴史家や言語学者にとって価値がある。
制限と将来の方向性
その有用性にもかかわらず、KMNISTには制限がある。10文字は完全なひらがな音節文字のごく一部に過ぎず、画像はMNISTの形式に合わせて前処理され、元の筆運び情報の一部が失われる可能性がある。さらに、データセットは現代の大規模データセットと比較して比較的小さく、非常に深いモデルの訓練には限界がある。
将来の研究では、KMNISTをより多くの文字を含むように拡張したり、異なる前処理を施した変種を作成したりすることが含まれるかもしれない。2025年時点で、KMNISTは標準的なベンチマークであり続けているが、研究者は最先端モデルの評価にCIFAR-10やImageNetなどのより複雑なデータセットにますます目を向けている。それでもなお、KMNISTは迅速なプロトタイピングや教育目的の貴重なツールとして機能し続けている。