MNISTデータセットの公開

英語からの翻訳

MNISTデータセットは、手書き数字画像70,000枚からなる広く使用されるベンチマークであり、NISTデータセットを再構成して作成され、画像認識における機械学習モデルのトレーニング用に1998年に公開された。

MNISTデータベース(Modified National Institute of Standards and Technology database)は、手書き数字画像の大規模なコレクションであり、画像処理や機械学習システムの訓練とテストに一般的に使用される。元のNISTデータセットからのサンプルを再混合して作成され、アメリカ国勢調査局職員由来の訓練データと、アメリカの高校生由来のテストデータというNISTの訓練データの限界に対処するよう設計されており、機械学習実験には不適切であった。白黒画像は28x28ピクセルの境界ボックスに正規化され、アンチエイリアス処理が施されてグレースケール階調が導入された。

MNISTには60,000枚の訓練画像と10,000枚のテスト画像が含まれ、各セットの半分はNISTの訓練データから、残り半分はテストデータから抽出されている。作成者らはデータセットでテストされた手法のリストを維持しており、元の論文ではサポートベクターマシンを用いて0.8%のエラー率を報告した。元のMNISTデータセットには少なくとも4つの誤ったラベルが含まれており、これはよく知られた特徴である。

前身と起源

MNIST以前には、USPSデータベース(1988年)が、米国郵便物の手書き郵便番号から得られたより小規模な数字データセットを提供していた。これには16x16のグレースケール画像が含まれ、7,291枚の訓練画像と2,007枚のテスト画像、合計9,298枚があった。このデータセットには曖昧で誤分類されたサンプルが含まれており、人間のエラー率は平均2.5%と困難なものであった。これは1989年の初期のLeNetアーキテクチャの訓練に使用された。

1980年代後半、国勢調査局は手書きフォームのデジタル化を自動化しようとし、NISTの画像認識グループにOCRシステムの評価を依頼した。その作業により、SD-1(1990年)、SD-3(1992年)、SD-7(1992年)といういくつかの特別データベースが生み出された。これらは手書きサンプルフォーム(HSF)から構築され、300 dpiでスキャンされ、名前、数字、文字のための様々なフィールドがあった。SD-3には、223,125桁を含むセグメント化された英数字の128x128バイナリ画像が含まれ、国勢調査職員から派生したものであった。テストセットであるSD-7には、500人の高校生からの58,646枚の画像があり、人間のエラー率は1.5%であった。特に、SD-3はよりクリーンで容易であったが、SD-3で訓練された機械学習システムはSD-7で約-10%のエラーへの性能低下が見られ、分布シフトが浮き彫りになった。

1992年のNISTコンペティションでは、SD-3を訓練データ、SD-7をテストセットとして使用し、26社から45のアルゴリズムが参加した。優勝エントリーは独自の訓練セットを使用し、SD-3で訓練されたシステムの中で最良のものは、不変計量を持つ最近傍分類器であった。SD-19(1995年)はいくつかの特別データベースを組み合わせ、814,255枚の画像を含んでいた。

MNISTの作成

1994年夏より前のある時点で、MNISTはSD-3とSD-7から構築された。作成者らはSD-7の画像を訓練セットとテストセットに分割し、各セットは250人の筆記者から得られ、ほぼ30,000枚の画像となった。その後、各セットにSD-3の画像を追加して、セットあたり60,000サンプルに達するようにした。すべての画像は、アスペクト比を維持した20x20ピクセルのボックスにサイズ正規化され、グレースケールにアンチエイリアス処理され、その後、重心に合わせて調整することで28x28画像の中央に配置された。ダウンサンプリングの詳細は後に再構築された。

当初、訓練セットとテストセットの両方が60,000サンプルであったが、テストセットのサイズを減らすために50,000サンプルが破棄され、インデックス24476から34475のみが保持され、10,000枚のテスト画像となった。

評価と影響

MNISTはMachine learningおよびDeep learning研究における標準的なベースラインとなった。単純な線形モデルから複雑なNeural networkモデルまで、アルゴリズムを比較するために広く使用されている。このデータセットの小さな画像サイズと適度なクラス数は、プロトタイピングに理想的である。その公開性と明確なベンチマークにより、一般的な教育ツールとなっている。

遺産と後継

Extended MNIST(EMNIST)は、NISTによって開発された新しいデータセットで、2017年にMNISTの後継としてリリースされた。手書きの数字と文字を含み、より広範なカテゴリを持つ。2019年には、MNISTの完全な60,000テストセットが復元されてQMNISTが作成され、研究のためにより大きなテストセットを提供した。これらの派生データセットは、MNISTの構造を維持しつつ、その多様性を拡大している。

関連項目

参考文献

  • Yann LeCunらによる元のMNIST論文、1998年(ソース事実に記載)。
  • NIST特別データベースの出版物およびOCRベンチマークレポート。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning-dataset·handwritten-digits·benchmark·deep-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴