英語からの翻訳

MNISTデータベースは、手書き数字画像7万枚の大規模なコレクションであり、機械学習や画像処理システムのトレーニングとテストに広く使用されています。これはNISTの元のデータセットからサンプルを再混合して作成され、この分野の基礎的なベンチマークとなっています。

MNISTデータベース(Modified National Institute of Standards and Technology database)は、手書き数字の大規模なデータベースであり、さまざまな画像処理システムのトレーニングによく使用されます。また、機械学習の分野におけるトレーニングとテストにも広く利用されています。このデータベースは、NISTの元のデータセットのサンプルを「再混合」して作成されました。作成者らは、元のトレーニングデータセット(アメリカ国勢調査局の職員から取得)とテストデータセット(アメリカの高校生から取得)が、機械学習の実験には適していないと感じたためです。NISTの白黒画像は、28x28ピクセルの境界ボックスに収まるように正規化され、アンチエイリアス処理が施されました。これにより、グレースケールの階調が導入されました。

MNISTデータベースには、60,000枚のトレーニング画像と10,000枚のテスト画像が含まれています。トレーニングセットの半分とテストセットの半分はNISTのトレーニングデータセットから、残りの半分はそれぞれNISTのテストデータセットから取得されました。元の作成者らは、このデータセットでテストされた方法のリストを維持しています。彼らの元の論文では、サポートベクターマシンを使用して0.8%のエラー率を達成しました。元のMNISTデータセットには、少なくとも4つの誤ったラベルが含まれています。

歴史

USPSデータベース

1988年、米国郵政公社のデータセットが構築されました。これは、ニューヨーク州バッファローの郵便局を通過する米国郵便物に記載された手書きの郵便番号からデジタル化された、16×16のグレースケール画像で構成されていました。トレーニングセットには7,291枚、テストセットには2,007枚、合計9,298枚の画像が含まれていました。両方のセットには、曖昧で分類不能なデータや誤分類されたデータが含まれていました。このデータセットは、1989年のLeNetのトレーニングとベンチマークに使用されました。このタスクは困難であり、テストセットでは2人の人間が平均2.5%のエラー率を示しました。

特別データベース

1980年代後半、国勢調査局は手書きの国勢調査フォームの自動デジタル化に関心を持ち、NISTの画像認識グループ(IRG)にOCRシステムの評価を依頼しました。数年にわたる作業の結果、いくつかの「特別データベース」とベンチマークが作成されました。MNISTにとって特に重要なのは、1990年5月にリリースされた特別データベース1(SD-1)、1992年2月にリリースされた特別データベース3(SD-3)、および1992年4月にリリースされた特別データベース7(SD-7、別名NISTテストデータ1、TD-1)です。これらはISO-9660 CD-ROMでリリースされました。データは、人々に「手書きサンプルフォーム」(HSF)に記入してもらい、そのフォームをデジタル化して英数字文字を切り出すことで取得されました。各筆記者は1枚のHSFを作成しました。

各HSFには、名前と日付の記入欄、市区町村欄、28の数字欄、1つの大文字欄、1つの小文字欄、および制約のない憲法の文章の欄など、複数の入力フィールドが含まれていました。各HSFは、300ドット/インチ(11.8ドット/ミリメートル)の解像度でスキャンされました。

SD-1とSD-3は、1990年の米国国勢調査の一環として、3,400人の常設国勢調査員のうち2,100人によって作成された同じHSFのセットから構築されました。SD-1には、セグメント化されたデータ入力フィールドが含まれていましたが、セグメント化された英数字は含まれていませんでした。SD-3には、セグメント化された英数字からデジタル化されたバイナリ128×128画像が含まれており、223,125の数字、44,951の大文字、および45,313の小文字が含まれていました。

SD-7(またはTD-1)はテストセットであり、メリーランド州ベセスダの高校生500人によって書かれた58,646枚のバイナリ128×128画像で構成されていました。これは「高校の授業中の短い演習として」書かれたものと説明されています。各画像には、筆記者の身元を示す一意の整数IDが付随していました。SD-7はラベルなしでCD-ROMでリリースされ、ラベルは後日フロッピーディスクでリリースされました。HSFは含まれていませんでした。SD-7の人間のエラー率は1.5%でした。

SD-3はSD-7よりもはるかにクリーンで認識が容易でした。ヨーロッパ式の7の書き方(横棒付き)は、SD-7ではSD-3よりもはるかに多く見られました。SD-3はSD-7よりも意欲的な人々によって作成された可能性があり、SD-3用の文字セグメンター(古い設計)は失敗することが多く、その結果、より困難なインスタンスが除外されたと考えられました。SD-3でトレーニングおよび検証された機械学習システムは、SD-7でテストすると、エラー率が1%未満から約10%へと大幅に低下しました。

1992年、NISTと国勢調査局は、最先端技術を競うコンテストと会議を後援しました。チームには、3月23日までにSD-3をトレーニングセットとして、4月13日までにSD-7をテストセットとして使用することが求められ、4月27日までにSD-7を分類するシステムを提出することになりました。7か国から26の企業が参加し、合計45のアルゴリズムが提出されました。5月27日と28日に、メリーランド州ゲイサーズバーグで第1回国勢調査OCRシステム会議が開催され、FBI、IRS、USPSのオブザーバーも参加しました。優勝エントリーはSD-3をトレーニングに使用せず、はるかに大規模な独自のトレーニングセットを使用して、分布のずれを回避しました。SD-3を使用した25のエントリーの中で、勝者はユークリッド変換に対して不変な手作りのメトリックを使用した最近傍分類器でした。

SD-19は1995年に、SD-1、SD-3、SD-7、および追加データをまとめたものとして公開されました。これには、814,255枚のバイナリ英数字画像と、SD-7の生成に使用された500枚のHSFを含む4,169枚のHSFのバイナリ画像が含まれていました。2016年に更新されました。

MNISTの構築

MNISTは、1994年の夏より前に、SD-3とSD-7の128x128バイナリ画像を混合して構築されました。具体的には、作成者らはまずSD-7のすべての画像を取得し、それぞれ250人の筆記者からの画像で構成されるトレーニングセットとテストセットに分割しました。その結果、各セットには約30,000枚の画像が含まれることになりました。次に、各セットが正確に60,000枚の画像を含むまで、SD-3の画像を追加しました。

各画像は、アスペクト比を維持しながら20x20ピクセルのボックスに収まるようにサイズ正規化され、アンチエイリアス処理されてグレースケールに変換されました。次に、ピクセルの重心が画像の中心に来るように平行移動され、28x28の画像に配置されました。ダウンサンプリング手順の詳細は、後に再構築されました。

トレーニングセットとテストセットは、もともとそれぞれ60,000サンプルでしたが、テストセットの50,000サンプルは破棄され、インデックス24,476から34,475までのサンプルのみが残され、テストセットはわずか10,000サンプルになりました。

さらなるバージョン

2019年には、MNISTの完全な60,000テストセットが復元され、QMNISTが構築されました。QMNISTには、トレーニングセットに60,000枚、テストセットに60,000枚の画像が含まれています。

拡張MNIST(EMNIST)は、MNISTの後継としてNISTによって開発およびリリースされた新しいデータセットで、2017年にリリースされました。MNISTが手書き数字のみを含んでいたのに対し、EMNISTはSD-19のすべての画像(文字と数字を含む)から構築され、深層学習および人工知能研究のための、より困難なベンチマークを提供します。

遺産

MNISTは、機械学習の教育と研究における基本的なベンチマークとなっており、新しいアルゴリズムやアーキテクチャの最初のテストとしてよく使用されます。その単純さとサイズの小ささは、ニューラルネットワークのトレーニングと評価の概念を教えるのに理想的です。このデータセットの広範な採用は、その後のベンチマークの開発に影響を与え、深層学習生成AIを含む分野の成長に貢献しました。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·machine-learning·computer-vision·benchmark
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴