Fashion-MNISTは、機械学習と深層学習の分野で広く使用されるベンチマークデータセットである。70,000枚のファッション製品のグレースケール画像で構成され、各画像は28×28ピクセルであり、60,000枚のトレーニング画像と10,000枚のテスト画像に分割されている。このデータセットは、2017年にZalando Researchによって作成され、手書き数字の元のMNISTデータセットが非常に高い分類精度で飽和状態になっていたことから、より挑戦的で現実的な代替手段として提供された。Fashion-MNISTは、ニューラルネットワークモデルが10の異なる衣料品カテゴリを区別する能力をテストするように設計されており、画像分類アルゴリズムを評価するための標準的なツールとなっている。
データセットの10クラスは、Tシャツ/トップス、ズボン、プルオーバー、ドレス、コート、サンダル、シャツ、スニーカー、バッグ、アンクルブーツである。各画像は、中央に配置された低解像度のグレースケール写真であり、MNISTのクリーンで中央に配置された数字よりも、実際の状況をより密接に反映する背景ノイズをいくつか含んでいる。画像が小さくデータセットのサイズが中程度であるため、Fashion-MNISTは計算コストが低くトレーニング可能であるが、さまざまなアーキテクチャとハイパーパラメータを持つモデルを区別するのに十分に難しい問題を提起する。
歴史と動機
Fashion-MNISTは、ドイツのファッションEコマース企業Zalandoの機械学習部門であるZalando Researchの研究者であるHan Xiao、Kashif Rasul、Roland Vollgrafによる2017年の論文で紹介された。主な動機は、1998年にYann LeCun、Corinna Cortes、Christopher Burgesによってリリースされた元のMNISTデータセットが、現代の分類器にとって簡単すぎるものになっていたという観察であった。多くのモデルが99%以上の精度を達成し、アルゴリズム設計における意味のある改善を識別することが困難になっていた。著者らは、MNISTと同じ形式と複雑さ(28×28のグレースケール画像、10クラス、同じトレイン/テスト分割)を維持しながら、より挑戦的な視覚認識タスクを持つデータセットを作成することを目指した。
画像はZalandoのカタログから取得され、製品写真はグレースケールに変換され、リサイズされ、アイテムを中央に配置するためにトリミングされた。データセットはMITライセンスの下でリリースされ、学術および商業アプリケーションでの自由な使用が許可されている。リリース以来、Fashion-MNISTは機械学習研究で最も引用されるデータセットの1つとなり、畳み込みニューラルネットワーク、サポートベクターマシン、その他の分類器をベンチマークするために何千もの論文で使用されている。
データセットの特性
Fashion-MNISTの各画像は28×28ピクセルの配列であり、ピクセル値は0(黒)から255(白)の範囲である。画像は元のMNISTと同一の形式で保存されており、既存のコードベースで一方のデータセットをもう一方に簡単に交換できる。トレーニングセットにはクラスごとに6,000枚の画像が含まれ、テストセットにはクラスごとに1,000枚の画像が含まれており、10カテゴリすべてにわたってバランスの取れた表現が保証されている。
注目すべき特徴は、クラス内変動の存在である。たとえば、「シャツ」クラスには半袖と長袖のシャツの両方が含まれ、「バッグ」クラスにはハンドバッグ、バックパック、クラッチが含まれる。この変動性により、モデルは単純なピクセルパターンに依存するのではなく、より堅牢な特徴を学習する必要がある。さらに、プルオーバー、コート、シャツなど、一部のクラスは互いに視覚的に類似しており、MNISTの明確な数字形状と比較して分類タスクの難易度が高まっている。
機械学習研究での使用
Fashion-MNISTは、新しいニューラルネットワークアーキテクチャ、最適化手法、正則化手法を評価するためのベースラインデータセットとして一般的に使用されている。データセットは単一のGPUで数分でトレーニングできるほど小さいため、研究者は迅速に反復できる。また、深層学習の概念を教える教育現場でも頻繁に使用されており、手書き数字よりも興味深い視覚タスクを提供しながら、学生にとって管理しやすいものとなっている。
Fashion-MNISTの典型的なベンチマーク結果では、適切に調整された畳み込みニューラルネットワークが約93〜95%の精度を達成できるのに対し、単純なロジスティック回帰モデルは約85%に達する。このギャップは、このタスクに対する深層学習アプローチの利点を強調している。このデータセットは、転移学習、データ拡張戦略、敵対的堅牢性のテストにも使用されており、その画像はMNISTよりも複雑であるが、制御された実験には十分に単純である。
元のMNISTとの比較
元のMNISTデータセットは、米国国勢調査局の従業員と高校生から収集された0から9の手書き数字で構成されている。MNISTはほぼ解決されており、多くのモデルが99.5%以上の精度を達成している一方、Fashion-MNISTは通常96〜97%程度の最高精度が見られ、改善の余地が残されている。ファッション画像にはエッジの複雑さとテクスチャの変動も多く含まれており、Eコマースでの製品認識などの実世界のコンピュータビジョンタスクのより良い代理となっている。
もう1つの違いはデータのソースである。MNISTの数字は手書きでスキャンされたが、Fashion-MNISTの画像はプロの製品写真から派生しており、照明の変動や背景要素が含まれている。これにより、Fashion-MNISTは実用的なアプリケーションをよりよく代表しているが、視覚化と処理が容易な同じ低解像度と単純な形式を保持している。
制限と拡張
その人気にもかかわらず、Fashion-MNISTには制限がある。28×28の解像度は細かい分類には低すぎ、グレースケール形式は実世界のファッション認識に役立つ可能性のある色情報を破棄している。一部の研究者は、このデータセットがCIFAR-10やImageNetなどの現代のベンチマークと比較して簡単すぎると批判している。これらのベンチマークには、より高い解像度とより多くのクラスを持つ自然画像が含まれる。それでも、Fashion-MNISTは迅速なプロトタイピングと教育目的のための貴重なツールであり続けている。
データセットの拡張には、ノイズ、回転、敵対的摂動を追加したFashion-MNISTの変種が含まれ、モデルの堅牢性をテストするために使用される。一部の研究では、Fashion-MNISTを他のデータセットと組み合わせてマルチタスク学習ベンチマークを作成している。データセットの単純さと明確なラベル付けにより、人工知能の新しいアイデアをより複雑なデータセットにスケーリングする前に探索する研究者にとって信頼できる出発点となっている。
影響と遺産
Fashion-MNISTは、おもちゃの問題と実世界のアプリケーションの間のギャップを埋める標準化されたアクセス可能なベンチマークを提供することで、機械学習コミュニティに大きな影響を与えてきた。TensorFlow、PyTorch、Kerasなどの主要な深層学習ライブラリに統合されており、ユーザーは1行のコードでデータセットを読み込むことができる。その広範な採用により、入門コンピュータビジョンコースや、新しく提案されたモデルのパフォーマンスを比較するための事実上の標準となっている。
データセットの作成者はまた、データの読み込みと視覚化のためのコードを含む詳細な技術レポートとGitHubリポジトリを提供し、急速な採用を促進した。2020年代初頭の時点で、Fashion-MNISTは毎年何百もの研究論文で引用され続けており、低解像度領域で画像分類アルゴリズムを開発する人にとって推奨されるベンチマークであり続けている。