SVHN Croppedは、機械学習と深層学習において広く使用されるベンチマークデータセットであり、Google Street Viewの画像における住宅番号から抽出された60万枚以上の切り出し済み数字画像で構成されています。各画像は32x32ピクセルのカラーパッチで、単一の数字(0-9)に中心が合わせられており、数字分類、ニューラルネットワークのトレーニング、データ拡張の研究などのタスクに適しています。このデータセットは、2011年にスタンフォードAIラボとGoogleの研究者によって、地図サービス向けの住宅番号の自動読み取りを改善することを目的としたStreet View House Numbers(SVHN)プロジェクトの一環として導入されました。
SVHN CroppedセットはMNISTとよく比較されますが、その自然画像の特性により、より困難であると考えられています。数字は、さまざまな背景、照明条件、歪み、および端に時折現れる邪魔な数字とともに表示されます。完全なデータセットは、73,257枚のトレーニング画像、26,032枚のテスト画像、およびトレーニングセットを拡張するために使用できる追加の531,131枚の追加トレーニングサンプルに分割されています。ラベルは中央の数字に対応し、画像はPNG形式で提供され、数字のバウンディングボックスメタデータも含まれています。
データセットの構造と形式
SVHN Croppedデータセットは、train.tar.gz、test.tar.gz、extra.tar.gzの3つの主要ファイルに編成されています。各アーカイブには、一意の識別子で名前が付けられた個々のPNG画像と、各数字のバウンディングボックス座標とラベルを格納するdigitStruct.matファイル(MATLAB形式)が含まれています。切り出し版では、画像はすでに対象の数字に中心が合わせられていますが、メタデータには元のバウンディングボックスが含まれており、オブジェクトの位置特定やデータセットのバリアント作成などのタスクに役立ちます。
各画像は32x32ピクセルで、3つのカラーチャネル(RGB)を持ち、これはグレースケールの28x28 MNIST画像とは対照的です。サイズが大きく、色情報があるため、視覚的な複雑さが増し、SVHN Croppedは畳み込みアーキテクチャや残差ネットワーク設計をテストするための好ましい選択肢となっています。このデータセットは研究目的で公開されており、公式のSVHNウェブサイトまたはTensorFlowやPyTorchなどの一般的な機械学習ライブラリ(組み込みのローダーを含む)からダウンロードできます。
機械学習における応用
SVHN Croppedは主に数字分類タスクに使用され、新しいモデルや技術を評価するための標準的なベンチマークとして機能します。これは、畳み込みニューラルネットワーク(CNN)、ResNet、および最近のトランスフォーマーベースのビジョンモデルを含むさまざまなアーキテクチャのパフォーマンスを比較するために、多くの研究で使用されてきました。データセットの自然画像の多様性は、住宅番号、ナンバープレート、または写真内の数字シーケンスを読み取るなどの実世界のOCR(光学文字認識)タスクの良い代理となります。
分類に加えて、SVHN Croppedは、モデルが最初に簡単なサンプルでトレーニングされるカリキュラム学習実験や、ランダムクロッピング、回転、カラージッターなどのデータ拡張戦略のテストに使用されています。また、バッチ正規化、ドロップアウト、その他の正則化技術、およびモデルプルーニングや知識蒸留研究のテストベッドとしても機能します。531,131枚の追加セットは、小さなラベル付きサブセットが大きなラベルなしプールとともに使用される半教師あり学習シナリオをシミュレートするためによく使用されます。
他のデータセットとの比較
SVHN Croppedは、MNISTやCIFAR-10と頻繁に比較されます。クリーンで中央に配置されたグレースケールの数字を含むMNISTとは異なり、SVHN Croppedの数字はカラーで、スケールや向きがさまざまで、背景のノイズが含まれています。これにより、SVHN Croppedは実世界の条件をよりよく表し、モデルが高い精度を達成するのが難しくなっています。たとえば、単純なCNNはMNISTで99%以上の精度を達成するかもしれませんが、SVHN Croppedでは、広範なチューニングや拡張なしでは約95〜97%しか達成できない場合があります。
10のオブジェクトクラスにわたる60,000枚の32x32カラー画像を含むCIFAR-10と比較すると、SVHN Croppedはより多くのトレーニングデータ(60万枚以上)と、より焦点を絞ったタスク(数字認識)を提供します。データセットのサイズが大きいため、過学習なしでより深いネットワークをトレーニングするのに役立ちます。研究者は、MNISTの単純さとImageNetの複雑さの中間としてSVHN Croppedを使用することが多く、モデルパフォーマンスの迅速かつ有意義な評価を提供します。
影響と遺産
SVHN Croppedの導入は、研究コミュニティに挑戦的でありながらアクセスしやすいデータセットを提供することで、深層学習の進歩に貢献しました。これは何千もの論文で引用され、多くの機械学習コースやチュートリアルの標準的なコンポーネントであり続けています。このデータセットはまた、Google Street Viewなどのサービスからの実世界データを使用する価値を強調し、大規模なデータ収集が人工知能の進歩をどのように推進できるかを示しました。
長年にわたり、SVHN Croppedは、Papers with Codeなどのさまざまなベンチマークスイートやリーダーボードに統合され、最先端のパフォーマンスを追跡するために使用され続けています。その影響は、データ拡張技術の開発や、ドメインシフトに対する堅牢性の評価にまで及びます。2020年代初頭の時点で、SVHN Croppedは依然として関連性が高く広く使用されているリソースですが、より複雑なタスクを持つ新しいデータセットが登場しているものの、研究者や実務者にとっての基本的な足がかりとして機能し続けています。