SVHN(Street View House Numbers)データセットは、Googleストリートビューの車両によって撮影された住所番号から派生した数字画像のコレクションです。2011年にGoogleの研究者(Yuval Netzer、Tao Wang、Adam Coates、Alessandro Bissacco、Bo Wu、Andrew Y. Ngを含む)によって、手書き数字認識のための古典的なMNISTデータセットに対する、より困難で現実的な代替手段として導入されました。SVHNには60万枚以上のラベル付き数字画像が含まれており、各画像はより大きな街頭写真から切り取られています。このデータセットは、数字が歪んだり、部分的に遮蔽されたり、他のテキストや物体に囲まれたりする可能性がある、自然で雑然としたシーンにおける数字認識アルゴリズムをテストするように設計されています。これはMachine learningおよびDeep learning研究における標準的なベンチマークとなり、数字分類、物体検出、シーケンス認識などのタスクに使用されています。
データセットは3つの部分に分かれています:73,257枚の画像からなるトレーニングセット、26,032枚の画像からなるテストセット、およびトレーニングに使用できる531,131枚の「追加」画像のセットです。各画像は32x32ピクセルのカラー(RGB)画像で、単一の数字に中心が合わせられていますが、隣接する数字の一部や他の視覚的ノイズが含まれることがよくあります。ラベルは実際の数字の値(0〜9)です。SVHNはその実世界由来の性質で注目に値します:画像は実際の住所番号プレートから来ており、多種多様なフォント、色、背景、照明条件を示しています。これにより、合成データセットよりも現実的なテストベッドとなり、Neural networkアーキテクチャ、データ拡張技術、転移学習アプローチの堅牢性を評価するために使用されてきました。
データセットの特性と課題
MNISTでは数字がきれいに書かれ中央に配置されているのに対し、SVHN画像にはかなりの視覚的雑然さが含まれています。単一の数字は、標識柱、窓、または別の数字によって部分的に遮蔽されることがあります。数字自体は回転、傾斜、または厚さの変化がある場合があります。背景にはレンガの壁、ドア、葉、または他の建築要素が含まれることがあります。これらの要因により、SVHNはより困難な分類タスクとなり、人間レベルのパフォーマンスは約98%の精度と推定され、最先端のDeep learningモデルはテストセットで99%以上の精度を達成しています。データセットには各画像の「数字構造」注釈も含まれており、元の完全な画像内のすべての数字の境界ボックスを指定しているため、数字の位置特定や複数桁認識などのタスクが可能になります。
「追加」セットは、ラベルなし(または弱いラベル付き)データの大きなプールを提供するため、半教師あり学習実験に特に役立ちます。多くの研究論文が、データ拡張(例:ランダムクロッピング、回転、カラージッター)、バッチ正規化、残差接続などの技術の有効性を実証するためにSVHNを使用しています。このデータセットは、画像サイズが比較的小さく複雑さが中程度であるため、Generative AIモデルなどの生成モデルのベンチマークにも一般的に選択されています。
研究における応用
SVHNは学術および産業研究で広く使用されています。これは画像分類アルゴリズムの標準的なテストベッドとして機能し、比較研究ではMNISTやCIFAR-10と組み合わせて使用されることがよくあります。2010年代初頭には、深層畳み込みニューラルネットワーク(CNN)の力を実証するための重要なデータセットでした。例えば、2012年には、Stanford AI Labや他の機関の研究者がSVHNを使用して、深層CNNが従来の手作り特徴法よりも優れていることを示しました。このデータセットは、合成データ(例:MNIST)でトレーニングされたモデルが実世界データ(例:SVHN)に適応されるドメイン適応の研究にも使用されています。
分類以外にも、SVHNは物体検出タスクに使用されており、目標は完全なストリートビュー画像内のすべての数字を位置特定して認識することです。完全な画像(切り取られた数字だけでなく)が利用可能であり、境界ボックス注釈により検出モデルのトレーニングが可能になります。これは、TomTomやWaymoなどのナビゲーションシステムやマッピングサービスに関連する自動住所認識に応用されています。このデータセットは、その自然な複雑さが敵対的攻撃の困難なターゲットとなるため、敵対的堅牢性の研究にも使用されています。
他のデータセットとの比較
SVHNは、70,000枚の手書き数字(28x28グレースケール)で構成されるMNISTとよく比較されます。MNISTは「解決済み」と見なされていますが(モデルが99.7%以上の精度を達成)、SVHNはより困難なベンチマークのままです。主な違いは次のとおりです:(1)SVHN画像はカラーでより大きい(32x32)、(2)背景の雑然さが含まれる、(3)数字が歪んだり部分的に遮蔽されたりする可能性がある、(4)ラベル分布がよりバランスが取れている(MNISTにはわずかな不均衡がある)。SVHNはCIFAR-10データセットにも似ていますが、CIFAR-10には数字ではなく一般的な物体(飛行機、車、動物)が含まれています。実世界シナリオでの数字認識に興味がある研究者にとって、SVHNは事実上の標準です。
このデータセットは、街頭画像から住所番号を読み取るなどの自動文書処理のためのArtificial intelligenceシステムの開発にも使用されています。Google DeepMindやOpenAIなどの企業は研究でSVHNを使用していますが、これはより一般的には学術研究所と関連付けられています。データセットは自由にダウンロードでき、その人気により多くの機械学習ライブラリやチュートリアルに含まれるようになりました。
将来の方向性と限界
SVHNは貴重なリソースですが、限界があります。画像は比較的低解像度(32x32)であり、細かい詳細を捉えられない場合があります。データセットは数字に限定されているため、文字や他の文字はカバーしていません。研究者は、クロッピングなしの元の完全な画像を含む「SVHN full」データセットなどの拡張を作成しています。2020年代半ばの時点で、SVHNは依然として広く使用されていますが、Googleの「Street View Text」やさまざまなシーンテキストデータセットなどの新しいデータセットが、より複雑なタスクのために登場しています。それでも、SVHNはComputer visionとDeep learningについて学ぶ学生や研究者にとって標準的な入門点のままです。その単純さと実世界の複雑さの組み合わせは、新しいアルゴリズムのプロトタイピングや教育目的に理想的なデータセットです。