SUN397は、シーン認識のための大規模データセットであり、2010年にMITコンピュータ科学・人工知能研究所とプリンストン大学の研究者によって導入された。108,754枚の画像が397の異なるシーンカテゴリにわたって分布しており、寝室、スキーリゾート、図書館など、画像が描く環境の種類によって画像を分類するアルゴリズムを評価するための最も包括的なリソースの1つとなっている。このデータセットは、オブジェクト中心のタスクを超えてシーン理解の限界を押し広げるように設計されており、画像の全体的な文脈を強調している。
このデータセットは階層的に構成されており、カテゴリは屋内、屋外自然、屋外人工物などのより広いクラスにグループ化されている。各カテゴリには少なくとも100枚の画像が含まれており、トレーニングとテストに十分なサンプルが確保されている。画像はFlickrやその他のオンラインリポジトリを含む公開コレクションから取得され、関連性と品質を確保するために手動でキュレーションされている。SUN397は、画像のサブセットに対する属性注釈とオブジェクト注釈も含むSUNベンチマークと併せて一般的に使用される。
構築と注釈
SUN397の作成には、多様性とカバレッジを確保するための厳格なプロセスが関与していた。研究者らはまず、辞書や既存のデータセットを含むさまざまなソースからシーンカテゴリのリストをまとめ、それを397カテゴリに拡張した。画像はウェブ検索とユーザー投稿を通じて収集され、重複や無関係なコンテンツを除去するためにフィルタリングされた。各画像は、割り当てられたカテゴリに属することを手動で検証された。データセットはトレーニングセットとテストセットに分割され、カテゴリごとにトレーニング用に50枚、テスト用に50枚を使用する標準プロトコルが採用されているが、他の分割も使用される。
シーン認識研究における役割
SUN397は、コンピュータビジョンと機械学習における標準的なベンチマークとなっている。これは、畳み込みニューラルネットワークやその他の深層学習モデルを評価するために頻繁に使用される。このデータセットは、異なるタイプのキッチンや図書館など、視覚的に類似したシーンを区別し、多様な照明、視点、遮蔽にわたって一般化することをアルゴリズムに挑戦させる。多くの最先端モデルは、SUN397でのパフォーマンスを主要な指標として報告しており、テストセットで90%を超える精度を達成することが多い。
他のデータセットとの比較
SUN397は、Places365やImageNetなどの他の人気データセットを補完する。ImageNetがオブジェクト分類に焦点を当てているのに対し、SUN397はシーンレベルの理解を強調している。後に導入されたPlaces365は、365カテゴリを持つより大規模なシーンデータセットであるが、SUN397は、そのより細かいカテゴリと初期のシーン認識研究における役割により、依然として価値がある。このデータセットには、属性ラベルを持つサブセットも含まれており、シーン属性予測などのタスクを可能にしている。
影響と遺産
SUN397の導入は、シーン認識における大きな進歩を促進し、文脈とレイアウトを理解するモデルの開発に貢献した。これは、自動運転からコンテンツベースの画像検索に至るまでのアプリケーションで使用されてきた。このデータセットは研究目的で公開されており、学術文献で広く引用されている。その階層構造と明確な評価プロトコルにより、2025年時点でも現代の研究で参照され続ける永続的なリソースとなっている。