ImageNet-Sketchは、画像分類モデルが異なる視覚領域に対してどの程度うまく汎化するかをテストするために2019年に導入されたベンチマークデータセットである。このデータセットには5万枚のグレースケールスケッチ画像が含まれており、元のImageNetデータセットの1,000クラスそれぞれに対して50枚の画像が含まれている。スケッチは「[クラス名]のスケッチ」といった用語でGoogle画像検索から収集され、意図した対象を描いていることを確認するために手動でフィルタリングされている。自然な写真とは異なり、これらの画像は抽象的な線画であり、多くの場合詳細が最小限であるため、標準的な写真データセットで訓練されたモデルにとって困難なドメインシフトテストとなっている。
このデータセットは、カリフォルニア大学バークレー校の研究者ら(Haohan Wang、Songwei Ge、Zachary Lipton、Eric Xingを含む)によって作成された。これは、「Learning Robust Global Representations by Penalizing Local Predictive Power」というタイトルの論文とともに公開され、2019年の神経情報処理システム会議(NeurIPS)で発表された。主な動機は、分布シフト、特に実世界の画像から抽象的な人間のスケッチへのシフトに対するモデルの堅牢性を評価するための、シンプルかつ効果的なプローブを提供することであった。ImageNet-Sketchはその後、Machine learningおよびDeep learningの分野における標準的な評価セットとなり、ImageNet-CやImageNet-Rなどの他の堅牢性ベンチマークと並んでよく使用されている。
構築と特徴
構築プロセスでは、1,000のImageNetクラスそれぞれについて「[クラス]のスケッチ」というパターンでGoogle画像検索をクエリした。返された画像は、写真や図などのスケッチ以外の画像を除去し、各クラスに少なくとも50枚の有効なスケッチがあることを確認するためにフィルタリングされた。最終的なデータセットには、クラスごとに正確に50枚の画像が含まれ、合計5万枚の画像が含まれる。すべての画像は、Neural network分類器の標準的な入力サイズに一致するように、通常224x224ピクセルの一貫した解像度にリサイズされている。
ImageNet-Sketchの主な特徴は、人間が描いたスケッチに依存していることであり、これは本質的に自然画像よりも抽象的で写実的ではない。これらのスケッチは、色、テクスチャ、細かい詳細を省略することが多く、モデルにグローバルな形状と構造的な手がかりに依存することを強いる。これにより、このデータセットは、モデルが堅牢で汎化可能な特徴を学習したか、それとも自然画像の表面的な統計に過適合したかを研究するのに特に有用である。
堅牢性評価における役割
ImageNet-Sketchは、ドメインシフト下での画像分類器の堅牢性を測定するために広く使用されている。ImageNetで訓練されたモデルは、ImageNet-Sketchで評価された場合、自然画像でのトップ1精度が約70〜80%から、スケッチでは20〜30%に大幅に低下することが多い。この性能ギャップは、多くのDeep learningモデルが分布外入力に直面したときの脆弱性を浮き彫りにしている。
このデータセットは、堅牢性のリーダーボードや研究に頻繁に含まれている。例えば、これはImageNet-CおよびImageNet-Pの破損ベンチマークのコアコンポーネントであるが、合成破損ではなく自然で人間が作成したドメインシフトを表すという点で異なる。研究者らは、ImageNet-Sketchを使用して、Data Augmentation戦略、敵対的訓練、Residual Network (ResNet)バリアントなどのアーキテクチャ変更など、さまざまな堅牢性手法の有効性を評価してきた。また、モデルの内部表現を調査するためにも使用されており、多くのモデルがグローバルな形状ではなくテクスチャや局所的なパターンに大きく依存していることが明らかになっており、スケッチはこれを破壊する。
他のベンチマークとの関係
ImageNet-Sketchは、ImageNet-R(絵画や漫画などの芸術的表現を含む)やImageNet-A(自然に発生する敵対的例を含む)などの他のドメインシフトデータセットを補完する。ImageNet-Rにはさまざまな芸術スタイルの混合が含まれる一方、ImageNet-Sketchは線画に特化しており、形状ベースの認識のよりクリーンなテストを提供する。このデータセットはSketchyデータセットやTU-Berlinスケッチデータセットにも関連しているが、その規模とImageNetクラスとの直接的な整合性において独自である。
Artificial intelligence研究のより広い文脈では、ImageNet-Sketchは現在のモデルの限界を浮き彫りにし、堅牢で汎化可能な学習への関心を高める上で重要な役割を果たしてきた。これは、ドメイン汎化、自己教師あり学習、モデル解釈可能性に関する論文で頻繁に引用されている。2025年現在、これはコンピュータビジョンにおける標準的な評価ツールであり続けており、多くの最先端モデルがこのベンチマークでの性能を報告している。
限界と批判
ImageNet-Sketchの限界の1つは、スケッチがウェブ検索から収集されているため、スタイルや内容にバイアスが導入される可能性があることである。例えば、一部のクラスは他のクラスよりも多様なスケッチスタイルを持つ場合があり、フィルタリングプロセスが純粋なスケッチではない画像を誤って含める可能性がある。さらに、データセットは静的であるため、時間の経過に伴うスケッチスタイルの進化を捉えていない。これらの問題にもかかわらず、そのシンプルさと使いやすさから、研究者に人気のある選択肢となっている。
もう1つの批判は、ImageNet-Sketchでの性能低下が、スケッチが極端な抽象化であるため、現実世界のドメインシフトを完全には反映していない可能性があることである。しかし、この極端さこそが、このデータセットをストレステストに価値あるものにしている。これは、研究者にピクセルパターンの記憶を超え、より抽象的な転移可能な表現を学習する方法の開発を強いる。
研究と産業での使用
学術研究では、ImageNet-Sketchは新しいアーキテクチャと訓練方法をベンチマークするためによく使用される。例えば、ビジョントランスフォーマーや畳み込みネットワークに関する研究では、堅牢性を示すためにこのデータセットでの結果を頻繁に報告している。また、多様なデータでの事前訓練がこのような分布外セットでの性能向上につながると期待される基盤モデルの開発にも使用されている。産業界では、自動運転や医療画像などの画像認識システムに取り組む企業が、モデル汎化のサニティチェックとしてImageNet-Sketchを使用する場合があるが、研究環境でより一般的である。
このデータセットは公開されており、その使用は元のImageNetの利用規約に準拠しており、非営利の研究使用が許可されている。これは何千もの論文で引用されており、この分野で最も影響力のある堅牢性ベンチマークの1つとなっている。2025年現在、特に多様で予測不可能な環境で信頼できるモデルの構築にコミュニティが焦点を当てているため、これは引き続き関連性が高く広く使用されているリソースである。
将来の方向性
今後、研究者らはImageNet-Sketchを3Dスケッチやアニメーション描画などの他のドメインに拡張し、より細かいクラスを持つより挑戦的なバージョンを作成する方法を模索している。また、評価するだけでなく、本質的により堅牢なモデルを訓練するためにこのデータセットを使用することへの関心もある。例えば、形状バイアスを改善するためにスケッチデータを訓練セットに組み込む研究もあり、これにより他のドメインシフトでのより良い汎化につながる可能性がある。このデータセットは、真に堅牢なArtificial intelligenceシステムを実現するための継続的な取り組みにおける基盤であり続けている。