Saliency Maps(顕著性マップ)

英語からの翻訳

サリエンシーマップは、人間の視覚的注意や機械学習モデルの予測にとって最も重要な画像領域を強調するヒートマップであり、コンピュータビジョンや説明可能なAIで使用されます。

コンピュータビジョンにおいて、顕著性マップ(saliency map)とは、人々の目が最初に焦点を合わせる領域、または機械学習モデルにとって最も関連性の高い領域を強調する画像である。顕著性マップの目的は、人間の視覚系またはその他の不透明なMLモデルに対する画素の重要度を反映することである。例えば、風景画像において、人は最初に砦や明るい雲を見るかもしれない。そのため、それらの領域が顕著性マップ上で強調される。顕著性マップは、画像圧縮から説明可能な人工知能まで、モデルの決定の視覚的説明を提供する幅広いアプリケーションで使用されている。

顕著性の概念は、人間の視覚的注意の研究に由来する。V1顕著性仮説によれば、一次視覚野(V1)が顕著性マップに関与していると考えられている。機械学習において、顕著性マップは通常、深層ニューラルネットワーク、特に畳み込みニューラルネットワークやトランスフォーマーに対して生成され、入力のどの部分が出力に最も影響を与えるかを示す。

人間の目のアプリケーション

顕著性マップは、さまざまな問題に応用されている。人間の目の注意については、以下の用途で使用される:

  • 画像およびビデオ圧縮:人間の目は、フレーム内の小さな関心領域のみに焦点を合わせる。したがって、フレーム全体を均一な品質で圧縮する必要はない。顕著性マップを使用することで、同じ視覚的知覚でビデオの最終サイズを削減できる。
  • 画像およびビデオ品質評価:画像またはビデオ品質メトリックの主なタスクは、ユーザーの意見との高い相関である。顕著な領域の差異はより重要視され、品質スコアにより大きく寄与する。
  • 画像リターゲティング:これは、非情報領域を拡大または縮小して画像をリサイズすることを目的とする。リターゲティングアルゴリズムは、すべての顕著な画像詳細を正確に推定する顕著性マップの利用可能性に依存する。
  • 物体検出および認識:計算的に複雑なアルゴリズムを画像全体に適用する代わりに、オブジェクトを含む可能性が最も高い画像の最も顕著な領域に適用できる。

説明可能なAI

顕著性マップは、説明可能な人工知能における顕著なツールであり、機械学習モデル、特に深層ニューラルネットワークの意思決定プロセスの視覚的説明を提供する。これらのマップは、モデルの出力に最も影響を与える入力データの領域を強調し、モデルが予測を行う際に「どこを見ているか」を効果的に示す。例えば、画像分類タスクでは、顕著性マップは特定のクラス決定に最も寄与する画素または領域を識別できる。

畳み込みニューラルネットワーク用に開発された顕著性マッピング技術は、クラススコアの入力データに対する勾配を単純に取るものから、統合勾配やクラスアクティベーションマッピングなどのより複雑なアルゴリズムまで多岐にわたる。トランスフォーマーアーキテクチャでは、注意メカニズムにより、アテンションマップ、アテンションロールアウト、クラス判別アテンションマップなどの類似の顕著性マップが生み出された。

セグメンテーション問題としての顕著性

顕著性推定は、画像セグメンテーションの一例と見なすことができる。コンピュータビジョンにおいて、画像セグメンテーションは、デジタル画像を複数のセグメント(画素の集合、スーパーピクセルとも呼ばれる)に分割するプロセスである。セグメンテーションの目標は、画像の表現を、より意味があり、分析しやすいものに単純化および/または変更することである。画像セグメンテーションは通常、画像内のオブジェクトと境界(線、曲線など)を特定するために使用される。より正確には、画像セグメンテーションは、同じラベルを持つ画素が特定の特性を共有するように、画像内のすべての画素にラベルを割り当てるプロセスである。

古典的アルゴリズム

OpenCVに実装されている古典的な顕著性推定アルゴリズムには、3つの形式がある:

  • 静的顕著性:画像の特徴と統計に依存して、画像の関心領域を特定する。
  • 動きの顕著性:オプティカルフローによって検出されるビデオ内の動きに依存する。動くオブジェクトは顕著と見なされる。
  • オブジェクトネス:オブジェクトネスは、画像ウィンドウがオブジェクトを覆う可能性を反映する。これらのアルゴリズムは、画像内でオブジェクトが存在する可能性のある場所の境界ボックスのセットを生成する。

古典的なアプローチに加えて、ニューラルネットワークベースの方法も人気がある。動きの顕著性推定のためのニューラルネットワークの例がある:

  • TASED-Net:2つのビルディングブロックで構成される。最初に、エンコーダネットワークが低解像度の時空間特徴を抽出し、次に予測ネットワークがすべての時間情報を集約しながら空間的にエンコードされた特徴をデコードする。
  • STRA-Net:2つの本質的な問題を強調する。第一に、外観とオプティカルフローの結合を介して統合された時空間特徴、第二に、注意メカニズムを介して学習されたマルチスケールの顕著性。
  • STAViS:時空間の視覚情報と聴覚情報を組み合わせる。このアプローチは、音源を特定し、2つの顕著性を融合して最終的な顕著性マップを取得することを学習する単一のネットワークを採用する。

視覚歪み感度と呼ばれる新しい静的顕著性法がある。これは、真のエッジ、すなわちオブジェクトの輪郭が、他の複雑なテクスチャ領域よりも顕著であるという考えに基づいている。これは、古典的なエッジ検出アルゴリズムとは異なる方法でエッジを検出する。勾配の存在を考慮するために、勾配の大きさにかなり小さなしきい値を使用する。垂直、水平、および2つの対角方向の4つのバイナリマップを取得する。形態学的クロージングとオープニングがバイナリ画像に適用され、小さなギャップを閉じる。ブロブ状の形状をクリアするために、距離変換を利用する。結局、接続された画素グループは個々のエッジ(または輪郭)である。接続された画素セットのサイズのしきい値を使用して、画像ブロックに知覚可能なエッジ(顕著な領域)が含まれているかどうかを判断する。

実装例

単純な顕著性マップは、各画素から同じフレーム内の他の画素までの距離を計算することで計算できる。画素 \(I_k\) の顕著性値は次のように与えられる:

\(\mathrm{SALS}(I_k) = \sum_{i=1}^{N} |I_k - I_i|\)

ここで、\(I_i\) は画素 \(i\) の値であり、範囲は[0,255]である。展開形式は次のとおり:

\(\mathrm{SALS}(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|\)

ここで、N は現在のフレーム内の画素の総数である。この式は、同じ強度値を持つ画素をグループ化することで再構成できる:

\(\mathrm{SALS}(I_k) = \sum_{n=0}^{255} F_n \times |I_k - I_n|\)

ここで、\(F_n\) は強度値 \(I_n\) の頻度である。頻度はヒストグラムの形式で表され、ヒストグラムの計算時間は \(O(N)\) である。このアプローチは効率的であり、多くの古典的な顕著性検出方法の基礎を形成する。

ニューラルネットワークアプローチ

現代の顕著性マップ生成は、しばしば深層学習に依存している。畳み込みニューラルネットワークの場合、勾配ベースの方法は、入力画像に対するクラススコアの導関数を計算し、最も強い影響を持つ画素を強調する顕著性マップを生成する。統合勾配とクラスアクティベーションマッピング(CAM)は、より滑らかで判別力のあるマップを提供するより高度な技術である。トランスフォーマーでは、注意メカニズムがアテンションマップを生成し、これをレイヤー全体で集約して(アテンションロールアウトとして知られる)、視覚およびテキスト入力の顕著性マップを作成できる。これらの方法は、モデルの解釈可能性のためにMachine learningおよびDeep learningで広く使用されている。

他のドメインへの応用

顕著性マップはコンピュータビジョンで最も一般的であるが、他のドメインにも適応されている。自然言語処理では、顕著性マップは、特にTransformer (architecture)ベースのモデル(Large language modelなど)において、モデルの予測に最も影響を与える単語またはトークンを強調できる。音声処理では、顕著性マップは分類に関連する時間周波数領域を示すことができる。基本原理は同じままである:出力にとって最も重要な入力の部分を特定すること。

課題と限界

顕著性マップは批判がないわけではない。入力の小さな摂動に敏感で、不安定な説明につながる可能性がある。一部の方法は、クラス判別性のないマップを生成する。つまり、特定の予測に固有ではなく、一般的に顕著な領域を強調する。さらに、モデルの注意に対するグラウンドトゥルースがないため、顕著性マップの品質を評価することは困難である。研究者は、Neural network研究やArtificial intelligence倫理からの洞察を利用して、信頼性と解釈可能性を向上させる新しい技術を開発し続けている。

将来の方向性

Artificial intelligenceモデルがより複雑になるにつれて、透明な説明の必要性が高まっている。顕著性マップは、特に医用画像や自動運転などのリスクの高いアプリケーションにおいて、説明可能なAIの主要なツールであり続ける可能性が高い。Generative AIおよびマルチモーダルモデルの進歩は、視覚、テキスト、聴覚の手がかりを組み合わせた新しい形式の顕著性につながる可能性がある。MIT CSAILStanford AI LabBAIR (Berkeley AI Research)などの機関での研究は、顕著性マップを基本的な技術として、解釈可能性の限界を押し広げ続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·explainable-ai·saliency·interpretability
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴