顕著性マップ(サリエンシーマップ)は、画像内の特定のタスクに最も関連する領域を強調する視覚的表現であり、人間の視覚的注意または機械学習モデルの判断のいずれかに関連する。コンピュータビジョンにおいて、そのようなマップは、各ピクセルが人間の視覚系または不透明なモデルにとって持つ重要度の程度を反映する。例えば、写真において、視聴者は最初に砦や薄い雲を見るかもしれない。その画像の顕著性マップは、それらの領域を明るくして、その顕著性を示す。視線追跡による顕著性マップが人間の視線を近似するのに対し、機械学習における勾配ベースの顕著性マップは、モデルが予測を行う際にどこに焦点を当てているかを明らかにする。
人工知能の文脈では、顕著性マップは説明可能なAIにおける中心的なツールとなっている。これらは、出力に最も影響を与える入力ピクセルまたは特徴を強調することにより、深層ニューラルネットワークがどのように判断に到達するかを視覚的に説明する。この技術は、画像分類や物体検出で特に一般的であるが、後のトランスフォーマーアーキテクチャにも注意マップを通じて拡張される。この概念は認知科学と機械学習を橋渡しし、その人間の視覚へのルーツは、アルゴリズム的アプローチと評価方法の両方を形成してきた。
人間の視覚的顕著性
人間の顕著性マップは、人の注意を最初に引き付ける場所を予測することを目的とする。V1顕著性仮説によれば、一次視覚野(V1)が顕著性マップに責任があるとされ、顕著性は生物学的に根拠のある現象である。人間の顕著性の計算モデルは、多くの場合、色、コントラスト、エッジ、動きなどの低レベル特徴に依存する。
この領域での最も一般的な応用は以下の通りである:
- 画像およびビデオ圧縮:人間の目はフレーム内の小さな関心領域のみに焦点を合わせる。顕著性マップを使用することで、その領域外を低品質でエンコードでき、知覚される損失なしにファイルサイズを削減できる。
- 画像およびビデオ品質評価:顕著な領域の差異をより重く重み付けする品質指標は、主観的な人間の意見との相関が高くなる。
- 画像リターゲティング:非情報領域を拡大または縮小して画像をリサイズし、重要なコンテンツを保存する。正確な顕著性推定に依存する。
- 物体検出および認識:複雑なアルゴリズムを画像全体に適用するのではなく、認識対象の物体を含む可能性が高い最も顕著な領域に適用する。
古典的な推定アルゴリズムは、OpenCVで実装されているように、主に3つのタイプがある:静的顕著性(画像特徴と統計に基づく)、動き顕著性(オプティカルフローからの動きに基づき、動く物体が顕著である)、および物体性(可能性のある物体の周囲に境界ボックスを提供する)。また、視覚歪み感度と呼ばれる新しい静的メソッドもあり、テクスチャ領域よりも真のエッジ(物体輪郭)をより顕著として扱う。これは、小さな勾配閾値、形態学的操作、および距離変換を使用してエッジを分離する。
セグメンテーションとしての顕著性
顕著性推定は、画像セグメンテーションの一例と見なすことができる。画像セグメンテーションは、デジタル画像を複数のセグメントまたはスーパーピクセルに分割するプロセスである。目標は、画像表現を意味のある、分析しやすいものに簡素化することであり、多くの場合、すべてのピクセルにラベルを割り当てる。顕著性の場合、セグメンテーション問題は二値である:各ピクセルを前景(顕著)または背景のいずれかにラベル付けする。出力は、顕著な物体が白でマークされ、残りが黒である二値マスク、または強度が顕著性を示す連続ヒートマップであることが多い。
この関連性は、セグメンテーション技術と損失関数を再利用でき、顕著な領域の全体的な理解が画像セグメンテーションのようなタスクに役立つため、特に重要である。ただし、顕著性マップは通常、ハードな境界ではなく、ソフトまたは段階的な重要度を提供する。
深層学習のための勾配ベースの顕著性
ニューラルネットワークに適用される場合、顕著性マップは、クラススコアの入力に対する勾配を取ることによって計算されることが多い。これは2010年代に畳み込みネットワーク用に開発され、最初の顕著なアプローチは単純な勾配を使用した:各ピクセルについて、出力スコアがそのピクセルの小さな変化にどれだけ敏感であるかを計算する。勾配の大きさは相対的な重要度を示す。
より洗練された技術が続いた:
- 統合勾配:ベースライン入力から実際の入力へのパスに沿って勾配を合計することで重要度を割り当て、飽和を考慮し、予測スコアが中間点でのみ変化する場合の帰属を保証する。
- クラス活性化マッピング(CAM):最後の畳み込み層からの特徴マップ、ターゲットクラスの重みを使用し、通常はアップサンプリングされる空間解像度で粗い顕著性マップを生成する。
- 勾配加重クラス活性化マッピング(Grad-CAM):クラススコアの特徴マップに対する勾配を使用して活性化を重み付けするCAMの拡張。
これらの方法は、畳み込みニューラルネットワーク(例:Residual Network (ResNet))に固有であるが、注意メカニズムを通じてTransformer (architecture)モデルに一般化され、注意マップ、注意ロールアウト、または識別的な注意マップを学習するものとなっている。
トランスフォーマーにおける注意マップ
自然言語処理および視覚におけるTransformer (architecture)アーキテクチャの台頭により、顕著性マップは注意重みの形を取る。トランスフォーマーでは、Multi-Head Attentionメカニズムが、入力内の1つのトークンが別のトークンにどれだけ注意を払うかを示すスコアを計算する。これらの重みは、層とヘッドにわたって集約され、画像などの入力に対する顕著性マップを生成できる。注意ロールアウトやクラス識別的な注意マップなどの技術が、これらのマップをより解釈可能にするために開発されている。
これらのマップは、画像の分類判断を説明するためによく使用されるが、同じアイデアはテキストにも適用され、重要な単語やトークンを強調する。2020年代の時点で、トランスフォーマーにおける顕著性検出は活発な研究領域であり、Large language modelの解釈可能性をサポートするが、注意スコアが常に出力に因果的に責任があるわけではないため、勾配ベースのマップよりもモデルへの忠実度が低い可能性がある。
アルゴリズム実装の例
多くのアルゴリズムは複雑であるが、単純な静的顕著性の公式が提案されている。これは、フレーム内の各ピクセルから他のすべてのピクセルまでの距離を計算する。ピクセルI_kの場合、顕著性SALS(I_k)は、すべてのピクセルにわたる合計で与えられる:
SALS(I_k) = Σ_{i=1}^N |I_k - I_i|、
ここで、I_iは[0,255]のピクセル値であり、Nはピクセルの総数である。これは、SALS(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|に展開される。
この公式は、画像ヒストグラムで表現できる:SALS(I_k) = Σ_n F_n × |I_k - I_n|、ここで、F_nは強度値n(nは0から255)の頻度である。ヒストグラム計算の計算時間はO(N)である。これにより、画像全体に対する各ピクセルの重要度の一意な表現が得られる。
このタイプは古典的なアプローチであり、現在ではニューラルネットワークに取って代わられることが多いが、核心的な原理を示している。
ニューラルネットワークの顕著性メソッド
勾配ベースおよび従来の方法に加えて、現代のニューラルネットワークは、多くの場合、ビデオおよびマルチモーダルデータ用に、顕著性マップを出力するように特別に訓練される。3つの注目すべき例:
- TASED-Net:低解像度の時空間特徴を抽出するエンコーダと、空間特徴をデコードしながらすべての時間情報を集約する予測ネットワークで構成される。
- STRA-Net:視覚およびオプティカルフロー結合を介して時空間特徴を統合し、注意メカニズムを使用してマルチスケール顕著性に焦点を当てる。
- STAViS:時空間の視覚および聴覚情報を組み合わせる。音源をローカライズすることを学習する単一ネットワークを使用し、2つの顕著性手がかりを融合して最終マップを生成する。
これらのネットワークは、時間の経過に伴う人間の視線を予測するためにビデオデータセットで訓練される。これらは、顕著性がデータから学習できることを示し、フレームレベルの方法を動きと音声で強化した。
説明可能なAIにおける応用
説明可能な人工知能(XAI)では、顕著性マップは、人工知能モデルが何を見ているかを理解するための顕著な方法である。画像分類または物体識別を実行するモデルの場合、顕著性マップは、予測に最も影響を与えるピクセルまたは領域を正確に示す。例えば、ニューラルネットワークが写真に犬が含まれると分類する場合、顕著性マップは背景ではなく、犬の頭と尾を強調するかもしれない。これは、特定のクラス判断に最も寄与する領域を強調する。
顕著性メソッドの選択は、品質と解釈可能性に影響する。単純な勾配は高速であるが、ノイズが多く、無関係な領域に重要度を割り当てることがある一方、統合勾配やCAMはより意味のある説明を提供できる。システムレベルの安全性と説明責任に関して、顕著性マップは、モデルが背景や透かしによる疑似相関ではなく、関連する特徴に依存していることを検証するために使用される。
ただし、顕著性マップは全体像を示すわけではない。これらは重要度を示すが、モデルの論理や反事実は示さない。2020年代の時点で、より堅牢で忠実な説明可能性への研究が続いている。
結論
顕著性マップは、人間の視覚の理解と深層学習モデルの内部動作を橋渡しする。これらは、注意の生物学的モデルとして、またモデルデバッグ、画像圧縮、または判断説明のための実用的なツールとして機能する。古典的な画像処理からDeep learningアプローチおよびTransformer (architecture)ベースの注意への進化に伴い、顕著性マッピングはより柔軟で強力になったが、「重要」な領域が正確に何を構成するかについての疑問は依然として提起される。その開発は進行中であり、顕著性マップはピクセルレベルおよびニューラルモデルの解釈可能性の両方の不可欠な部分である。