クラスアクティベーションマッピング(CAM)は、深層学習における技術であり、畳み込みニューラルネットワークの予測に対する視覚的な説明を生成する。これは、入力画像のうち特定の出力クラスに最も関連する領域を強調する粗いヒートマップを生成し、モデルの解釈可能性の一形態を提供する。この手法は2016年にBolei Zhouらによる論文で導入され、それ以来、画像分類モデルの理解とデバッグのための基礎的なツールとなっている。
CAMの核となる考え方は、畳み込みネットワークの特徴マップに保持されている空間情報を活用することである。典型的な分類アーキテクチャでは、最後の畳み込み層が一連の特徴マップを生成し、それぞれが異なる視覚的パターンを捉える。これらの特徴マップを特定のクラスに対する重要度に応じて重み付けし、それらを合計することで、モデルが決定を下す際に「見ている」場所を示す単一の空間マップを得ることができる。このマップは通常、入力画像サイズにアップサンプリングされ、ヒートマップとして重ね合わせられる。
歴史的背景と動機
2010年代の深層学習の台頭は、画像分類などのタスクで前例のない精度をもたらしたが、同時に「ブラックボックス」問題も導入した。つまり、モデルがなぜ特定の予測を行ったのかが不明瞭であることが多かった。この透明性の欠如は、医用画像や自動運転などの重要な分野での採用を妨げた。CAMは、この解釈可能性へのニーズへの応答として開発され、畳み込みネットワークの推論を可視化するシンプルかつ効果的な方法を提供した。
CAM以前には、逆畳み込みネットワークやオクルージョン感度などの可視化技術が存在したが、それらは計算コストが高いか、直感的でない結果を提供する傾向があった。CAMは、最終分類層の前にグローバル平均プーリング層を使用するネットワークである限り、追加のトレーニングやアーキテクチャの変更を必要としない点で際立っていた。この制約は元の手法の主要な限界であり、その後の変種の開発につながった。
技術的メカニズム
元のCAMの実装は、最後の畳み込み層の後にグローバル平均プーリング層を使用するネットワークに適用される。このようなアーキテクチャでは、最後の畳み込み層からの特徴マップが各空間次元にわたって平均化され、値のベクトルが生成される。このベクトルはその後、ソフトマックス活性化を備えた全結合層に入力され、クラススコアが生成される。
特定のクラスcに対して、k番目の特徴マップをクラススコアに接続する重みはw_k^cと表される。クラスcのクラスアクティベーションマップは、特徴マップA_kの重み付き和として計算され、正の寄与のみを保持するためのReLU活性化が続く:
M_c = ReLU(Σ_k w_k^c * A_k)
この合計は、元の画像サイズにアップサンプリングできる2D空間マップを生成する。結果のヒートマップは分類を強く支持する領域を強調し、明るい領域ほど関連性が高いことを示す。
GAPの使用は、ネットワークが単一の場所に焦点を当てるのではなく、グローバルに判別的な特徴マップを学習することを強制するため、重要である。この特性により、重み付き合計が位置特定ツールとして意味を持つ。
変種と拡張
元のCAMの限界を克服するために、いくつかの拡張が提案されている。注目すべき変種の1つはGrad-CAMであり、2017年にRamprasaath R. Selvarajuらによって導入された。Grad-CAMは、GAP層を必要とせずに任意の畳み込みニューラルネットワークにCAMを一般化する。これは、クラススコアの特徴マップに対する勾配のグローバル平均として重みを計算し、より柔軟なアプローチを提供する。
もう1つの拡張はGrad-CAM++であり、正の偏微分の重み付き組み合わせを使用して位置特定精度を向上させる。Score-CAMやAblation-CAMなどの他の手法は、代替の重み付けスキームを提供し、多くの場合、より視覚的に明確なヒートマップを生成する。これらの変種は、モデルの決定を理解することが臨床的信頼にとって重要である医用画像解析などの分野で広く採用されている。
アプリケーションと影響
CAMとその派生技術は、多くの領域で応用が見つかっている。医用画像では、肺炎や皮膚がんなどの疾患を診断するモデルが、アーティファクトではなく臨床的に関連する特徴に焦点を当てていることを放射線科医が検証するのに役立つ。自動運転では、シーンのどの部分が車両の決定に影響を与えるかを示すことで、エンジニアが知覚システムのデバッグを支援する。
解釈可能性に加えて、CAMは弱教師あり物体位置特定にも使用されている。ヒートマップが判別的な領域を強調するため、高価なバウンディングボックス注釈なしで検出モデルをトレーニングするための擬似ラベルとして機能できる。この応用は、手動ラベリングが非現実的な大規模データセットで特に価値がある。
この技術は、トランスフォーマーモデルを説明するために類似の注意ベースの手法が使用される自然言語処理を含む、Machine learningの他の分野の研究にも影響を与えてきた。しかし、CAMは依然として畳み込みアーキテクチャと最も直接関連している。
限界と考慮事項
その有用性にもかかわらず、CAMには既知の限界がある。ヒートマップは粗く、物体の細かい境界を捉えられない場合がある。また、最も判別的な部分のみを反映するため、モデルが疑似相関に依存している場合に誤解を招く可能性がある。例えば、オオカミとシベリアンハスキーを分類するようにトレーニングされたモデルが、動物自体ではなく背景の雪に焦点を当てる場合、CAMはその雪を強調する。
さらに、元のCAMは特定のネットワークアーキテクチャを必要とし、直接的な適用可能性を制限する。Grad-CAMなどの変種がこれを解決する一方で、勾配の線形性など独自の仮定を導入し、これらは常に成立するとは限らない。その結果、CAMはモデルの推論の決定的な証明ではなく、探索的なツールとして最適に使用される。
近年、説明可能AIの分野はSHAPやLIMEなどの手法で拡大しているが、CAMはそのシンプルさと計算効率のため、依然として人気のある選択肢である。これは解釈可能性研究の標準的なベースラインであり続けており、深層学習ライブラリやフレームワークに頻繁に含まれている。