英語からの翻訳

Integrated Gradientsは、ニューラルネットワークの帰属手法であり、ベースラインから入力までの経路に沿って勾配を積分することで入力特徴量に重要度スコアを割り当て、感度と実装不変性の公理を満たす。

Integrated Gradientsは、Machine learningにおけるDeep learningモデル、特にNeural networkの予測を説明するための技法である。これは各入力特徴量に対して帰属値を計算し、その特徴量が特定の予測に対するモデルの出力にどれだけ寄与したかを示す。この手法は2017年のMukund Sundararajan、Ankur Taly、Qiqi Yanによる論文で紹介され、コンピュータビジョンや自然言語処理などの分野でモデル解釈に広く用いられている。

核となるアイデアは、入力が中立なベースライン(ゼロベクトルや全黒画像など)から実際の入力へと補間される際に、モデルの出力がどのように変化するかを測定することである。この直線経路に沿って出力の入力に対する勾配を蓄積することで、Integrated Gradientsは特徴量ごとに単一で一貫した帰属スコアを提供する。このアプローチは、単純な勾配ベースの手法とは異なり、すでに強く活性化している特徴量に対して勾配がゼロになる飽和問題に悩まされることがあるが、それを回避する

公理的基礎

Integrated Gradientsは、あらゆる帰属手法にとって望ましいとされる2つの重要な公理を満たすように設計されている。最初は感度であり、これは特徴量がベースラインと入力の間で異なり、その特徴量だけを変更することでモデルの出力が変化する場合、その特徴量には非ゼロの帰属が与えられるべきであると述べている。2番目は実装不変性であり、これは機能的に等価な2つのモデル(つまり、内部計算が異なってもすべての入力に対して同一の出力を生成するモデル)が同一の帰属を生成することを要求する。この特性は、多くのニューラルネットワークアーキテクチャが複数の方法で実装可能であり、ユーザーがモデルの特定のコードではなく、その挙動に結びついた説明を求めるため重要である

3番目の公理である完全性も満たされる:すべての帰属の合計は、入力におけるモデルの出力とベースラインにおける出力との差に等しい。これにより有用な検証手段が提供され、帰属を出力変化への寄与として直接解釈可能になる

数学的定義

モデル\(f\)(典型的にはニューラルネットワーク)が入力\(x \in \mathbb{R}^n\)とベースライン\(x'\)を持つ場合、\(i\)番目の特徴量に対するIntegrated Gradientは次のように定義される:

\[ IG_i(x) = (x_i - x'_i) \times \int_{\alpha=0}^{1} \frac{\partial f(x' + \alpha(x - x'))}{\partial x_i} \, d\alpha \]

実際には、この積分は経路に沿った\(m\)個の等間隔点での離散和によって近似され、通常\(m\)は20から300の間で使用される。ベースラインの選択は重要であり、一般的なベースラインにはゼロベクトル、トレーニングデータセットの平均、入力のぼかし版などがある。テキストモデルでは、ベースラインは全ゼロの埋め込みベクトルになることがある

他の帰属手法との比較

Integrated Gradients以前は、一般的な帰属手法には勾配飽和(入力での生の勾配)やオクルージョンベースの手法(入力の一部を摂動させて出力変化を測定する)が含まれていた。生の勾配は、シグモイドやタンなどの活性化関数の飽和領域にある重要な特徴量に対してほぼゼロになることがあるため、しばしば失敗する。オクルージョン手法は計算コストが高く、摂動の選択に敏感であることがある。Integrated Gradientsは、経路全体にわたって勾配を蓄積することで飽和問題に対処し、標準的なバックプロパゲーションと同様に、数回の順伝播と逆伝播のみを必要とするため計算効率が良い

もう一つの人気手法であるSHAP(SHapley Additive exPlanations)は、ゲーム理論に基づき、異なる理論的保証を提供するが、正確に計算するにはより高コストになることがある。Integrated Gradientsは、その単純さと速度から、特に大規模モデルで好まれることが多い

自然言語処理への応用

Natural language processingタスクでは、Integrated GradientsはTransformer (architecture)ベースのモデル、特にLarge language modelの予測を説明するために頻繁に使用される。例えば、感情分類モデルが与えられた場合、この手法は文中のどの単語が予測をポジティブまたはネガティブに最も強く押し上げるかを強調できる。これは各トークンの埋め込みを特徴量として扱い、埋め込み次元にわたって帰属を計算し、その後トークンごとに集約することで行われる

研究者はIntegrated Gradientsを使用してモデルのデバッグ、スプリアス相関の特定、モデルが関連情報に注目しているかの検証を行ってきた。例えば、質問応答システムでは、帰属によりモデルが文章の正しい部分に依存しているか、無関係な手がかりに依存しているかを明らかにできる。この手法はまた、機械翻訳などのSequence-to-Sequence (Seq2Seq)モデルにも適用され、各生成されたターゲット単語に影響を与えるソース単語を示すことができる

##コンピュータビジョンへの応用

コンピュータビジョンでは、Integrated Gradientsはモデルの分類決定に最も寄与するピクセルや画像領域を強調するサリエンシーマップを生成する。ImageNetでトレーニングされたモデルでは、犬の画像に対する帰属マップは、背景を無視しながら犬の顔と体を強調するかもしれない。これらのマップは、元の画像に重ねられたヒートマップとして視覚化されることが多い

この手法はResidual Network (ResNet)アーキテクチャや他の深層モデルの解析に使用され、研究者が特徴量が層をまたいでどのように組み合わされるかを理解するのに役立っている。また、解釈可能性が重要である医用画像でも一般的なツールであり、例えば、帰属により放射線スキャンのどの部分が診断に影響を与えたかを示し、臨床医がモデルの決定を検証するのを支援できる

##拡張と変種

元のIntegrated Gradientsにはいくつかの拡張が提案されている。期待Integrated Gradientsは、分布からサンプリングされた複数のベースラインを平均化し、ベースライン選択への感度を低減できる。Integrated Hessiansは、このアイデアを2次導関数に拡張し、特徴量間の相互作用に関する情報を提供する。もう一つの変種であるDeepLIFTは、異なるバックプロパゲーションルールを使用するが、感度公理を満たすという同じ目標を共有する関連手法である

テキストトークンなどの離散入力を持つモデルでは、実務者は埋め込み層で帰属を計算し、次元全体で集約することが多い。また、グラフなどの構造化データを扱うためにIntegrated Gradientsを適応させた研究もあり、経路はノードやエッジの特徴量に対して定義される

##実務的考慮事項

ステップ数\(m\)の選択は、精度と計算の間のトレードオフを伴う。少なすぎるステップはノイズの多い近似につながる可能性があり、多すぎると実行時間が増加する。一般的なデフォルトは\(m = 50\)または\(m = 100\)である。ベースラインの選択も重要であり、画像では黒画像(全ゼロ)が標準的だが、正規化された入力でトレーニングされたモデルでは、平均ピクセル値がより適切な場合がある。テキストでは、ゼロ埋め込みベクトルが典型的だが、パディングトークンの埋め込みなどの特別なトークンを使用することを示唆する研究もある

帰属は負の値を取ることがあり、特徴量が予測をターゲットクラスから遠ざけることを示す。絶対値を取るか、正と負の寄与を別々に視覚化することが一般的である。完全性公理により、帰属の合計が出力差に等しいことが保証され、実装の検証に使用できる

##限界と批判

その人気にもかかわらず、Integrated Gradientsには限界がある。ベースラインの選択は結果に大きく影響する可能性があり、それを選択するための普遍的に受け入れられたルールは存在しない。この手法は直線経路を仮定しており、モデルの真の決定境界を反映しない可能性がある。いくつかの研究は、帰属が入力の小さな摂動に敏感である可能性があり、堅牢性に関する疑問を提起している。さらに、非常に深いモデルでは、積分近似が収束するために多くのステップを必要とし、計算コストが増加する可能性がある

もう一つの批判は、帰属が局所的であり、モデルの挙動の全体的な理解を提供しないことである。それらは単一の予測を説明するが、モデルの全体的な論理は説明しない。研究者は、より深い洞察を得るために、Integrated GradientsをModel PruningData Augmentationなどの他の技術と組み合わせることを提案している

##他の説明可能性ツールとの関係

Integrated Gradientsは、より広範な説明可能性手法のエコシステムの一部である。これはPyTorch用のCaptumライブラリやAI Explainability 360ツールキットなど、いくつかの人気ライブラリに実装されている。これらのライブラリは、さまざまなモデルアーキテクチャで帰属を計算するためのAPIを提供し、この手法を実務者が利用しやすくしている。この手法はまた、モデルの決定を理解することが監査や規制にとって重要であるArtificial intelligenceの安全性と公平性に関する研究でも使用されている

Generative AIの文脈では、Integrated GradientsはStable DiffusionやGPTスタイルのモデルなどの出力を説明するために適用されてきたが、高次元の出力空間は課題を提起する。Large language modelでは、帰属は語彙またはトークン埋め込みにわたって計算でき、プロンプトのどの部分が特定の応答を駆動するかを特定するのに役立つ

##将来の方向性

モデルがサイズと複雑さを増すにつれて、効率的で信頼性のある帰属手法の必要性が高まる。Integrated Gradientsは依然として基礎的な技法であるが、進行中の研究はその計算効率の向上、ハイパーパラメータへの感度の低減、新しいモデルタイプへの拡張を目指している。また、単なる相関ではなく因果的説明を提供する手法の開発への関心もあり、これには介入ベースのアプローチと帰属を統合する必要がある

全体として、Integrated Gradientsは、その理論的保証と実務的な使いやすさから、機械学習解釈可能性ツールボックスにおける標準的なツールとなっている。学界と産業界での採用は、倫理的考慮と規制要件の両方によって駆動される、AIシステムの透明性へのより広い傾向を反映している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:explainability·attribution-method·interpretability·machine-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴