アクティベーションパッチングは、メカニスティック・インタープリタビリティ(機構的解釈可能性)で用いられる因果的介入手法であり、これは説明可能な人工知能の一分野で、ニューラルネットワークの具体的な構造、アルゴリズム、回路を分析することでその内部動作を理解することを目指す。この手法は、順伝播中に特定のニューロン、層、またはアテンションヘッドのアクティベーションを変更し、その結果生じるモデルの出力の変化を観察することを含む。内部状態に体系的に介入することで、研究者は個々のコンポーネントがモデルの行動に与える因果的寄与を測定でき、従来のソフトウェアデバッグと同様の方法でネットワークをリバースエンジニアリングできる。
この手法は、機械学習モデルの重みにエンコードされた構造、回路、またはアルゴリズムを特定することを目指す、メカニスティック・インタープリタビリティのより広い目標の中心となる。サリエンシーマップや勾配ベースの属性付けなど、主に「ブラックボックス」の説明に焦点を当てた初期の解釈可能性手法とは異なり、アクティベーションパッチングは内部状態と出力の間に直接的な因果関係を提供する。これにより、モデルの動作を検証し、AIのミスアライメントなどの潜在的なリスクを検出し、大規模言語モデル(LLM)やその他のニューラルネットワークが与えられた入力から特定の結論にどのように到達するかを理解するための強力なツールとなる。
起源と発展
「メカニスティック・インタープリタビリティ」という用語は、Anthropicの共同創設者であるクリス・オラーによって造られ、彼の回路分析の研究を説明するものとして、解釈可能なAIにおける通常の方法とは対照的だった。回路分析はモデル内の個々の特徴と回路を完全に特徴づけようとしたのに対し、より広い分野はサリエンシーマップのような勾配ベースのアプローチに傾いていた。回路分析以前は、このサブフィールドの研究は、特徴可視化、次元削減、属性付けなどの様々な手法を人間とコンピュータの相互作用手法と組み合わせて、視覚モデルであるInception v1のようなモデルを分析していた。
アクティベーションパッチングは回路分析の自然な拡張として登場し、特定の行動にとってどのコンポーネントが重要であるかという仮説を検証する方法を提供した。初期の応用は視覚モデルに焦点を当てていたが、この手法はトランスフォーマーベースの大規模言語モデルの台頭とともに重要性を増し、アテンションヘッド、残差ストリーム、フィードフォワードネットワークを研究するための標準的なツールとなった。Anthropic、OpenAI、Google DeepMindなどの機関の研究者は、その後この手法を洗練させ、スパースオートエンコーダなどの他の解釈可能性ツールと統合してきた。
基本原則
アクティベーションパッチングは、ニューラルネットワークの内部表現が情報を分散的にエンコードするという原則に基づいて動作する。順伝播の特定の時点でのニューロンまたは層のアクティベーションは、特徴の混合を捉えたベクトルである。そのアクティベーションを異なる入力(または反事実的設定)からの値に置き換えることで、研究者は出力がどのように変化するかを観察でき、それによってそのコンポーネントの役割を隔離できる。
この手法は線形表現仮説に依存しており、これは高次の概念がニューラルネットワークのアクティベーション空間における線形方向として表現されることを示唆する。単語埋め込みや大規模言語モデルからの経験的証拠はこの見解を支持するが、普遍的に成り立つわけではない。アクティベーションパッチングはこの線形性を利用して、概念方向の観点で解釈可能な標的を絞った介入を行う。
方法論
典型的なアクティベーションパッチング実験には、3回の順伝播が含まれる。まず、クリーンな入力でベースラインのパスを実行し、モデルの出力を記録して、関心のあるアクティベーションを保存する。次に、変更された入力(例えば、主要な名詞が置き換えられた文)で破損したパスを実行し、異なる出力を生成して、破損したアクティベーションを保存する。3番目に、パッチされたパスを実行し、特定の層またはヘッドで破損したパスからのアクティベーションをクリーンなパスからのものに置き換え、出力をベースラインと比較する。
パッチされたパスと破損したパスの間の出力の差は、パッチされたコンポーネントの因果効果を示す。特定のヘッドをパッチすることで元の出力が復元される場合、そのヘッドはタスクにとって重要である可能性が高い。逆に、パッチングが効果を持たない場合、そのコンポーネントは冗長または無関係である可能性が高い。このプロセスをすべてのコンポーネントにわたって繰り返すことで、ネットワークの因果マップを生成でき、しばしばヒートマップやグラフとして視覚化される。
大規模言語モデルへの応用
アクティベーションパッチングは、大規模言語モデルのメカニスティック・インタープリタビリティの基盤となっている。研究者はこれを使用して、主語と動詞の一致、照応解決、事実の想起などの特定の言語現象にどのアテンションヘッドが責任を持つかを特定する。例えば、トランスフォーマーモデルで「The cat sat on the mat」のような文の間に特定のアテンションヘッドのアクティベーションをパッチすることで、そのヘッドが「cat」と「sat」の関係をエンコードしているかどうかを明らかにできる。
この手法は、トランスフォーマーにおける主要な情報ハイウェイである残差ストリームの研究にも使用される。異なる層で残差ストリームをパッチすることで、研究者は情報が入力から出力へどのように流れ、どこで変換されるかを追跡できる。これにより、文脈からパターンをコピーする役割を担う誘導ヘッドや、その他の機能的回路の発見につながった。
スパースオートエンコーダとの関係
アクティベーションパッチングは、ニューラルネットワークのアクティベーションをスパース表現に分解するように訓練されたモデルであるスパースオートエンコーダ(SAE)と組み合わせられることが多い。SAEの学習された次元は、しばしば単純で人間が理解できる概念を表す。言語モデルのアクティベーションにSAEを適用することで、研究者は特定の文脈でどの特徴がアクティブであるかを特定し、その特徴をパッチして因果的役割をテストできる。Anthropicはこの手法を大規模言語モデルの解釈可能性に適用し、SAEを使用してアクティベーションを解釈可能な特徴に分解し、その特徴をパッチして効果を検証している。
この組み合わせにより、生のアクティベーションをパッチするよりも細かい介入が可能になり、層全体ではなく特定の概念方向を標的にする。また、多くの特徴が少数のニューロンに詰め込まれる重ね合わせの課題に対処するのにも役立つ。
回路と因果分析
ニューラルネットワークの回路は、特徴アクティベーションの因果チェーンで構成される。どの回路がどの下流の結果につながるかをマッピングし、回路を活性化または抑制することで、ニューラルネットワーク(LLMなど)が与えられた入力から与えられた結果にどのように到達するかを分析できる。アクティベーションパッチングはこのマッピングの主要なツールであり、研究者が仮説上の回路が実際に行動に必要かどうかをテストできるようにする。
例えば、視覚モデルでは、回路はエッジを検出するニューロンのセット、コーナーを検出する別のセット、そして物体を認識する最終的なセットで構成されるかもしれない。エッジ検出ニューロンのアクティベーションをランダムな値でパッチすると回路全体が破壊されるが、後の層をパッチするとより局所的な効果があるかもしれない。この階層的分析は、モデルの内部アルゴリズムの完全な全体像を構築するのに役立つ。
限界と課題
アクティベーションパッチングにはいくつかの限界がある。第一に、テストされる各コンポーネントに対して複数の順伝播が必要であり、計算コストが高い。数十億のパラメータを持つ大規模モデルでは、これは実行不可能になる可能性がある。第二に、破損した入力の選択が重要であり、不適切な破損は誤解を招く結果につながる可能性がある。第三に、この手法はコンポーネントが独立して動作することを前提としているが、実際にはコンポーネント間の相互作用が分析を混乱させる可能性がある。
さらに、アクティベーションパッチングはモデルの局所的で入力固有のビューのみを提供する。ある入力にとって重要なコンポーネントは別の入力にとっては無関係かもしれないため、単一の実験から導き出された結論は一般化されない可能性がある。研究者は、堅牢な理解を構築するために、多様な入力にわたって多くの実験を実行する必要があることが多い。
今後の方向性
2020年代半ばの時点で、アクティベーションパッチングは活発な研究分野であり、この手法をより大きなモデルにスケーリングし、回路の発見を自動化する取り組みに焦点が当てられている。TransformerLensライブラリのようなツールは、研究者がオープンソースモデルにパッチングを適用することを容易にし、学術ラボとAnthropicやGoogle DeepMindなどの業界グループとのコラボレーションが進歩を加速させている。最終的な目標は、ニューラルネットワーク内部の包括的な理解を開発することであり、これはAI安全性の実践に情報を提供し、より信頼性が高く制御可能なAIシステムにつながる可能性がある。