メカニスティック・インタープリタビリティは、AI safetyと機械学習における研究プログラムであり、訓練済みのNeural networkの重みを、それが実装するアルゴリズムの人間が理解できる説明へと逆工学することを試みるものである。これは、ほとんどのExplainable AI手法が行うように、外部からその振る舞いを単に近似するのではなく、そのアプローチは訓練済みモデルを、ソースコードなしでコンパイル済みバイナリコードを扱うリバースエンジニアがするのと同様に扱う。つまり、個々のニューロン、層、重みの組み合わせを調べることで、研究者はネットワークがタスクを実行するために使用する離散的な特徴や回路を回復しようとし、最終的な目標は、モデルの振る舞いをソースコードを読むのと同じ確信度で予測、検証、または編集できるようにすることである。
起源
コンピュータビジョンにおける初期の解釈可能性研究、特にオンラインジャーナルDistillに関連する特徴可視化研究は、Convolutional neural networkモデルなどの画像分類器における個々のニューロンまたは小さなニューロン群が、曲線、テクスチャ、物体の一部などの認識可能な概念に対応し得ることを示した。Anthropicの共同創設者であり、この分野の主要人物であるChris Olahは、この視覚的で回路ベースの分析スタイルを普及させるのに貢献し、その後それを言語モデルに拡張した。Transformer (architecture)アーキテクチャとLarge language modelシステムの台頭により、この分野の焦点は、アテンションヘッド、残差ストリーム、そしてモデルがIn-context learningなどのタスクを実行できるようにする内部表現の理解へと移行した。
主要な発見
解釈可能性研究者は、いくつかの繰り返し現れる現象を特定している。重ね合わせ(スーパーポジション)は、ニューラルネットワークがニューロンよりも多くの異なる特徴を表現することが多く、複数の概念を活性化空間の重複する方向に詰め込むため、個々のニューロンを単独で解釈することが困難になるという発見を説明する。スパースオートエンコーダは、より広範なAutoencoder技術の応用であり、これらの重複する表現を、より単義的で個別に解釈可能な特徴のより大きな集合に分解するために使用されてきた。Anthropicの2024年の研究では、本番規模のClaudeモデルにおいて数百万ものそのような特徴を特定し、その後の研究で行動に関連する特定の特徴を特定して編集したが、これはこの分野で最も広く議論された結果の一つであった。他の研究ラインでは、モデルが繰り返しパターンを完了できるようにする「誘導ヘッド」メカニズムなど、狭い能力を担う特定の回路を特定し、解釈可能性ツールを使用して、モデルの表明された出力のみに依存するのではなく、モデル内部の欺瞞や目標の誤一般化の兆候を検出してきた。
動機と重要性
支持者は、メカニスティック・インタープリタビリティは、行動テストのみに依存するのではなく、高度に能力のあるモデルが、それが追求しているように見える目標を実際に追求しているかどうかについて、人間に真の洞察を与えることができる数少ない研究方向の一つであると主張する。これは、AI alignmentとReward hackingに関する議論と密接に関連する懸念である。解釈可能性は、ブラックボックスを事後に説明するのではなく、直接開くことを目的としているため、一部の研究者は、それを、はるかに能力の高い将来のシステム、特にArtificial general intelligenceに近づくものを自信を持って展開するための前提条件であると考えている。
限界
この分野は、いまだに最先端モデルの完全な説明には遠く及ばない。現在の技術は本番モデルの規模にうまく拡張できず、スパースオートエンコーダの特徴はネットワークのすべての振る舞いをきれいにカバーしておらず、解釈可能性に基づく説明が単に妥当であるだけでなく完全であることを検証するための合意された方法もない。研究者は一般に、メカニスティック・インタープリタビリティを初期段階の科学として説明しており、その野心においては、生物学的脳のマッピングを試みる神経科学に匹敵するが、成熟度においてはまだ及ばない。