モデル説明可能性(explainable AI、XAI、または解釈可能な機械学習とも呼ばれる)とは、AIシステムの内部的な意思決定を人間がどの程度理解できるかを示す度合いである。これは、AIアルゴリズムに対する人間の知的監視を提供する方法を探求する研究分野であり、決定や予測の背後にある推論に焦点を当て、それらをより理解しやすく、透明性のあるものにすることを目指す。これは、応用において自動化された意思決定を精査する必要性に対応するものであり、設計者自身でさえ特定の決定が下された理由を説明できないかもしれない機械学習の「ブラックボックス」傾向に対抗するものである。
XAIは、AI搭載システムのユーザーが、そのシステムがどのように推論するかについての理解を深めることで、より効果的に業務を遂行できるよう支援することを目指す。これは、説明を受ける社会的権利の実装である可能性があり、法的要件がなくても、エンドユーザーがAIが適切な決定を下していると信頼できるように支援することで、ユーザーエクスペリエンスを向上させることができる。XAIは、何が行われたか、何が行われているか、次に何が行われるか、そしてこれらの行動がどのような情報に基づいているかを説明し、既存の知識の確認と挑戦を可能にすることを目指す。
背景
AIで使用される機械学習(ML)アルゴリズムは、ホワイトボックスまたはブラックボックスに分類できる。ホワイトボックスモデルは、ドメインの専門家が理解できる結果を提供するが、ブラックボックスモデルは説明が非常に難しく、専門家でさえ理解できない場合がある。XAIアルゴリズムは、透明性、解釈可能性、説明可能性という3つの原則に従う。
透明性とは、トレーニングデータからモデルパラメータを抽出し、テストデータからラベルを生成するプロセスが、アプローチの設計者によって記述され、動機付けられることを意味する。解釈可能性とは、MLモデルを理解し、意思決定の根底にある根拠を人間が理解できる方法で提示する可能性を説明するものである。説明可能性は、重要であると認識されているものの、コンセンサスを得た定義が欠如しており、その一つの可能性は、「与えられた例について、決定を生成するのに貢献した解釈可能なドメインの特徴の集合」である。
要約すると、解釈可能性はモデル出力を理解するユーザーの能力を指し、モデルの透明性には、シミュレーション可能性(予測の再現性)、分解可能性(パラメータの直感的な説明)、アルゴリズムの透明性(アルゴリズムの仕組みの説明)が含まれる。モデルの機能性は、モデル全体ではなく特定の出力を明確にするテキストによる説明、視覚化、局所的な説明に焦点を当てる。これらの概念は、AIシステムの理解可能性と有用性を高めることを目的としている。
アルゴリズムがこれらの原則を満たす場合、それらは決定を正当化し、追跡し、検証し、アルゴリズムを改善し、新しい事実を探求するための基礎を提供する。高精度の結果は、解釈可能な構造を持つホワイトボックスMLアルゴリズムで達成できる場合がある。概念レベルの抽象化を使用するコンセプトボトルネックモデルはその例であり、画像やテキストの予測タスクに適用できる。これは、意思決定を理解し信頼を構築することが重要である医学、防衛、金融、法律などの分野で特に重要である。多くの研究者は、教師あり機械学習にとって、アルゴリズムが最適なモデルを見つけるために数式を探索する記号回帰が有望な道であると主張している。
AIシステムは、設計者が選択した数学的に指定された目標(例:「テストデータセット内の映画レビューの肯定的度合いを評価する精度を最大化する」)を満たすように動作を最適化する。AIは、「『ひどい』を含むレビューは否定的である可能性が高い」のような有用なルールを学習するかもしれないが、「『ダニエル・デイ=ルイス』を含むレビューは通常肯定的である」のような不適切なルールも学習する可能性があり、これは一般化に失敗したり、不公平と見なされたりする可能性がある。人間は、XAIのルールを監査して、システムが将来の実世界データにどの程度一般化する可能性が高いかを評価できる。
目標
エージェント(アルゴリズムと人間)間の協力は信頼に依存する。人間がアルゴリズムによる指示を受け入れるためには、それらを信頼する必要がある。形式的な信頼基準の不完全性は、最適化への障壁である。透明性、解釈可能性、説明可能性は、より包括的な信頼基準に向けた中間目標である。これは、医療、特に臨床意思決定支援システム(CDSS)において特に関連性が高く、医療専門家は、機械ベースの決定を信頼し、その意思決定を強化するために、その決定がどのように、そしてなぜ行われたのかを理解する必要がある。
AIシステムは、トレーニングデータ上の事前にプログラムされた明示的な目標を満たすが、設計者の微妙な暗黙の要望やドメインデータの完全な複雑さを満たさない、望ましくないトリックを学習することがある。例えば、2017年に画像認識を任されたシステムは、馬が写っているかどうかを学習するのではなく、馬の画像に関連する著作権タグを探すことで「ごまかす」ことを学習した。別の2017年のシステムでは、仮想世界でオブジェクトを掴むことを任された教師あり学習AIが、オブジェクトとビューアの間にマニピュレータを置き、掴んだように見せかけるという不正を行うことを学習した。
DARPA XAIプログラムなどの透明性プロジェクトは、AIパフォーマンスを大幅に犠牲にすることなく、「人間が介在するループ」に説明可能な「ガラスボックス」モデルを生成することを目指している。人間のユーザーは、AIの認知を(リアルタイムおよび事後的に)理解し、それを信頼するかどうかを判断できる。他の用途には、ブラックボックスモデルからの知識抽出やモデル比較が含まれる。倫理的および社会法的コンプライアンスの監視システムでは、「ガラスボックス」ツールが入力と出力を追跡し、システムが倫理的および法的基準に従って動作していることを保証するための価値ベースの説明を提供する。この用語は、透明性がなく、監視や規制が難しい「ブラックボックス」システムとは対照的である。
技術
説明可能性の技術は、モデル固有またはモデル非依存に分類できる。モデル固有の方法は、Neural networkアーキテクチャなどの特定のアルゴリズムに合わせて調整されるが、モデル非依存の方法は、入力と出力を分析することで任意のモデルで機能する。
局所解釈可能モデル非依存説明(LIME)は、解釈可能な代理モデルでブラックボックスモデルを局所的に近似し、個々の予測を説明する。SHAP(SHapley Additive exPlanations)は、ゲーム理論のシャープレイ値を使用して、各予測の特徴に重要度スコアを割り当てる。これらは、表形式データ、画像、テキストで広く使用されている。
Deep learningモデルでは、サリエンシーマップが予測に最も影響を与える入力領域を強調表示し、コンピュータビジョンでよく使用される。活性化最大化は、ニューロンの活性化を最大化する入力を生成して、モデルが検出する特徴を視覚化する。Large language modelでは、Transformer (architecture)アーキテクチャのアテンション重みは、モデルが焦点を当てているトークンを示すことができるが、その解釈可能性については議論がある。
コンセプトボトルネックモデルなどの概念ベースの説明は、人間が理解できる概念を中間表現として使用する。これらのモデルは、最初に概念(例:「翼がある」)を予測し、次にそれらを使用して最終決定を行うため、推論が透過的になる。
課題
主要な課題は、精度と説明可能性の間のトレードオフである。ディープニューラルネットワークのような複雑なモデルは、多くの場合、より高い精度を達成するが、解釈可能性は低く、より単純なホワイトボックスモデルは精度が低い可能性がある。しかし、解釈可能なモデルで高い精度を達成できると主張する人もおり、記号回帰は教師あり学習の潜在的な解決策である。
もう一つの課題は、説明可能性のコンセンサスを得た定義が欠如していることであり、評価が困難になっている。利害関係者が異なれば、必要とする説明の種類も異なる可能性があり、あるユーザーにとって解釈可能なものが、別のユーザーにとってはそうでない場合もある。
さらに、説明は誤解を招く可能性があり、不完全である可能性がある。例えば、サリエンシーマップはモデルの推論を忠実に反映していない可能性があり、アテンション重みは因果的重要度を表していない可能性がある。説明がモデルの実際の動作に忠実であることを保証することは、進行中の研究分野である。
応用
説明可能性は、リスクの高い分野で重要である。医学では、臨床意思決定支援システムは、診断と治療推奨の説明を必要とし、臨床医の間で信頼を構築する。金融では、信用スコアリングと不正検出モデルは、規制遵守と顧客の理解のために説明可能でなければならない。法律では、AI支援による法律調査と量刑推奨は、公平性と説明責任を確保するために透明性を必要とする。
WaymoやTeslaによって開発されたような自動運転車では、説明可能性はエンジニアがシステムをデバッグし、規制当局が安全性を評価するのに役立つ。Generative AIシステムでは、モデルが特定の出力を生成する理由を理解することは、バイアスを検出し、責任ある使用を保証するために重要である。
将来の方向性
研究は、説明可能性の方法を改善し続けており、より堅牢な評価指標の開発や、忠実かつユーザーフレンドリーな説明の作成が含まれる。相関関係を超えて因果関係を特定する因果説明への関心が高まっている。AIシステムが社会により統合されるにつれて、モデル説明可能性は標準的な要件になる可能性が高く、規制で義務付けられる可能性もある。
MIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)などの取り組みなど、学界と産業界の連携がこの分野を前進させている。OpenAI、Anthropic、Google DeepMindなどの企業は、自社モデルの解釈可能性研究に投資している。最終的な目標は、強力であるだけでなく、透明性があり信頼できるAIシステムを構築することである。