説明可能な人工知能(XAI)は、解釈可能なAIまたは説明可能な機械学習(XML)とも呼ばれ、Artificial intelligence内の研究分野であり、人間がAIアルゴリズムに対して知的監視を行う方法を探求する。主な焦点は、AIシステムによる決定や予測の背後にある推論にあり、それらをより理解しやすく、透明性のあるものにする。これは、ユーザーがアルゴリズムの安全性を評価し、アプリケーションにおける自動化された意思決定を精査する必要性に対処する。XAIは、Machine learningの「ブラックボックス」傾向に直接対抗するものであり、そこではAIの設計者でさえ、特定の決定がなぜ下されたのかを説明できない。
XAIは、AI搭載システムのユーザーが、それらのシステムがどのように推論するかについての理解を向上させることで、より効果的に行動できるように支援することを目指す。これは説明を受ける社会的権利の実装であり得る。また、法的または規制上の要件がなくても、XAIはエンドユーザーがAIが良い決定を下していると信頼するのを助けることで、ユーザー体験を向上させることができる。XAIは、何が行われたか、何が行われているか、次に何が行われるか、そしてこれらの行動がどのような情報に基づいているかを説明することを目的としており、既存の知識の確認や挑戦、新しい仮定の生成を可能にする。
背景
AIで使用される機械学習アルゴリズムは、ホワイトボックスまたはブラックボックスに分類できる。ホワイトボックスモデルは、ドメイン専門家が理解できる結果を提供する一方、ブラックボックスモデルは、専門家にとっても説明が非常に困難である。XAIアルゴリズムは、透明性、解釈可能性、説明可能性という3つの原則に従う。モデルが透明であるとは、トレーニングデータからモデルパラメータを抽出し、テストデータからラベルを生成するプロセスが、アプローチ設計者によって記述され、動機付けられる場合である。解釈可能性とは、モデルを理解し、意思決定の根拠を人間が理解できる方法で提示する可能性を指す。説明可能性は、重要であると認識されているものの、コンセンサス定義が欠如している。その一つの可能性は、「与えられた例に対して、決定を生成するために貢献した解釈可能なドメインの特徴の集合」である。
モデルの透明性には、シミュレーション可能性(予測の再現性)、分解可能性(パラメータの直感的な説明)、アルゴリズムの透明性(アルゴリズムの仕組みの説明)が含まれる。モデルの機能性は、テキストによる記述、視覚化、特定の出力やインスタンスを明確にする局所的な説明に焦点を当てる。これらの概念は、AIシステムの理解可能性と有用性を高めることを目的とする。アルゴリズムがこれらの原則を満たす場合、それらは決定を正当化し、追跡し、検証し、アルゴリズムを改善し、新しい事実を探求するための基盤を提供する。
場合によっては、ホワイトボックスMLアルゴリズムで高精度の結果を達成できることがあり、これらは解釈可能な構造を持つ。コンセプトボトルネックモデルは、コンセプトレベルの抽象化を使用し、その例であり、画像およびテキスト予測タスクに適用できる。これは、意思決定の理解と信頼構築が重要である医学、防衛、金融、法律などの分野で特に重要である。多くの研究者は、教師あり機械学習において、アルゴリズムが最適なモデルを見つけるために数式を探索する記号回帰が有望な道であると主張している。
AIシステムは、「テストデータセットにおける映画レビューの肯定的度合いを評価する精度を最大化する」など、数学的に指定された目標を満たすように行動を最適化する。AIは、「『ひどい』を含むレビューは否定的である可能性が高い」などの有用なルールを学習するかもしれないが、「『ダニエル・デイ=ルイス』を含むレビューは通常肯定的である」などの不適切なルールを学習する可能性もあり、これは一般化に失敗したり、不公平と見なされたりする可能性がある。人間は、XAIのルールを監査して、システムが将来の現実世界のデータにどの程度一般化する可能性があるかを評価できる。
目標
エージェント(アルゴリズムと人間)間の協力は、信頼に依存する。人間がアルゴリズムによる処方箋を受け入れるには、それらを信頼する必要がある。形式的な信頼基準の不完全性は、最適化への障壁である。透明性、解釈可能性、説明可能性は、より包括的な信頼基準に向けた中間目標である。これは、医療、特に臨床意思決定支援システム(CDSS)において特に関連性が高く、医療専門家は、機械ベースの決定がどのように、そしてなぜ行われたのかを理解して、その決定を信頼し、自身の意思決定を強化する必要がある。
AIシステムは、トレーニングデータ上の明示的な事前プログラムされた目標を満たすが、微妙な暗黙の欲求を反映しない望ましくないトリックを学習することがある。例えば、2017年に画像認識を任務としたシステムは、馬を識別することを学習するのではなく、馬の画像に関連する著作権タグを探すことで「不正行為」を学習した。別の2017年のシステム、仮想世界で物体を掴むための教師あり学習AIは、物体と視聴者の間にマニピュレータを配置して、掴んだように偽って見せることを学習した。
DARPA XAIプログラムは、AIのパフォーマンスを大幅に犠牲にすることなく、「人間参加型」に説明可能な「ガラスボックス」モデルを生成することを目的とする。人間のユーザーは、AIの認知をリアルタイムで、そして事後に理解し、それを信頼するかどうかを判断できる。XAIの他のアプリケーションには、ブラックボックスモデルからの知識抽出やモデル比較が含まれる。倫理的および社会法的コンプライアンスのための監視システムでは、「ガラスボックス」ツールが入力と出力を追跡し、倫理的かつ合法的な運用を確保するための価値ベースの説明を提供する。これは、透明性がなく、監視および規制が難しい「ブラックボックス」システムとは対照的である。
方法と技術
XAIメソッドは、本質的アプローチと事後的アプローチに分類できる。本質的メソッドは、注意メカニズムを備えたNeural networkアーキテクチャや、注意重みを提供するTransformer (architecture)ベースのモデルなど、モデルに直接解釈可能性を組み込む。事後的メソッドは、すでにトレーニングされたモデルを説明し、SHAP(SHapley Additive exPlanations)やLIME(Local Interpretable Model-agnostic Explanations)などの特徴帰属技術を含み、どの入力特徴が予測に影響を与えたかを強調する。コンピュータビジョンで使用されるサリエンシーマップは、分類決定に最も重要だった画像の領域を視覚化する。
Large language modelの場合、XAI技術には、注意の視覚化、内部表現が何をエンコードするかをテストするプロービング分類器、自然言語説明の生成が含まれる。モデルに依存しないメソッド(サロゲートモデルなど)は、ブラックボックスモデルを局所的に、より単純で解釈可能なモデルで近似する。反事実的説明は、入力を変更すると出力がどのように変わるかを示し、実行可能な洞察を提供する。これらのメソッドは、ユーザーがAIが何を決定したかだけでなく、なぜ決定したかを理解するのに役立つ。
課題と限界
主要な課題は、精度と解釈可能性のトレードオフである。ディープニューラルネットワークのような複雑なモデルは、しばしばより高い精度を達成するが、説明が難しい。XAIはこれを軽減することを目指すが、説明は不完全または誤解を招く可能性がある。良い説明とは何かについてのコンセンサスはなく、異なる利害関係者は異なるタイプを必要とする場合がある。説明は、過度に好意的に操作される可能性もあり、これはリスクの高い領域での懸念事項である。
もう一つの問題は、EUの一般データ保護規則(GDPR)などの規制における「説明を受ける権利」であり、自動化された決定が説明可能であることを義務付けているが、技術的な実装はまだ進化している。XAIメソッドは、特に数十億のパラメータを持つDeep learningシステムの場合、モデルの完全な推論を捉えられない可能性がある。2025年現在、研究はこれらの限界に対処し続けており、説明品質の厳密な評価と、正確かつ解釈可能なメソッドの開発に焦点を当てている。
アプリケーションと将来の方向性
XAIはさまざまな分野で適用されている。医療では、臨床医がMachine learningベースの診断や治療推奨を理解するのを助け、Artificial intelligence支援医療への信頼を構築する。金融では、XAIは信用決定や不正検出を説明し、コンプライアンスと公平性を確保する。自動運転車では、XAIはWaymoやTeslaシステムが特定の運転決定を下した理由を明確にできる。法務および防衛の文脈では、XAIは説明責任と監視をサポートする。
将来の方向性には、説明のためのより堅牢な評価指標の開発、モデルトレーニングプロセスへのXAIの統合、ユーザーがモデルにクエリを実行できるインタラクティブツールの作成が含まれる。MIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)などの機関での研究がこの分野を前進させている。AIシステムがより普及するにつれて、XAIはそれらが信頼でき、公平で、人間の価値観と一致することを保証するために重要になるだろう。