Concept Bottleneck Models(CBM)は、ニューラルネットワークアーキテクチャの一種であり、人間が解釈可能な明示的な中間層である概念層を介して、2段階のプロセスで予測を行うように設計されている。CBMは、生の入力を直接出力にマッピングする代わりに、まず事前に定義された意味的に意味のある属性(概念)のセットを予測し、次にこれらの予測された概念を使用して最終的な決定を行う。この設計により、人間はモデルの内部推論を検査、理解、さらには介入することができ、機械学習および深層学習における標準的なブラックボックスモデルの主要な制限に対処している。
概念ボトルネックアプローチは、2020年にPang Wei Koh、Thao Nguyen、Yew Siang Tang、Stephen Mussmann、Brandon Ying、Percy Liangによって正式に導入された。彼らはスタンフォード大学およびトロント大学に所属していた。論文「Concept Bottleneck Models」は、モデルに最終出力の前に解釈可能な概念を予測させることで、競争力のある精度を達成しながら、モデルの動作をデバッグおよび制御する能力を得られることを実証した。この研究は、解釈可能および分離可能な表現に関する初期のアイデアに基づいているが、具体的で訓練可能なアーキテクチャを提供し、その後広範な研究に影響を与えた。
アーキテクチャと訓練
Concept Bottleneck Modelは、入力エンコーダ、概念予測器、タスク予測器の3つの主要コンポーネントで構成される。入力エンコーダは、生データ(例:画像、テキストシーケンス、表形式レコード)を特徴表現に処理する。次に、概念予測器はこの表現を、事前定義された各概念に対応する概念スコアのベクトルにマッピングする。最後に、タスク予測器はこれらの概念スコア(および必要に応じて元の特徴)を入力として受け取り、クラスラベルや回帰値などの最終出力を生成する。
CBMの訓練は通常、独立訓練、逐次訓練、同時訓練の3つのパラダイムのいずれかに従う。独立訓練では、まず概念予測器がグラウンドトゥルースの概念ラベルを予測するように訓練され、次にタスク予測器が予測された概念(またはグラウンドトゥルースの概念、概念予測器は凍結された状態)で訓練される。逐次訓練では、概念予測器を最初に訓練し、次に概念予測器を固定したままタスク予測器を訓練するが、タスク訓練中は予測された概念を使用する。同時訓練では、両方のコンポーネントを同時に最適化し、多くの場合、概念予測誤差とタスク予測誤差を組み合わせた重み付き損失を使用する。同時訓練は通常、最高のタスク精度をもたらすが、概念精度を犠牲にする可能性がある。一般的な変種は「介入認識」訓練であり、モデルが概念予測に対する人間の修正に対して堅牢になるように訓練され、テスト時にユーザーが誤りを修正できるようにする。
解釈可能性と介入
CBMの主な動機は解釈可能性である。モデルを人間が理解できる概念を通じて推論するように制約することで、ユーザーはモデルが存在すると信じている概念と、それらの概念が最終予測にどのように影響するかを確認できる。例えば、鳥の分類タスクでは、CBMは「黄色い腹部がある」「尖った翼がある」「長い尾がある」などの概念を予測し、それらを使用して種を分類する可能性がある。この透明性により、ドメイン専門家はモデルが偽の相関ではなく、賢明な特徴を使用していることを検証できる。
CBMの特徴的な機能は、介入する能力である。ユーザーがモデルの概念予測が間違っていることを知っている場合(例:黄色い腹部を検出できなかった)、その概念値を手動で修正でき、タスク予測器は修正された概念に基づいて新しい出力を生成する。この人間参加型の機能は、医療や金融などの高リスク領域で価値があり、最終決定前にモデルの誤りを修正できる。研究によると、少数の介入でも精度を大幅に向上できることが示されており、特に概念予測器が不完全な場合に有効である。
応用
CBMはさまざまな領域に適用されている。医用画像では、胸部X線診断に使用され、概念は「心肥大」や「胸水」などの可視的な病変に対応する。皮膚科では、CBMは悪性度を分類する前に皮膚病変の属性を予測できる。自動運転では、「歩行者が存在する」や「信号機の色」などの概念を使用して運転決定を行うことができるが、これは知覚タスクほど一般的ではない。自然言語処理では、CBMは感情分析や有害性検出に適用され、「冒涜的な言葉を含む」や「怒りを表現する」などの概念がある。表形式データでは、CBMは信用スコアリングに使用され、「収入レベル」や「支払い履歴」などの概念が解釈可能である。
変種と拡張
CBMのいくつかの変種が、制限に対処するために提案されている。ラベルフリーCBM(2022年にTu、Maらによって導入)は、手動の概念注釈の必要性を排除し、大規模な事前訓練モデル(例:大規模言語モデルまたは視覚言語モデル)を使用して、クラス記述から概念ラベルを自動生成する。これにより、新しいタスクにCBMを適用する際の主要なボトルネックである注釈の負担が軽減される。別の変種であるConcept Embedding Modelは、バイナリまたはカテゴリラベルではなく、連続的な埋め込み空間に概念を投影し、より豊かな概念表現を可能にする。ポストホックCBMは、既に訓練されたブラックボックスモデルから概念ボトルネックを抽出しようとし、プロービングやクラスタリング技術を使用して解釈可能な次元を特定する。
その他の拡張には、概念の不確実性をモデル化する確率的CBMや、ユーザーが最も影響力のある概念についてモデルに問い合わせできる対話型CBMが含まれる。一部の研究では、CBMをトランスフォーマーアーキテクチャと統合し、注意メカニズムを使用して概念を入力領域と整合させている。
制限と課題
その利点にもかかわらず、CBMはいくつかの課題に直面している。最も重要なのは、概念注釈の要件であり、これらは高価で主観的であることが多い。タスクの完全で重複しない概念セットを定義することは難しく、概念が欠落すると情報損失と精度低下につながる可能性がある。CBMはまた、複雑なタスクでは標準的なブラックボックスモデルよりもパフォーマンスが低下する傾向があり、概念ボトルネックが情報の流れを制限するためである。解釈可能性と精度のトレードオフは、中心的な研究課題である。
もう1つの問題は、概念漏洩である。タスク予測器が概念予測を意図しない方法で使用することを学習したり、概念予測器が記載された概念を超えた情報(例:相関する特徴を通じて)をエンコードしたりする可能性がある。これにより、モデルが意図したほど解釈可能でなくなる可能性がある。さらに、人間の介入は、タスク予測器が概念修正に対して堅牢である場合にのみ効果的であり、そうでない場合、概念を修正しても出力が期待どおりに変わらない可能性がある。
他の解釈可能性手法との関係
CBMは、解釈可能な機械学習技術のより広いファミリーの一部である。これらは、訓練後にブラックボックスモデルを説明しようとするsaliencyマップや勾配ベースの属性などのポストホック説明手法と対比されることが多い。CBMは設計上本質的に解釈可能であり、高リスクの決定には一般的に好まれる。また、概念活性化ベクトルを用いたテスト(TCAV)などの概念ベースの説明とも関連しているが、TCAVはモデルのアーキテクチャを制約しない。CBMは、決定木やルールベースのモデルと比較されることもあり、これらも本質的に解釈可能であるが、柔軟性は低い。
現在の研究と将来の方向性
CBMに関する研究は進化し続けている。最近の研究は、CBMを大規模データセットにスケーリングし、基盤モデルと統合することに焦点を当てている。例えば、CLIPスタイルの埋め込みを使用して連続空間で概念を定義することが有望であることが示されている。もう1つの方向性は、強化学習やロボティクスでのCBMの使用であり、解釈可能な中間表現が安全性とデバッグに役立つ。また、CBMを公平性とバイアス軽減に使用することへの関心もあり、概念ボトルネックにより監査者が保護属性が使用されているかどうかを確認できる。
2025年現在、CBMは依然として活発な研究領域であり、NeurIPS、ICML、ICLRなどの主要会議で論文が発表されている。解釈可能性とパフォーマンスのトレードオフはまだ完全には解決されていないが、この分野は、固定された人間定義のセットに依存するのではなく、概念を動的に学習するものを含む、より柔軟でスケーラブルな概念ベースのモデルへと移行している。