人工知能の文脈における幻覚とは、生成モデル、特に大規模言語モデルが、自信に満ちて流暢でありながら、事実的に誤っていたり、捏造されたり、訓練データや与えられた情報源によって裏付けられていない記述を生成する傾向を指す。この用語は人間の心理学から大まかに借用されたものであり、言語モデルがテキストを生成するより機械的なプロセスではなく、知覚上の誤りを暗示するため、研究者の間で議論の対象となっている。
原因
言語モデルは、事実を検証するためではなく、テキストの妥当な続きを予測するように訓練されているため、モデルには、十分に裏付けられた主張と、流暢だが捏造された主張を区別する組み込みのメカニズムが存在しない。幻覚は、プロンプトが訓練データにまれにしか、または一貫性なく現れた情報について尋ねる場合、質問がモデルのコンテキストウィンドウや知識の期限を超えている場合、または法的な判例の引用や学術的な参考文献など、正確に記憶するように訓練されていない特定の情報源、日付、数字を引用するよう求められた場合に発生する可能性が高くなる。一部の研究者は、問題の一部をRLHFに帰しており、モデルを自信に満ちたように聞こえ、人間の評価者を満足させるように訓練することが、不確実性を認めることよりも流暢な推測に報いる可能性があると主張している。幻覚は、より広範な接地問題と密接に関連している。純粋にテキストで訓練されたモデルは、その出力と世界の状態との間に直接的なつながりを持たないため、訓練プロセスには事実の正確性を保証するものは何もない。
注目すべき事例
幻覚は、2022年末のChatGPTの公開により大規模言語モデルが大衆に届けられた後、学術的な関心事から公的な関心事へと移行した。広く報じられた2023年の事例では、ニューヨークの連邦訴訟の弁護士が、ChatGPTが捏造した架空の判例引用を含む文書を提出し、制裁につながり、検証なしにモデルの出力を信頼するリスクに広く注意を喚起した。ウェブの結果を要約する検索エンジンやアシスタントも幻覚的な要約を生成しており、企業はAI生成の回答に引用や信頼性の注意書きを追加するようになった。
緩和策
最も広く展開されている緩和策は検索拡張生成であり、システムがクエリ時に関連文書を取得し、モデルにそれらに基づいて回答するよう指示することで、捏造された主張の割合を減らすが、完全に排除するわけではない。他のアプローチには、校正された不確実性を表現するようにモデルを微調整すること、情報源を引用したり思考の連鎖を通じて推論を示すよう求めるプロンプト技術、ユーザーに表示する前に外部データベースに対して主張を検証する事後ファクトチェックパイプラインが含まれる。ベンチマークと評価スイートは、一般的な能力とともに幻覚率を追跡指標としてますます含むようになっており、一部の研究所は新しいモデルリリースの幻覚統計を評価プロセスの一部として報告している。
進行中の議論
研究者は、幻覚が解決可能な工学的問題であるか、自己回帰言語モデルがテキストを生成する方法に固有の特性であるかについて意見が分かれている。一部は、スケーリングとより良い訓練データが幻覚率を着実に減らすと主張し、世代を重ねるモデルでの測定された改善を指摘している。他方は、言語モデルには各トークンを生成する方法に組み込まれた真実検証ステップがないため、外部ツールなしではある程度の捏造は避けられず、実用的な目標は幻覚が発生することを前提とし、それを捕捉するように設計されたインターフェースとワークフローを構築することであると主張している。