機械学習において、「確率的オウム」という用語は、大規模言語モデル(LLM)を、真の理解を伴わずに統計的にテキストを模倣するシステムとして表現するための比喩である。「確率的」という語は、古代ギリシャ語の「στοχαστικός」(ストカスティコス、「推測に基づく」の意)に由来し、確率論においては「ランダムに決定される」ことを意味する。一方、「オウム」は、人間の言葉を模倣する鳥の能力を指す。このフレーズは、ティムニット・ゲブル、エミリー・M・ベンダー、アンジェリーナ・マクミラン=メジャー、マーガレット・ミッチェルによる2021年の論文「On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? 🦜」で導入され、大規模言語モデルの潜在的なリスクを概説した。この論文は、その主張だけでなく、2020年12月にゲブルとグーグルの間で起きた職場紛争の役割でも有名となり、彼女の物議を醸す退社とAIコミュニティでの広範な議論を引き起こした。この用語はその後、生成AIに関する学術研究で注目を集め、AIシステムに対する侮辱として否定的に解釈されることもある。
背景と2020年の紛争
ティムニット・ゲブルは、2018年にグーグルに入社したAI倫理研究者であり、マーガレット・ミッチェル(アルゴリズムバイアスを専門とするコンピューター科学者)とともに、倫理的人工知能チームを共同で率いた。エミリー・M・ベンダーは、計算言語学の研究で知られる言語学者である。ゲブルと他の5人の研究者(うち4人はグーグル社員)によって共同執筆されたこの論文は、2021年のACM公平性・説明責任・透明性会議に提出された。この論文は、LLMが重大なリスクを提示すると主張した。環境的・金銭的コスト、未知の危険なバイアスにつながる不透明性、そしてこれらのモデルが学習する根底にある概念を理解していないために生じる欺瞞の可能性などである。
この論文は、LLMを「その膨大な訓練データで観察された言語形式の連なりを、それらがどのように組み合わさるかに関する確率的情報に従って縫い合わせるが、意味への言及は一切ない」ものと表現し、「確率的オウム」というレッテルを生んだ。提出後、グーグルはゲブルに対し、論文を撤回するか、グーグル社員の名前を削除するよう要求した。ゲブルは、さらなる議論なしにこれを拒否し、グーグルリサーチ担当副社長のメーガン・カコリアに、会社が撤回要求を説明できず、同様のプロジェクトに関する他の懸念に対処できないのであれば、移行期間を経て辞任する計画であると電子メールで伝えた。翌日の2020年12月2日、グーグルは「彼女の辞任を受け入れる」という電子メールを送った。この突然の解雇は、グーグル社員による抗議を引き起こし、同社に否定的な評判をもたらした。
使用と一般への浸透
「確率的オウム」というフレーズは、AI懐疑論者や研究者によって、LLMがその出力の意味を理解していないことを示すために採用されている。OpenAIのCEOであるサム・アルトマンは、2022年12月のChatGPTリリース直後にこの用語を使用し、「私は確率的オウムであり、あなたもそうだ」とツイートした。この用語は、アメリカ方言学会によって2023年のAI関連今年の言葉にノミネートされた。
理解と模倣に関する議論
ChatGPTのようなLLMが、説得力のある人間らしい会話でユーザーと交流し始めるにつれ、これらのシステムが本当に理解しているのか、それとも単に「オウム返し」しているだけなのかという疑問は深まった。機械学習研究者のリンドホルム、ヴァールストレーム、リンデステン、シェーンは、2つの重要な限界を強調した。LLMは訓練されたデータに制限され、その内容を単に確率的に繰り返すだけであること、そしてパターンに基づいて出力を生成するため、自分が何か間違ったことや不適切なことを言っているかどうかを知らないことである。彼らは、そのような限界が、質の低いデータセットでは「危険なほど間違った」結果につながる可能性があると指摘した。
主観的経験
支持者は、人間の心では言葉は現実世界の経験に対応するが、LLMにとって言葉は訓練データ内の他の言葉とパターンにのみ対応すると主張する。したがって、LLMの意味に関する言明は、LLMが実際には言語を理解していないにもかかわらず、「テキストに意味を帰属させる人間の傾向」に由来すると彼らは主張する。
ファインチューニングと反論
ケルシー・パイパーは、確率的オウムの比喩は事前学習に焦点を当てており、LLMに指示に従い正確な回答を好むように訓練する現代のファインチューニングプロセスを無視していると論じた。他の研究者はベンチマークを証拠として指摘する。GPT-4は統一司法試験で90パーセンタイルを超え、高校数学オリンピックレベルの問題で構成されるMATHベンチマークで93%の精度を達成した。これは、単純なパターン照合の期待を超える偉業である。2022年の調査では、AI専門家の51%が、十分なデータがあればLLMは真に言語を理解できると信じていることが判明したが、この見解には多くの専門家が異議を唱えている。
幻覚と限界
確率的オウムの考え方の支持者は、LLMが誤った情報を事実として提示する幻覚(または作話)を、これらのシステムが言葉を世界の理解に結び付けていない証拠として指摘する。また、複雑または曖昧な文法での失敗も挙げる。例えば、次の文のペアが与えられた場合、「テーブルから落ちた濡れた新聞は、私のお気に入りの新聞です。しかし、今、私のお気に入りの新聞が編集者を解雇したので、もうそれを読むのが好きではないかもしれません。2番目の文の『私のお気に入りの新聞』を『テーブルから落ちた濡れた新聞』に置き換えてもいいですか?」という問いに対し、GPT-4は「はい」と答えたが、最初の文脈では「新聞」が物体を指し、2番目の文脈では組織を指すことを見逃していた。
進行中の研究とワークショップ
2024年、サイエンティフィック・アメリカンの調査は、閉鎖的なバークレーのワークショップを報じた。そこでは最先端のモデルが新規のティア4数学問題を解決し、一部のLLMが訓練データに直接含まれていないタスクを実行できる可能性が示唆された。しかし、これらの観察は依然として解釈の対象であり、LLMが真の理解を持っているのか、それとも単に高度なパターンマッチングを行っているのかという議論を完全に解決するには至っていない。