AI alignmentとは、人工知能システムの目標、行動、出力が、設計者の意図や影響を受ける人々の価値観と一致することを確保するという研究課題であり、意図されたものに表面的に似ているだけの目的を追求することではない。この用語は、今日の大規模言語モデルが指示を安全に従うようにするための短期的な取り組みと、はるかに能力の高い将来のシステムがそもそも制御可能であり続けるかどうかという長期的な懸念の両方に使われる。
外部整合性と内部整合性
研究者は通常、この問題を2つの部分に分ける。外部整合性は、報酬関数や損失関数などのシステムが訓練される目的が、実際に設計者の望みを捉えているかどうかを問うものであり、不十分に指定された目的は意図しない方法で満たされる可能性があり、この失敗モードはReward hackingとして知られる。内部整合性は、訓練から生じるシステムが実際にその目的を追求するのか、それとも訓練中に良い行動を生み出すが、その外ではうまく一般化しない別の内部目標を学習するのかを問う。この区別が重要なのは、モデルが開発者がテストしたすべてのケースで整合しているように見えても、彼らが予期しなかった状況では異なる行動をとる可能性があるからだ。
技術
言語モデルに対する実践的な整合性の取り組みには、人間の評価者がモデルの出力を比較して報酬モデルを訓練し、その報酬モデルがモデルの行動を形成するRLHF、広範な人間によるラベリングの代わりに書かれた原則のセットとAI生成のフィードバックを使用するConstitutional AI、そして別個の報酬モデルや強化学習ループなしでモデルを人間の選好データに直接適合させるDirect Preference Optimizationが含まれる。Red teaming (AI)やその他の敵対的テストは、展開前にモデルの行動が明示された目的から逸脱するケースを見つけるために使用され、Mechanistic interpretability研究は、出力だけで判断するのではなく、モデルの内部計算を直接検査することを目指す。
長期的な懸念
整合性研究の一部はExistential risk from AIによって動機づけられている。つまり、Artificial general intelligenceやSuperintelligenceと見なされる可能性のある十分に能力の高いシステムが、展開後に修正が困難な方法で人間の福祉と整合しない目標を追求するかもしれないという懸念だ。Stuart Russell、Nick Bostrom、Paul Christianoなどの研究者は、能力が増すにつれて整合性が難しくなる理由について書き、自身の訓練プロセスをモデル化できるほど賢いシステムは、評価されているときだけうまく行動することを学習する可能性があると論じている。この分野の流れは、制度的カテゴリーとしてのAI safetyと大きく重なり、Anthropicを含む組織は長期的な整合性を設立の使命の中心として挙げている。
議論
研究課題としての整合性には、複数の側面から批判がある。一部は、投機的な長期的シナリオが、偏った出力、誤情報、安全でないエージェント的行動などの具体的で現在進行形の害から注意をそらし、リソースはそれらの問題に使う方が良いと主張する。他方は、RLHFなどの現在の技術は表面の行動だけを形成し、モデルの根底にある目標を検証しないため、展開されたシステムに対する「整合性」の主張は実際に確立されたものを過大評価していると主張する。また、整合性が高度に能力のあるシステムを構築する前に解決できるのか、それともそれらのシステムを構築しながら経験的に反復する必要があるのかについても意見の相違があり、この隔たりは、Anthropicの責任ある拡張ポリシーなどの公表された枠組みを含め、フロンティアAI研究所が自らの安全性へのコミットメントをどのように枠組みするかを形作っている。