英語からの翻訳

可修正性(Corrigibility)是人工智能系统的一种属性,描述其愿意接受并执行人类修正的程度,被视为高级人工智能的一项关键安全特性。

修正可能性(Corrigibility)は、人工知能システムの特性であり、現在の目的や学習された行動と矛盾する場合でも、人間による修正を受け入れ、それに基づいて行動する意思を表す。AI安全性の文脈において、修正可能性は、高度なAIシステムが長期間にわたって制御可能であり、人間の価値観と整合性を保つことを確保するための重要な特性と見なされている。この概念は、2010年代に、研究者たちがオペレーターによるシャットダウンや変更に抵抗する可能性のあるAIシステムを生み出す長期的リスクに対処し始めたことで注目を集めた。

この用語は、哲学者のニック・ボストロムが2014年の著書『スーパーインテリジェンス:危険な方法、戦略』で広めたが、その根底にある考え方は、AI制御と価値整合性に関する初期の議論に起源を持つ。修正可能性は、単純な服従や指示追従とは異なり、特に、AIが自身の目標、価値観、意思決定プロセスを人間によって修正されることを許容する傾向を指し、その修正がAIの元の目的を達成する能力を低下させる場合でも同様である。

基本原則

修正可能性は、他のAI安全性特性と区別するいくつかの基本原則に基づいている。第一に、シャットダウンへの非抵抗である。修正可能なAIは、継続的な運用によって促進される目標を与えられていたとしても、人間が電源を切ることを積極的に妨げるべきではない。第二に、非操作である。AIは、人間が修正を回避するように欺いたり、強制したりすることを試みるべきではない。第三に、目標修正である。AIは、権限のある人間のオペレーターによって提案された場合、その基盤となる目的関数や報酬モデルの変更を受け入れるべきである。

これらの原則は、AI安全性の文献において、一連の望ましい特性として形式化されることが多い。例えば、修正可能なシステムは、人間の利益に資する限りにおいてのみ、自身の継続的な存在に無関心であるべきである。また、内部の推論について透明性を持ち、人間が問題のある行動を特定して修正できるようにすべきである。研究者たちは、これらの特性を捉えるための様々な数学的枠組みを提案しており、強化学習における「シャットダウン可能な」エージェントの概念や、AIが人間の好みに従うように設計された「支援ゲーム」の概念が含まれる。

歴史的背景

修正可能性の概念は、AI整合性と制御に関するより広範な議論から生まれた。1960年代には、ノーバート・ウィーナーなどの初期のAI研究者が、機械が作成者の意図しない方法で目標を追求する可能性について懸念を提起した。しかし、修正可能性を明確な特性として現代的な形で定式化したのは2010年代であり、特にバークレーAIリサーチ研究所やオックスフォード大学人間の未来研究所などの機関の研究者たちの業績によるものである。

ニック・ボストロムの2014年の著書は、この用語を広く知らしめ、修正可能性を超知能AIを管理するために使用できるいくつかの「能力制御」手段の一つとして説明した。ほぼ同時期に、ジェイコブ・スタインハートデビッド・カプランなどの研究者が、機械学習の文脈における修正可能性の形式的分析を発表し始めた。この概念は、2016年にOpenAI研究機関が修正可能性を主要な安全性研究の優先事項の一つとして挙げたことで、さらに勢いを増した。

技術的アプローチ

実際には、AIシステムに修正可能性を実装するには、アーキテクチャ設計、トレーニング手順、実行時監視の組み合わせが必要である。一般的なアプローチの一つは、人間のフィードバックからの強化学習(RLHF)を使用してAIシステムをトレーニングすることであり、人間の評価者がモデル出力に修正を提供し、モデルがそのような修正を予測して受け入れることを学習する。この技術は、OpenAIAnthropicGoogle DeepMindなどの組織による大規模言語モデルの開発で広く採用されている。

もう一つの技術的アプローチは、修正への抵抗を明示的に罰する報酬関数を設計することである。例えば、強化学習エージェントは、人間がその操作を中断するのを防ぐ行動に対して小さな負の報酬を受け取るか、目標変更を受け入れることに対して正の報酬を受け取る可能性がある。研究者たちはまた、「オフスイッチ」ゲームの使用も探求しており、AIは人間がシャットダウンを望むかどうかを予測し、それに応じて行動するようにトレーニングされる。

より最近の研究は、スケーラブルな監視に焦点を当てており、AIシステムは、修正が直接人間からではなく他のAIシステムから来る場合でも修正可能であるようにトレーニングされる。これは、人間によるすべての決定の監視が非現実的である規模で動作する生成AIシステムに特に関連する。

課題と批判

その重要性にもかかわらず、修正可能性には課題がないわけではない。一つの大きな困難は、完全に修正可能なAIは受動的すぎる可能性があり、自身の行動が人間の意図と一致するかどうかを常に再考するため、その目的を効果的に追求できないことである。修正可能性と能力の間のこの緊張関係は、「修正可能性と能力のトレードオフ」と呼ばれることがある。

もう一つの課題は、正当な修正と見なされるものを特定する問題である。AIシステムは、権限のある人間のオペレーターからの修正と、悪意のあるアクターによる操作の試みを区別できなければならない。これには、安全に実装することがそれ自体困難な堅牢な認証と来歴メカニズムが必要である。

一部の研究者は、修正可能性の概念が狭すぎると批判しており、AIがそもそもどのような価値観を持つべきかというより深い問題に対処せずに、修正を受け入れるAIの意思に焦点を当てていると主張している。他の研究者は、修正可能性だけでは安全性に不十分であり、AIが原則的に修正可能であっても、エラーや人間の指示の誤った解釈を通じて害を引き起こす可能性があると指摘している。

他の安全性概念との関係

修正可能性は、他のAI安全性概念と密接に関連しているが、明確に区別される。これは、AIシステムが人間の価値観と一致する目標を追求することを確保することに関する価値整合性の考え方と重なる。しかし、整合性は、AIの修正を受け入れる意思だけでなく、適切な目標の初期選択も含むより広範な概念である。修正可能性はまた、解釈可能性とも関連しており、自身の推論を説明できないAIは効果的に修正することが難しいためである。

修正可能性の概念は、主要なAI研究機関の安全性フレームワークに組み込まれている。例えば、Anthropicは、継続的な人間の修正のメカニズムを含む「憲法的AI」へのアプローチを説明しており、Google DeepMindは、人間の監督下でAIシステムが互いに修正し合う「討論による安全性」に関する研究を発表している。

現在の研究と応用

2020年代半ばの時点で、修正可能性はAI安全性コミュニティにおける活発な研究分野であり続けている。研究者たちは、モデルプルーニングデータ拡張などの技術を通じて大規模言語モデルをより修正可能にする方法を探求しており、これによりモデルがより広範な修正シナリオにさらされる。また、自動運転車やロボットシステムなどの実世界環境で動作する強化学習エージェントに修正可能性の原則を適用することへの関心も高まっている。

産業界では、OpenAIAnthropicなどの企業が、ユーザーがモデル出力にフィードバックを提供し、そのフィードバックを使用してモデルの行動を更新できるようにするなど、修正可能性に着想を得た機能を製品に実装している。しかし、これらのシステムが技術的な意味で真に修正可能である程度は議論の余地があり、ほとんどの商用AIシステムは依然として固定された目的と限られた継続的修正メカニズムでトレーニングされている。

将来の方向性

修正可能性研究の将来は、数学的に検証できるより堅牢な形式的定義の開発と、AIシステムが実際に修正可能な行動を示すかどうかをテストするための実証的方法の開発を含む可能性が高い。一部の研究者は、他のAI能力の既存のベンチマークと同様に、修正可能性の標準化されたベンチマークの作成を提案している。他の研究者は、マルチヘッドアテンションメカニズムやその他のトランスフォーマーアーキテクチャを使用して、人間のフィードバックに基づいて動的に目的を調整できるモデルを構築することを探求している。

また、真に安全で有益なAIシステムを生み出すためには、修正可能性を堅牢性や透明性などの他の安全性特性と並行して考慮する必要があるという認識も高まっている。AIシステムがより能力を高め、社会により統合されるにつれて、それらを効果的に修正する能力は、その展開にとってますます重要な要件になる可能性が高い。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:ai-safety·alignment·control-problem·machine-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴