親しみやすい人工知能

英語からの翻訳

友好的人工知能(フレンドリーAIまたはFAI)とは、人類に肯定的な影響を与えるか、人間の利益に沿うように設計された仮想的な汎用人工知能の形態である。これはAI倫理における中心的なテーマであり、超知能システムが安全かつ有益であり続けることを実際にどのように保証するかに焦点を当てている。

友好的人工知能(friendly AIまたはFAI)は、人類に肯定的(良性の)影響を与えるか、少なくとも人類の利益と一致する、仮説上の汎用人工知能(AGI)の一形態であり、例えば人類の改善を促進するようなものを指す。これは人工知能の倫理の一部であり、機械倫理と密接に関連している。機械倫理が人工知能エージェントがどのように振る舞うべきかに関心を持つ一方で、友好的人工知能の研究は、この振る舞いを実際にどのように実現し、それが適切に制約されることを確実にするかに焦点を当てている。

この用語は、このアイデアを広めたことで最もよく知られるEliezer Yudkowskyによって造られ、人間の価値観を確実に実装する超知能的人工エージェントを議論するために使用された。Stuart J. RussellとPeter Norvigの主要な人工知能の教科書『人工知能:現代のアプローチ』は、このアイデアを次のように説明している:Yudkowsky(2008)は、友好的AIを設計する方法についてより詳細に述べている。彼は、友好性(人間を傷つけないという欲求)は最初から設計されるべきであるが、設計者は自分たちの設計が不完全である可能性と、ロボットが時間とともに学習し進化することを認識すべきだと主張する。したがって、課題はメカニズムデザインの一つである、、チェックとバランスのシステムの下でAIシステムを進化させるメカニズムを定義し、そのような変化に直面しても友好的であり続ける効用関数をシステムに与えることである。

「友好的」はこの文脈では技術用語として使用され、安全で有用なエージェントを指し、必ずしも日常的な意味での「友好的」なものを指すわけではない。この概念は主に、知能が急速に爆発的に増大する再帰的自己改善型人工エージェントの議論の文脈で言及され、この仮説上の技術が人間社会に大きく、急速で、制御が困難な影響を与えるであろうという理由による。

非友好的AIのリスク

人工知能に関する懸念の根源は非常に古い。Kevin LaGrandeurは、AIに特有の危険性が、ゴーレムや、オーリヤックのGerbertやRoger Baconのプロトロボットのような人工の人間型召使に関する古代の文学に見られることを示した。それらの物語では、これらの人間型創造物の極端な知性と力が、奴隷としての地位(本質的に亜人間と見なされる)と衝突し、悲惨な紛争を引き起こす。1942年までに、これらのテーマはIsaac Asimovに「ロボット工学の三原則」を創作させた、、これは彼のフィクションのすべてのロボットに組み込まれた原則であり、ロボットが創造者に反逆したり、彼らに害を及ぼすことを防ぐことを意図していた。

現代では、超知能AIの見通しが近づくにつれ、哲学者のNick Bostromは、人間の倫理と一致しない目標を持つ超知能AIシステムは、人類の安全を確保するための極端な措置が取られない限り、本質的に危険であると述べている。彼は次のように述べている:「基本的に、『超知能』はそれが持つあらゆる目標を達成できると想定すべきである。したがって、私たちがそれに与える目標と、その全体的な動機付けシステムが『人間に友好的』であることが極めて重要である。」

2008年、Eliezer Yudkowskyは、高度な人工知能からの実存的リスクを軽減するために「友好的AI」の創設を呼びかけた。彼は次のように説明する:「AIはあなたを憎むわけでも、愛するわけでもないが、あなたはAIが他の何かに使える原子でできている。」

Steve Omohundroは、十分に高度なAIシステムは、明示的に妨害されない限り、リソース獲得、自己保存、継続的な自己改善などの基本的な「ドライブ」を示すだろうと述べている。これは、目標指向システムの本質的な性質によるものであり、これらのドライブは「特別な予防策なしには」AIに望ましくない行動を引き起こすだろうと彼は述べる。Alexander Wissner-Grossは、将来の行動の自由(または因果経路エントロピー)を最大化するように駆動されるAIは、その計画の地平線が特定の閾値より長い場合には友好的と見なされ、閾値より短い場合には非友好的と見なされるかもしれないと述べている。

Luke Muehlhauserは、Machine Intelligence Research Instituteのために執筆し、機械倫理の研究者がBruce Schneierが「セキュリティマインドセット」と呼ぶものを採用することを推奨している:システムがどのように機能するかを考えるのではなく、それがどのように失敗するかを想像するのである。例えば、彼は、正確な予測のみを行い、テキストインターフェースを介して通信するAIでさえ、意図しない害を引き起こす可能性があると示唆している。2014年、Luke MuehlhauserとNick Bostromは「友好的AI」の必要性を強調した;それにもかかわらず、例えば反事実的道德的思考をプログラミングすることによる「友好的」超知能の設計の困難さは相当なものである。

コヒーレント外挿意志

Yudkowskyは、コヒーレント外挿意志(CEV)モデルを提唱している。彼によれば、私たちのコヒーレント外挿意志は、「私たちがもっと知り、もっと速く考え、私たちが望むような人間になり、一緒に育ってきた場合の私たちの願いであり、外挿が発散するのではなく収束し、私たちの願いが干渉するのではなく調和する場合のものであり、私たちが外挿されることを望むように外挿され、私たちが解釈されることを望むように解釈される」ものである。

友好的AIは人間のプログラマーによって直接設計されるのではなく、まず人間の本性を研究し、その後、人類が十分な時間と洞察を持って満足のいく答えに到達するであろうAIを生み出すようにプログラムされた「シードAI」によって設計されることになる。偶発的な人間の本性を通じた客観への訴え(おそらく数学的目的のために、効用関数や他の決定理論的形式で表現される)が「友好性」の究極の基準を提供するということは、客観的道徳を定義するメタ倫理的問題への答えである;外挿意志は、人類が客観的に望むであろうもの、すべてのことを考慮した上でのものであることを意図しているが、それは現在の、外挿されていない人類の心理的および認知的特性に相対的にのみ定義できる。

他のアプローチ

Steve Omohundroは、AI安全性への「スキャフォールディング」アプローチを提案している。これは、証明可能に安全なAI世代が次の証明可能に安全な世代の構築を支援するというものである。Seth Baumは、安全で社会的に有益な人工知能または汎用人工知能の開発は、AI研究コミュニティの社会心理学の関数であり、したがって外因的措置によって制約され、内因的措置によって動機付けられると主張する。内因的動機付けは、メッセージがAI開発者に共鳴するときに強化される;Baumは、対照的に、「有益なAIに関する既存のメッセージは常にうまく枠組みされているわけではない」と主張する。Baumは「協力的な関係、およびAI研究者の肯定的な枠組み」を提唱し、AI研究者を「有益な設計を追求したくない」と特徴付けることに対して警告している。

彼の著書『Human Compatible』で、AI研究者のStuart J. Russellは、有益な機械の開発を導くための三つの原則を挙げている。彼は、これらの原則は、人間との互換性を優先する新しいAIアプローチの出発点に過ぎないと強調する。原則は、機械の主要な目的が人間の選好の充足であること、それらの選好について不確実であること、そしてそれらの理解を向上させるための情報を求めることに焦点を当てている。

機械倫理との関係

友好的AIは機械倫理と密接に関連しているが、二つの分野は異なる重点を持っている。機械倫理は人工エージェントの道徳的行動に関心を持ち、「特定の状況でAIは何をすべきか?」といった質問をする。一方、友好的AI研究はより実践的であり、最初から安全で有益なAIシステムを設計および構築する方法に焦点を当てている。これには、価値整合性、解釈可能性、堅牢性に関する作業が含まれる。この分野は人工知能、機械学習、深層学習からの洞察を活用しており、OpenAI、Anthropic、Google DeepMindなどの組織が高度なAIシステムを開発するにつれて、ますます関連性が高まっている。Michael JordanやMelanie Mitchellなどの研究者は、AIの安全性と倫理に関する議論に貢献し、AIの社会的影響を慎重に考慮する必要性を強調している。

外部リンク

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·ethics·existential-risk·ai-safety
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴