AI安全は、人工知能システムから生じる事故、誤用、その他の有害な結果を防ぐことに焦点を当てた学際的な分野である。これには、AIシステムが意図通りに動作することを目指すAIアライメント、リスクに対するAIシステムの監視、そしてそれらの堅牢性の向上が含まれる。この分野は、高度なAIモデルによってもたらされる実存的リスクに特に関心を寄せているが、バイアス、監視、サイバー脅威といった短期的な問題にも取り組んでいる。
技術的研究に加えて、AI安全には安全性を促進する規範や政策の策定が含まれ、さまざまなレベルの政府における規制の提唱も含まれる。この分野は2023年に大きな注目を集め、生成AIの急速な進歩と、研究者やCEOらによる潜在的な危険性への懸念表明が相まった。2023年のAI安全サミットでは、米国と英国がそれぞれ自国のAI安全研究所を設立した。しかし、研究者らは、AI安全対策がAI能力の急速な発展に追いついていないという懸念を表明している。
動機
学者らは、重要なシステムの障害、バイアス、AIによる監視といった現在のリスクに加え、技術的失業、デジタル操作、兵器化、AIによるサイバー攻撃やバイオテロなどの新たなリスクについて議論している。また、将来の汎用人工知能(AGI)エージェントの制御喪失や、AIが永続的な独裁政権を可能にするといった投機的なリスクについても議論している。
実存的リスク
AGIに関する懸念を批判する者もいる。例えば、アンドリュー・ンは2015年に、それを「まだ惑星に足を踏み入れてもいないのに火星の人口過剰を心配するようなものだ」と比較した。一方、スチュアート・J・ラッセルは、「人間の創意工夫を過小評価するよりも、先回りして備える方が良い」と主張し、慎重さを促している。
AI研究者の間では、AI技術によってもたらされるリスクの深刻度と主な発生源について見解が大きく分かれているが、調査によれば、専門家は深刻な結果をもたらすリスクを真剣に受け止めている。AI研究者を対象とした2つの調査では、回答者の中央値はAI全体に対して楽観的であったが、高度なAIが「極めて悪い(例:人類の絶滅)」結果をもたらす確率を5%と見積もった。2022年に自然言語処理コミュニティを対象とした調査では、37%が、AIの決定が「全面核戦争と少なくとも同等に悪い」大惨事につながる可能性があると同意またはやや同意した。
歴史
AIからのリスクは、コンピュータ時代の始まりに真剣に議論され始めた。1951年、アラン・チューリングは次のように書いている。「さらに、学習し、経験によって行動が修正される機械を作る方向に進むならば、我々が機械に与える独立性の度合いの一つ一つが、我々の意図に対する反逆の可能性の度合いであるという事実に直面しなければならない。」1988年、ブレイ・ホイットビーは、AIを倫理的かつ社会的に責任ある形で開発する必要性を概説した書籍を出版した。
2008年から2009年にかけて、人工知能推進協会(AAAI)は、AI研究開発が社会に与える潜在的な長期的影響を調査し、対処するための研究を委託した。このパネルは、SF作家による急進的な見解には概ね懐疑的であったが、「複雑な計算システムの挙動の範囲を理解し検証する方法に関する追加研究は、予期しない結果を最小限に抑えるために価値があるだろう」と同意した。
2011年、ロマン・ヤンポリスキーは、哲学と人工知能理論の会議で「AI安全工学」という用語を紹介し、AIシステムの過去の失敗を列挙し、「AIがより高性能になるにつれて、そのような事象の頻度と深刻度は着実に増加するだろう」と主張した。
2014年、哲学者のニック・ボストロムは著書『スーパーインテリジェンス:道、危険、戦略』を出版した。彼は、AGIの出現が、AIによる労働力の置き換え、政治的・軍事的構造の操作、さらには人類の絶滅の可能性に至るまで、様々な社会問題を引き起こす可能性があるという見解を持っている。将来の高度なシステムが人類の存在に脅威を与える可能性があるという彼の主張は、イーロン・マスク、ビル・ゲイツ、スティーブン・ホーキングに同様の懸念を表明させた。
2015年、数十人の人工知能専門家が、AIの社会的影響に関する研究を求め、具体的な方向性を概説した人工知能に関する公開書簡に署名した。これまでに、この書簡にはヤン・ルカン、シェーン・レッグ、ヨシュア・ベンジオ、スチュアート・ラッセルを含む8000人以上が署名している。同年、スチュアート・J・ラッセル教授が率いる学者グループがカリフォルニア大学バークレー校に人間適合型AIセンターを設立し、未来生命研究所は「人工知能(AI)を安全かつ倫理的で有益なものに保つ」ことを目的とした研究に650万ドルの助成金を授与した。
2016年、ホワイトハウス科学技術政策局とカーネギーメロン大学は、AIの安全性と制御に関する公開ワークショップを発表した。これは、AIの「利点と欠点」を調査することを目的とした一連の4つのホワイトハウスワークショップの1つであった。同年、最初で最も影響力のある技術的AI安全アジェンダの1つである『AI安全性における具体的な問題』が出版された。
2017年、未来生命研究所は有益なAIに関するアシロマ会議を後援し、100人以上の思想的リーダーが、「競争回避:AIシステムを開発するチームは、安全基準の手抜きを避けるために積極的に協力すべきである」を含む有益なAIのための原則を策定した。
2018年、DeepMindの安全チームは、仕様、堅牢性、保証におけるAI安全問題を概説した。翌年、研究者らはICLRでこれらの問題領域に焦点を当てたワークショップを開催した。2021年には、『機械学習安全性における未解決問題』が出版され、堅牢性、監視、アライメント、システム的安全性における研究方向性が概説された。
2023年、リシ・スナクは、英国を「世界のAI安全規制の地理的な本拠地」にし、AI安全に関する最初の世界的サミットを主催したいと述べた。AI安全サミットは2023年11月に開催され、フロンティアAIモデルに関連する誤用と制御喪失のリスクに焦点が当てられた。サミットでは、高度なAIの安全性に関する国際科学報告書を作成する意向が発表された。
2024年、米国と英国はAI安全の科学に関する新たなパートナーシップを締結した。覚書は2024年4月1日に、米国のジーナ・レモンド商務長官と英国のミシェル・ドネラン技術長官によって署名され、11月にブレッチリー・パークで開催されたAI安全サミットで発表されたコミットメントに続き、高度なAIモデルテストを共同開発することになった。
2025年、ヨシュア・ベンジオ議長の下、96人の専門家からなる国際チームが最初の国際AI安全報告書を発表した。30カ国と国連によって委託されたこの報告書は、高度な人工知能に関連する潜在的なリスクに関する初の世界的な科学レビューである。誤用、機能不全、社会的混乱に起因する潜在的な脅威を詳述し、証拠に基づく調査結果を通じて政策に情報を提供することを目的としている。
技術的アプローチ
技術的なAI安全研究は、いくつかのサブ分野にまたがっている。堅牢性は、分布シフト、敵対的攻撃、分布外入力の下でAIシステムが確実に動作することを保証することを目的としている。監視は、異常検知や解釈可能性ツールを使用するなどして、有害な行動を検出し予測することを含む。アライメントは、AIシステムの目的と行動を人間の価値観や意図と一致させることに焦点を当てている。これには、仕様(何を望むかの定義)、保証(準拠の検証)、修正可能性(修正を可能にすること)が含まれる。
『AI安全性における具体的な問題』(2016年)は、5つの研究領域を特定した:負の副作用、報酬ハッキング、スケーラブルな監視、安全な探索、分布シフト。これらの問題は、この分野の中心であり続けている。その後の研究は、大規模言語モデルのようなモデルの内部メカニズムを理解することを目的とした解釈可能性や、マルチエージェント相互作用と社会的影響からのリスクに対処するシステム的安全性を含むように拡張されている。
機関とガバナンス
AI安全研究は、学術機関と産業研究所で実施されている。カリフォルニア大学バークレー校の人間適合型AIセンター、オックスフォード大学の未来人類研究所、機械知能研究所は、注目すべき学術ハブである。産業界の取り組みには、DeepMindの安全チーム、OpenAIのアライメント研究、Anthropicの憲法的AIアプローチが含まれる。米国AI安全研究所や英国AI安全研究所などの政府機関は、フロンティアモデルを評価するために2023年に設立された。
国際協力は成長しており、国際AI安全報告書(2025年)や米英パートナーシップのような二国間協定に例証されている。しかし、ガバナンスは断片化されたままであり、適切な規制レベルと、能力開発に対する安全研究のペースに関する議論が続いている。
課題と批判
AI安全はいくつかの課題に直面している。技術的な困難には、人間の価値観を特定することの複雑さ、ニューラルネットワークの不透明性、高度なシステムにおけるアライメントを検証することの難しさが含まれる。また、競争環境で安全対策が迂回されるリスクや、学際的な協力の必要性といった社会的な課題もある。
批判者らは、実存的リスクへの懸念は誇張されており、バイアスや監視といったより差し迫った害から注意をそらすと主張している。また、安全研究は資金不足であり、この分野には成功を測る明確な指標が欠けていると主張する者もいる。生成AIの急速な進歩はこれらの議論を激化させており、一部の研究者は特定の開発の一時停止を求めている。
今後の方向性
将来のAI安全研究は、ますます高性能になるシステムに対するスケーラブルな監視、解釈可能性、堅牢なアライメントに焦点を当てる可能性が高い。自己改善できるAIの開発は、制御と価値の固定に関する新たな疑問を提起する。国際的な調整と安全基準の確立が重要になるだろう。AIシステムが社会により統合されるにつれて、この分野は技術的リスクだけでなく、倫理的、法的、政治的側面にも対処する必要があるだろう。
国際AI安全報告書(2025年)は、証拠に基づく政策と継続的な研究の必要性を強調している。この分野は成長すると予想され、より多くの機関や政府が安全対策に投資している。しかし、AI能力と安全研究の間のギャップは、多くの専門家が指摘するように、依然として懸念事項である。