AI安全は、人工知能システムによる害を防ぐことを目的とする学際的な分野であり、バイアス、誤情報、悪用といった短期的な問題から、高度な能力を持つ将来のシステムに対して人間が有意義な制御を維持できるかどうかという長期的な懸念までを対象としている。この分野は機械学習研究、政策、哲学を基盤としており、実務者の間では、どのリスクに最も注意を払うべきかについて見解が分かれており、その対立はしばしば「短期的」安全と「長期的」安全という言葉で非公式に表現される。
範囲
短期的なAI安全の取り組みは、今日展開されているシステムに見られる問題、例えば、事実に反する記述を生成する[[幻覚]]、[[プロンプトインジェクション]]や[[ジェイルブレイク]]による操作、有害な出力をブロックする[[ガードレール]]の構築といった課題に対処する。長期的なAI安全の取り組みは、[[人工知能による実存的リスク]]に関係しており、[[汎用人工知能]]や[[超知能]]に近づくシステムが、人間の意図と一致しない目標を追求し、それを覆すことが困難になる可能性を含んでいる。どちらの立場も、システムの実際の動作を設計者の意図と一致させるという[[AIアライメント]]を基礎的な問題として扱っている。
歴史と機関
組織的なAI安全研究は、2020年代初頭の[[大規模言語モデル]]の拡大後に大幅に成長した。[[Anthropic]]は2021年に元OpenAIの研究者らによって設立され、彼らはフロンティアモデルを直接構築し研究することが安全研究に必要だと感じた。[[マシンインテリジェンス研究所]]や[[AI安全センター]]などの学術・非営利機関は、[[イライザー・ユドコウスキー]]や[[ダン・ヘンドリクス]]といった研究者とともに、高度なAIからの極端なリスクを深刻な可能性として扱うべきだと主張してきた。2023年には、ヘンドリクスのセンターが、AIによる絶滅リスクをパンデミックや核戦争に匹敵する世界的優先事項として扱うよう求める声明を発表し、主要な研究所のリーダーたちが署名した。これを受けて政府は、2023年11月に英国で開催された初のAI安全サミットでの[[ブレッチリー宣言]]、英国と米国における国家AI安全研究所の設立、[[EU AI法]]などの拘束力のある規制を含む、新たな機関や協定で対応した。
技術
実践的な安全技術には、[[レッドチーミング]](テスト担当者がシステム展開前に意図的に有害な行動を引き出そうとする手法)、[[解釈可能性]]研究(モデルの出力だけでなく内部計算を理解しようとする手法)、[[人間からのフィードバックによる強化学習]]や[[憲法的AI]](トレーニング中にモデルの行動を形成する手法)、そしてサイバー攻撃やバイオ兵器設計の支援能力などの危険な能力をテストする評価フレームワークが含まれる。一部の研究所は、モデルがより高性能になるにつれて追加の安全対策を発動する能力閾値を公表しており、これはAnthropicの責任あるスケーリングポリシーなどの枠組みに反映されている。
議論
一方の批評家は、実存的リスクへの焦点が、アルゴリズムバイアス、労働力の置き換え、トレーニングの環境コストといった具体的で現在進行形の害から注意と資金をそらすと主張する。もう一方の批評家は、AI安全研究者自身を含めて、より高性能なシステムを構築する競争に参加する研究所からの自主的な取り組みは、外部からの強制がなければ不十分であり、企業間や国家間の競争圧力が公に約束された安全策を損なうと論じる。この分野はまた、基本的な測定問題にも直面している。数十年にわたる事故データを持つ安全重視の産業とは異なり、AI安全活動が防ごうとしている害の可能性を定量化する確立された方法がなく、そのため優先順位をめぐる議論は未解決のままである。