AI Safety Instituteは、最先端のAIモデル(フロンティアAIモデルとも呼ばれる)の安全性を評価・確保するために設立された政府支援組織である。2023年11月に英国政府によって創設され、英国で開催されたAI安全サミットを受けて、フロンティアAIタスクフォースから発展した。この研究所の主な使命は、最先端のAIシステムの独立した安全性評価を実施し、AIの安全性とガバナンスに関する国際基準を設定することである。
この研究所は、AIリスクへの懸念が高まった時期、特に2023年に高度なAIによる潜在的な存在リスクに関する公的な声明が出された後に注目を集めた。リシ・スナク首相率いる英国政府は、独立した監視の必要性を強調し、スナク首相はAI企業は「自分の宿題を採点することはできない」と述べた。これにより、導入前テストと安全性研究のための専門機関として研究所が設立された。
設立と初期活動
AI Safety Instituteは、2023年11月のAI安全サミットで正式に発足し、フロンティアAIタスクフォースを引き継いだ。当初はロンドンに拠点を置いていたが、2024年5月には、多くの主要AI企業が本社を置くサンフランシスコにオフィスを開設する計画を発表した。この動きは、英国の技術担当大臣ミシェル・ドネランによれば、「AI安全性に関する新たな国際基準を設定する」という広範な戦略の一環であった。
2024年4月、研究所は米国の対応機関と共同安全性テストに関する協定を締結した。この協力は、多くのAI企業が共通ルールが確立されるまで最先端モデルへの導入前アクセスを共有することに消極的だったため、評価手順の調和を目的とした。研究所の活動は、OpenAI、Anthropic、Google DeepMindなどの主要開発者のモデル評価に焦点を当てている。
国際ネットワーク
AI Safety Instituteは、2024年5月のAIソウルサミットを受けて、同様の機関のより広範な国際ネットワークの一部となった。国際リーダーたちは、英国、米国、日本、フランス、ドイツ、イタリア、シンガポール、韓国、オーストラリア、カナダ、欧州連合の機関からなるネットワークを形成することに合意した。このネットワークは、安全性評価を調整し、管轄区域間でベストプラクティスを共有することを目的としている。
2025年7月、ネットワークはAIエージェントの評価に関する問題、特に機密情報漏洩とサイバーセキュリティに関連する問題を探る演習を実施した。ネットワークメンバーはまた、サンディエゴで開催されたNeurIPS 2025で協力努力をさらに進めるために会合した。ネットワークの形成は、AI開発と展開のグローバルな性質を考慮すると、AI安全性には国際協力が必要であるという認識の高まりを反映している。
評価と研究の焦点
研究所の中心的な活動は、フロンティアAIモデルの公開前の独立した評価を実施することである。これには、Large language modelの性能、悪用の可能性、人間の価値観との整合性などの分野の評価が含まれる。研究所は、Machine learning研究の方法論を用いて厳格なテストを設計・実施する技術専門家を雇用している。
重要な焦点は、Generative AIやDeep learning技術に関連するものを含む、高度なAIシステムに関連するリスクの特定と軽減である。研究所はまた、Reinforcement Learning from AI Feedback (RLAIF)やModel Pruningなどの安全メカニズムを研究し、これらの技術がモデルの動作にどのように影響するかを理解している。その調査結果は政府の政策に情報を提供し、国際的に採用できる安全基準の開発に貢献している。
改名と進化
2025年、英国のAI Safety Instituteは「AI Security Institute」に改名され、安全性に加えてセキュリティ上の懸念を含むようにその任務が拡大されたことを反映した。この変更は、米国でも対応機関がCenter for AI Standards and Innovation(CAISI)となった同様の進化を反映したものである。この改名は、偶発的な害だけでなく、AIシステムの意図的な悪用にも対処する方向へのシフトを示していた。
名称変更にもかかわらず、研究所はフロンティアAIモデルの評価と安全な開発慣行の促進という中核的な使命を継続している。MIT CSAILやStanford AI Labなどの学術機関や業界パートナーと緊密な関係を維持し、AI安全性研究の最前線に立ち続けている。AIの能力が急速に進歩し続ける中、研究所の活動は依然として重要である。
影響と遺産
AI Safety Instituteは、グローバルなAIガバナンスの形成に重要な役割を果たしてきた。その設立は、自主的な業界の自己規制を超えて、政府がAI監視に関与する上での画期的な出来事となった。研究所の独立評価モデルは他の国々にも採用され、世界中で同様の機関の創設に貢献した。
研究所の導入前テストへの重点は、AI開発者が安全性に取り組む方法に影響を与え、より厳格な内部評価プロセスを奨励した。国際パートナーとの協力努力は、AIリスクに対するより調整されたグローバルな対応の構築に貢献した。2025年現在、研究所は進化するAI安全性とセキュリティの状況において重要なプレーヤーとして活動を続けている。