米国AI安全研究所(AISI)は、2023年に国立標準技術研究所(NIST)内に設立され、高度な人工知能システムの安全な開発と展開を確保することを目的とした研究を実施している。その研究課題は、技術的評価、レッドチーミング、およびAIの能力とリスクに関する測定基準の開発に及ぶ。同研究所は、学術機関、産業パートナー、および国際機関と協力して、生成AIやその他の新興技術によってもたらされる課題に取り組んでいる。
AISIの研究は、厳格かつ実証的なテストがAIシステムの挙動、限界、および潜在的な害を理解するために不可欠であるという信念に基づいている。同研究所の活動は、政策提言とAI開発者向けのベストプラクティスに情報を提供し、大規模言語モデルや深層学習などの分野で高度な能力を示すフロンティアモデルに焦点を当てている。
技術的評価とレッドチーミング
AISIの研究の中心的な構成要素は、AIモデルの技術的評価の設計と実施である。これらの評価は、サイバー攻撃、生物学的脅威の創出、自律的複製などの危険な能力をテストする。研究者は、レッドチーム手法を採用し、チームが有害な出力を引き出したり、安全対策を迂回したりしようと試みる。2024年、AISIはフロンティアAIモデルを評価するための枠組みを公開し、標準化されたベンチマークと敵対的テストプロトコルを含むものとした。同研究所はまた、自動評価のためのツールを開発し、多様なシナリオにわたるモデル挙動のスケーラブルな評価を可能にしている。
安全基準とガイドライン
AISIは、AIシステムの安全基準とガイドラインの開発に貢献している。これには、堅牢性、公平性、透明性のための指標の定義、およびモデルの文書化と展開のためのベストプラクティスの確立が含まれる。同研究所は、標準化団体と協力して、AIリスク管理のための構造化されたアプローチを提供するNIST AIリスク管理フレームワークなどの国際的に認知された規範を作成している。この分野の研究はまた、モデル枝刈りやデータ拡張などの技術がモデルの安全性と信頼性を向上させる効果を探求している。
コラボレーションとパートナーシップ
AISIは、MITコンピュータ科学・AI研究所、スタンフォードAIラボ、バークレーAI研究などの主要なAI研究機関、およびOpenAI、Anthropic、Google DeepMindなどの業界プレーヤーと協力している。これらのパートナーシップにより、最先端のモデルと専門知識へのアクセスが容易になり、AISIはフロンティアシステムの展開前テストを実施できる。同研究所はまた、英国AI安全研究所などの国際的なカウンターパートと連携し、評価アプローチを調和させ、調査結果を共有している。2024年、AISIはカーネギーメロン大学とのパートナーシップを発表し、AIシステムの安全性を検証する新しい方法を開発している。
政策と公的関与
AISIの研究は、AI安全性に関する政策決定と公的議論に直接情報を提供している。同研究所は、調査結果を要約し、規制当局や立法者への勧告を行う報告書やブリーフィングを公開している。また、市民社会や学界を含む利害関係者間の対話を促進するためのワークショップや会議を主催している。AISIの活動は、AI監視に関連する大統領令や立法提案に影響を与え、証拠に基づく規制の必要性を強調している。同研究所は、評価結果と安全性研究の公開リポジトリを維持し、透明性と説明責任を促進している。
今後の方向性
今後、AISIは解釈可能性、整合性、およびAIの社会的影響などの分野に研究を拡大する計画である。同研究所は、人間の価値観とのモデル整合性を改善するために、人間のフィードバックからの強化学習(RLHF)やその他の技術の使用を探求している。さらに、AISIは汎用人工知能の潜在的なリスクと長期的な安全性の懸念を調査している。AI技術が進化するにつれて、AISIは安全性研究の最前線に留まり、新たな課題に対処するためにその方法を適応させ、害を最小限に抑えながらAIが社会に利益をもたらすことを確保することを目指している。