スタンフォードAI安全研究とは、スタンフォード大学における、Artificial intelligenceに伴うリスクの理解と軽減に特化した学術的取り組みの総称である。これらの取り組み、特にスタンフォード存在論的リスク・イニシアチブ(SERI)は、コンピューターサイエンス、哲学、法学、政策学の研究者を結集し、短期的および長期的な安全性の課題に取り組んでいる。その活動は、堅牢なMachine learningシステムに関する技術研究、ガバナンス枠組み、倫理的考察に及び、スタンフォードを世界的なAI安全の展望における主要な学術ハブとして位置づけている。
この分野は、Deep learningおよびLarge language model技術の急速な進歩とともに出現した。これらの技術は、変革的な可能性と新規の故障モードの両方を実証している。スタンフォードの関与は、AI倫理に関する初期の学術的議論から構造化されたプログラムへと成長し、SERIは研究、教育、アウトリーチを調整するために正式に設立された。このイニシアチブは、他の機関や業界ラボ、特にAnthropicやOpenAIと協力し、知見を共有し、安全慣行に影響を与えている。
技術研究の方向性
スタンフォードの研究者は、敵対的入力に対する堅牢性、Neural networkの決定の解釈可能性、AIシステムと人間の価値観との整合性など、さまざまな技術的安全問題を調査している。Transformer (architecture)アーキテクチャに関する研究では、アテンション・メカニズムをより透過的にする方法が探求され、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)に関する研究では、意図した指示を確実に遵守するモデルを訓練する方法が検討されている。同大学はまた、欺瞞や権力追求行動などの危険な能力を展開前に測定する評価ベンチマークの開発にも貢献している。
重要な焦点は、Large language modelシステムが他のAIシステムを監視するために使用されるスケーラブルな監視と、安全性特性の形式的検証にある。研究者は、意図しない行動を減らす技術としてModel PruningとData Augmentationに関する論文を発表し、生成の多様性とリスクを制御するためにTop-P (Nucleus) SamplingとTemperature Scalingを積極的にテストしている。これらの技術的努力は、BAIR (Berkeley AI Research)およびUniversity of Oxfordとの共有安全枠組みに関する協力によって補完されている。
ガバナンスと政策関与
技術的活動に加えて、スタンフォードAI安全研究は政策立案に関与し、ホワイトペーパーを作成し、AI規制について政府機関に助言している。同大学は、立法者、業界リーダー、学者を集め、AIによる危害の責任、透明性要件、国際協力などのトピックについて議論するワークショップを開催している。SERIは米国議会スタッフ向けのブリーフィングを組織し、TSMCやNVIDIA類似のハードウェアの高度なチップに関する輸出管理の議論を含む、国家AI戦略に情報を提供する報告書に貢献してきた。
このイニシアチブはまた、雇用の喪失や誤情報などのAI展開の社会的影響を調査し、包摂的な開発慣行を提唱している。教員は公聴会で証言し、オピニオン記事を発表しており、大学院生は技術的視点と政策的視点を橋渡しするセミナーシリーズを運営している。この活動は、MIT CSAILやCarnegie Mellon Universityでの広範な取り組みと一致しているが、シリコンバレーへの近接性により、スタンフォードは業界の実務者への独自のアクセスを持っている。
教育とコミュニティ構築
スタンフォードは、Gradient Clippingから存在論的リスクモデリングまでをカバーする大学院セミナーを含むAI安全コースを提供している。同大学は、読書会、ハッカソン、キャリアフェアを組織する学生主導のグループを支援し、学生を安全重視の組織でのインターンシップに結びつけている。SERIは初期キャリア研究者に資金を提供するフェローシッププログラムを運営し、Google DeepMind、Amazon Web Services、その他の主要ラボからの参加者を集める年次会議を主催している。
コミュニティ構築は、講義録画や基礎論文のキュレーションされた書誌などのオンラインリソースにも及んでいる。このイニシアチブはまた、Stanford AI Labとインフラを共有し、University of Torontoと機関間の研究交換を行っている。これらの取り組みは、学界であれ、Inflection AIやAI21 Labsのような企業であれ、研究において安全性を優先する研究者のパイプラインを育成することを目的としている。
注目すべき貢献と協力
スタンフォードの研究者は、「仕様ゲーミング」の概念や報酬ハッキング検出方法など、影響力のある安全性の概念にいくつか貢献してきた。また、外部監査人や規制機関によって使用されるAIシステム監査のためのオープンソースツールも開発している。Anthropicとの協力プロジェクトでは、立憲的AIが探求され、OpenAIとの共同研究では、スケーラブルな監視の限界が調査された。
Michael I. JordanやAnima Anandkumarなどの教員は、その主たる研究は中核的な機械学習にあるものの、安全性の議論に専門知識を提供してきた。このイニシアチブはまた、Google DeepMindやXerox PARCからの訪問研究者の恩恵を受け、アイデアの相互受粉を促進している。2024年現在、スタンフォードAI安全研究は拡大を続けており、長期的リスク研究のための新たな資金と、業界および政府の安全関連役割に配置された卒業生のネットワークが成長している。
将来の見通し
スタンフォードAI安全研究の軌道は、特にGenerative AIシステムがより有能になるにつれて、フロンティアAI開発とのより深い統合を指し示している。研究者は、有害な出力を罰するLoss Functionsなどを通じて、安全性の制約をトレーニングパイプラインに直接埋め込む方法と、より解釈可能なMulti-Head Attentionメカニズムを設計する方法を探求している。このイニシアチブはまた、AIガバナンスの国際規範を形成することを目指し、政策フットプリントを拡大する計画である。
商業展開の急速なペースや創発的行動の予測の難しさなど、課題は残っている。しかし、厳密な技術研究と実用的な政策関与を組み合わせたスタンフォードの学際的アプローチは、これらの課題に対処する位置にある。オープンサイエンスと協力への大学のコミットメントは、その発見が学術ラボからスタートアップ、確立された企業に至るまで、より広範なAIコミュニティに利益をもたらすことを保証している。