Jan Leikeは、AIアライメント研究者であり、OpenAIのSuperalignmentチームを共同率いた後、2024年の注目を集めた辞任を経てAnthropicに加わった。
DeepMindとOpenAIでの経歴
Leikeは、オーストラリア国立大学で強化学習理論の博士号を取得している。OpenAIに入社する前は、DeepMindでAI安全性とAI alignment問題に関する研究科学者として働いていた。OpenAIでは、モデルをより有用で誠実にするための訓練技術に広く取り組み、ChatGPTを形成したRLHF研究プログラムに貢献し、後にスケーラブルな監視と弱から強への一般化に関するOpenAIの研究を共同執筆した。
Superalignmentと辞任
2023年7月、OpenAIはSuperalignmentチームを発表し、LeikeとOpenAIの共同創業者であるIlya Sutskeverが共同で率いることとなった。その目標は、仮想的な将来の超知能AIシステムを4年以内にアライメントするという技術的問題を解決することであり、多大な計算リソースの投入が約束された。チームの作業は、Mechanistic interpretability、スケーラブルな監視、自動化されたアライメント研究に及んだ。
2024年5月、LeikeはOpenAIを辞任し、同社では「安全性の文化とプロセスが華やかな製品に後れを取っている」と公に述べ、自身のチームが約束された計算リソースを得るのに苦労していたと明かした。彼の辞任は、Sutskever自身の退社と同じ週に起こり、急速な製品展開と長期的な安全性研究のバランスを巡るOpenAI内部の緊張に大きな注目を集めた。この緊張は、2023年11月のOpenAI board crisisでも表面化していた。
Anthropicへの移籍
OpenAIを離れた直後、Leikeはアライメント研究を続けるためにAnthropicに加わり、安全性の優先順位を巡る意見の相違からOpenAIからAnthropicへ移った研究者の増加する集団に加わった。その中には、Jared KaplanやChris Olahといった先に移籍した者も含まれる。Anthropicでは、スケーラブルな監視とモデル評価に関連する研究を継続している。
影響
Leikeの公開辞任状は、フロンティア研究所の内部インセンティブが公言する安全性へのコミットメントを確実に支えているかどうかというAI安全性コミュニティの議論において、最も広く流通した文書の一つとなった。この議論は、AI governanceや長期的なAIリスクに関するより広範な問題と密接に関連している。彼の退社は、他の安全性重視の研究者による同様の退社に続くものであり、急速に動く商業研究所の内部アライメントチームが、計算リソースと人員を巡って製品の締め切りと競争する構造的な圧力に直面している証拠として頻繁に引用された。