译自英文

Jan Leike是一位德国AI对齐研究员,曾共同领导OpenAI的[[superalignment|超级对齐]]团队,后于2024年因对公司安全文化的担忧而辞职,随后加入Anthropic。

Jan Leike是一位AI对齐研究者,曾共同领导OpenAI的超级对齐团队,并在2024年高调辞职后加入Anthropic

在DeepMind和OpenAI的职业生涯

Leike在澳大利亚国立大学获得强化学习理论博士学位。在加入OpenAI之前,他曾在DeepMind担任研究科学家,专注于AI安全和对齐问题。在OpenAI,他广泛研究了训练模型使其更有帮助和更诚实的技巧,为塑造ChatGPTRLHF研究项目做出了贡献,并后来合著了OpenAI关于可扩展监督和弱到强泛化的研究。

超级对齐与辞职

2023年7月,OpenAI宣布成立超级对齐团队,由Leike和OpenAI联合创始人Ilya Sutskever共同领导,目标是在四年内解决对齐假设中的未来超级智能AI系统的技术问题,并承诺投入大量计算资源。该团队的工作涉及可解释性、可扩展监督和自动化对齐研究。

2024年5月,Leike从OpenAI辞职,公开表示该公司的“安全文化和流程已让位于光鲜的产品”,并称其团队一直在争取承诺的计算资源方面遇到困难。他的辞职与Sutskever的离职发生在同一周,引起了外界对OpenAI内部在快速产品部署与长期安全研究之间平衡的紧张关系的广泛关注,这些紧张关系在2023年11月的OpenAI董事会危机中也曾浮现。

转投Anthropic

离开OpenAI后不久,Leike加入Anthropic继续对齐研究,加入了一个不断壮大的研究人员群体,其中包括早前因安全优先级分歧而从OpenAI转投Anthropic的Jared KaplanChris Olah等人。在Anthropic,他继续从事与可扩展监督和模型评估相关的工作。

影响

Leike的公开辞职信成为AI安全社区讨论中最广泛传播的文件之一,涉及前沿实验室的内部激励机制是否可靠地支持其声明的安全承诺,这一辩论与AI治理长期AI风险中的更广泛问题密切相关。他的离职,以及其他安全导向研究人员的类似退出,经常被引用为证据,表明快速发展的商业实验室中的内部对齐团队在计算资源和人员配置方面面临与产品截止日期竞争的结构性压力。

分类:ai-safety·alignment·industry
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史