约翰·舒尔曼是一位机器学习研究员,以开发广泛使用的强化学习算法以及领导OpenAI早期聊天模型训练方法而闻名。他在加州大学伯克利分校获得博士学位,期间在一个机器人和强化学习实验室工作,并且是2015年12月OpenAI成立时的创始研究员之一。
研究贡献
舒尔曼最被引用的技术贡献是近端策略优化(PPO),该算法在他2017年领导的一篇论文中提出。PPO将早期的信任域方法简化为一种更易于实现和调优的算法,并成为机器人和后来的语言模型训练中部署最广泛的策略梯度算法之一。PPO随后成为基于人类反馈的强化学习流程中使用的默认优化算法,包括支持ChatGPT的流程。
在OpenAI的角色
在OpenAI,舒尔曼领导了将RLHF应用于大型语言模型的团队,这项工作在2022年产生了InstructGPT,并直接推动了2022年11月ChatGPT的发布(参见ChatGPT发布)。他在内部和外部被广泛认为是使GPT-3时代模型可靠遵循指令而非仅仅续写文本的对齐技术的技术架构师。他继续领导后训练和对齐研究,贯穿GPT-4时代,与伊利亚·苏茨克弗和萨姆·奥尔特曼等同事合作。
离职加入Anthropic和Thinking Machines Lab
2024年8月,舒尔曼宣布离开OpenAI加入Anthropic,并表示他希望更直接地专注于AI对齐研究和动手技术工作,而不是管理。这一举动引人注目,因为它发生在OpenAI 2023年11月董事会危机(参见OpenAI董事会危机)不到一年之后,许多观察者将其解读为高级研究人员向安全导向实验室流动的更广泛浪潮的一部分。他在Anthropic从事对齐和后训练方法研究,直至2024年。
2025年,舒尔曼离开Anthropic加入Thinking Machines Lab,这家初创公司由前OpenAI首席技术官米拉·穆拉蒂创立,他担任联合创始人兼首席科学家。这一举动使他与多位OpenAI校友并肩,该公司筹集了AI初创公司历史上最大的种子轮融资之一。
影响
舒尔曼被认为是将强化学习从人类反馈转变为实用、生产级技术而非研究好奇心的最关键研究者之一,这一转变支撑了2022年后发布的几乎所有消费级聊天机器人。他在OpenAI、Anthropic和Thinking Machines Lab之间的职业轨迹也被引为顶级AI研究人才如何在尖端实验室之间流动的案例研究。