保罗·克里斯蒂亚诺是一位美国AI对齐研究员,以共同开发后来成为基于人类反馈的强化学习的技术以及创立非营利性对齐研究组织,,对齐研究中心而闻名。
早期职业生涯与RLHF
克里斯蒂亚诺在OpenAI成立初期担任研究员,2017年,他作为合著者参与了“基于人类偏好的深度强化学习”论文的撰写,该论文引入了核心方法:通过人类对模型输出的比较来训练奖励模型,然后针对该奖励模型优化策略。这一方法后来被扩展并应用于语言模型,成为RLHF,成为使面向聊天的模型与人类意图对齐的主导技术,最显著的是在ChatGPT及其遵循指令的前身InstructGPT的训练中。
对齐研究中心
2021年,克里斯蒂亚诺离开OpenAI,创立了非营利组织对齐研究中心(ARC),专注于AI对齐的理论研究,包括从模型中“引出潜在知识”的研究,以及评估模型是否具有其输出未揭示的能力或意图的方法。ARC还因构建并运行一些最早的正式部署前前沿模型能力评估而闻名,包括与OpenAI和Anthropic等实验室协调进行的危险能力测试,这些测试在包括GPT-4在内的模型发布前开展。
美国AI安全研究所
2024年,克里斯蒂亚诺被任命领导美国AI安全研究所的安全评估工作,该研究所隶属于国家标准与技术研究院。这一角色使一位与技术对齐工作密切关联的研究者进入了一个负责在国际AI安全峰会进程(始于2023年11月的布莱切利园)之前评估前沿模型的政府机构。这一任命在AI安全社区的不同群体中既获得了支持,也引发了关于独立性和政府评估能力的批评。
影响
克里斯蒂亚诺在AI安全领域被广泛认为是将关于长期AI风险的抽象关切转化为具体、可实证检验的研究项目的最关键研究者之一,他架起了与尼克·博斯特罗姆等人相关的更具哲学性的工作与2022年后发布的几乎所有主要面向聊天模型所采用的应用训练技术之间的桥梁。