斯图尔特·罗素是英国计算机科学家,加州大学伯克利分校教授,最为人知的身份是与彼得·诺维格合著《人工智能:一种现代方法》(AIMA),,该书自1995年首版以来,一直是该领域使用最广泛的入门教材。
职业生涯
罗素1962年出生于英格兰朴茨茅斯,在牛津大学学习物理学,1986年在斯坦福大学获得计算机科学博士学位。同年他加入伯克利,此后一直在此任教,研究领域涵盖概率推理、知识表示和强化学习。AIMA现已出版多个版本,将人工智能呈现为一个围绕理性智能体概念组织的统一学科,并深刻影响了几代学生对该领域的入门认知,包括其中涉及的搜索、逻辑规划和机器学习内容。
人类兼容的人工智能
自2010年代中期以来,罗素成为学术界最突出的声音之一,主张“标准模型”存在根本性风险,,在该模型中,系统被构建为优化一个固定的、由人类指定的目标,而随着系统能力增强,任何目标设定不当都可能以意想不到的方式被追求,从而带来危害。在他2019年的著作《人类兼容》中,他提出了一种他称之为“可证明有益”的人工智能替代方案:机器被设计为对人类偏好保持刻意的不确定性,并将决策权交还人类,而不是自信地追求一个硬编码的目标。这一框架与更广泛的对齐研究紧密相关。
罗素创立并领导伯克利的“人类兼容人工智能中心”(CHAI),该中心致力于研究如何让先进人工智能系统始终处于人类有意义的控制之下。他是2023年暂停信的签署人之一,该信呼吁暂停训练最强大的模型。他还曾在多个国家和国际机构就人工智能风险与监管作证,其工作被置于关于人工智能安全和人工智能生存风险的更广泛讨论之中,与约书亚·本吉奥等研究者并列。罗素认为,该领域自身公开宣称的长期目标,,构建在几乎所有任务上达到或超越人类水平的通用智能,,要求研究者严肃对待一个问题:如果这一目标在控制问题尚未解决的情况下实现,后果将如何。这一关切也是通用人工智能安全研究的核心议题。