理查德·萨顿是一位计算机科学家,被广泛认为是现代强化学习的奠基人之一,这是机器学习的一个分支,关注通过奖励信号进行试错学习的智能体。
职业生涯与贡献
萨顿于1984年在马萨诸塞大学阿默斯特分校获得计算机科学博士学位,师从安德鲁·巴托,并与巴托共同开发了时序差分(TD)学习法,这是一种基于连续预测之间的差异而非等待最终结果来更新价值估计的方法。TD学习成为强化学习中核心的算法思想之一,后来与神经网络函数逼近相结合,应用于从1990年代杰拉尔德·特索罗的西洋双陆棋程序TD-Gammon,到数十年后由谷歌深度思维研究人员(包括曾师从萨顿的大卫·西尔弗)开发的阿尔法围棋及其后继系统。萨顿与巴托合著的教科书《强化学习:导论》于1998年首次出版,至今仍是该领域的标准参考书。
萨顿职业生涯后期大部分时间在阿尔伯塔大学担任教授,并担任谷歌深度思维阿尔伯塔实验室的特聘研究科学家,同时担任阿尔伯塔机器智能研究所(Amii)的首席科学顾问,该研究所是帮助加拿大成为强化学习研究中心的重要机构之一。
“苦涩的教训”
2019年,萨顿发表了一篇简短但被广泛讨论的文章《苦涩的教训》,指出在人工智能研究的历史中,利用日益增长的计算能力的通用方法(如搜索和学习)始终优于依赖手工编码人类领域知识的方法,并且研究人员反复抵制这一教训,因为这可能让人感觉是在放弃理解。这篇文章已成为关于缩放定律和大语言模型系统设计辩论中的试金石,经常被引用以支持优先考虑规模和通用算法而非手工构建的启发式方法,并常与近期关于测试时计算和推理模型系统(这些系统在可验证任务上使用类似强化学习的训练)的研究一起阅读。
萨顿与安德鲁·巴托共同获得2024年图灵奖,以表彰他们“开发了强化学习的概念和算法基础”,这一认可到来之际,强化学习技术(包括基于人类反馈的强化学习)不仅已成为游戏系统的核心,也已成为对齐现代对话式人工智能行为的关键。