安德鲁·盖赫雷特·巴尔托(生于1948年)是美国计算机科学家,马萨诸塞大学阿默斯特分校计算机科学荣休教授。他被广泛认为是现代计算强化学习的先驱,这一领域支撑了人工智能和机器学习的诸多进展。他的工作,尤其是与前博士生理查德·S·萨顿的合作,奠定了智能体在不确定环境中从奖励中学习的概念和算法基础。
巴尔托的研究在将强化学习从理论思想转化为实用算法方面发挥了关键作用,影响了从机器人技术到游戏对弈的多个领域。他的教科书《强化学习:导论》已成为该领域的标准参考,他的贡献获得了2024年ACM A.M.图灵奖的认可,该奖常被称为“计算领域的诺贝尔奖”。
早年生活与教育
安德鲁·盖赫雷特·巴尔托生于1948年。他最初在密歇根大学学习造船工程,但在接触迈克尔·阿尔比布、沃伦·斯特吉斯·麦卡洛克和沃尔特·皮茨的工作后,他对使用计算机和数学建模大脑产生了浓厚兴趣。他转而专注于数学,并于1970年以优异成绩获得数学学士学位。他继续在密歇根大学深造,于1975年完成计算机科学博士学位,论文主题为细胞自动机。
在马萨诸塞大学阿默斯特分校的学术生涯
1977年,巴尔托作为博士后研究助理加入马萨诸塞大学阿默斯特分校信息与计算机科学学院。他逐步晋升,于1982年成为副教授,1991年成为正教授。他于2007年至2011年担任系主任,并是神经科学与行为项目的核心教员。
在UMass,巴尔托共同指导了自主学习实验室(最初为自适应网络实验室),该实验室成为强化学习研究的中心。他的博士生理查德·萨顿与他合作提出了关键思想,共同开发了定义该领域的数学框架。
强化学习的基础
当巴尔托开始在UMass工作时,他加入了一个探索大脑神经元行为如何作为智能基础的研究小组,这一概念由A·哈里·克洛夫提出。巴尔托和萨顿使用马尔可夫决策过程(MDP)作为数学基础,解释智能体如何在随机环境中做出决策,并在每次行动后获得奖励。传统MDP理论假设智能体对环境有完全了解;巴尔托和萨顿的创新允许环境和奖励未知,使算法适用于广泛的现实问题。
他们的工作为现代强化学习奠定了基础,后者后来推动了谷歌AlphaGo击败人类冠军等突破。该技术已成为现代AI繁荣的基石,影响了深度学习和神经网络研究。
出版物与影响
巴尔托在期刊、书籍和会议论文集中发表了一百多篇论文和章节。他最具影响力的作品是与理查德·萨顿合著的教科书《强化学习:导论》,由麻省理工学院出版社于1998年首次出版,2018年出版第二版。他还与珍妮·西、沃伦·鲍威尔和唐·温奇二世共同编辑了《学习与近似动态规划手册》(Wiley-IEEE出版社,2004年)。
他的研究直接影响了许多领域,包括机器人技术、游戏对弈和自主系统,他的思想是大型语言模型和生成式AI发展的核心。
奖项与荣誉
巴尔托因其贡献获得了众多荣誉。他是美国科学促进会会士、IEEE会士和高级会员,以及美国人工智能协会和神经科学学会会员。他于2004年获得IEEE神经网络学会先驱奖,2017年获得IJCAI研究卓越奖,2019年获得UMass神经科学终身成就奖。
2024年,他与理查德·S·萨顿共同获得计算机协会颁发的图灵奖,获奖理由是:“因开发强化学习的概念和算法基础”。这一荣誉巩固了他作为该领域奠基性人物的地位。