大卫·西尔弗

译自英文

大卫·西尔弗是谷歌DeepMind的英国计算机科学家,他领导了AlphaGo、AlphaZero和MuZero背后的强化学习研究。

David Silver 是英国计算机科学家,也是Google DeepMind的首席研究员,以指导产生AlphaGoAlphaZero和MuZero的强化学习项目而闻名。他在剑桥大学获得博士学位,之后在阿尔伯塔大学与理查德·萨顿合作研究时序差分学习方法,随后加入伦敦大学学院担任讲师,并于2013年成为DeepMind创始研究团队的一员。在学术生涯之前,Silver曾在Elixir Studios担任游戏AI程序员,这是一家由戴密斯·哈萨比斯联合创办的伦敦游戏公司,两人早期的合作后来在共同加入DeepMind时得以延续。

AlphaGo与自我对弈强化学习

Silver从大约2014年起领导AlphaGo项目,将深度神经网络与蒙特卡洛树搜索相结合,通过强化学习和自我对弈进行训练。该系统于2015年10月击败欧洲冠军樊麾,随后在2016年3月于首尔举行的AlphaGo对李世石比赛中以4比1战胜世界冠军李世石,这一结果比大多数专家对围棋领域的预测提前了数年。Silver与DeepMind的同事在戴密斯·哈萨比斯的领导下,于2016年在《自然》杂志上发表了AlphaGo方法论,Silver被列为该论文的第一作者。

他随后在2017年领导了AlphaZero项目,将该方法推广到仅通过自我对弈学习国际象棋、将棋和围棋,无需人类棋谱或手工设计的特征,在每种棋类中仅经过数小时训练便达到或超越现有最强程序。后续系统MuZero于2019年问世,将方法扩展到环境规则未预先给定的场景,通过让智能体学习自身对游戏或任务的内部预测模型来实现。

奖励即足够

这一系列工作支撑了Silver提出的关于通用智能的更广泛研究论点。在2021年与Satinder Singh、Doina Precup和理查德·萨顿合著的题为“奖励即足够”的论文中,他主张,在足够复杂的环境中,仅以最大化足够丰富的奖励信号为目标的智能体,原则上可以发展出智能行为的许多标志性特征,包括规划、探索、记忆和泛化,而无需单独设计这些能力。该论文将强化学习定位为通往更强大系统的候选通用框架,这一主张与大型语言模型所采用的扩展方法一道,至今仍存在争议。

荣誉

凭借AlphaGo的工作,Silver分享了2019年ACM计算奖。他继续在伦敦大学学院担任教授,同时在Google DeepMind担任研究职务,他关于自我对弈和基于模型的强化学习的论文至今仍是该领域被引用最多的文献之一。

分类:reinforcement-learning·deepmind·game-playing-ai
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史