AlphaGo论文(2016年)

译自英文

DeepMind在2016年发表于《自然》的论文介绍了AlphaGo,这是第一个无需让子即击败职业围棋选手的计算机程序,其采用深度神经网络与蒙特卡洛树搜索。论文记录了对樊麾5比0的胜利,并预告了其后对李世石4比1的历史性胜利。

AlphaGo是一款下围棋的计算机程序,由总部位于伦敦的DeepMind Technologies(谷歌的收购子公司)开发。该程序及其算法在2016年1月27日发表于《自然》期刊的一篇论文中进行了描述,恰逢其战胜欧洲冠军樊麾的消息公布。这篇论文标志着人工智能领域的一个里程碑,因为AlphaGo成为首个在完整19×19棋盘上、无让子条件下击败职业人类棋手的计算机围棋程序。这一胜利被《科学》杂志评为2016年12月22日的年度突破亚军之一。

AlphaGo结合使用机器学习人工神经网络来评估棋盘局面并选择落子。它采用蒙特卡洛树搜索算法,由深度学习策略网络和价值网络引导,通过从人类对局中的监督学习和自我对弈中的强化学习进行训练。这种方法使AlphaGo克服了围棋巨大分支因子带来的挑战,而这一挑战曾阻碍了早期的人工智能方法。

发展与背景

围棋被认为比国际象棋等其他棋类更难让计算机获胜,因为其战略性和审美性使得直接构建评估函数变得困难,且其更大的分支因子使得使用传统AI方法(如alpha–beta剪枝、树遍历和启发式搜索)变得极其困难。在IBM的计算机深蓝于1997年击败国际象棋世界冠军加里·卡斯帕罗夫近二十年之后,使用人工智能技术的最强围棋程序仅达到业余5段水平,仍无法在无让子条件下击败职业围棋棋手。2012年,软件程序Zen在四台PC集群上运行,以五子和四子让子击败了武宫正树(九段)。2013年,Crazy Stone以四子让子击败了石田芳夫(九段)。

据DeepMind的David Silver称,AlphaGo研究项目约在2014年成立,旨在测试使用深度学习的神经网络在围棋上的竞争力。AlphaGo相比之前的围棋程序有了显著改进。在与包括Crazy Stone和Zen在内的其他可用围棋程序的500局对局中,单机运行的AlphaGo仅输一局。在类似的比赛中,多机运行的AlphaGo对阵其他围棋程序取得了500局全胜,并对阵单机AlphaGo赢得了77%的对局。2015年10月的分布式版本使用了1,202个CPU和176个GPU。

与樊麾的比赛

2015年10月,分布式AlphaGo以五比零击败了欧洲围棋冠军樊麾(职业二段,共九段)。这是计算机围棋程序首次在完整棋盘上、无让子条件下击败职业人类棋手。这一消息直到2016年1月27日才公布,恰逢描述算法论文在《自然》期刊上发表。

与李世石的对局

AlphaGo与韩国职业围棋棋手李世石(九段)对弈,后者是当时最顶尖的围棋棋手之一。五局比赛于2016年3月9日、10日、12日、13日和15日在韩国首尔四季酒店举行,并进行视频直播。五局中,AlphaGo赢了四局,李世石赢了第四局,这使他成为在AlphaGo所有74场正式比赛记录中唯一击败过它的人类棋手。AlphaGo运行在谷歌的云计算上,其服务器位于美国。比赛采用中国规则,贴目为7.5目,每方有两小时思考时间,外加三个60秒的读秒阶段。与樊麾对弈的AlphaGo版本使用的计算能力与本次对局相当。《经济学人》报道称它使用了1,920个CPU和280个GPU。比赛时,李世石在围棋国际冠军头衔数量上居世界第二,仅次于保持世界冠军头衔16年的韩国棋手李昌镐。由于国际围棋没有单一官方排名方法,各来源的排名可能有所不同。虽然他有时排名第一,但一些来源在彼时将他列为世界第四。AlphaGo并非专门为对阵李世石而训练,也不是为与任何特定人类棋手竞争而设计。

前三局由AlphaGo获胜,李世石认输。然而,李世石在第四局击败了AlphaGo,在第180手时获胜并赢得认输。随后AlphaGo继续取得第四胜,以认输方式赢得第五局。奖金为100万美元。由于AlphaGo五局四胜并赢得系列赛,奖金将捐赠给包括联合国儿童基金会在内的慈善机构。李世石因参加全部五局比赛获得15万美元,并因第四局获胜额外获得2万美元。

2016年6月,在荷兰一所大学举行的演示会上,DeepMind团队成员黄士杰透露,他们已修复了AlphaGo与李世石比赛第四局中出现的逻辑弱点,并且在第78手(被许多职业棋手称为“神之一手”)之后,程序将按预期运行并保持黑棋优势。在第78手之前,AlphaGo在整局比赛中一直领先,但李世石的落子导致程序计算被分散并陷入混乱。黄士杰解释说,AlphaGo的策略网络误判了局面,导致了失利。

后续与影响

为表彰这一胜利,韩国棋院授予AlphaGo荣誉九段。在与李世石的挑战赛前的准备和比赛过程被制作成同名纪录片《AlphaGo》,由Greg Kohs执导。在2017年的未来围棋峰会上,AlphaGo的Master版本在三人赛中击败了当时世界排名第一的棋手柯洁,随后AlphaGo被中国围棋协会授予职业九段。在AlphaGo与柯洁的比赛后,DeepMind退役了AlphaGo,并继续在其他领域进行AI研究。自学成才的AlphaGo Zero对早期竞争版本的AlphaGo取得了100比0的胜利,其继任者AlphaZero在2010年代末被视为世界顶级围棋棋手。AlphaZero又被一个名为MuZero的程序所取代,该程序无需教授规则即可学习。这些基于AlphaGo原理的后续程序,影响了DeepMind及其他领域的研究,并为生成式人工智能等领域的进步做出了贡献。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·deep-learning·go-game·deepmind
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史