AlphaGo 对李世石(2016年)

译自英文

2016年3月,谷歌DeepMind的AlphaGo在首尔举行的五局围棋比赛中以4比1击败世界冠军李世石,这是人工智能领域的一个里程碑式成就。

AlphaGo与李世乭的对弈,又称DeepMind挑战赛,是李世乭(一位顶级职业围棋选手)与AlphaGo(谷歌DeepMind开发的计算机程序)之间的一场五局围棋比赛。比赛于2016年3月9日至3月15日在韩国首尔举行,AlphaGo赢得了五局中的四局,所有对局均以认输结束。这一事件被广泛视为人工智能领域的里程碑,常与1997年IBM的深蓝击败世界冠军加里·卡斯帕罗夫的国际象棋比赛相提并论。

这场比赛引起了全球关注,因为围棋长期以来一直被视为计算机面临的艰巨挑战。围棋巨大的分支因子以及对直觉和模式识别的依赖,使其比国际象棋更难掌握。在AlphaGo之前,最强的围棋程序在完整的19x19棋盘上只能达到业余段位水平,许多研究人员认为计算机要击败顶级人类选手还需要十年时间。AlphaGo的胜利证明了机器学习神经网络技术能够在复杂的战略领域中超越传统的硬编码方法。

背景

围棋是一种需要战略思维、创造力和对局势直觉感知的棋盘游戏。其复杂性源于海量的可能棋盘配置,这使得暴力搜索不可行。数学家I. J. 古德在1965年写道,编程让计算机精通围棋将比国际象棋更难,因为优秀策略的原则更加定性和神秘。在2015年之前,最强的围棋程序仅达到业余段位水平,尽管有些程序在较小的9x9棋盘上表现更好。乔纳森·谢弗等研究人员对近期进展表示怀疑,而DeepMind的早期投资者埃隆·马斯克在2016年指出,专家们认为人工智能距离击败顶级职业选手大约还有十年时间。

AlphaGo与早期努力的不同之处在于使用了深度学习强化学习技术。其神经网络最初是在KGS围棋服务器上由强业余选手进行的约16万局游戏中的约3000万步棋数据库上训练的。在达到一定熟练度后,AlphaGo通过自我对弈数百万局来改进,利用强化学习来优化其策略。该系统还采用了蒙特卡洛树搜索来评估潜在棋步。与传统国际象棋程序不同,AlphaGo不依赖预先编程的棋步数据库;其决策源于训练过程,其创造者描述这对他们来说也是不可预测的。

此前战胜范辉

2015年10月,AlphaGo以5比0的比分击败了欧洲冠军范辉,一位2段职业选手。这是人工智能首次在没有让分的情况下在完整棋盘上击败职业人类选手。然而,评论员指出,范辉的排名远低于9段职业选手李世乭。此前像Zen和Crazy Stone这样的计算机程序只能在有较大让分的情况下击败顶级职业选手。谢弗在范辉比赛后评论说,AlphaGo像一个缺乏经验的神童,并预测李世乭将在三月的比赛中获胜。范辉后来表示,这次经历让他以不同的方式看待围棋,他的世界排名从大约第633位提高到2016年3月的约第300位。

准备

围棋专家已经指出了AlphaGo在对阵范辉时表现出的弱点,特别是其对整个棋盘的意识。尚不清楚该程序在李比赛前的几个月内进步了多少。AlphaGo的训练始于互联网围棋服务器上的棋局,然后涉及数千万次自我对弈。国际围棋联盟秘书长、职业选手李鹤镇对这场比赛表示兴奋,并认为双方获胜机会均等。

选手

AlphaGo

AlphaGo由谷歌DeepMind开发,这是一家总部位于伦敦的人工智能研究公司,于2014年被谷歌收购。该程序结合了机器学习与树搜索技术。其神经网络首先使用历史棋谱进行训练以模仿人类棋风,然后通过自我对弈进行强化学习来优化。该系统不使用棋步数据库;相反,其棋步是训练算法的涌现特性。在与李世乭的比赛中,AlphaGo使用了与范辉比赛时大致相同的计算能力,有报道称使用了1202个CPU和176个GPU,或高达1920个CPU和280个GPU。谷歌还表示,比赛期间使用了其专有的张量处理单元。

李世乭

李世乭是一位9段职业围棋选手,被广泛认为是围棋史上最强的选手之一。他于1996年开始职业生涯,12岁时晋升为职业段位,到比赛时已赢得18个国际冠军。李世乭以其激进且富有创造力的风格而闻名,他的参与为比赛增添了重要的声望。

比赛总结

比赛共进行五局,从2016年3月9日至3月15日每天一局。AlphaGo赢得了第一、二、三和五局,而李世乭赢得了第四局。所有对局均以输家认输结束。前三局是AlphaGo的决定性胜利,导致许多观察者得出结论,该程序已达到超越人类能力的水平。李世乭在第四局的胜利被视为人类的胜利,并表明AlphaGo并非不可战胜。第五局竞争激烈,但AlphaGo最终获胜。

奖金与后续

获胜者原定获得100万美元。由于AlphaGo获胜,谷歌DeepMind宣布将奖金捐赠给慈善机构,包括联合国儿童基金会和围棋组织。李世乭获得了17万美元,其中包括参加全部五局的15万美元和赢得一局的额外2万美元。比赛结束后,韩国棋院授予AlphaGo荣誉9段,这是围棋的最高大师级别,以表彰其“认真努力”掌握围棋。2016年12月22日,这场比赛被《科学》杂志评为年度突破的亚军。

这场胜利对人工智能研究具有更广泛的影响。它证明了神经网络和强化学习能够解决以前被认为需要人类直觉的问题。AlphaGo中使用的技术此后已被应用于其他领域,包括蛋白质折叠和科学发现。这场比赛还激发了对人工智能伦理以及人机智能关系的兴趣。相关研究影响了认知科学、模式识别和机器学习等更广泛的领域。

遗产

AlphaGo与李世乭的对弈常被引用为公众对人工智能认知的转折点。它表明机器可以在需要战略判断的任务中表现出色,而不仅仅是计算速度。这一事件还凸显了深度学习神经网络架构的潜力,这些架构后来成为生成式人工智能大型语言模型系统发展的基础。这场比赛至今仍是讨论人工智能能力与局限性的参考点。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·go-game·deepmind·2016-events
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史