AlphaGo与李世石之间的比赛是2016年3月9日至15日在韩国首尔举行的一场五局围棋系列赛。这场比赛将DeepMind的AlphaGo程序与李世石对决,后者是18次世界冠军得主,也是其时代最强的围棋选手之一。AlphaGo以四比一获胜,这一结果令围棋界大为震惊,因为此前普遍预期人类棋手还能在多年内保持优势。
背景
围棋长期以来被视为比国际象棋更难攻克的问题,而深蓝早在1997年就已征服国际象棋,原因在于围棋巨大的分支因子及其对模式识别和直觉的依赖,这些难以通过暴力搜索解决。AlphaGo结合了深度神经网络,这些网络通过监督学习在大量人类棋谱上训练,并通过强化学习在自我对弈中优化策略网络和价值网络,同时结合蒙特卡洛树搜索来选择落子。该项目由DeepMind的戴维·西尔弗领导,其创始人戴密斯·哈萨比斯长期以来对将游戏作为通用智能的试验场抱有浓厚兴趣。
比赛过程
AlphaGo赢得了前三局,在最后两局进行前就已锁定胜局。第二局产生了一个被广泛讨论的时刻,即第37手,一个非常规的肩冲,评论员最初认为这是失误,但后来的分析认为这极具创造性,是人类职业棋手不太可能下出的一手。李世石在第四局中以第78手开始的序列获胜,这一手有时被称为“神之一手”,短暂利用了AlphaGo在评估异常局面时的弱点。AlphaGo赢得第五局,最终以4比1结束比赛。
后续与意义
这一结果在专业围棋和人工智能圈子之外被广泛报道,并经常被引用为深度学习研究的里程碑,在文化影响力上可与国际象棋中的深蓝1997年战胜加里·卡斯帕罗夫相提并论。李世石形容这次失利在个人层面难以接受,后来表示即使成为顶尖人类棋手也不再意味着不可战胜。他于2019年退役,将人工智能的崛起列为因素之一,并评论说现在有了“一个无法被击败的存在”。
DeepMind在比赛后推出了泛化该方法的后续版本:一个仅通过自我对弈训练、不使用人类棋谱数据的版本,以及AlphaZero,后者将该方法从零扩展到国际象棋和将棋。这场比赛在讨论通用人工智能以及一旦找到架构、算力和训练方法的正确组合,狭义超人类性能能多快实现时经常被提及,这一主题在后来的扩展定律和涌现能力大模型辩论中反复出现。