AlphaGo是一款由DeepMind开发的计算机程序,用于下围棋,这款游戏长期以来被视为人工智能领域的一项重大未解挑战,因为其搜索空间极为庞大,远超国际象棋,使得像深蓝中使用的暴力搜索方法在计算上不可行。AlphaGo结合了深度神经网络与蒙特卡洛树搜索,利用在人类专家棋局和自对弈强化学习中训练的网络来评估棋盘局面并选择落子。
李世石对决
AlphaGo通过2016年与李世石的对决在国际上声名鹊起,李世石是当时世界上最顶尖的职业围棋选手之一,比赛于2016年3月9日至15日在韩国首尔举行。AlphaGo以4比1赢得了五局比赛,这一结果令围棋界和人工智能界大为震惊,此前普遍预期,鉴于围棋的复杂性,人类在围棋上的优势至少还能维持十年。这场比赛在全球转播,估计有2亿人观看,成为当时人工智能能力最引人注目的公开展示之一,可以说是深度学习进入主流公众视野的时刻,其影响力堪比七年后ChatGPT的发布。
第37手
比赛第二局产生了一个成为AlphaGo创新性象征的时刻:在第37手,AlphaGo在棋盘第五线落子,职业评论员和李世石本人最初都认为这手棋极为异常,甚至可能是失误,因为它违背了人类围棋策略数百年来积累的智慧。这手棋后来被证明是AlphaGo赢得该局的关键,之后被广泛引用为证据,表明该系统产生了真正新颖的战略洞察,而非仅仅模仿或插值人类棋谱,后续对系统内部落子概率估计的分析也基本支持这一说法。第37手成为人工智能研究和大众写作中频繁引用的例子,展示了机器学习系统产生创造性、非人类式问题解决能力。
AlphaZero的前身
AlphaGo的训练最初依赖大量记录的人类专家棋局数据来初始化其策略网络,随后通过自对弈强化学习进一步优化。DeepMind随后开发了AlphaGo Zero,于2017年公布,该版本仅通过随机初始化后的自对弈学习围棋,不使用任何人类棋局数据,并且超越了原版AlphaGo的棋力。这一研究路线直接催生了AlphaZero,它将相同的自对弈方法推广到国际象棋和将棋,于2017年晚些时候发布。
反响与遗产
AlphaGo战胜李世石被广泛视为人工智能历史上的里程碑事件,其文化意义可与深蓝1997年击败加里·卡斯帕罗夫相提并论,但区别在于AlphaGo依赖学习到的模式识别而非穷举搜索,反映了人工智能研究从符号方法和暴力搜索向基于深度学习方法的转变。李世石于2019年退出职业围棋比赛,部分原因是他认为人工智能在围棋上已不可战胜,他感叹即使作为顶尖棋手,也无法击败“一个无法被击败的实体”。DeepMind的AlphaGo研究项目经常与AlphaFold一起被引用,作为DeepMind将强化学习和深度学习应用于定义明确且此前难以解决的问题这一更广泛战略的证据。