Traduit de l'anglais

Un programme informatique développé par DeepMind qui est devenu la première IA à vaincre un joueur humain professionnel au jeu de plateau Go, battant notamment le champion du monde Lee Sedol lors d'un match de 2016 suivi par des millions de personnes.

AlphaGo是DeepMind开发的一款计算机程序,用于下围棋--这项棋类运动长期以来被认为是人工智能领域的一大未解挑战,因为其搜索空间远大于国际象棋,使得深蓝所采用的暴力搜索方法在计算上不可行。AlphaGo将深度神经网络与蒙特卡洛树搜索相结合,利用在人类棋局和自我对弈中训练出的网络来评估棋局并选择落子。

与李世石的对弈

AlphaGo通过2016年与李世石的对弈而闻名于世。李世石是当时世界最强的职业围棋棋手之一,比赛于2016年3月9日至15日在韩国首尔举行。AlphaGo以4比1赢得五番棋,这一结果出乎许多人的意料,因为围棋界普遍认为,鉴于围棋的复杂性,人类至少还能再抵挡机器十年。这场比赛在全球范围内被广泛转播,观看人数估计达2亿,成为当时人工智能能力最引人注目的公开展示,可以说是深度学习进入公众视野的标志性时刻,其影响力堪比七年后ChatGPT的发布。

第37手

在第二局比赛中,AlphaGo下出了第37手--在棋盘第五线落子,这一手棋让职业棋手和李世石本人都感到意外,甚至被认为是失误,因为它与人类围棋数百年来积累的定式相悖。然而,这手棋后来被证明是决定性的,帮助AlphaGo赢下了那一局。事后,这一手棋被广泛引用为AlphaGo并非简单模仿或插值人类棋谱、而是产生了真正新颖战略思想的证据,系统内部对落子概率的估计也支持了这一论断。第37手因此成为人工智能研究中经常提及的案例,展示了机器学习系统能够产生创造性、非人类式的解决问题方式。

通向AlphaZero的前身

AlphaGo最初依靠大量人类职业棋手的棋谱来训练其策略网络,随后通过自我对弈的强化学习进一步优化。2017年,DeepMind推出了AlphaGo Zero,它完全从随机初始化开始,仅通过自我对弈学习围棋,不使用任何人类棋谱数据,并且棋力超越了最初的AlphaGo。这一研究方向直接催生了AlphaZero--一个将同样的自我对弈方法推广到国际象棋和日本将棋的通用系统,于2017年晚些时候发布。

反响与遗产

AlphaGo战胜李世石被广泛视为人工智能史上的里程碑事件,其文化意义可与1997年深蓝击败卡斯帕罗夫相提并论,但不同之处在于,AlphaGo依赖的是学习到的模式识别而非穷举搜索,这反映了人工智能研究从符号方法和暴力计算向深度学习方法的转变。李世石于2019年退出职业围棋界,部分原因正是他感到人工智能已不可战胜,他曾表示,即使作为顶尖棋手,他也无法击败“一个无法被击败的存在”。DeepMind的AlphaGo研究项目也常与AlphaFold一同被提及,作为DeepMind将强化学习和深度学习应用于定义明确、此前难以解决的问题的更广泛战略的例证。

Catégories:reinforcement-learning·history-of-ai·games
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique