译自英文

由DeepMind开发的一种强化学习系统,于2017年12月公布,它仅通过自我对弈,在不使用任何人类棋局数据的情况下,学会了以超人类水平下国际象棋、日本将棋和围棋。

AlphaZero是一个由DeepMind开发的[[强化学习]]系统,它使用单一通用算法,在没有人类生成的[[训练数据|游戏数据]]的情况下,以超人类水平学会了国际象棋、将棋和围棋。DeepMind在2017年12月发表的一篇论文中宣布了AlphaZero,描述了一个仅从每种游戏的规则出发,完全通过自我对弈学习的系统,该系统使用[[深度学习|深度神经网络]]结合蒙特卡洛树搜索来评估局面并选择走法,然后通过与自身对弈的游戏结果来改进该网络。

与AlphaGo的关系

AlphaZero将AlphaGo Zero首次展示的自我对弈方法推广到了更多游戏。AlphaGo Zero是AlphaGo的一个版本,它仅通过自我对弈学习围棋,无需人类游戏数据。AlphaGo和AlphaGo Zero专门针对围棋,而AlphaZero使用相同的底层架构和训练流程,除了规则本身外没有任何针对特定游戏的调整,也在国际象棋和将棋中达到了超人类水平,证明了自我对弈强化学习方法并非围棋特有的技巧,而是一种真正通用的掌握完美信息游戏的方法。

国际象棋结果

AlphaZero在国际象棋上的结果引起了人工智能和国际象棋界的特别关注,因为国际象棋的计算机引擎开发历史远比围棋悠久,二十年来一直由使用深度、手工调优的暴力搜索的传统引擎主导,最著名的是Stockfish。经过仅四小时的自我对弈训练,不使用开局库、残局表库或其他超出基本规则的国际象棋特定人类知识,AlphaZero在100局比赛中击败了Stockfish。包括审阅了这些对局的国际象棋特级大师在内的评论者指出,AlphaZero的国际象棋下法展现出独特的风格,偏好长期的棋子机动性和王的安全,而非传统引擎中嵌入的计子启发式,并且经常做出牺牲,产生持久的局面优势而非即时的物质收益,这种风格被一些人描述为比先前引擎更直观或更具美学冲击力。

意义

AlphaZero证明了单一自我对弈强化学习算法可以在没有领域特定工程的情况下掌握多种不同的完美信息游戏,这被视为迈向更通用学习系统的重要一步,尽管AlphaZero仍局限于完全可观察、确定性、双人游戏,并未扩展到与[[人工通用智能]]相关的开放式现实世界任务。其架构和自对弈训练方法影响了DeepMind后续的研究,包括MuZero,这是一个后续系统,通过学习环境的内部[[世界模型]]来玩游戏,包括规则未知的游戏,而非直接给定规则。AlphaZero的国际象棋对局随后被职业棋手和引擎开发者广泛研究,其一些风格倾向影响了后来国际象棋引擎的设计和评估,包括采用类似自我对弈训练方法的开源神经网络引擎。

反响

AlphaZero在人工智能研究中被广泛引用,作为自我对弈强化学习结合深度神经网络和搜索力量的里程碑式展示,扩展了AlphaGo早期结果的意义,包括其在2016年战胜李世石的胜利,并强化了DeepMind更广泛的研究叙事,即通用学习算法在足够计算能力下,可以在定义明确的领域中匹敌或超越数十年积累的人类和手工工程领域知识。

分类:reinforcement-learning·history-of-ai·games
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史