AlphaGo Zero是一款由Google DeepMind于2017年开发的计算机程序,通过自我对弈强化学习在棋盘游戏围棋中达到了超人类水平。与其前身AlphaGo(基于数千盘人类业余和职业棋局训练)不同,AlphaGo Zero完全从零开始学习,以随机落子起步,仅通过与自身对弈来提升。该程序在2017年10月发表于期刊《自然》的论文中介绍,标题为“Mastering the game of Go without human knowledge”(无需人类知识掌握围棋)。
该系统将深度神经网络与一种称为蒙特卡洛树搜索的机器学习算法相结合。神经网络评估棋盘局面并预测获胜概率,而树搜索则指导落子选择。训练采用强化学习循环:网络进行数百万次自我对弈,其参数被更新以更好地预测对局结果并改进落子选择。这种方法消除了对人类专家数据的需求,证明了人工智能能够独立发现复杂策略。
架构与训练
AlphaGo Zero的架构比早期版本更简单。它使用带有残差块的单一神经网络,这是一种有助于训练极深网络的深度学习结构。网络以当前棋盘状态为输入,输出两个值:策略向量(每个可能落子的概率)和价值标量(估计的获胜概率)。训练采用Adam优化器以及结合策略和价值误差的自定义损失函数。
自我对弈游戏在多台机器上并行生成。每局游戏由当前最佳网络进行,结果用于通过随机梯度下降更新网络。训练过程在64个张量处理单元(TPU)上运行约72小时,TPU是Google设计的定制硬件加速器。在此期间,程序进行了约490万次自我对弈游戏,这一数量远小于其他一些AI训练方案中使用的数十亿局游戏。
性能与结果
经过三天的训练,AlphaGo Zero达到了超越此前击败2016年世界冠军李世石的AlphaGo版本的水平。21天后,其评分达到约5185 Elo,高于任何人类棋手或之前的AI系统。在一系列评估对局中,AlphaGo Zero以100比0击败AlphaGo Lee,并以89比11击败早期改进版本AlphaGo Master。
该程序自行发现了许多已知的围棋策略,包括“3-3点”打入等开局模式和复杂的中盘战术。它还发展出人类棋局中不常见的新颖策略,例如令职业棋手惊讶的异常早期落子。这表明自我对弈学习能够在没有人类指导的情况下产生创造性解决方案。
意义与影响
AlphaGo Zero代表了人工智能研究的一个重要里程碑。它证明了一种通用学习算法,结合足够的计算能力,能够在没有任何先验知识的情况下掌握复杂领域。这与早期依赖人类专家知识或手工设计特征的方法形成对比。AlphaGo Zero的成功影响了后续的强化学习工作,包括在其他游戏以及蛋白质折叠和芯片设计等现实问题中的应用。
该方法还凸显了计算资源的重要性。虽然算法在概念上简单,但需要大量硬件来运行数百万次自我对弈游戏。这引发了关于此类技术可及性的问题,因为只有像DeepMind这样的大型组织才能负担所需的基础设施。然而,核心思想后来被改编用于较小规模的问题和开源实现。
遗产与后续工作
AlphaGo Zero背后的原理被扩展到其他领域。2019年,DeepMind发布了AlphaZero,这是一个更通用的版本,可以使用相同的自我对弈方法玩围棋、国际象棋和将棋。AlphaZero在这三种游戏中均达到超人类水平,进一步证明了该方法的通用性。这些系统的成功为更广泛的深度学习领域做出了贡献,并强化了强化学习在AI发展中的潜力。
AlphaGo Zero还引发了关于AI中创造力和直觉本质的讨论。它在没有人类输入的情况下发现新颖策略的能力表明,机器可以在复杂环境中生成原创解决方案。这对游戏之外的领域,包括科学发现和优化问题,具有启示意义。该程序仍然是简单学习规则在结合足够计算时如何导致复杂行为的标志性例子。
接受与批评
尽管AlphaGo Zero因其技术成就而广受赞誉,一些研究人员指出了局限性。训练过程需要巨大的计算资源,使其对许多学术实验室不切实际。此外,该程序专门针对围棋,未经重大修改无法推广到其他任务。批评者还指出,自我对弈方法依赖于具有明确规则的良好定义环境,这可能不适用于具有不确定性和不完整信息的现实问题。
尽管存在这些保留意见,AlphaGo Zero对AI研究的影响是巨大的。它启发了关于自我对弈和课程学习的新工作,其成功帮助验证了智能行为可以从简单学习机制中涌现的观点。该程序常被引用为现代机器学习技术力量的关键例子,并仍是AI课程和研究论文中的研究对象。