译自英文

MuZero是DeepMind开发的一种强化学习算法,它无需了解棋盘游戏和Atari游戏的规则,通过结合学习模型与基于树的搜索来掌握这些游戏。该算法于2019年发布,在国际象棋、将棋、围棋及Atari基准测试中,其表现与先前最先进的系统相当或更优。

MuZero 是由人工智能研究公司DeepMind(谷歌的子公司)开发的一款计算机程序,旨在无需知晓游戏规则及其底层动态的情况下掌握游戏。其于2019年发布,并包含了对围棋、国际象棋、日本将棋以及57款不同Atari游戏的性能基准测试。该算法采用了与AlphaZero类似的方法,即结合基于树的搜索与学习模型。它在国际象棋和日本将棋上的表现与AlphaZero相当,在围棋上则有所提升,并且在掌握一系列57款Atari游戏(即Arcade学习环境)方面,超越了现有技术水平。

MuZero通过自我对弈进行训练,无需访问规则、开局库或残局库。训练后的算法使用了与AlphaZero相同的卷积和残差架构,但在搜索树中每个节点的计算步骤减少了20%。

历史

2019年11月19日,DeepMind团队发布了一份关于MuZero的预印本。这项工作直接建立在AlphaZero算法的基础上,后者通过结合机器学习与蒙特卡洛树搜索,在国际象棋、日本将棋和围棋中展现了超人类的表现。MuZero通过移除对游戏模拟器进行编程的需求,扩展了这一范式。

源自AlphaZero

MuZero(MZ)是AlphaZero(AZ)算法的高性能规划与无模型强化学习方法的结合。这种结合使得在经典规划领域(如围棋)中训练更为高效,同时也能够处理输入更为复杂的领域,例如视觉视频游戏。

MuZero直接源自AZ代码,并共享其超参数设置规则。两者方法之间的差异包括:

  • AZ的规划过程使用一个知晓游戏规则且必须被显式编程的模拟器。随后,一个神经网络预测未来局面的策略与价值。游戏规则的完全知识被用于建模搜索树中的状态转移、每个节点可用的动作以及树分支的终止。MZ则无法访问规则,而是通过神经网络来学习这些内容。
  • AZ对于游戏(从棋盘局面到预测)使用单一模型;MZ则分别使用模型来表示当前状态(从棋盘局面到其内部嵌入)、状态动态(动作如何改变棋盘局面的表示)以及预测未来局面的策略与价值(给定状态的表示)。
  • MZ的隐藏模型可能很复杂,并且可能能够进行计算;在训练好的MZ实例中探索隐藏模型的细节,是未来研究的一个课题。
  • MZ并不期望一个赢家通吃的双人游戏。它适用于标准的强化学习场景,包括具有连续中间奖励、可能具有任意幅度并带有时间折扣的单智能体环境。AZ则是为可能分出胜负、平局或输赢的双人游戏而设计的。

与R2D2的比较

在玩Atari游戏套件方面,之前的最先进技术是R2D2,即循环重放分布式DQN。MuZero在该游戏套件上的平均和中位性能均超越了R2D2,尽管并非在每款游戏上都表现更好。

训练与结果

MuZero在训练时使用了16个第三代张量处理单元(TPU),并在棋盘游戏的自我对弈中使用了1000个TPU,每一步进行800次模拟;在Atari游戏的训练中使用了8个TPU,自我对弈中使用了32个TPU,每一步进行50次模拟。AlphaZero在训练时使用了64个第二代TPU,自我对弈中使用了5000个第一代TPU。由于TPU设计已改进(第三代芯片的单芯片性能是第二代的两倍,且在芯片间带宽和网络连接方面也有进一步进步),这些训练配置是可比的。R2D2则经过了5天的训练,共进行了200万步训练。

初步结果

MuZero在国际象棋和日本将棋上,经过约100万步训练后,其表现与AlphaZero相当;在围棋上,经过50万步训练后表现相当,并在100万步后超越。在Atari游戏套件上,经过50万步训练后,其平均和中位性能与R2D2相当,并在100万步后超越,尽管在套件中的6款游戏上表现不佳。

反响与相关工作

MuZero被视为对AlphaZero的重大改进,并且是在无监督学习技术方面可推广的一步。这项工作被认为推进了对如何从较小组件构建系统的理解,其意义更多在于系统层面的发展,而非纯粹的机器学习发展。

虽然开发团队仅发布了伪代码,但Werner Duvaud基于此制作了一个开源实现。MuZero已被用作其他工作的参考实现,例如作为一种生成基于模型行为的方式。

2021年末,提出了一种更高效的MuZero变体,名为EfficientZero。它在Atari 100k基准测试中,仅凭两小时的实时游戏经验,就达到了194.3%的人类平均表现和109.0%的中位表现。2022年初,又提出了一种用于玩随机游戏的MuZero变体,名为Stochastic MuZero,它使用事后状态动态和机会编码来解释环境的随机性,用于训练动态网络。

2022年2月,DeepMind报告了MuZero在现实世界任务中的首次应用,即与YouTube合作改进开放源代码VP9编解码器的视频压缩。一个名为MuZero-RC的版本取代了VP9的默认码率控制机制,为每一帧选择量化参数,在不损失质量的情况下,平均降低了4%的码率。

另见

  • 通用游戏玩法
  • 无监督学习
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:reinforcement-learning·deepmind·game-ai·neural-networks
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史