AlphaStar 是由 DeepMind 开发的一款计算机程序,用于玩即时战略游戏《星际争霸 II》。它于 2019 年 1 月推出,达到了与顶级人类专业人士相当的游戏水平,展示了在需要长期规划、实时决策和处理不完美信息的领域中,人工智能所取得的进展。该系统结合了深度学习和机器学习技术,包括神经网络和强化学习,以掌握该游戏复杂的机制。
AlphaStar 的开发是 DeepMind 内部的一项合作成果,涉及Koray Kavukcuoglu和Karen Simonyan等研究人员。该项目建立在 DeepMind 早期开发的游戏 AI 工作(如国际象棋和围棋程序)的基础上,但解决了《星际争霸 II》的实时性、隐藏信息和大动作空间所带来的额外挑战。
游戏玩法与训练
AlphaStar 通过结合人类回放的监督学习和通过强化学习进行的自我对弈来训练。最初,系统通过分析数千场记录的比赛来模仿人类玩家。随后,它通过与自身以及程序的早期版本对弈来完善策略,并使用基于联赛的训练方法,以确保对各种游戏风格具有鲁棒性。
该智能体通过一个神经网络运行,该网络处理游戏状态,包括可见的单位、建筑和资源,以及隐藏敌方行动的战争迷雾。它输出的动作速率与人类玩家相当,并对每分钟动作数进行了限制,以避免利用超人的速度。在公开演示中,AlphaStar 达到了击败专业玩家的水平,包括在 2018 年 12 月以 10-1 的比分击败职业玩家 Grzegorz 'MaNa' Komincz,尽管这些比赛是在与标准锦标赛设置不同的条件下进行的。
技术架构
AlphaStar 的架构使用基于 transformer 的神经网络,类似于自然语言处理中使用的transformer模型,来处理游戏中的序列和空间信息。网络接收一组表示游戏地图、单位和其他实体的特征图作为输入,并输出用于选择动作的策略以及用于估计预期结果的价值函数。该系统还结合了一个指针网络来处理大量可能的动作目标,例如选择特定单位或位置。
训练是在大规模分布式计算基础设施上进行的,使用了数千个Google Cloud TPU 和 CPU。AlphaStar 的最终版本经过数月的训练,基于联赛的训练涉及多个智能体相互竞争和学习。这种方法使系统能够发现多样化的策略并适应以应对它们。
结果与意义
2019 年 7 月,DeepMind 在《自然》杂志上发表了一篇论文,描述了 AlphaStar 的成就。该程序在欧洲《星际争霸 II》天梯上达到了大师级水平,跻身人类玩家前 0.2% 之列。它是第一个在流行的即时战略游戏中达到此水平的 AI 系统,由于该游戏的复杂性和隐藏信息,它被认为比国际象棋或围棋等棋盘游戏更具挑战性。
AlphaStar 的成功凸显了强化学习在复杂的、类似现实世界环境中的潜力。所开发的技术,如联赛训练和用于序列决策的 transformer 网络,已影响了后续在生成式 AI和其他深度学习领域的研究。然而,该系统是专门为《星际争霸 II》设计的,未经重大调整无法直接应用于其他领域。
反响与局限性
AlphaStar 受到了 AI 研究界和游戏界的关注。一些批评者指出,其最初演示的条件,例如使用固定地图以及在某些比赛中能够查看整个地图,使其相对于人类玩家具有优势。DeepMind 在后续版本中通过限制智能体的视野为人类玩家所见范围,并在公共天梯上游戏,解决了其中一些担忧。
尽管取得了成就,AlphaStar 仍有局限性。它需要巨大的计算资源进行训练,并且其性能特定于《星际争霸 II》。该系统无法泛化到其他游戏或任务,其策略有时也非同寻常,反映了 AI 与人类游戏方式之间的差异。截至 2024 年,DeepMind 尚未将 AlphaStar 作为公开产品发布,该项目被视为研究演示而非商业工具。
遗产
AlphaStar 通过证明深度强化学习可以处理具有长时间跨度的复杂多智能体环境,为更广泛的 AI 领域做出了贡献。其使用 transformer 网络进行游戏的时间早于 transformer 在其他领域的广泛采用,其联赛训练方法已在后续关于多智能体系统的研究中被引用。该项目还引发了关于 AI 在竞技游戏中公平性和伦理的讨论,并且它仍然是 AI 在战略推理方面能力的一个显著例子。