译自英文

AlphaTensor是由DeepMind于2022年开发的人工智能系统,用于通过强化学习发现高效的矩阵乘法算法,其被构建为一个名为TensorGame的单人游戏。

AlphaTensor 是由DeepMind开发的人工智能系统,用于通过强化学习发现高效的矩阵乘法算法。该系统于2022年推出,基于AlphaZero,并将矩阵乘法算法的搜索形式化为一个名为TensorGame的单人游戏。

AlphaTensor 旨在搜索以更少标量乘法运算来执行矩阵乘法的新方法。矩阵乘法是线性代数、数值分析、科学计算、计算机图形学和机器学习中的基本运算。该系统发现了数千种矩阵乘法算法,其中包括重新发现已知人工设计方法的算法,以及针对特定矩阵尺寸和数学设定改进已有结果的算法。

背景

矩阵乘法是数值计算中的基本运算之一。两个方阵相乘的标准算法具有三次时间复杂度,而像Strassen算法这样的更快算法通过使用更复杂的代数分解来减少乘法运算次数。寻找最优矩阵乘法算法可能很困难,因为这涉及在大量可能的张量分解空间中进行搜索。

AlphaTensor 通过将算法发现表示为TensorGame来处理这一问题,其中每一步移动对应一个操作,该操作会减少表示矩阵乘法的张量。游戏的目标是找到矩阵乘法张量的低秩分解,这对应于一种高效的乘法算法。

开发

AlphaTensor 由DeepMind开发,并在2022年10月发表于《自然》期刊的一篇论文中进行了描述。该系统基于AlphaZero中使用的强化学习方法构建,该方法此前已应用于围棋、国际象棋和将棋等游戏。与这些游戏不同,TensorGame涉及非常大的搜索空间,因此需要对AlphaZero风格的搜索方法和神经网络架构进行修改。

DeepMind 通过一个公开的GitHub仓库发布了源代码和与该论文相关的已发现算法。

结果

AlphaTensor 发现了在标准算术和有限域上的矩阵乘法算法。一个被广泛报道的结果是,在包含两个元素的域上,用47次乘法运算实现4×4矩阵相乘,改进了在该设定下递归应用Strassen算法所需的49次运算。

该系统还发现了针对特定计算机硬件优化的算法,包括为图形处理单元和张量处理单元设计的算法。DeepMind 表示,在测试硬件上,一些针对特定硬件的算法相比常用算法提高了实际执行时间。

意义

AlphaTensor 被描述为使用机器学习不仅应用现有算法,还协助发现新算法的示例。这项工作与算法发现、自动化机器学习、程序合成和计算复杂性理论等更广泛的研究相关联,尤其是确定矩阵乘法最优复杂度的开放问题。

AlphaTensor 后来成为Google DeepMind 用于算法和数学发现的更广泛系统组的一部分,与AlphaDev和AlphaEvolve等系统并列。

参见

参考文献

  • DeepMind,'AlphaTensor',2022年。
  • 《自然》论文,2022年10月。

外部链接

  • 官方网站
  • GitHub 上的 alphatensor
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·machine-learning·algorithm-discovery·matrix-multiplication
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史