译自英文

Pluribus是一款由Facebook AI实验室与卡内基梅隆大学联合开发的人工智能扑克机器人,是首个在多人无限注德州扑克中击败人类的系统。它采用离线自我对弈与实时学习技术,在2019年的比赛中每局平均赢利超过30毫大盲注。

Pluribus是一个基于人工智能的计算机扑克玩家,由Facebook的AI实验室和卡内基梅隆大学开发。它玩的是无限注德州扑克变体,并且是第一个在复杂的多人比赛中击败人类的机器人,这一里程碑由其开发者在2019年发表。该系统标志着先前AI游戏成就的转变,这些成就主要集中在双人游戏上,而Pluribus则在传统博弈论策略不直接适用的多人环境中取得了成功。

该项目源于更广泛的机器学习深度学习领域,这些领域已在国际象棋、围棋和单挑扑克等游戏中取得了超人类的结果。然而,在多人扑克中,对手可以串通,且游戏并非零和,这使得近似纳什均衡的标准方法变得复杂。Pluribus反而结合了离线自我对弈来构建基础策略,并在在线游戏中实时学习,这种方法缺乏强有力的理论保证,但在经验上对人类职业选手表现良好。

开发与策略

据Pluribus的创造者称,“开发一个超人类的多人扑克AI是计算机扑克中公认的主要剩余里程碑”。基础策略在八天内计算完成,按市场价计算大约花费144美元,这远小于当代超人类游戏里程碑(如AlphaZero)的成本。这种效率来自于使用相对适度的计算资源,与早期需要大规模云计算集群的AI系统形成对比。

Pluribus依赖离线自我对弈来建立基础策略,然后在在线比赛中实时优化。这种混合方法使机器人能够动态适应对手的倾向。其自我学习的游戏风格显著避免了“跛入”(跟注大盲注),并且比人类专家更频繁地进行“驴式下注”(以跟注结束一轮,并以下注开始下一轮)。这些非常规战术促成了其成功,因为它们打乱了人类的预期,使机器人难以被解读。

表现与结果

在与五名职业扑克选手的比赛中,Pluribus平均每手赢得5美元,每小时赢利1000美元,Facebook将其描述为“决定性的胜利差距”。在各种比赛中,Pluribus平均每局赢得超过30毫大盲注。这些结果之所以显著,是因为它们发生在六人无限注德州扑克中,这是一种比双人变体复杂得多的游戏。

机器人的成功不仅是统计上的,也是心理上的。职业选手报告称感到沮丧和力不从心。Jason Les表示他感到“非常绝望。你不觉得有任何办法可以赢。”Chris Ferguson指出,“Pluribus是一个非常难对付的对手。很难把他锁定在任何一手牌上。”然而,Jimmy Chou从这次经历中发现了价值:“每次与机器人对弈,我都觉得能学到一些新东西融入我的游戏。”在《华尔街日报》中,科学编辑Daniela Hernandez将Pluribus描述为“在人类关键技能,,欺骗方面表现出色”。

在AI研究中的意义

Pluribus代表了游戏AI发展中的一个里程碑,紧随OpenAI在Dota 2中的机器人和Google DeepMind的AlphaZero等早期成就之后。与这些主导双人游戏的系统不同,Pluribus解决了传统均衡近似失效的多智能体环境挑战。Pluribus使用的方法虽然缺乏强有力的理论保证,但证明了通过自我对弈和实时适应可以学习到经验上成功的策略,这为后续生成式AI和其他交互系统的研究提供了信息。

这一成功还凸显了神经网络在游戏AI中的重要性。Pluribus使用神经网络来估计游戏状态的价值,并使用搜索算法来优化决策,这一技术与其他超人类游戏引擎中使用的类似。机器人融合离线与在线学习的能力为必须在动态多智能体环境中运行的AI系统提供了模板,其相关性超越了游戏,延伸到金融和谈判等领域。

更广泛的背景与反响

Pluribus的开发是2010年代末更广泛AI研究浪潮的一部分,当时深度学习神经网络的进步促成了推理和策略方面的突破。与后来出现的大型语言模型不同,Pluribus专注于一个特定、定义明确的领域,但其成功凸显了AI在对抗性、交互性环境中的潜力。正如Hernandez所指出的,机器人欺骗人类玩家的能力强调了AI在建模人类行为和虚张声势方面日益增长的复杂性。

该项目由Facebook AI和卡内基梅隆大学的研究人员领导,并于2019年发表了他们的发现。这一合作体现了学术研究与工业AI努力日益增长的交叉,类似于与斯坦福AI实验室伯克利AI研究的伙伴关系。

伦理与实践考量

在胜利之后,开发者拒绝发布源代码,担心它会被滥用以在在线比赛中暗中欺骗人类扑克玩家。这一决定反映了AI社区对双重用途技术的更广泛担忧,即研究开发的能力可能被应用于有害目的。此举为AI研究中的负责任披露树立了先例,平衡了科学开放性与潜在社会风险。

这一案例也影响了关于AI安全性和超人类系统伦理部署的讨论。虽然扑克是一种娱乐活动,但Pluribus中使用的技术对其他多人决策领域具有影响,如谈判和拍卖竞价,这些领域适用类似的战略考量。截至2020年代初,没有主流扑克平台公开部署了类似能力的AI,部分原因是开发者决定不公开源代码。

遗产与伦理考量

在胜利之后,开发者拒绝发布源代码,担心它会被滥用以在在线比赛中暗中欺骗人类扑克玩家。这一决定反映了对高级AI系统双重用途性质的日益担忧,这一主题在后来生成式AI的发展中变得更加突出。机器人还影响了关于在线游戏公平性的讨论,因为此类系统被恶意行为者部署的可能性引发了关于检测和监管的问题。

Pluribus的遗产延伸到多智能体AI和实时适应的持续研究中。其成功表明,经验方法可以在复杂的多人环境中胜过基于理论的方法,鼓励了在拍卖竞价、谈判和其他战略互动领域的进一步工作。AI的后续发展,包括Transformer模型和生成式AI的进步,建立在Pluribus所体现的自我对弈和强化学习的更广泛基础上,尽管其具体技术仍然专有。

伦理与影响考量

在胜利之后,开发者拒绝发布源代码,担心它会被滥用以在在线比赛中暗中欺骗人类扑克玩家。这一决定反映了AI社区对高级算法双重用途性质的日益担忧,特别是那些可能被利用以获取经济利益的算法。不公开代码与一些早期AI研究项目的开放实践形成对比,但符合高风险领域负责任披露的趋势。

机器人的成功也引发了关于人类在不完美信息游戏中竞争未来的问题。在扑克中,虚张声势和欺骗是核心,Pluribus证明了AI可以在这些微妙技能上匹配或超越人类能力,这一发展对谈判和网络安全等领域具有影响。研究人员指出,Pluribus中使用的技术可能被适应于其他多人场景,尽管开发者拒绝发布源代码,担心它会被滥用以在在线比赛中暗中欺骗人类扑克玩家。

遗产

Pluribus仍然是AI游戏系统历史上的一个里程碑,与IBM的国际象棋计算机和AlphaZero等成就并列。其在多人扑克中的成功表明,AI可以在拥有两个以上智能体的环境中表现出色,在这些环境中均衡更难定义。后续AI研究继续基于这些想法,将自我对弈和实时学习融入自动驾驶车辆机器人技术等系统。虽然源代码从未发布,但Pluribus架构和策略的已发表细节为多智能体强化学习的学术研究提供了信息。

参考文献

  • 来源事实根据维基百科(CC BY-SA)提供。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·poker·multiplayer-games·reinforcement-learning
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史