译自英文

美国计算机科学家,以开发超人类水平的扑克和《外交》游戏AI系统而闻名,后来在OpenAI领导了o1模型背后的推理研究。

诺姆·布朗是一位美国计算机科学家,以构建在长期被认为对人工智能具有抵抗力的游戏中击败顶尖人类专业人士的游戏系统而闻名,并后来在OpenAI领导关于推理模型的研究。

布朗在卡内基梅隆大学获得博士学位,期间与图奥马斯·桑德霍姆合作研究扑克游戏智能体。他们的系统Libratus于2017年在单挑无限注德州扑克中击败了顶尖职业选手,其后续系统Pluribus于2019年在六人扑克中同时击败多名职业选手,这一成果之所以引人注目,是因为它涉及两个以上竞争智能体同时博弈,这比人工智能此前掌握的象棋或围棋等双人零和博弈环境要困难得多,属于多智能体设定。

外交游戏与CICERO

加入Meta AI(当时为Facebook AI Research)后,布朗协助领导了CICERO团队,该系统玩的是棋盘游戏《外交》,该游戏要求玩家之间进行自然语言谈判、说服和战略规划。CICERO于2022年发表在《科学》杂志上,结合了用于生成对话的语言模型与战略推理引擎,并在在线外交联赛中达到了人类水平的表现,这一里程碑常被引为证据,表明人工智能能够处理合作性与对抗性的社会推理,而不仅仅是具有完美信息的对抗性游戏。

加入OpenAI与o1

布朗于2023年加入OpenAI,从事测试时计算研究,其核心理念是,通过让模型在推理时“思考”更长时间,而非仅仅扩大训练规模,可以改进模型的答案。这项工作促成了2024年发布的OpenAI o1,该模型利用扩展的思维链推理,并通过强化学习训练,以提升数学、编程和逻辑任务的表现。布朗公开主张,扩展测试时计算代表了人工智能进步的第二个维度,与扩展预训练数据和参数并列,他将其类比为自己开发的扑克智能体在获得更多搜索时间而非仅仅更多训练时表现显著提升的情况。

认可

布朗在扑克和外交游戏方面的工作被广泛报道,作为证据表明博弈论人工智能技术能够超越狭窄的棋盘游戏,扩展到涉及隐藏信息、谈判和多个同时智能体的场景,这些主题在他后来的推理研究中反复出现。他已成为在公开演讲和采访中解释OpenAI推理路线图的较为知名的研究声音之一,经常将测试时计算扩展描述为与更大规模预训练运行带来的持续收益互补,而非替代。

分类:ai-industry·reasoning-models·game-playing-ai
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史