在人工智能中,世界模型是一种内部表示,智能体利用它来预测其环境将如何随时间变化,包括响应自身行为的变化,从而使智能体无需在真实环境中采取行动观察后果,即可进行规划、想象结果并评估选择。该术语源于经典控制理论和基于模型的强化学习,其中智能体对环境动态的模型被明确用于规划,但近年来其意义已更为广泛,研究人员提出,从原始感官数据(尤其是视频)中学习预测性世界模型,可能是通向比仅基于文本训练更通用、更稳健的智能的路径。
强化学习中的起源
基于模型的强化学习长期以来使用显式或习得的动态模型在行动前模拟未来状态,这与直接通过试错学习策略或价值函数的无模型方法形成对比。David Ha和于尔根·施米德胡贝尔于2018年发表的一篇被广泛引用的论文,题为“世界模型”,展示了一个智能体可以学习视频游戏环境的压缩生成模型,然后在几乎完全在该学习到的模拟中训练策略,从而使该术语在现代AI意义上广为人知,并建立在早期关于预测性、自建模智能体的工作之上。
视频预测与生成式世界模型
一条较新的研究路线将大规模视频预测本身视为一种隐式学习世界模型的方式,而无需手工设计的模拟器。Google DeepMind的Genie于2024年推出,仅从无标签的互联网视频中学习生成可玩、可交互的2D环境,而无需获取底层游戏引擎状态或动作标签,这证明动作条件的世界动态可以从被动观察中学习。视频生成系统(如索拉)的开发者也将其描述为早期、通用的“世界模拟器”,其论点是准确预测视频应如何继续需要隐含的物理、物体恒存和因果模型,尽管批评者指出,此类模型经常违反基本的物理一致性,且流畅的视频生成并不一定意味着可靠或可泛化的内部物理模型。
JEPA与LeCun的提议
扬·勒昆提出了联合嵌入预测架构(JEPA),作为纯生成式视频模型和标准自回归模型语言建模的替代方案。JEPA风格模型不是预测原始像素或令牌,而是在抽象的学习表示空间中预测未来状态,勒昆认为这种方法更高效,更能忽略无关细节(如纹理噪声),同时仍能捕捉规划所需的因果结构。勒昆将以此方式构建的世界模型定位为具身智能和超越当今大型语言模型系统能力进步的关键缺失要素,并将其与主要押注于扩展基于文本的预训练的实验室形成直接对比。
意义
世界模型越来越多地被认为不仅与机器人技术和游戏智能体相关,还与关于通用人工智能的更广泛问题相关,因为拥有准确环境内部模型的智能体原则上可以规划更长的视界,并比仅对即时输入做出反应的智能体更高效地泛化到新情况。截至2020年代中期,世界模型研究仍是一个活跃且未定论的领域,关于其中有多少可以从被动视频中学习,以及有多少需要具身互动,存在重大分歧。