Dreamer 是基于模型的强化学习算法家族,由Google DeepMind开发,因其能够直接从图像输入中学习复杂行为且具有高样本效率而闻名。其核心思想是,智能体从过往经验中学习一个紧凑的潜在空间世界模型,以镜像环境的动态,然后完全在该潜在表示中“想象”未来状态的展开,以训练策略和值函数。这种方法与需要大量真实世界交互的无模型方法形成对比,使 Dreamer 成为迈向更具样本效率的人工智能体的关键一步。
首个版本 Dreamer 于 2020 年由 Danijar Hafner、Timothy Lillicrap、Jimmy Ba 和 Mohammad Norouzi 发表的论文中提出。它确立了潜在想象范式,即智能体学习一个循环状态空间模型(RSSM),将观测和动作编码为随机潜在状态。策略通过沿想象出的潜在轨迹反向传播值梯度进行更新。在 DeepMind Control Suite 和 Atari 游戏的基准任务中,Dreamer 在显著减少环境交互次数的同时,匹配或超越了 DQN 和 D4PG 等无模型算法的性能。
算法演进
DreamerV2 于 2021 年发表,通过在世界模型中引入具有分类分布的离散潜在变量,对架构进行了改进。这一变化,连同 KL 平衡和自由比特等技术,提升了模型捕捉多模态动态的能力。DreamerV2 成为首个使用单一超参数集掌握全部 55 个 Atari 游戏的智能体,超越了人类水平得分,并在该基准上树立了样本高效强化学习的新标杆。
DreamerV3 于 2023 年发布,通过在运动、操作和视频游戏等 150 个多样化任务中无需任何任务特定调优即取得强劲性能,展示了广泛的通用性。其稳定方法包括归一化预测、symlog 损失缩放和基线归一化,以实现稳健的值估计。DreamerV3 尤其成为首个从原始像素和动作中在游戏《Minecraft》中收集钻石的智能体,该任务需要长时域规划和稀疏奖励,凸显了该算法的实际鲁棒性。
核心组件
Dreamer 家族依赖三个学习组件。首先,世界模型,,一个学习潜在动态的 RSSM:它将高维观测(如像素)编码为紧凑的潜在向量,根据动作预测后续潜在状态,并重建观测和奖励。其次,评论家(值网络)从任何潜在状态估计期望折扣回报。第三,行动者(策略网络)根据当前潜在状态输出动作。在训练期间,智能体使用世界模型从初始潜在状态想象多达许多时间步,利用评论家评估回报,并训练行动者以最大化这些回报,通常通过直通估计梯度实现。
影响与应用
Dreamer 的潜在想象方法启发了基于模型强化学习中的众多后续工作,包括 MuZero 等算法,后者使用学习模型但采用不同表示,以及其他潜在空间规划器。其样本效率使其在真实交互成本高昂的机器人和控制领域具有吸引力。研究人员已将 Dreamer 变体应用于真实世界任务,如使用人形机器人进行机器人抓取和自动驾驶模拟。代码已开源,允许在工业界和学术界广泛采用,并经常用作研究中强化学习的基线。
与无模型方法的比较
像深度 Q 网络和策略梯度这样的无模型算法需要数百万步才能掌握任务,因为它们忽略了动态结构。Dreamer 利用学习到的模型生成虚拟经验,在类似运动导航等任务上,以相似性能实现高达 10-100 倍更少的真实环境交互。然而,基于模型的方法可能遭受世界模型中复合预测误差的影响,Dreamer 通过使用短想象时域和随机潜在状态来缓解这一问题。在非常高维观测或非平稳动态下,无模型方法可能仍然更受青睐。
更广泛的背景
Dreamer 是Artificial intelligence中朝向自监督学习和世界模型这一更大趋势的一部分,这也影响了Generative AI和基于模型的规划。它与认知科学中关于心理模拟和想象作为决策机制的思想相关联。随着大型语言模型的兴起,正在进行的研究将 Dreamer 风格的世界模型与transformer 架构相结合,以构建能够同时推理文本和物理环境的智能体。该算法的开源生态系统和可复现结果使其成为现代 AI 研究的基础参考。
未来方向
正在进行的工作包括将 Dreamer 扩展到多智能体设置,将其与分层动作空间结合,并提高其对高维观测(如点云输入)的连续控制的扩展性。研究人员还在探索世界模型内的不确定性量化,以提高在开放世界环境中的鲁棒性。随着计算资源的增长,Dreamer 风格的潜在想象预计将成为在有限数据下进行长时域规划的智能体的核心组成部分。