译自英文

PlaNet是一种深度强化学习模型,它从图像输入中学习世界模型,从而能够在潜在空间中进行规划。由谷歌研究人员开发,它在控制任务上比无模型方法所需的交互更少。

PlaNet(深度规划网络)是一种用于基于模型的强化学习的神经网络架构,由Google DeepMind的研究人员于2019年提出。它从高维图像观测中学习潜在动力学模型,并利用该模型进行规划,使智能体能够以远少于无模型方法的环境交互次数解决控制任务。该系统在论文《Learning Latent Dynamics for Planning from Pixels》中提出,作者包括Danijar Hafner、Timothy Lillicrap、Ian Fischer、Ruben Villegas、David Ha、Honglak Lee和James Davidson。

与需要数百万次试验的无模型深度学习智能体不同,PlaNet学习环境动力学的紧凑表示,并直接在潜在空间中进行规划。这种方法在某些任务上将样本复杂度降低了多达5000倍,使其成为人工智能和基于模型的机器学习领域的基础性贡献。

架构与潜在动力学

PlaNet使用循环状态空间模型(RSSM)来学习环境的潜在表示。该模型由确定性循环组件和随机组件组成,共同捕捉世界的可预测和不确定方面。编码器将原始像素观测压缩为潜在状态,而转移模型根据动作预测未来的潜在状态。这种设计使智能体能够想象未来轨迹而无需生成完整图像,从而在计算上高效。

训练目标结合了重建损失(确保潜在状态包含足够信息)和预测损失(确保前向动力学准确)。模型使用时间反向传播进行端到端训练,类似于训练循环神经网络

规划与控制

PlaNet中的规划过程使用交叉熵方法(CEM)的变体,这是一种无导数优化算法。在每个时间步,智能体采样一组候选动作序列,使用学习到的潜在模型模拟其结果,并选择最大化预测累积奖励的序列。这一过程迭代进行,细化动作分布。执行最佳序列的第一个动作,然后重复该过程。

这种规划方法完全学习而来,不需要为模型预定义奖励函数;相反,奖励从潜在状态预测。PlaNet在纯图像设置中运行,仅接收原始像素作为输入,无法访问环境的真实状态。

实验结果

PlaNet在DeepMind控制套件的一系列连续控制任务上进行了评估,包括cartpole摆动、手指旋转、猎豹奔跑、步行者行走、杯中球和reacher。在大多数任务中,PlaNet达到了与最先进的无模型算法相当或更好的性能,但交互次数显著减少。例如,在cartpole摆动任务中,PlaNet在约100个回合内解决了任务,而无模型方法如D4PG需要数千个回合。

作者报告称,在猎豹奔跑任务中,PlaNet使用的交互次数比无模型基线少约5000倍,同时达到相似的最终性能。这些结果凸显了基于模型方法在样本高效强化学习中的潜力,这是数据收集成本高昂的现实应用中的关键挑战。

影响与遗产

PlaNet影响了后续基于模型的强化学习工作,包括Dreamer系列模型,这些模型将思想扩展到更大规模的任务和更高效的规划。在潜在空间中学习世界模型的概念成为生成式AI研究的核心主题,其应用超出控制领域,例如在大型语言模型中使用内部世界表示进行推理。

这项工作也为关于深度学习中样本效率重要性的更广泛讨论做出了贡献,特别是在机器人和自主系统中。PlaNet在潜在空间中规划的方法已被其他研究团体以各种形式采用,并已集成到基于模型的AI开发框架中。

局限性与未来方向

尽管取得了成功,PlaNet仍有局限性。它在需要长时域规划或高度随机环境的任务上表现不佳,其规划循环在推理时计算密集。该模型还需要仔细的超参数调整,并对潜在维度和训练计划的选择敏感。

后来的改进,如Dreamer和DreamerV2,通过使用学习到的价值函数和演员-评论家方法而非纯规划来解决其中一些问题,实现了更好的性能和可扩展性。PlaNet仍然是该领域的里程碑,证明了基于模型的方法既能样本高效又具有竞争力,并继续激发世界模型和预测学习的研究。

参考文献与进一步阅读

原始论文发表于2019年国际学习表示会议(ICLR)。作者发布了开源代码,已在研究社区中广泛使用。感兴趣者可以参考相关的Dreamer论文(2020年)和DreamerV2(2021年),它们提供了扩展和比较。PlaNet的思想也与早期基于神经网络的世界模型工作相关,如Ha和Schmidhuber的World Models论文,该论文使用了类似的潜在空间方法进行控制。

截至2025年,PlaNet的影响在现代强化学习研究中持续存在,特别是在自动驾驶和机器人等领域,样本效率至关重要。其遗产证明了学习世界内部模型的力量,这一概念仍处于AI创新的前沿。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:reinforcement-learning·deep-learning·world-models·google-deepmind
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史