译自英文

R2D2是由DeepMind开发的一种循环经验回放深度强化学习算法,它将回放缓冲区与循环神经网络相结合,以提高在Atari游戏上的样本效率和性能。

R2D2(循环回放分布式深度DQN)是一种由DeepMind研究人员开发的深度强化学习算法。它在2019年发表的论文《分布式强化学习中的循环经验回放》中被提出,代表了在深度Q网络(DQN)框架中应用循环神经网络的重大进展。R2D2旨在解决部分可观测性和长期依赖问题中的强化学习挑战,在发表时于一系列3D和2D Atari游戏中达到了最先进的性能。

R2D2建立在先前分布式强化学习工作的基础上,特别是Ape-X DQN架构,该架构使用共享回放缓冲区和多个智能体来收集多样化的经验。其关键创新在于将循环神经网络,特别是长短期记忆(LSTM)单元,整合到行动和学习过程中。这使得智能体能够维持一个内部状态来捕捉时间上下文,这对于观测在没有历史信息时具有模糊性的环境至关重要。

核心架构与循环经验回放

R2D2的核心组成部分是其使用循环回放缓冲区,该缓冲区存储经验序列而非单个转移。在标准DQN中,经验回放通常存储单个(状态,动作,奖励,下一状态)元组。R2D2存储长度为80的短序列,每个存储序列包括记录时LSTM的初始内部状态。这种设计确保当网络从回放数据中学习时,能够正确初始化其隐藏状态以匹配时间上下文,避免因截断或乱序序列训练而产生的问题。

该算法使用优先回放机制,其中序列根据其时间差分误差进行采样,如优先经验回放中引入的那样。为了处理循环隐藏状态的随机性,R2D2采用了一种称为“预热”的技术,其中序列的一部分(通常为40个时间步)仅用于预热隐藏状态,然后在剩余步骤上计算实际训练损失。这提高了训练的稳定性和性能。

训练与分布式设置

R2D2以分布式方式训练,借鉴了Ape-X的架构。它使用多达256个并行智能体与环境副本交互,每个智能体配备自己的LSTM循环状态。这些智能体生成经验,并发送到中央回放缓冲区。一个独立的训练进程从该缓冲区采样批次并更新网络权重。这种分离允许高吞吐量和多样化的数据收集,这对于有效训练循环网络至关重要。

在原始实验中,R2D2在Arcade学习环境中的57个Atari 2600游戏以及DeepMind Lab(一个3D迷宫导航环境)上进行了训练。该算法在样本效率上显著优于先前方法,并在大多数游戏中达到或超过人类水平。值得注意的是,R2D2在几乎所有游戏上优于早期的Ape-X DQN,并在多个游戏中创下新纪录,包括以探索难度著称的《蒙特祖玛的复仇》。

与其他方法的比较

R2D2是2010年代末将循环架构与分布式训练相结合的更广泛趋势的一部分。它与其他算法有相似之处,例如其前身N步双重DQN,以及后来的R2D3(带优先经验回放和3D环境的循环回放分布式DQN),后者引入了人类演示以进一步改善探索。在这些算法中,R2D2常被视为基础性工作,影响了后续设计,包括Rainbow DQN扩展和更先进智能体(如MuZero)的开发。

该算法的成功凸显了记忆在强化学习中的重要性,特别是对于部分可观测任务。与前馈网络仅看到当前帧不同,R2D2的循环层可以从时间模式中推断隐藏动态,例如物体速度或屏幕外刺激的存在。

实现与影响

R2D2论文由Steven Kapturowski、Georg Ostrovski、John Quan、Remi Munos和Will Dabney撰写,于2019年在国际学习表征会议(ICLR)上发表。代码库最初未开源,但其思想在学术界和工业界被广泛采用。后来,循环经验回放的概念成为深度强化学习中的标准工具,出现在各种后继算法和框架中。

R2D2的影响还扩展到更广泛的强化学习研究领域,它常被用作基线。其分布式智能体、优先序列和循环动态的组合已在许多现代智能体中得到复制,包括用于机器人和自主系统的智能体。该算法的设计原则也为基于transformer的记忆模型工作提供了参考,尽管LSTM等循环方法在许多实时应用中仍保持计算效率。

局限性与未来方向

尽管有其优势,R2D2存在固有局限性。LSTM单元的使用引入了额外参数和训练复杂性,这可能在简单任务上比前馈替代方案减慢学习速度。分布式设置还要求大量计算资源,这在历史上限制了其应用范围,仅适用于资金充足的研究环境。然而,随着硬件能力的增长,这些约束已变得不那么严格。

后续研究在R2D2基础上进行了修改,例如基于价值的动作选择、改进的探索策略以及与生成模型的集成。R2D2的遗产在于它证明了记忆和循环对于在复杂环境中实现稳健性能至关重要,这一原则继续塑造着现代强化学习系统,从游戏玩法到大规模应用中的序列决策。

总之,R2D2是深度强化学习中的里程碑式算法,以其循环回放设计、分布式训练效率和强大的实证结果而闻名。它在处理部分可观测性方面的贡献使其成为该领域后续工作的参考点。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-reinforcement-learning·recurrent-neural-networks·atari·deepmind
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史