分布性Soft Actor-Critic(DSAC)是一种为连续控制任务设计的强化学习算法。它在Soft Actor-Critic(SAC)框架的基础上,融入了分布性强化学习原理。DSAC不是将期望回报估计为单个标量值,而是学习可能回报的完整分布,这提供了更丰富的训练信号,并在具有随机动态或奖励噪声的环境中提升了性能。该算法于2020年由段京良、关杨和李升波等研究人员提出,并已应用于自动驾驶和机器人控制基准测试。
DSAC将最大熵强化学习与分布性价值估计相结合。其核心思想是最小化回报分布与目标分布之间的Kullback-Leibler散度,同时最大化策略熵以鼓励探索。这种结合使DSAC在MuJoCo和OpenAI Gym任务等标准连续控制基准上实现了最先进的样本效率,通常优于SAC以及Distributional DQN等其他分布性变体。
算法概述
DSAC包含三个主要组件:策略网络、价值分布网络和目标价值分布网络。价值分布网络输出回报值上的分类分布,类似于C51和其他分布性Q学习方法中使用的做法。策略的训练目标是最大化期望回报加上熵奖励,而价值分布则通过分布性Bellman备份进行更新,该备份最小化预测分布与目标分布之间的交叉熵。
DSAC的一个关键创新是使用软Q函数,将熵纳入回报分布。这与标准分布性方法不同,后者通常在价值分布中忽略熵。通过纳入熵,DSAC在受益于分布性价值估计的同时,保持了最大熵强化学习的探索优势。
训练稳定性与样本效率
DSAC解决了actor-critic方法中常见的多个稳定性问题。分布性表示降低了目标值的方差,从而带来更稳定的梯度更新。该算法还采用双价值分布网络来缓解过估计偏差,类似于TD3和SAC。这些设计选择使DSAC能够比SAC从更少的环境交互中学习,特别适用于数据收集成本高昂的现实应用。
实证结果表明,在HalfCheetah、Walker2d和Ant等任务上,DSAC获得的累积奖励高于SAC,尤其是在训练早期阶段。该算法还表现出对超参数变化的鲁棒性,减少了对大量调参的需求。
应用
DSAC已成功应用于自动驾驶模拟,在复杂交通场景中控制车辆加速和转向。价值函数的分布性特性有助于处理交通动态中的固有不确定性。在机器人领域,DSAC已用于操作任务,使智能体能够从高维传感器输入中学习灵巧策略。该算法的样本效率使其适用于物理试验受限的现实机器人学习。
扩展与变体
已提出了DSAC的多种扩展。具有自动温度调节的DSAC(DSAC-T)引入了可学习的熵系数,消除了手动调参的需要。另一种变体,具有集成分布的DSAC,结合多个价值分布以进一步降低方差。研究人员还将DSAC与基于模型的规划相结合,使用学习到的动态模型生成合成经验以进行额外训练。
与相关方法的比较
DSAC与SAC的主要区别在于价值估计方法。SAC学习Q函数的点估计,而DSAC学习分布,这提供了关于回报不确定性的更多信息。与分布性DQN相比,DSAC在连续动作空间中运行,并纳入最大熵探索。该算法还与深度学习和神经网络技术相关,因为它依赖深度函数逼近器来表示策略和价值网络。
局限性与未来方向
DSAC继承了分布性强化学习的一些局限性,包括因维护回报分布而增加的计算成本。分布表示的选择(分类、高斯或分位数)会影响性能,需要仔细选择。未来的研究方向包括将DSAC扩展到多智能体设置,以及纳入Transformer架构用于基于序列的决策,尽管截至2025年这些扩展仍处于实验阶段。