TD3(双延迟深度确定性策略梯度)是一种为连续动作空间设计的深度学习强化学习算法。它是深度确定性策略梯度(DDPG)方法的扩展,旨在解决在演员-评论家方法中常见的、导致性能下降的高估偏差问题。TD3由Scott Fujimoto、Herke van Hoof和David Meger在其2018年论文《解决演员-评论家方法中的函数逼近误差》中提出。
该算法结合了演员-评论家架构与三项关键改进:裁剪双Q学习、延迟策略更新和目标策略平滑。这些改进共同降低了方差并提高了稳定性,使TD3成为机器学习中连续控制任务的广泛使用的基线。
核心机制
TD3在标准强化学习框架内运作,其中智能体与环境交互以最大化累积奖励。演员网络将状态映射到动作,而评论家网络则估计状态-动作对的期望回报(Q值)。与使用单一评论家的DDPG不同,TD3维护两个评论家网络,并在计算目标值时使用它们估计值的最小值。这种裁剪双Q学习减轻了函数逼近误差引起的高估偏差。
该算法还延迟了策略更新:演员的更新频率低于评论家(通常每两次评论家更新一次)。这使得评论家在策略调整前变得更加精确,从而降低了更新不稳定的风险。此外,目标策略平滑会向目标动作添加小幅随机噪声,这正则化了价值估计,并防止策略利用Q函数中的狭窄峰值。
与DDPG的比较
DDPG由Timothy P. Lillicrap等人于2016年提出,是使用深度神经网络进行连续控制的先驱算法。然而,它常常遭受Q值高估的问题,导致策略次优。TD3通过引入双评论家机制和其他稳定化措施直接解决了这一问题。在诸如MuJoCo运动环境(例如HalfCheetah、Walker2d、Hopper)等基准任务上的实证研究表明,TD3在最终性能和样本效率方面均持续优于DDPG。
与每一步都更新策略的DDPG不同,TD3的延迟更新减少了策略与价值函数更新之间的相关性,这是其稳定性提升的一个因素。目标平滑项也起到了一种人工智能正则化的作用,类似于监督学习中的噪声添加。
实现细节
在实践中,TD3使用经验回放缓冲区存储转换,并从中采样小批量进行训练。两个评论家网络均使用相同的目标值进行更新,该目标值计算为两个目标评论家输出的最小值。演员则使用确定性策略梯度进行更新,但仅在固定次数的评论家更新之后进行。演员和评论家的目标网络均通过软更新(Polyak平均)进行更新,其中tau参数较小,通常为0.005。
该算法的超参数相对标准:评论家的学习率约为1e-3,演员的学习率约为1e-4,折扣因子为0.99,批量大小为256。探索噪声通常为高斯噪声,标准差为0.1,而目标平滑噪声的标准差为0.2,并被裁剪到-0.5至0.5的范围内。
应用与影响
TD3已成为强化学习研究中的标准基线,特别是在机器人和控制领域。它经常被用于伯克利人工智能研究和其他学术实验室,以基准测试新算法。其原理影响了后续方法,如软演员-评论家(SAC),后者也解决了高估问题,但通过熵正则化而非双评论家。
该算法已被应用于自动驾驶和机器人手术研究的模拟环境中,尽管实际部署仍然有限。在工业界,OpenAI和谷歌DeepMind已探索了类似的演员-评论家方法用于连续控制,但TD3本身主要是一个研究工具。
局限性与扩展
TD3假设环境是马尔可夫性的,并且策略是确定性的,这可能限制探索。诸如TD3+BC(结合行为克隆)的变体已被提出用于离线强化学习,即智能体从固定数据集中学习。其他扩展包括分布式评论家和集成方法,以进一步降低方差。
尽管有其优势,TD3可能对超参数调整敏感,并可能在高维或部分可观测环境中表现不佳。研究人员继续在其框架基础上进行构建,使其成为现代深度强化学习的基础性贡献。
参见
- 深度强化学习
- 演员-评论家方法
- 连续控制
- 软演员-评论家