策略梯度方法是一类强化学习算法,也是策略优化方法的一个子类。与基于价值的方法(学习价值函数以推导策略)不同,策略优化方法直接学习一个策略函数,该函数在选择动作时无需参考价值函数。要应用策略梯度,策略函数需由可微参数(通常记为theta)参数化,目标是通过对策略参数进行梯度上升来最大化期望累积奖励。
这些方法是现代强化学习的核心,并已应用于机器人技术、游戏博弈和自主系统等领域。它们在具有连续动作空间的环境中尤其有用,而基于价值的方法在此类环境中往往表现不佳。策略梯度方法也以“蒙特卡洛梯度估计”之名被研究,因为它们依赖随机采样来估计梯度。
概述
在基于策略的强化学习中,actor是一个参数化的策略函数,它将状态映射到动作上的概率分布。对于给定状态,策略输出每个可能动作的概率,所有动作的概率之和或积分等于1,具体取决于动作空间是离散的还是连续的。目标是找到能最大化期望情节奖励的参数,该奖励定义为从初始状态开始,在时间范围内折扣奖励的总和。
策略梯度是该期望奖励关于策略参数的梯度。不同的策略梯度方法以不同方式随机估计该梯度,但所有方法都旨在通过沿梯度上升来迭代改进策略。关键挑战在于获得无偏且方差低的梯度估计,这催生了诸如基线和actor-critic架构等多种技术。
REINFORCE
REINFORCE算法由Ronald J. Williams于1992年提出,是第一个策略梯度方法。它基于一个基本恒等式,将策略梯度表示为轨迹上对数策略梯度与总奖励乘积的期望。一个关键改进是“因果性技巧”,它仅用从该时间步开始的奖励来加权每个动作,从而在不引入偏差的情况下降低方差。REINFORCE是一种蒙特卡洛方法,即使用完整情节来估计梯度,这可能导致高方差,但实现简单。
Actor-Critic方法
Actor-critic方法将策略梯度与价值函数近似相结合以降低方差。Actor是策略网络,而critic估计价值函数,用于计算基线或优势函数。这使得学习比纯REINFORCE更稳定且样本效率更高。著名示例包括A2C(优势Actor-Critic)和A3C(异步优势Actor-Critic),它们已广泛用于深度强化学习。
现代变体
现代策略梯度方法包括近端策略优化(PPO)和信任区域策略优化(TRPO),它们限制策略更新以避免破坏性的大步长。这些方法因其可靠性和性能而成为深度强化学习的标准。它们被用于训练《Dota 2》和《星际争霸II》等游戏中的智能体,以及机器人技术和自动驾驶研究。
应用与挑战
策略梯度方法已应用于多个领域,包括人工智能研究、机器学习系统和深度学习框架。它们对连续控制任务(如机器人操作和移动)尤其有效。然而,它们面临高样本复杂度和对超参数敏感等挑战。研究持续致力于解决这些问题,并在神经网络架构和优化技术方面取得进展。
策略梯度方法也与大型语言模型训练相关,其中基于人类反馈的强化学习(RLHF)使用类似策略梯度的更新来使模型与人类偏好对齐。这一联系凸显了这些算法在传统强化学习场景之外的广泛适用性。