近端策略优化

译自英文

近端策略优化(PPO)是一种用于训练智能体的强化学习算法,具体而言,它是一种策略梯度方法,在深度强化学习中用于大型策略网络。

近端策略优化(PPO)是一种用于训练智能体的强化学习(RL)算法。具体而言,它是一种策略梯度方法,常用于策略网络规模很大的深度强化学习场景。PPO于2017年提出,作为信任区域策略优化(TRPO)的近似方法,旨在提高训练稳定性,同时避免计算二阶导数的计算成本。自2018年以来,PPO一直是OpenAI的默认强化学习算法,并已应用于机械臂控制、玩Atari游戏以及通过OpenAI Five项目在Dota 2中击败职业选手等领域。

PPO属于策略梯度方法家族,这类方法通过估计期望奖励的梯度来直接优化策略。与基于价值的方法(如深度Q网络(DQN))不同,PPO是一种在策略算法,意味着它使用当前策略收集的数据来更新策略。它支持离散和连续动作空间,使其适用于多种环境。

背景:信任区域策略优化

PPO的前身,信任区域策略优化(TRPO),于2015年发表。TRPO通过使用信任区域方法限制旧策略和新策略之间的KL散度,解决了DQN的不稳定问题。这种约束确保策略在更新过程中不会变化过于剧烈,从而有助于维持稳定的学习。然而,TRPO通过计算Hessian矩阵(二阶导数矩阵)来实施这一约束,这在计算上代价高昂,且对于大规模问题效率低下。这一局限性促使了PPO的开发,PPO在不需Hessian矩阵的情况下近似了TRPO的约束。

PPO算法

PPO通过用裁剪目标函数替代KL散度约束来简化TRPO。核心思想是通过裁剪新旧策略之间的概率比来限制策略更新。这种裁剪机制防止了过大的更新,从而避免训练不稳定。目标函数旨在提供策略改进的下界,确保更新既保守又有效。

该算法通常遵循以下步骤:

  1. 通过在环境中运行当前策略来收集轨迹。
  2. 计算回报和优势估计(例如,使用广义优势估计)。
  3. 通过最大化裁剪的替代目标来更新策略,通常使用随机梯度上升。
  4. 可选地,更新价值函数以改进优势估计。

PPO以其相对于TRPO的简单性和易实现性而闻名,同时在许多任务中达到相当或更好的性能。它已成为强化学习研究中的标准基线。

应用与影响

PPO已在研究和工业领域得到广泛采用。在OpenAI,它于2018年成为默认的强化学习算法,用于OpenAI Five等项目,该项目在2019年击败了Dota 2的卫冕世界冠军。PPO还用于机器人控制,包括训练机械臂执行操作任务,以及玩Atari游戏,在许多游戏上达到了超人类水平。

该算法的稳定性和样本效率使其成为微调大型语言模型的热门选择,特别是在基于人类反馈的强化学习(RLHF)背景下。许多现代大型语言模型已使用PPO或其变体进行对齐,推动了生成式AI系统的发展。

与其他方法的比较

PPO常与其他策略梯度算法(如A2C(优势演员-评论家)和DDPG(深度确定性策略梯度))进行比较。与使用多个并行环境的A2C不同,PPO可以在单一环境中工作,并使用重要性采样来重用数据。与离策略且确定性的DDPG相比,PPO是在策略且随机的,使其对超参数变化更加稳健。PPO的裁剪目标还提供了比TRPO信任区域更简单的替代方案,在保持稳定性的同时减少了计算开销。

局限性与扩展

尽管取得了成功,PPO仍有局限性。它可能对裁剪参数和优势估计方法的选择敏感。它还需要仔细调整学习率和迷你批大小等超参数。研究人员提出了扩展方法,如PPO-λ,它结合了广义优势估计,以及自适应调整裁剪范围的变体。此外,PPO的在策略特性可能使其与离策略方法相比样本效率较低,尽管这通常被其稳定性所抵消。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:reinforcement-learning·machine-learning·openai·algorithms
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史