近端策略优化(PPO)是OpenAI于2017年提出的强化学习算法,通过裁剪目标函数限制每次策略更新的幅度,兼顾稳定性与实现简洁性。它是RLHF流程中最经典的优化算法,InstructGPT与早期ChatGPT均基于PPO训练。

| 英文名 | Proximal Policy Optimization |
| 简称 | PPO |
| 提出者 | John Schulman 等 |
| 提出时间 | 2017年 |
| 提出机构 | OpenAI |
| 算法类型 | 策略梯度强化学习 |
近端策略优化(Proximal Policy Optimization,简称PPO)是一种策略梯度类强化学习算法,由OpenAI的John Schulman等人于2017年提出。它以实现简单、训练稳定著称,长期是深度强化学习的默认算法,并因成为RLHF(人类反馈强化学习)的核心组件而在大模型时代广为人知。
策略梯度方法直接优化策略网络,但更新步子过大容易导致策略崩溃。PPO的前身TRPO(信赖域策略优化)用复杂的二阶约束解决这一问题,而PPO用一个简单的一阶技巧达到近似效果:限制新旧策略的概率比值在一个小区间内,从而保证每次更新都近端(proximal),即不偏离旧策略太远。
PPO被广泛用于游戏智能体、机器人控制等传统强化学习任务。在大模型领域,InstructGPT提出的RLHF三段式流程(监督微调、训练奖励模型、PPO优化策略)使其成为对齐训练的标准算法,并加入与参考模型的KL散度惩罚防止模型偏离过远。由于PPO需要同时维护策略、价值、奖励、参考四个模型,工程复杂且显存开销大,后来出现了DPO、GRPO等简化替代方案,但PPO仍是理解现代对齐技术的基础。
问:PPO和DPO有什么区别?答:PPO是在线强化学习,需要训练独立的奖励模型并采样生成;DPO将偏好学习转化为直接的监督式损失,无需奖励模型和在线采样,实现更简单,但两者各有适用场景。
问:为什么RLHF中要加KL惩罚?答:防止策略为了刷高奖励分数而生成偏离自然语言分布的文本(即奖励攻击),KL项把模型约束在参考模型附近。

| 英文名 | Proximal Policy Optimization |
| 简称 | PPO |
| 提出者 | John Schulman 等 |
| 提出时间 | 2017年 |
| 提出机构 | OpenAI |
| 算法类型 | 策略梯度强化学习 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧