加载中...

PPO(Proximal Policy Optimization,近端策略优化)是 OpenAI 于 2017 年提出的策略梯度类强化学习算法,以实现简单、训练稳定著称。
策略梯度方法直接优化策略网络,但更新步长过大容易导致策略崩溃。PPO 在目标函数中引入新旧策略概率比,并通过裁剪(clip)机制将该比值限制在一个小区间内,从而保证每次更新不会偏离旧策略太远,兼顾了样本效率与稳定性。通常配合优势函数估计(GAE)和价值网络一起使用。
PPO 广泛用于游戏智能体、机器人控制等领域,更重要的是它是 RLHF(人类反馈强化学习)流程中优化语言模型策略的经典算法,InstructGPT 与早期 ChatGPT 的对齐训练均基于 PPO。
优点是稳定、易调参、适用面广;缺点是在大模型场景下需要同时维护策略、参考、奖励、价值多个模型,显存与工程开销大。

登录 后参与讨论
暂无讨论,来发表第一条评论吧