加载中...

GRPO(Group Relative Policy Optimization,组相对策略优化)是 DeepSeek 团队在训练数学推理模型时提出的强化学习算法,是 PPO 的一种简化变体。
PPO 需要额外训练一个价值网络来估计基线,显存开销大。GRPO 的做法是:对同一个提示采样一组(多个)回答,用组内所有回答奖励的均值和标准差对每个回答的奖励做归一化,以此作为优势估计,从而完全省去价值网络。策略更新仍沿用 PPO 式的裁剪目标并加 KL 约束。
GRPO 在 DeepSeekMath 中提出,并在 DeepSeek-R1 的推理能力强化训练中发挥关键作用,配合可验证奖励(如数学答案判分、代码测试)效果显著,此后被众多开源推理模型复现采用。
优点是省去价值网络、实现简单、显存友好;缺点是需要对每个提示采样多条回答,推理采样成本较高。

登录 后参与讨论
暂无讨论,来发表第一条评论吧