过程奖励模型对推理过程中的每一步分别打分,而非只评判最终答案,能更精确地发现和抑制错误推理。OpenAI 2023年的研究证明其在数学推理上优于结果奖励,是推理模型与搜索式解题的重要组件。

| 英文名 | Process Reward Model |
| 简称 | PRM |
| 对应概念 | 结果奖励模型(ORM) |
| 代表论文 | Let's Verify Step by Step(2023) |
| 代表数据集 | PRM800K |
| 典型用途 | best-of-n择优、搜索引导 |
过程奖励模型(Process Reward Model,简称PRM)是一类对模型推理过程逐步打分的奖励模型:它评估思维链中每一个中间步骤是否正确,而不是只看最终答案对错。与之相对的是只评判最终结果的结果奖励模型(Outcome Reward Model,ORM)。
在数学、代码等多步推理任务中,模型可能凭借错误的推理碰巧得到正确答案;只用结果监督训练,会把这类侥幸解也当成正样本,奖励信号粗糙。过程监督把反馈细化到步骤级别,能定位第一处出错的位置,提供更密集、更准确的训练信号。OpenAI在2023年的论文《Let's Verify Step by Step》中对两者做了系统对比:在MATH数据集上,过程监督训练的奖励模型显著优于结果监督,团队同时发布了含80万条人工步骤标注的PRM800K数据集。
PRM是测试时扩展与推理模型研究的重要组件,广泛用于数学解题、定理证明与代码推理。其局限包括:步骤标注成本高;对开放式任务难以定义步骤对错;奖励模型本身可能被策略模型钻空子(奖励攻击)。DeepSeek-R1等工作也表明,在可自动验证最终答案的任务上,纯结果奖励的大规模强化学习同样能训练出强推理模型,PRM并非唯一路径。
问:PRM和ORM该怎么选?答:任务答案可自动判定且规模足够时,结果奖励简单可靠;需要精细定位错误、做逐步搜索或候选排序时,过程奖励更有优势,实践中也常结合使用。
问:过程奖励会被作弊吗?答:会。策略模型可能生成看似规范但空洞的步骤骗取高分,因此需要持续更新奖励模型并配合真实验证信号。

| 英文名 | Process Reward Model |
| 简称 | PRM |
| 对应概念 | 结果奖励模型(ORM) |
| 代表论文 | Let's Verify Step by Step(2023) |
| 代表数据集 | PRM800K |
| 典型用途 | best-of-n择优、搜索引导 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧