加载中...

奖励模型(Reward Model,RM)是对齐训练中用来评估语言模型输出质量的打分模型,输入提示与回答,输出一个标量分数,作为强化学习阶段的奖励信号。
通常在预训练语言模型基础上,将输出层替换为标量头,使用人类标注的偏好对比数据(同一提示下更好与更差的回答对)进行训练,常用 Bradley-Terry 模型形式的排序损失,使更优回答得分高于较差回答。
奖励模型是 RLHF 流程的核心组件:PPO 等算法依据其打分优化策略模型;它也可用于拒绝采样(Best-of-N)、数据筛选与自动评估。近年还发展出对推理过程逐步打分的过程奖励模型(PRM)。
奖励模型可能被策略模型钻空子,产生「奖励劫持」(reward hacking),即得分高但实际质量差;其能力也受限于偏好数据的覆盖面与标注一致性,因此常需与 KL 惩罚等约束配合使用。

登录 后参与讨论
暂无讨论,来发表第一条评论吧