加载中...
| 类别 | AI术语 |
| 领域 | 人工智能 |
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)是一种将人类偏好引入模型训练的技术,通过收集人类对模型输出的评价信号,训练奖励模型并以强化学习优化语言模型,使其行为更符合人类的意图、价值观与安全规范。它是大语言模型从「会说话」走向「说得好、说得对」的关键对齐手段。[1]
典型 RLHF 包含三个阶段。第一阶段为监督微调(SFT),使用人工标注的高质量示范数据对预训练模型进行初步调整。第二阶段训练奖励模型(RM):针对同一提示采样多个回答,由标注者按偏好排序,奖励模型据此学习一个标量打分函数,以拟合人类偏好。第三阶段以强化学习优化策略,常用近端策略优化(PPO)算法,以奖励模型的打分为回报信号更新语言模型,同时通过 KL 散度惩罚项约束模型不过度偏离 SFT 基线,防止奖励欺骗与能力退化。
RLHF 的优势在于能够捕捉难以用规则显式表达的隐性偏好,如有用性、无害性与诚实性。其局限包括:标注成本高昂、奖励模型易被钻空子(reward hacking)、人类反馈存在主观偏差,以及 PPO 训练不稳定。为此业界提出了更简洁的替代方案,如直接偏好优化(DPO)绕过显式奖励建模,以及基于 AI 反馈的 RLAIF 以降低人力依赖。
RLHF 是现代对话式大模型对齐的核心环节,广泛用于提升回答质量、遵循指令、拒绝有害请求与减少偏见。它使模型输出更贴近用户期待,是构建安全、可靠、可控的通用助手不可或缺的训练范式。
| 类别 | AI术语 |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧