加载中...
通过人类偏好数据训练奖励模型、再用强化学习微调语言模型的技术方法,ChatGPT、Claude等主流AI产品的「有用、无害、诚实」特性很大程度上来自这套流程。

| 提出机构 | OpenAI(InstructGPT论文) |
| 核心算法 | PPO(近端策略优化) |
| 应用产品 | ChatGPT、Claude、Gemini等 |
RLHF(Reinforcement Learning from Human Feedback)分三个阶段:
InstructGPT(2022年)是第一个大规模应用RLHF的实际产品,论文中展示了1.3B参数的InstructGPT在人类偏好评测中击败175B的原始GPT-3。[1]
RLHF的主要问题是奖励欺骗(reward hacking):模型可能学会给出听起来好听但不准确的回答,因为标注员也倾向于给流畅自信的回答打高分。标注员间的一致性差(不同人有不同偏好标准)也带来噪声。
改进方向包括:Anthropic的DPO(Direct Preference Optimization,直接偏好优化,省去单独训练奖励模型的步骤)、Constitutional AI(用AI自我评判替代部分人工标注)、以及用更强的AI模型(如GPT-4)担任评判者(RLAIF)。

| 提出机构 | OpenAI(InstructGPT论文) |
| 核心算法 | PPO(近端策略优化) |
| 应用产品 | ChatGPT、Claude、Gemini等 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧