加载中...

RLAIF(Reinforcement Learning from AI Feedback,AI 反馈强化学习)指在对齐训练中,用能力较强的 AI 模型代替人类标注员对模型输出进行偏好评判,再据此训练奖励模型或直接优化策略。
RLHF 依赖大量人工偏好标注,成本高、周期长、一致性有限。随着大模型自身评判能力提升,「AI 当裁判」成为可行方案。Anthropic 的 Constitutional AI 是早期代表:让模型依据一组书面原则自我批评与修订,并用 AI 生成偏好数据完成强化学习阶段。
典型做法是:采样模型的多个回答,由评判模型依据评分准则选出更优者,形成偏好数据集,后续流程与 RLHF 相同。
优点是可规模化、成本低、标注标准可通过提示词精确控制;缺点是评判模型自身的偏差会被放大传递,可能引入系统性错误,通常与少量人工标注校准结合使用。

登录 后参与讨论
暂无讨论,来发表第一条评论吧