加载中...
RLHF(Reinforcement Learning from Human Feedback,人类反馈强化学习)通过收集人类对模型输出的偏好评分来训练奖励模型,再用强化学习优化语言模型,使其输出更符合人类期望。ChatGPT 的「对齐」很大程度上依赖于 RLHF。

| 类型 | LLM 对齐技术 |
| 核心算法 | PPO(近端策略优化) |
| 简化替代 | DPO(2023,Rafailov et al.) |
标准 RLHF 分三个阶段:
RLHF 的工程复杂度很高:需要同时维护四个模型(SFT、RM、当前策略、参考策略),PPO 训练极不稳定,超参数敏感。
2023 年 Stanford 提出 DPO(Direct Preference Optimization):数学上证明了可以跳过显式的奖励模型,直接用偏好对数据微调语言模型,等价于隐式地优化同样的目标函数。DPO 实现简单、训练稳定,Llama 3、Mistral 等开源模型的对齐阶段纷纷采用 DPO 或其变体(IPO、KTO)。Anthropic 的 Constitutional AI 则用 AI 生成批评和修订,减少人工标注量,是另一种减少 RLHF 人力成本的路径。

| 类型 | LLM 对齐技术 |
| 核心算法 | PPO(近端策略优化) |
| 简化替代 | DPO(2023,Rafailov et al.) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧