加载中...

DPO(Direct Preference Optimization,直接偏好优化)是由斯坦福大学研究者于 2023 年提出的大语言模型对齐方法,用于替代传统 RLHF 流程中的强化学习阶段。
传统 RLHF 需要先训练奖励模型,再用 PPO 等强化学习算法优化策略。DPO 通过数学推导将奖励函数隐式地表达为策略本身的函数,把对齐问题转化为一个简单的分类式损失:给定同一提示下人类偏好的回答与被拒绝的回答,直接提升前者相对后者的概率,同时用参考模型约束偏移幅度。
优点是训练流程简单稳定、无需在线采样、计算开销低,已被大量开源模型采用。缺点是依赖离线偏好数据的质量与分布,对分布外提示的泛化能力可能弱于在线强化学习方法。
DPO 之后衍生出 IPO、KTO、ORPO 等一系列偏好优化变体,成为开源社区对齐微调的主流路线之一。

登录 后参与讨论
暂无讨论,来发表第一条评论吧