加载中...

监督微调(Supervised Fine-Tuning,SFT)指在预训练语言模型基础上,使用高质量的「指令-回答」示范数据继续训练,使模型从续写文本转变为遵循指令、以对话形式作答。
SFT 沿用与预训练相同的下一个词预测目标,但训练数据换成结构化的对话样本,并通常只对回答部分计算损失。模型由此学习回答的格式、语气与任务执行方式,即所谓「指令遵循」能力。
在典型的对齐流程中,SFT 是第一阶段,其后再接 RLHF 或 DPO 等偏好优化阶段。InstructGPT 论文确立了「SFT + 奖励模型 + 强化学习」的三段式范式。
SFT 数据讲究质量重于数量,少量精心编写的多样化示范往往优于海量低质数据;数据分布也决定了模型的风格与能力边界。过度 SFT 可能损伤预训练获得的知识,需控制训练轮数与学习率。

登录 后参与讨论
暂无讨论,来发表第一条评论吧