加载中...
指令微调是在大量以自然语言指令描述的多样任务上微调预训练模型的方法,使模型学会理解并遵循人类指令,从而具备零样本泛化到新任务的能力,是让基础模型变得可用的关键步骤。

| 中文名 | 指令微调 |
| 英文名 | Instruction Tuning |
| 类别 | 模型对齐方法 |
| 数据形式 | 指令加回答 |
| 主要收益 | 零样本泛化 |
指令微调(Instruction Tuning)是一种用大量以自然语言指令形式表达的任务数据来微调预训练语言模型的方法,目的是让模型学会理解并执行各种人类指令,显著提升其在未见任务上的零样本表现。
仅经过预训练的基础模型擅长续写文本,却未必能直接听懂并完成人类的具体要求。指令微调通过把大量不同任务统一改写成指令加回答的格式来训练模型,使其掌握遵循指令这一通用能力。这一范式在多项研究中被证明能让模型泛化到训练时从未见过的新指令,是从基础模型迈向可用助手的重要环节。
指令微调是几乎所有对话助手与指令跟随模型的必经步骤。它让模型能够根据不同要求进行问答、翻译、摘要、写作与推理,而无需为每个任务单独训练,是通用大模型可用性的核心来源之一。
问:指令微调和监督微调是一回事吗?答:指令微调是监督微调的一种特定形式,强调训练数据以指令加回答的形式覆盖大量任务;监督微调是更宽泛的概念,泛指用带标签数据微调模型。
问:指令微调后还需要强化学习吗?答:指令微调能让模型学会遵循指令,但在贴合人类偏好、控制风格与安全性方面,通常还需配合人类反馈强化学习等对齐手段进一步优化。

| 中文名 | 指令微调 |
| 英文名 | Instruction Tuning |
| 类别 | 模型对齐方法 |
| 数据形式 | 指令加回答 |
| 主要收益 | 零样本泛化 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧