加载中...
教师强制是训练序列生成模型的标准技巧:每一步都用真实标注序列而非模型自己的上一步输出作为输入,使训练可并行且稳定。其代价是训练与推理分布不一致,即曝光偏差问题。

| 英文名 | Teacher Forcing |
| 命名 | Williams 与 Zipser(1989) |
| 适用模型 | RNN、Transformer等自回归模型 |
| 主要代价 | 曝光偏差 |
| 缓解方法 | 计划采样、序列级训练 |
教师强制(Teacher Forcing)是训练自回归序列生成模型时的一种标准做法:在训练阶段,模型每一步的输入不使用自己上一步的预测结果,而是直接使用真实目标序列中的上一个词元,如同有教师在旁边随时纠正。该思想在1989年Williams与Zipser关于循环网络训练的论文中被正式命名,如今仍是从RNN到Transformer语言模型训练的基础。
自回归模型逐词生成序列,每一步都依赖之前的输出。如果训练时也让模型吃自己的预测,早期模型能力差,一步出错会导致后续输入全部偏离,梯度信号混乱且难以收敛。教师强制用真实序列作为每步输入,把序列生成训练转化为一系列独立的下一词预测问题,再配合交叉熵损失即可稳定训练。对Transformer而言,教师强制配合因果掩码还使得整个序列的所有位置可以一次前向并行计算损失,是大规模预训练高效率的关键。
教师强制被用于几乎所有自回归生成任务的监督训练:语言模型预训练、机器翻译、语音合成、图像描述等。大语言模型的预训练与监督微调本质上都是教师强制式的下一词预测;而RLHF等后训练让模型基于自己采样的完整输出获得反馈,可视为对曝光偏差的一种矫正。
问:教师强制只用于RNN吗?答:不是。Transformer语言模型的标准训练同样是教师强制,只是通过因果掩码把逐步喂入变成了并行计算。
问:曝光偏差在大模型时代还重要吗?答:大规模预训练显著缓解了该问题,但生成长序列时错误累积依然存在,这也是后训练与测试时自我纠错技术的动机之一。

| 英文名 | Teacher Forcing |
| 命名 | Williams 与 Zipser(1989) |
| 适用模型 | RNN、Transformer等自回归模型 |
| 主要代价 | 曝光偏差 |
| 缓解方法 | 计划采样、序列级训练 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧