加载中...

学习率预热(Learning Rate Warmup)指在训练开始的若干步内,将学习率从零或极小值线性(或按其他曲线)增大到设定峰值,之后再按正常调度衰减。
训练初期模型参数是随机初始化的,梯度方向噪声大;自适应优化器(如 Adam)的二阶动量统计也尚未积累充分,直接使用较大学习率容易造成损失剧烈震荡甚至发散。预热阶段以小步长「热身」,让优化器状态和网络内部统计量先稳定下来。
预热在 Transformer 训练中几乎是标配,原始 Transformer 论文即采用「先线性升温、再按步数平方根倒数衰减」的调度;现代大模型预训练普遍使用「线性预热 + 余弦衰减」组合。预热步数是重要超参数,常取总步数的百分之一到百分之几。
与之配套的概念包括余弦退火、学习率衰减、批量大小与学习率的线性缩放规则等。

登录 后参与讨论
暂无讨论,来发表第一条评论吧