加载中...

权重衰减(Weight Decay)是一种正则化方法:在每次参数更新时,额外把权重按一个小比例缩小,促使模型偏好较小的权重值,抑制过拟合。
在标准 SGD 下,权重衰减与在损失函数中加入 L2 正则项在数学上等价;但在 Adam 等自适应优化器下两者并不等价——L2 正则项会被自适应学习率缩放,导致衰减效果失真。AdamW 的贡献正是将权重衰减从梯度中解耦,恢复其正则作用。
较小的权重使模型函数更平滑、对输入扰动更不敏感;从贝叶斯视角看等价于对权重施加高斯先验。通常偏置项与归一化层的缩放参数不做衰减。
权重衰减是训练 Transformer 的标准配置,大模型预训练常用 0.1 量级的系数,视觉任务常用 1e-4 量级(SGD 下)。系数过大导致欠拟合,过小则正则不足,是需要调节的核心超参数之一。

登录 后参与讨论
暂无讨论,来发表第一条评论吧