加载中...

AdamW 是 Loshchilov 与 Hutter 提出的 Adam 优化器改进版,核心是把权重衰减(weight decay)从梯度中解耦:不再把 L2 正则项加进梯度参与自适应缩放,而是在参数更新时直接按比例衰减权重。
Adam 对每个参数维护梯度的一阶动量与二阶动量,自适应调整步长。若按传统方式把 L2 惩罚混入梯度,二阶动量会把衰减量也一并缩放,导致正则强度与梯度大小耦合、效果失真;AdamW 的解耦让权重衰减独立于自适应机制,泛化表现更好,学习率与衰减系数也更易分别调节。
从 BERT 到 GPT、Llama,几乎所有大模型都以 AdamW 为默认优化器,常配合余弦学习率衰减与预热使用。其缺点是需为每个参数存两份动量,显存开销大,由此催生了 Adafactor、8-bit Adam、Muon 等替代方案。

登录 后参与讨论
暂无讨论,来发表第一条评论吧