加载中...
Adam 是一种广泛使用的深度学习优化算法,全称为自适应矩估计。它结合了动量法与自适应学习率的优点,通过维护梯度的一阶和二阶矩估计,为每个参数动态调整更新步长,收敛快且对超参数不敏感,是训练神经网络的主流选择。

| 全称 | Adaptive Moment Estimation |
| 提出者 | Diederik Kingma、Jimmy Ba |
| 提出时间 | 2014 年 |
| 类型 | 自适应优化算法 |
| 核心思想 | 动量加自适应学习率 |
Adam 优化器(Adaptive Moment Estimation)即自适应矩估计,是由金玛(Diederik Kingma)和巴(Jimmy Ba)于 2014 年提出的一种随机梯度下降优化算法。它融合了动量法和自适应学习率两种思想,能为每个参数计算独立的自适应更新步长,是当前训练深度神经网络最常用的优化器之一。
传统随机梯度下降对所有参数使用统一学习率,调参困难且收敛可能缓慢。Adam 通过分别估计梯度的一阶矩(均值)和二阶矩(未中心化方差),自动为不同参数调整步长,既保留了动量带来的加速效果,又具备自适应能力,因而在实践中收敛快、鲁棒性好。
Adam 被广泛应用于计算机视觉、自然语言处理和各类深度学习模型的训练中,常作为默认优化器。在大模型训练里,其改进版本引入了更规范的权重衰减处理,进一步提升了泛化表现。
问:Adam 一定优于随机梯度下降吗?答:不一定。Adam 收敛快、易调参,但在某些任务上带动量的随机梯度下降经过精细调节反而泛化更好,具体选择需视任务而定。
问:Adam 和 AdamW 有什么区别?答:AdamW 将权重衰减与梯度更新解耦,以更正确的方式实现正则化,通常在大模型训练中表现更佳,是 Adam 的常用改进版本。

| 全称 | Adaptive Moment Estimation |
| 提出者 | Diederik Kingma、Jimmy Ba |
| 提出时间 | 2014 年 |
| 类型 | 自适应优化算法 |
| 核心思想 | 动量加自适应学习率 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧