加载中...

Dropout 是一种神经网络正则化方法:训练时按设定概率随机将一部分神经元的输出置零,每个批次丢弃的单元不同;推理时不再丢弃。该方法由 Geoffrey Hinton 团队提出,论文发表于 2014 年的 JMLR。
随机丢弃迫使网络不能依赖任何单个神经元,削弱神经元间的「共适应」,等效于同时训练大量共享权重的子网络并在推理时做近似集成,从而提升泛化能力。实现上常用 inverted dropout:训练时将保留的激活按保留概率放大,推理阶段网络无需任何改动。
Dropout 曾是 AlexNet 等经典网络对抗过拟合的关键组件;Transformer 在注意力权重与残差路径上也使用 Dropout。变体包括针对卷积的 SpatialDropout、随机深度(Stochastic Depth)、DropPath 等。
在数据极其充足的大模型预训练中,过拟合风险低,Dropout 常被弃用或设为零;但在小数据微调与判别式任务中仍是简单有效的正则化手段。

登录 后参与讨论
暂无讨论,来发表第一条评论吧