加载中...

层归一化(Layer Normalization)对每个样本在特征维度上计算均值和方差并做标准化,再施加可学习的缩放和平移参数。与批归一化不同,它不依赖批内其他样本,天然适合变长序列和小批量场景。
原始 Transformer 将 LayerNorm 放在残差相加之后(Post-LN),深层堆叠时梯度不稳,需要谨慎的学习率预热;GPT-2 起主流模型改为 Pre-LN,即先归一化再进子层,训练显著更稳定,可支撑数百层网络。
为进一步降低计算量,Llama 等模型采用去掉均值中心化的 RMSNorm;此外还有 DeepNorm 等针对超深网络的变体。归一化的位置与形式虽是细节,却直接决定大模型能否稳定训练,是架构设计中的关键选择。

登录 后参与讨论
暂无讨论,来发表第一条评论吧