加载中...

自注意力机制对输入序列是置换不变的,即打乱词序不会改变计算结果。为了让模型感知「谁在前谁在后」,必须显式注入位置信息,这一机制统称位置编码(Positional Encoding)。
原始 Transformer 采用正弦/余弦函数生成的固定编码,不同频率的三角函数组合可表示任意位置;BERT 等模型改用可学习的绝对位置向量;后续发展出相对位置编码、旋转位置编码(RoPE)和 ALiBi 等方案,直接在注意力计算中建模相对距离。
位置编码的选择直接影响模型的长文本外推能力。绝对位置编码超出训练长度后性能急剧下降,而 RoPE 配合插值或 NTK 缩放等技巧,可以把上下文窗口扩展到训练长度的数倍,是当前主流大模型的标准配置。

登录 后参与讨论
暂无讨论,来发表第一条评论吧