加载中...

线性注意力(Linear Attention)指一类去掉 softmax、用核函数特征映射近似注意力的方法。利用矩阵乘法结合律,先计算键与值的外积和,再与查询相乘,使复杂度从序列长度的平方降为线性。
标准注意力必须先算出完整的注意力矩阵;线性注意力把 (QK)V 重排为 Q(KV),KV 的累积和可以随序列递推更新,因此推理时等价于一个固定大小状态的 RNN,每步计算量恒定,无需保存不断增长的 KV 缓存。
优点是长序列效率极高、显存恒定;缺点是固定状态压缩了历史信息,精确检索能力弱于 softmax 注意力。代表工作包括 Linear Transformer、Performer、RetNet、Lightning Attention 等,MiniMax 等团队已将其用于生产级大模型,常与标准注意力混合使用。

登录 后参与讨论
暂无讨论,来发表第一条评论吧