加载中...

滑动窗口注意力(Sliding Window Attention)让每个位置只与前方固定大小窗口内的词计算注意力,而非全序列。它是稀疏注意力的一种简单而有效的形式,最早在 Longformer 等长文本模型中系统使用。
注意力的计算与显存开销随序列长度平方增长,而语言建模中多数依赖是局部的。窗口注意力把复杂度降为序列长度乘窗口大小的线性量级;多层堆叠后感受野逐层扩大,层数乘以窗口大小范围内的信息仍可间接传递,类似卷积网络的感受野叠加。
Mistral 7B 采用 4096 大小的滑动窗口配合滚动 KV 缓存,显著降低长文本推理成本;Gemma 2 等模型则采用窗口注意力与全局注意力交替的混合层设计,在效率与长程依赖之间取得平衡。

登录 后参与讨论
暂无讨论,来发表第一条评论吧