加载中...

多头注意力(Multi-Head Attention)是 Transformer 中的核心模块。它将查询(Q)、键(K)、值(V)通过不同的线性投影映射到多个低维子空间,在每个子空间独立计算缩放点积注意力,再将各头输出拼接并线性变换。
单一注意力头只能学到一种加权模式,多头机制让不同的头关注不同的信息:有的头捕捉局部语法关系,有的头捕捉远距离语义依赖。若模型维度为 d,头数为 h,每头维度通常为 d/h,总计算量与单头相近。
多头注意力用于自注意力和交叉注意力两种场景。后续研究发现部分头存在冗余,由此发展出多查询注意力(MQA)、分组查询注意力(GQA)等变体,在保持效果的同时大幅减少推理时的 KV 缓存开销。

登录 后参与讨论
暂无讨论,来发表第一条评论吧