加载中...

多查询注意力(Multi-Query Attention,MQA)由 Noam Shazeer 于 2019 年提出。它保留多个查询头,但所有头共享同一份键和值投影,使键值头数从 h 降为 1。
自回归解码的瓶颈在于每步都要从显存读取全部 KV 缓存,属于典型的访存受限问题。MQA 把 KV 缓存缩小为原来的 1/h,大幅减少显存占用与带宽压力,解码速度可提升数倍,对长序列和大批量场景收益尤其明显。
MQA 的代价是键值表达容量下降,部分任务上质量略有损失,训练也可能不够稳定。PaLM、Falcon 等模型采用了 MQA;后来的分组查询注意力(GQA)以分组共享折中质量与速度,逐渐取代 MQA 成为主流。

登录 后参与讨论
暂无讨论,来发表第一条评论吧