加载中...

分组查询注意力(Grouped-Query Attention,GQA)是介于多头注意力(MHA)与多查询注意力(MQA)之间的折中方案:查询头保持多个,键值头减少为若干组,每组键值被组内多个查询头共享。
推理时 KV 缓存的显存占用与键值头数成正比。MHA 效果好但缓存大,MQA 缓存最小但可能损失质量;GQA 通过调节分组数在两者之间平衡,例如 32 个查询头配 8 个键值头,可将 KV 缓存压缩到四分之一而效果几乎无损。已有的 MHA 模型也可通过少量继续训练转换为 GQA。
Llama 2 70B、Llama 3、Qwen、Mistral 等主流开源模型普遍采用 GQA,它显著提升了长上下文和高并发场景下的推理吞吐,是当前解码器架构的标准配置之一。

登录 后参与讨论
暂无讨论,来发表第一条评论吧