加载中...

多头潜在注意力(Multi-head Latent Attention,MLA)是 DeepSeek 在 DeepSeek-V2 中提出的注意力机制。它不直接缓存每个头的键值,而是把键值联合压缩为一个低秩潜在向量,推理时只缓存该向量,再按需投影还原。
MLA 的核心是低秩联合压缩:训练时通过降维矩阵把隐藏状态压成远小于原始 KV 的潜在表示,配合矩阵吸收技巧,解码时无需显式还原完整键值。位置信息则通过解耦的 RoPE 分支单独处理。相比 GQA 靠减少键值头数换显存,MLA 在压缩率更高的同时保留了各头独立的表达能力。
DeepSeek-V2、V3 与 R1 均采用 MLA,其 KV 缓存较传统多头注意力可压缩到数十分之一,是 DeepSeek 系列实现低成本推理的关键架构创新,也被后续多个开源模型借鉴。

登录 后参与讨论
暂无讨论,来发表第一条评论吧