加载中...

KV Cache(键值缓存)是大语言模型推理阶段最基础的优化技术。Transformer 解码器自回归生成时,每个新 token 的注意力计算需要用到之前所有 token 的 Key 和 Value 张量;若不缓存,每生成一步都要对全部历史重新前向计算,复杂度随序列长度平方增长。KV Cache 把已算出的 K、V 保存在显存中,每步只需计算新 token 的部分,将生成阶段的重复计算降为增量计算。
KV Cache 的显存占用与层数、注意力头数、序列长度、批大小成正比,长上下文和高并发下常常超过模型权重本身。主要优化方向包括:vLLM 提出的 PagedAttention 借鉴操作系统分页按需分配;MQA/GQA 让多个 Q 头共享少量 KV 头(Llama 3 采用);DeepSeek-V2 提出的 MLA 用低秩压缩缩小缓存;还有 KV 量化、滑动窗口注意力、前缀缓存复用相同上下文等。
各推理框架(vLLM、TensorRT-LLM、SGLang)的核心竞争力很大程度上就是 KV Cache 的管理效率;API 厂商的 Prompt Caching 计费折扣也源于此。

登录 后参与讨论
暂无讨论,来发表第一条评论吧