加载中...

前缀缓存(Prefix Caching)是大语言模型推理优化技术:当多个请求的输入拥有相同前缀(如同一段系统提示词、同一文档、多轮对话的历史)时,缓存该前缀对应的 KV Cache 供后续请求直接复用,跳过重复的预填充计算。
由于因果注意力下前缀的 KV 值与后续内容无关,系统可用哈希或基数树索引已缓存的 token 块:vLLM 的 Automatic Prefix Caching 以块哈希匹配,SGLang 的 RadixAttention 用基数树管理并支持任意长度的最长前缀匹配,配合 LRU 策略淘汰冷数据。
在系统提示词很长、多轮对话、批量文档问答等场景,可大幅降低首词延迟(TTFT)与算力消耗;商业 API 的「提示词缓存」计费折扣即基于此类技术。
跨机器的分布式 KV Cache 共享(如 Mooncake、LMCache)是该思想在集群层面的延伸。

登录 后参与讨论
暂无讨论,来发表第一条评论吧