加载中...

PagedAttention 是 vLLM 项目提出的 KV 缓存管理技术。它借鉴操作系统虚拟内存的分页思想,把每个请求的 KV 缓存切成固定大小的块(block),通过块表映射到非连续的物理显存,而非预留一整段连续空间。
传统实现须按最大可能长度预分配连续显存,内部与外部碎片可浪费大半空间。分页机制按需逐块分配,几乎消除碎片;块表还支持多请求共享相同前缀的物理块(写时复制),使并行采样、系统提示词复用等场景的显存开销大幅下降。
显存利用率的提升直接转化为更大的并发批次,vLLM 借此实现了远超此前方案的服务吞吐。PagedAttention 发表后迅速成为行业共识,TensorRT-LLM、SGLang 等主流推理框架均实现了类似的分块 KV 管理。

登录 后参与讨论
暂无讨论,来发表第一条评论吧