加载中...

PD 分离(Prefill-Decode Disaggregation)是大语言模型推理服务的一种架构,把处理输入提示词的预填充(prefill)阶段与逐 token 生成的解码(decode)阶段部署到不同的 GPU 实例上。
Prefill 是计算密集型,长提示词会占满算力;Decode 是访存密集型,每步计算量小但依赖 KV Cache 带宽。两者混跑时,prefill 会阻塞正在解码的请求,造成 token 间时延抖动。
分离架构中,prefill 集群完成首个 token 计算后,将 KV Cache 通过高速网络(如 RDMA)传输给 decode 集群继续生成;两侧可按负载特点独立选型和伸缩。DistServe、Mooncake(月之暗面 Kimi 的推理架构)等系统推动了该思路普及。
优点是时延稳定、资源利用率高;代价是 KV Cache 传输开销与系统复杂度上升,vLLM、SGLang、Dynamo 等已提供相应支持。

登录 后参与讨论
暂无讨论,来发表第一条评论吧