加载中...

分块预填充(Chunked Prefill)是大语言模型推理调度技术,把一条长提示词的预填充(prefill)计算切分成多个小块,分摊到连续多个迭代中执行,而非一次性算完。
在连续批处理中,一条超长提示词的 prefill 会独占 GPU 很长时间,期间同批次其他请求的解码被迫等待,造成 token 间延迟(ITL)剧烈抖动。该问题由 Sarathi 等研究工作系统分析并提出分块方案。
调度器每轮组建「混合批」:若干解码请求加上一个 prefill 块。解码是访存密集、prefill 是计算密集,两者拼批能更充分利用 GPU;块大小是吞吐与时延的调节旋钮。
vLLM、SGLang、TensorRT-LLM 等主流框架均已实现分块预填充并逐步默认开启,它与 PD 分离是解决长上下文干扰问题的两条主要路线,前者单集群即可用,后者隔离更彻底。

登录 后参与讨论
暂无讨论,来发表第一条评论吧