加载中...

连续批处理(Continuous Batching,又称迭代级调度)是大模型推理服务的调度技术:不再等一整批请求全部生成完毕才接收新请求,而是在每个解码步结束后,立即移除已完成的序列并插入等待中的新请求。
静态批处理下,批内序列长短不一,短序列早已结束却要陪跑到最长序列完成,GPU 大量空转。连续批处理以单次前向迭代为调度粒度,批次成员动态进出,配合 PagedAttention 的灵活显存管理,可让 GPU 始终接近满载。该思想由 Orca 系统在 2022 年的论文中系统提出。
vLLM、TensorRT-LLM、SGLang、Hugging Face TGI 等主流推理框架均以连续批处理为核心调度策略,配合分块预填充(chunked prefill)等技术平衡首字延迟与吞吐,是大模型在线服务的标配能力。

登录 后参与讨论
暂无讨论,来发表第一条评论吧