加载中...

SGLang 是伯克利团队(LMSYS 背景)开源的大模型推理引擎与前端语言,目标是高吞吐服务与复杂生成流程的高效执行,已被多家公司用于生产部署,DeepSeek 官方亦推荐其作为参考推理实现之一。
RadixAttention 用基数树自动管理与复用跨请求的 KV 缓存前缀,系统提示词、多轮对话、批量评测等场景可大量命中缓存;配合零开销调度器、连续批处理与张量并行实现高吞吐。前端提供受控生成原语,压缩状态机使 JSON 等约束解码几乎无额外开销,并支持多轮、分支等复杂程序化调用。
SGLang 与 vLLM 同为开源推理框架第一梯队,支持主流开源模型与量化格式,对 DeepSeek 系列的 MLA、多 token 预测等特性优化尤为深入。

登录 后参与讨论
暂无讨论,来发表第一条评论吧