加载中...

LMDeploy 是上海人工智能实验室(InternLM 团队)开源的大语言模型量化、压缩与部署工具箱。
它包含两个推理引擎:C++/CUDA 编写的高性能引擎 TurboMind(源自对 FasterTransformer 的改造),以及纯 PyTorch 引擎便于快速适配新模型;同时提供 W4A16(AWQ)量化、KV Cache 量化、OpenAI 兼容 API 服务等能力。
TurboMind 实现了持久化批处理(persistent batching)与分块 KV Cache 管理,在 InternLM、Qwen、Llama 等模型上具有出色的吞吐表现;对视觉语言模型(如 InternVL)的部署支持也较完善。
常用于国内企业和研究机构部署开源中文大模型,与 vLLM、SGLang 构成互补选择,尤其在书生浦语(InternLM)生态中是官方推荐方案。

登录 后参与讨论
暂无讨论,来发表第一条评论吧