加载中...
vLLM 是加州大学伯克利分校 Sky Computing Lab 于 2023 年开源的大语言模型推理与服务引擎,其核心论文提出的 PagedAttention 技术发表于 SOSP 2023。项目现由广泛的开源社区维护,是目前自建大模型推理服务最主流的选择之一。
vLLM 的两大支柱是 PagedAttention 与连续批处理(Continuous Batching)。前者借鉴操作系统虚拟内存分页思想,将 KV Cache 切分为固定大小的块按需分配,几乎消除显存碎片,并支持前缀共享;后者在迭代级别动态插入与移出请求,GPU 不再等待整批完成,吞吐量相比朴素实现可提升一个数量级。此外它还支持张量并行、多种量化格式、推测解码、结构化输出,并兼容 OpenAI API 协议。
vLLM 支持 Llama、Qwen、DeepSeek、Mistral 等主流开源模型,覆盖 NVIDIA、AMD 及多家国产加速器。同类项目包括 Hugging Face TGI、NVIDIA TensorRT-LLM 与 SGLang,其中 vLLM 以易用性、模型覆盖与社区活跃度见长。
登录 后参与讨论
暂无讨论,来发表第一条评论吧