加载中...
vLLM 是一个高吞吐、低延迟的大语言模型推理与服务引擎,其核心创新 PagedAttention 通过类似操作系统虚拟内存的分页机制管理 KV 缓存,大幅提升显存利用率与并发处理能力。

| 中文名 | vLLM 推理引擎 |
| 起源 | 伯克利团队 |
| 开源时间 | 2023 年 |
| 核心技术 | PagedAttention |
| 用途 | 大模型推理服务 |
vLLM 是一个开源的大语言模型推理与在线服务框架,以高吞吐量著称,其标志性技术 PagedAttention 显著提升了显存利用效率,是当前生产环境部署大模型的主流引擎之一。
vLLM 最初由加州大学伯克利分校的研究团队于二零二三年开源。传统推理框架在管理 KV 缓存时需要为每个请求预留连续显存,导致大量碎片与浪费。vLLM 借鉴操作系统的虚拟内存与分页思想,把 KV 缓存切分成固定大小的块按需分配,从而在相同硬件上服务更多并发请求。
vLLM 广泛用于大模型的在线聊天服务、批量离线推理、检索增强生成后端等高并发场景。它被众多企业与云平台采用作为模型服务化的底座,兼顾成本与响应速度。
问:vLLM 为什么能提升吞吐量?答:关键在于 PagedAttention 消除了显存碎片,配合连续批处理让更多请求同时驻留显存并共享计算,从而在单位时间内处理更多词元。
问:vLLM 支持哪些硬件?答:主要面向 GPU 部署,同时也逐步支持多种加速卡与量化方案,可根据显存与并发需求灵活配置并行策略。

| 中文名 | vLLM 推理引擎 |
| 起源 | 伯克利团队 |
| 开源时间 | 2023 年 |
| 核心技术 | PagedAttention |
| 用途 | 大模型推理服务 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧