加载中...

推测解码(Speculative Decoding)是一种大语言模型推理加速技术,由 Google 与 DeepMind 的研究者于 2022 至 2023 年间提出。其核心洞察是:自回归生成每次只产出一个 token,GPU 算力大量闲置在等待显存读取上;而验证一段候选文本(并行前向)比逐个生成便宜得多。
典型流程使用一大一小两个模型:小的草稿模型快速地连续生成若干候选 token;大的目标模型对这些候选做一次并行前向验证,通过拒绝采样机制逐个接受或拒绝,并在首个被拒位置由目标模型重新采样。数学上可证明最终输出分布与目标模型独立解码完全一致,即加速不损失质量。实践中常见 2 到 3 倍的解码加速。
后续研究衍生出多种免独立草稿模型的方案:Medusa 在原模型上加多个解码头并行预测;EAGLE 系列在特征层做自回归草稿,是当前效果领先的方法之一。vLLM、TensorRT-LLM 等主流推理框架均已内置推测解码支持。

登录 后参与讨论
暂无讨论,来发表第一条评论吧