加载中...

多 token 预测(Multi-Token Prediction,MTP)是对标准「下一词预测」目标的扩展:模型在每个位置除预测紧邻的下一个词元外,还通过附加的输出头同时预测其后第 2 至第 n 个词元,由 Meta 研究者于 2024 年系统论证。
仅预测下一词的目标偏向局部模式,MTP 迫使模型的隐藏表示携带更长远的规划信息,从而提升样本效率,在代码生成等任务上收益明显。训练时各预测头共享主干,推理时可丢弃额外头不增加成本,也可保留用作自带的草稿模型执行推测解码,一步生成多个词元。
DeepSeek-V3 采用顺序式 MTP 模块作为训练目标之一,并利用其加速推理,是该技术最著名的生产实践;多家开源模型与推理框架已跟进支持,MTP 成为提升训练效率与解码速度的双用途技术。

登录 后参与讨论
暂无讨论,来发表第一条评论吧