加载中...
贪心解码是语言模型生成文本时最简单的策略,每一步都选择概率最高的 token。它速度快、结果确定,但容易陷入局部最优,导致文本重复或缺乏多样性。

| 中文名 | 贪心解码 |
| 英文名 | Greedy Decoding |
| 选择方式 | 每步取最大概率 |
| 是否随机 | 否 |
| 对比方法 | 集束搜索、采样 |
贪心解码(Greedy Decoding)是自回归语言模型生成文本时最基础的解码策略。在每一个生成步骤,它都从模型输出的概率分布中直接选取概率最高的那个 token 作为结果,然后把它接到已生成序列后面,继续预测下一个 token,直到遇到结束符或达到长度上限。
语言模型每步会给出词表上所有 token 的概率分布,如何从中选择下一个词就是解码策略要解决的问题。贪心解码是最直接的做法:只看当前一步的局部最优。它计算简单、速度快,而且在温度为零时输出完全确定,便于复现和调试。但它只考虑当前步的最优,忽略了全局,可能错过整体概率更高的序列。
贪心解码适用于对确定性要求高、答案相对唯一的任务,如部分抽取式问答、格式固定的信息提取和一些代码补全场景。在需要文本更自然、多样或更接近全局最优的场景中,人们通常改用集束搜索,或采用带温度的核采样、Top-k 采样等随机解码方法,以缓解贪心解码的重复和呆板问题。
问:贪心解码为什么会重复?答:它每步只追求局部最高概率,容易落入模型偏好的高频短语循环,缺乏跳出局部最优的机制。
问:贪心解码和集束搜索有何区别?答:贪心只保留一条概率最高的路径,集束搜索同时保留多条候选路径,更接近全局最优,但计算开销更大。

| 中文名 | 贪心解码 |
| 英文名 | Greedy Decoding |
| 选择方式 | 每步取最大概率 |
| 是否随机 | 否 |
| 对比方法 | 集束搜索、采样 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧