加载中...
因果掩码是自回归 Transformer 中用于屏蔽未来位置的机制,确保每个位置只能关注自身及之前的 token。它保证模型在训练和推理中都遵循从左到右的生成顺序。

| 中文名 | 因果注意力掩码 |
| 又称 | 下三角掩码 |
| 作用 | 屏蔽未来位置 |
| 典型架构 | 仅解码器 |
| 生成顺序 | 从左到右 |
因果注意力掩码(Causal Attention Mask,又称下三角掩码)是自回归语言模型中的关键机制。它在自注意力计算时屏蔽掉每个位置右侧的未来 token,使得任意位置在计算注意力时只能看到它自己以及之前的位置,从而保证模型的生成过程严格遵循从左到右的因果顺序。
Transformer 的自注意力本身是全连接的,每个位置默认可以关注序列中所有位置。但在语言生成任务中,模型在预测第 t 个 token 时不应该提前看到第 t 个及之后的答案,否则会造成信息泄露,训练出的模型无法真正预测。因果掩码通过在注意力分数矩阵上加入一个下三角结构,把未来位置对应的分数置为负无穷,经过 Softmax 后这些位置的权重变为零。
因果掩码是 GPT 系列等仅解码器架构的标配,广泛用于文本生成、对话、代码补全等自回归任务。相对地,像 BERT 这类双向编码器不使用因果掩码,因为它们需要同时利用上下文两侧的信息。在训练时,因果掩码让模型可以用整句一次性并行学习,大幅提升训练效率。
问:为什么不能让模型看到未来 token?答:生成任务要求模型逐步预测下一个词,若能看到答案就无法学到真正的预测能力,也与推理时逐步生成的方式不一致。
问:因果掩码会降低训练速度吗?答:不会。它反而让整段序列可以并行训练,同时保持每个位置只依赖历史,是效率与因果性的巧妙结合。

| 中文名 | 因果注意力掩码 |
| 又称 | 下三角掩码 |
| 作用 | 屏蔽未来位置 |
| 典型架构 | 仅解码器 |
| 生成顺序 | 从左到右 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧