加载中...

仅解码器(Decoder-only)架构去掉了 Transformer 的编码器和交叉注意力,只保留带因果掩码的自注意力层堆叠。模型对所有文本统一建模:给定前文预测下一个词,理解与生成不再区分。
因果掩码保证每个位置只能看到左侧上下文,训练时一个序列的每个位置都是监督信号,样本利用率高;推理时配合 KV 缓存逐词生成。提示词(prompt)机制让同一模型无需改结构即可完成问答、翻译、代码等各类任务。
结构简单、易于规模化、训练目标与生成任务完全一致,且上下文学习能力随规模涌现,这些特性使其成为大模型的绝对主流:GPT 系列、Llama、Qwen、DeepSeek 等均为仅解码器架构。其局限是对长输入的编码效率不如编码器-解码器,需靠 KV 缓存优化弥补。

登录 后参与讨论
暂无讨论,来发表第一条评论吧