加载中...

自回归语言模型(Autoregressive Language Model)把文本序列的联合概率分解为逐词条件概率的连乘:每一步基于已生成的前文预测下一个词元的分布。训练目标即最大化语料中每个位置下一词的似然。
这种「下一词预测」看似简单,却迫使模型学习语法、事实、推理等一切有助于预测的规律,是大模型能力的根本来源。生成时从分布中按温度、top-p 等策略采样,逐词拼接;由于每步依赖前一步输出,解码本质上是串行的,这也是推理加速研究(如推测解码)的出发点。
掩码语言模型(如 BERT)双向编码但不擅长生成;扩散语言模型并行去噪生成,尚在探索阶段。自回归范式凭借训练简单、与生成任务天然一致、可无限规模化,成为当前大语言模型的统治性范式。

登录 后参与讨论
暂无讨论,来发表第一条评论吧