加载中...

n-gram 语言模型是一种统计语言模型,假设一个词出现的概率只依赖于它前面的 n-1 个词(马尔可夫假设),通过在大规模语料上统计词序列频率来估计句子概率。
句子概率被分解为条件概率的连乘,例如 trigram 模型用前两个词预测当前词。概率由最大似然估计得到,即用语料中词序列的相对频率近似。由于数据稀疏,实际应用必须配合平滑技术,如加一平滑、Katz 回退和 Kneser-Ney 平滑。
曾长期支撑语音识别、统计机器翻译、输入法和拼写纠错等系统的语言建模模块,也用于文本生成和作者识别。
优点是简单、可解释、训练和查询速度快;缺点是无法建模长距离依赖,参数量随 n 指数增长,泛化能力差。2010 年代后逐渐被循环神经网络和 Transformer 语言模型取代,但在轻量场景仍有价值。

登录 后参与讨论
暂无讨论,来发表第一条评论吧