加载中...

最大熵模型(Maximum Entropy Model)基于最大熵原理:在所有满足已知约束(特征的经验期望等于模型期望)的概率分布中,选择熵最大、即最不做额外假设的那一个。该原理由物理学家 E. T. Jaynes 于 1957 年阐明,1990 年代被 Berger、Della Pietra 等人引入自然语言处理。
求解带约束的熵最大化问题,经拉格朗日对偶可得指数族形式的条件分布,本质上与多分类逻辑回归(softmax 回归)等价;参数训练用改进迭代尺度法(IIS)或拟牛顿法(L-BFGS)最大化对数似然。
在统计 NLP 时代,最大熵模型广泛用于词性标注、文本分类、机器翻译的特征组合;其序列扩展"最大熵马尔可夫模型"(MEMM)是条件随机场的前身。
它展示了"用特征函数灵活注入知识 + 凸优化训练"的判别式建模范式,深刻影响了后续的对数线性模型family。

登录 后参与讨论
暂无讨论,来发表第一条评论吧