加载中...
KL 散度是衡量两个概率分布差异的非对称度量,表示用一个分布近似另一个分布时损失的信息量。它是机器学习中变分推断、蒸馏、强化学习对齐等众多方法的核心工具。

| 中文名 | KL 散度 |
| 又称 | 相对熵 |
| 提出时间 | 1951 年 |
| 取值范围 | 非负 |
| 是否对称 | 否 |
KL 散度(Kullback-Leibler Divergence,相对熵)是信息论中衡量两个概率分布之间差异的度量,记作从分布 P 到分布 Q 的散度。它表示当用 Q 去近似真实分布 P 时,平均需要额外付出的信息代价,取值非负,当且仅当两分布完全相同时为零。
KL 散度由 Kullback 和 Leibler 于 1951 年提出。它的一个关键性质是非对称,即从 P 到 Q 与从 Q 到 P 的散度一般不相等,因此它不是严格意义上的距离。尽管如此,由于其与最大似然、交叉熵之间的紧密联系,KL 散度成为概率建模中最常用的工具之一。交叉熵实际上等于目标分布的熵加上 KL 散度,这使得最小化交叉熵与最小化 KL 散度在训练中等价。
在变分自编码器中,KL 散度用于让隐变量分布逼近先验分布;在知识蒸馏中,它衡量学生模型输出与教师模型输出的差异;在基于人类反馈的强化学习中,常加入 KL 惩罚项,约束微调后的模型不要偏离原始模型太远,以防止训练崩坏。此外它也广泛用于变分推断和分布匹配。
问:KL 散度是距离吗?答:不是。它不满足对称性,也不满足三角不等式,所以只能算一种散度而非距离,但它仍能有效刻画分布差异。
问:为什么强化学习对齐要加 KL 惩罚?答:为了让微调模型在优化奖励的同时不过度偏离原始模型,避免语言能力退化或输出异常。

| 中文名 | KL 散度 |
| 又称 | 相对熵 |
| 提出时间 | 1951 年 |
| 取值范围 | 非负 |
| 是否对称 | 否 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧