加载中...
交叉熵损失是分类和语言建模中最常用的损失函数,衡量模型预测概率分布与真实标签分布之间的差异。语言模型训练几乎都以最小化交叉熵为目标。

| 中文名 | 交叉熵损失 |
| 英文名 | Cross-Entropy Loss |
| 常配合 | Softmax |
| 等价目标 | 最大似然 |
| 相关指标 | 困惑度 |
交叉熵损失(Cross-Entropy Loss)是机器学习中用于分类任务和语言建模的核心损失函数。它衡量模型输出的预测概率分布与真实标签分布之间的差距:当模型对正确类别赋予的概率越高,交叉熵越小;当模型自信地预测错误答案时,交叉熵会急剧增大。
交叉熵源自信息论,表示用一个分布去编码另一个分布所需的平均信息量。在监督学习中,真实标签通常是独热向量,此时交叉熵损失退化为对正确类别预测概率取负对数,即负对数似然。最小化交叉熵等价于最大化训练数据的似然,也等价于最小化预测分布与真实分布之间的 KL 散度,这三者在数学上紧密相连。
在图像分类、文本分类等任务中,交叉熵是默认损失。在大语言模型预训练与微调中,模型逐 token 预测下一个词,训练目标就是最小化整段文本上每个位置的交叉熵之和;困惑度这一常用评价指标本质上就是交叉熵的指数形式。因此可以说,现代语言模型的训练基本都围绕交叉熵展开。
问:交叉熵和 KL 散度什么关系?答:交叉熵等于真实分布的熵加上从真实分布到预测分布的 KL 散度。由于熵是常数,最小化交叉熵与最小化 KL 散度等价。
问:为什么分类不用均方误差而用交叉熵?答:配合 Softmax 时,交叉熵的梯度更利于优化,收敛更快,且能更强地惩罚自信的错误预测。

| 中文名 | 交叉熵损失 |
| 英文名 | Cross-Entropy Loss |
| 常配合 | Softmax |
| 等价目标 | 最大似然 |
| 相关指标 | 困惑度 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧