加载中...
损失函数量化模型预测与真实标签之间的差距,是训练目标的数学表达。选对损失函数对模型性能至关重要:分类用交叉熵、回归用均方误差、生成模型有其专属设计,而 RLHF 的奖励模型本质上也是一种特殊的损失设计。

| 类型 | 训练目标函数 |
| 分类任务标配 | 交叉熵损失 |
| 回归任务标配 | MSE / MAE / Huber Loss |
均方误差(MSE):(预测值 - 真实值)² 的均值,适合连续值回归,对异常值敏感(误差大的样本权重更高)。平均绝对误差(MAE)则对异常值更鲁棒。
交叉熵(Cross-Entropy)是分类任务的标配。对于二分类,它等价于最大化正确类别的对数概率;多分类则在 softmax 后计算。比 MSE 好的地方在于梯度更大、收敛更快——当预测概率接近 0 但真实标签为 1 时,MSE 梯度很小(已经「饱和」),交叉熵则给出大梯度,督促模型快速修正。
语言模型训练用的是下一个 token 预测损失,本质是词表大小(5 万维)上的交叉熵,每次前向传播对序列里每个位置都算一个损失然后取均值。[1]
很多算法创新的核心就是设计一个新损失函数。举几个典型例子:
好的损失函数需要可微分(梯度下降能用)、量化了真正关心的目标,且在实际数值上稳定(不会出现 NaN)。

| 类型 | 训练目标函数 |
| 分类任务标配 | 交叉熵损失 |
| 回归任务标配 | MSE / MAE / Huber Loss |
登录 后参与讨论
暂无讨论,来发表第一条评论吧