加载中...

| 中文名 | 归一化指数函数 |
| 英文名 | Softmax |
| 输入 | 实数向量(logits) |
| 输出 | 概率分布 |
| 常配合 | 交叉熵、注意力 |
Softmax 函数(归一化指数函数)是一种把任意实数向量映射为概率分布的函数。它先对每个元素取指数,再除以所有指数之和,使输出的每个分量都为正数且总和恰好为一,从而可以被解释为各类别的概率。
在多分类神经网络中,输出层通常先产生一组未归一化的实数分值,称为 logits,再经过 Softmax 转换成概率。数值越大的 logit 对应的概率越高,但由于指数放大效应,较大的分值会被进一步拉高。Softmax 与交叉熵损失搭配使用时,梯度形式非常简洁,是深度学习分类任务的标准组合。
Softmax 广泛用于图像分类、文本分类等模型的输出层,把网络分值转为类别概率。在 Transformer 的自注意力中,它用于把注意力分数归一化为权重,决定各位置信息的聚合比例。在大语言模型解码时,Softmax 配合温度参数控制采样随机性:温度越高分布越平缓、输出越多样,温度越低越确定。
问:温度参数如何影响 Softmax?答:温度大于一会让分布更平滑、更随机;温度小于一会让分布更尖锐、更确定;趋近于零则接近直接取最大值。
问:为什么实现时要减去最大值?答:指数运算容易在大数值时溢出,减去向量最大值不改变结果却能提升数值稳定性,是常见工程技巧。

| 中文名 | 归一化指数函数 |
| 英文名 | Softmax |
| 输入 | 实数向量(logits) |
| 输出 | 概率分布 |
| 常配合 | 交叉熵、注意力 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧