加载中...

| 类型 | 神经网络基础组件 |
| 主流选择 | ReLU(CNN)/ GELU(BERT/GPT)/ SwiGLU(LLaMA) |
| 关键性质 | 非线性、可微分、计算高效 |
如果神经网络的每一层都只做线性变换(矩阵乘法),那无论叠多少层,整体效果仍然等价于一个线性变换——只是参数的线性组合。这样的网络只能拟合线性关系,连 XOR 这种简单问题都解决不了(1969 年 Minsky 指出的感知机局限)。激活函数引入非线性后,网络才具备逼近任意连续函数的能力(通用近似定理)。
Sigmoid 函数把输出压到 (0,1) 区间,曾是标配,但两端梯度趋近于零(饱和区),导致深层网络梯度消失。Tanh 输出 (-1,1),均值为零,比 Sigmoid 稍好,但同样有饱和问题。[1]
2012 年 AlexNet 把 ReLU(Rectified Linear Unit,max(0,x))推到主流:正区间梯度恒为 1,完全无饱和;计算只需一次 max 操作,极快。ImageNet 上 ReLU 网络收敛速度比 Tanh 快 6 倍。缺陷是「死神经元」问题:负区间梯度为零,如果某个神经元持续收到负输入,它就永远不会更新(「死亡」)。
后续改进层出不穷:Leaky ReLU 给负区间一个小斜率(0.01x);GELU(2016)用高斯累积分布函数平滑 ReLU,BERT、GPT 系列都用它;SwiGLU(2022,PaLM 论文)是 Swish 和 GLU 的组合,LLaMA、Gemma 等最新模型的前馈层都采用 SwiGLU,实验上比 GELU 再提升约 0.5% 的下游任务表现。

| 类型 | 神经网络基础组件 |
| 主流选择 | ReLU(CNN)/ GELU(BERT/GPT)/ SwiGLU(LLaMA) |
| 关键性质 | 非线性、可微分、计算高效 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧