加载中...
CNN(Convolutional Neural Network)是专为处理网格状数据(图像、音频频谱)设计的神经网络,通过卷积核提取局部特征并逐层抽象,是图像分类、目标检测领域长达十年的主流架构。

| 类型 | 神经网络架构 |
| 首个实用模型 | LeNet-5,Yann LeCun,1998 |
| 突破年份 | 2012,AlexNet,ImageNet 竞赛 |
CNN 的核心思路是局部感受野 + 参数共享。一个 3×3 的卷积核在图像上滑动,每次只看 9 个像素,学习检测某种局部模式(比如边缘、角点)。同一个卷积核用于整张图的所有位置,参数量远比全连接网络少。多个卷积核并行,各自检测不同特征,输出多通道的特征图(feature map)。
浅层卷积核通常学到边缘、颜色梯度;中层学到纹理、形状;深层则是更抽象的部件甚至物体概念。这种层级特征提取方式和人类视觉皮层的分层处理方式高度相似,不是巧合,而是 Yann LeCun 早在 1989 年设计 LeNet 时受到神经科学启发的结果。[1]
1998 年 LeCun 的 LeNet-5 用于手写数字识别,是 CNN 的祖师爷。2012 年 AlexNet 在 ImageNet 竞赛上以 10.9% 的错误率大幅碾压传统方法(第二名 26%),正式宣告深度学习时代到来,它的关键创新是 ReLU 激活函数和 GPU 并行训练。2015 年 ResNet(残差网络)引入跳跃连接解决了深层网络梯度消失问题,152 层的 ResNet 将 ImageNet 错误率降至 3.57%,低于人类水平(5%)。
如今 Vision Transformer(ViT)在大数据集上超越了 CNN,但 CNN 因为归纳偏置(inductive bias)强、小数据表现好,在医学影像、工业检测等场景仍是首选。

| 类型 | 神经网络架构 |
| 首个实用模型 | LeNet-5,Yann LeCun,1998 |
| 突破年份 | 2012,AlexNet,ImageNet 竞赛 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧