卷积神经网络(CNN)是一种模仿生物视觉机制的前馈神经网络,通过卷积层自动提取图像局部特征,在图像识别、目标检测等大型图像处理任务中表现出色,是深度学习和计算机视觉领域的经典基础架构。

| 类型 | 深度学习网络架构(前馈神经网络) |
| 代表人物 | Yann LeCun 等 |
| 奠基模型 | LeNet、AlexNet |
| 应用领域 | 图像识别、目标检测、医学影像、自动驾驶 |
| 相关概念 | 深度学习、计算机视觉、神经网络 |
卷积神经网络(Convolutional Neural Network,简称 CNN)是一种包含卷积计算的前馈神经网络,其神经元只响应输入的一部分局部区域,擅长自动提取图像中的空间特征,是深度学习在图像处理领域最经典、应用最广的架构之一。
传统神经网络把图片摊平成一长串数字来处理,既丢失了像素之间的空间关系,参数量也会爆炸。CNN 的设计灵感来自生物视觉皮层:每个神经元只「看」画面中的一小块区域(局部感受野),再逐层把边缘、纹理等低级特征组合成轮廓、部件乃至完整物体的高级特征,从而高效地理解图像。
CNN 的奠基性工作以 Yann LeCun 提出的 LeNet 为代表,早期被用于手写数字识别。2012 年,AlexNet 在大规模图像识别竞赛中以显著优势夺冠,让 CNN 一举成为计算机视觉的主流方法,也点燃了这一轮深度学习浪潮。如今人脸识别、医学影像分析、自动驾驶感知等场景背后都有它的身影。
问:CNN 和普通神经网络有什么区别?答:普通全连接网络的每个神经元与上一层全部相连,处理图像时参数巨大且忽略空间结构;CNN 通过局部连接和权值共享大幅减少参数,并保留了像素间的空间关系,更适合图像任务。
问:CNN 只能处理图像吗?答:不是。凡是具有局部结构的数据都适用,例如语音、文本序列(一维卷积)以及视频(三维卷积),只是图像是其最典型的应用场景。
问:CNN 会被 Transformer 取代吗?答:Vision Transformer 等新架构在不少视觉任务上表现优异,但 CNN 计算效率高、小数据集上更稳健,在移动端和嵌入式设备中依然广泛使用,两者目前是互补关系。

| 类型 | 深度学习网络架构(前馈神经网络) |
| 代表人物 | Yann LeCun 等 |
| 奠基模型 | LeNet、AlexNet |
| 应用领域 | 图像识别、目标检测、医学影像、自动驾驶 |
| 相关概念 | 深度学习、计算机视觉、神经网络 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧