卷积神经网络

译自英文

卷积神经网络(CNN)是一种通过滤波器优化来学习特征的前馈神经网络,常用于处理图像等网格状数据。它利用卷积层、池化层和全连接层来处理和预测各种数据类型。

卷积神经网络(CNN)是一种前馈神经网络,通过滤波器(或核)优化来学习特征。这种深度学习网络已被应用于处理多种不同类型的数据并从中进行预测,包括文本、图像和音频。CNN是深度学习方法在计算机视觉和图像处理中的事实标准,只是在某些情况下最近才被诸如Transformer (architecture)等更新的架构所取代。

CNN也被称为平移不变或空间不变人工神经网络,基于卷积核或滤波器的共享权重架构,这些滤波器沿输入特征滑动,并提供称为特征图的平移等变响应。与直觉相反,大多数卷积神经网络并非平移不变,这是因为它们对输入应用了下采样操作。

架构

卷积神经网络由输入层、隐藏层和输出层组成。在卷积神经网络中,隐藏层包括一个或多个执行卷积的层。通常,这包括一个执行卷积核与层输入矩阵点积的层。该乘积通常是Frobenius内积,其激活函数通常是ReLU。当卷积核沿层输入矩阵滑动时,卷积操作生成特征图,该特征图进而构成下一层的输入。随后是其他层,如池化层、全连接层和归一化层。

卷积层

在CNN中,输入是一个形状为(输入数量)×(输入高度)×(输入宽度)×(输入通道)的张量。经过卷积层后,图像被抽象为特征图,也称为激活图,形状为(输入数量)×(特征图高度)×(特征图宽度)×(特征图通道)。卷积层对输入进行卷积,并将其结果传递给下一层。这类似于视觉皮层中的神经元对特定刺激的响应。每个卷积神经元仅处理其感受野内的数据。

虽然全连接前馈神经网络可用于学习特征和分类数据,但这种架构对于较大输入(例如高分辨率图像)通常不实用,因为每个像素都是相关的输入特征,这将需要大量神经元。对于大小为100×100的图像,全连接层中第二层的每个神经元有10,000个权重。卷积减少了自由参数的数量,使网络能够更深入。例如,使用5×5的平铺区域,每个区域具有相同的共享权重,仅需要25个神经元。使用共享权重意味着参数少得多,这有助于避免早期神经网络在反向传播中遇到的梯度消失和梯度爆炸问题。

为了加快处理速度,标准卷积层可以被深度可分离卷积层替代,后者基于深度卷积后接逐点卷积。深度卷积是对输入张量的每个通道独立应用的空间卷积,而逐点卷积是限制使用1×1核的标准卷积。

池化层

卷积网络可能包括局部和/或全局池化层以及传统卷积层。池化层通过将一层中神经元簇的输出组合为下一层中的单个神经元来减少数据的维度。局部池化组合小簇,通常使用2×2等平铺大小。全局池化作用于特征图的所有神经元。常用池化有两种类型:最大池化和平均池化。最大池化使用特征图中每个局部神经元簇的最大值,而平均池化取平均值。

全连接层

全连接层将一层中的每个神经元连接到另一层中的每个神经元。这与传统多层感知器神经网络(MLP)相同。全连接层中的每个神经元接收来自前一层所有神经元的输入。这些输入被加权并与相应的偏置求和,然后通过激活函数进行非线性变换,生成输出。展平的矩阵通过全连接层对图像进行分类。

生物学启发

卷积网络受到生物过程的启发,因为神经元之间的连接模式类似于动物视觉皮层的组织。单个皮层神经元仅对视觉场中的受限区域(称为感受野)内的刺激作出响应。不同神经元的感受野部分重叠,从而覆盖整个视觉场。这种生物学类比激发了卷积层的设计,其中每个神经元处理来自局部区域的输入,模仿感受野结构。

正则化与过拟合

前馈神经网络通常是全连接网络,即一层中的每个神经元连接到下一层的所有神经元。这些网络的“全连接性”使其容易过拟合数据。典型的正则化或防止过拟合的方法包括在训练期间惩罚参数(如权重衰减)或修剪连接(跳过连接、丢弃等)。稳健的数据集也增加了CNN学习表征给定数据集的广义原则而非稀疏数据集偏差的概率。此外,CNN的共享权重架构固有地减少了参数数量,提供了一种有助于缓解过拟合的正则化形式。

应用

CNN的一些应用包括图像和视频识别、推荐系统、图像分类、图像分割、医学图像分析、自然语言处理、脑机接口和金融时间序列。在计算机视觉中,CNN已广泛用于目标检测、人脸识别和自动驾驶等任务。在自然语言处理中,CNN已应用于文本分类和情感分析,尽管在许多此类任务中它们已被基于Transformer (architecture)的模型在很大程度上取代。CNN的多功能性源于其学习层次特征的能力,从低级边缘到高级语义概念。

优势与局限性

与其他图像分类算法相比,CNN使用的预处理相对较少。这意味着网络通过自动学习来优化滤波器(或核),而在传统算法中这些滤波器是手工设计的。这简化并自动化了过程,提高了效率和可扩展性,克服了人工干预的瓶颈。然而,由于下采样操作,CNN并非固有平移不变,这在某些任务中可能是一个限制。此外,虽然CNN在计算机视觉中一直占主导地位,但诸如Transformer (architecture)等新架构已开始在某些应用中取代它们,特别是在大规模数据和计算资源可用时。

与其他神经网络类型的关系

CNN是Neural network的一种专门形式,也是Deep learning架构的一个子集。它们与全连接网络的不同之处在于使用卷积和池化层,这减少了参数数量并实现了层次特征提取。与依赖注意力机制的Transformer (architecture)相比,CNN使用局部感受野和共享权重,使其在网格状数据上更参数高效,但在没有额外修改的情况下捕获长距离依赖的能力较弱。尽管transformer兴起,CNN仍然是Machine learning中的基础架构,并继续用于结合卷积和注意力组件的混合模型中。

未来方向

研究继续改进CNN,包括深度可分离卷积的效率发展、解决梯度消失的残差连接,以及与其他架构的集成。诸如Batch NormalizationDropout等技术常用于稳定训练和防止过拟合。截至2020年代初,CNN仍然是计算机视觉中的标准工具,但其主导地位正受到基于transformer的模型的挑战,尤其是在大规模设置中。正在进行的工作旨在结合两种方法的优势,为广泛的应用带来更稳健和高效的模型。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·computer-vision·neural-networks
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史