神经网络是一种计算模型,由相互连接的简单处理单元层组成,这些单元大致受生物神经元启发,其连接强度(即权重)通过训练进行调整,以逼近所需函数。神经网络是现代深度学习的核心计算结构,进而也是大多数当代人工智能系统的基础。
历史
最早可训练的神经模型是感知机,于1958年提出,它能够使用单层可调权重学习对简单模式进行分类。其局限性在1969年的一篇批评文章中被记录,导致研究资金大幅流失,这一现象被称为人工智能寒冬。20世纪80年代,随着反向传播算法的普及,对多层网络的兴趣重新兴起,该算法能高效计算网络中每个权重应如何变化以减小误差,使得带有隐藏层的网络在实践中得以训练。2012年AlexNet的成功使神经网络从一种小众技术转变为人工智能领域的主导方法,该网络证明了使用图形处理单元在大数据集上训练的多层网络,能够在现实任务中显著超越以往方法。
结构
神经网络按层组织单元(即神经元),每个神经元计算其输入的加权和,并通过非线性激活函数处理后传递给下一层。输入与输出之间具有许多此类层的网络被称为“深度”网络,深度学习因此得名。在训练过程中,损失函数衡量网络输出与期望结果之间的差距,梯度下降迭代调整权重以缩小这一差距,而反向传播则高效地为所有层同时提供所需的梯度。
架构家族
不同的网络架构适用于不同类型的数据。卷积神经网络使用共享的、空间局部的滤波器,非常适合图像处理。循环神经网络(包括长短期记忆变体)逐步处理序列,历史上曾用于文本和语音,后来被Transformer架构所取代,后者利用注意力机制并行处理整个序列。生成式架构如生成对抗网络和扩散模型将神经网络应用于生成新数据,而不仅仅是分类或预测。
局限性与可解释性
神经网络常被批评为“黑箱”:即使其输出准确,其内部表示也难以被人类检查或解释。这催生了一个有时被称为可解释性的研究子领域,试图逆向工程训练网络中各个组件所代表的内容。尽管存在这种不透明性,神经网络仍然是视觉、语言、音频以及日益增多的机器人和科学应用中的主导工具,这主要是因为其性能随着数据、参数和计算量的增加而持续可预测地提升。