译自英文

多层感知机(MLP)是一种具有全连接层和非线性激活函数的前馈神经网络,能够学习非线性模式。它构成了深度学习的基础,并通过反向传播进行训练。

多层感知器(MLP)是一种前馈神经网络,由全连接神经元按层组织而成,并采用非线性激活函数。与仅能分类线性可分数据的单层感知器不同,MLP能够区分非线性可分的数据,因此成为深度学习中的基础架构。现代MLP通过反向传播进行训练,通常被通俗地称为“香草”神经网络。

MLP源于克服单层感知器局限性的努力,单层感知器使用海维赛德阶跃函数作为其激活函数。然而,反向传播需要连续激活函数,如S型函数或修正线性单元(ReLU)。MLP构成深度学习的基础,并适用于广泛领域,包括图像识别、自然语言处理和时间序列预测。

历史发展

人工神经元的概念可追溯至1943年,当时沃伦·麦卡洛克和沃尔特·皮茨提出了一种二元神经元,作为生物神经网络的逻辑模型。1958年,弗兰克·罗森布拉特引入了多层感知器模型,该模型具有输入层、权重随机且不学习的隐藏层,以及具有可学习连接的输出层。罗森布拉特1962年的著作《神经动力学原理》描述了通过“反向传播误差”训练多达两个可学习层的变体,但这并非现代反向传播算法,当时尚无通用方法训练多层网络。

1965年,阿列克谢·格里戈里耶维奇·伊瓦赫年科和瓦伦丁·拉帕发表了数据处理的群方法,这是最早的深度学习方法之一,并于1971年用于训练八层神经网络。1967年,甘利俊一报告了首个通过随机梯度下降训练的多层神经网络,该网络能够分类非线性可分的模式类别;他的学生斋藤使用具有两个学习层的五层前馈网络进行了计算机实验。

反向传播在1970年代初期被多次独立开发。最早发表的实例是塞波·林纳依马1970年的硕士论文。保罗·韦尔博斯于1971年独立开发了该方法,但直到1982年才得以发表。1986年,戴维·E·鲁梅尔哈特及其同事推广了反向传播,导致其广泛采用。2003年,由于约舒亚·本吉奥及其合著者在语言建模方面的深度学习成功,对反向传播网络的兴趣再次兴起。

架构与激活函数

MLP由三层或更多层组成:输入层、输出层以及一个或多个隐藏层。每一层中的每个节点以特定权重连接到下一层的每个节点,使网络全连接。如果所有神经元使用线性激活函数,线性代数表明,任何层数都可简化为两层输入输出模型。因此,MLP使用非线性激活函数,这些函数是为了模拟生物神经元的放电频率而开发的。

历史上,两种常见的激活函数是S型函数:双曲正切函数,其范围从-1到1,以及逻辑函数,其范围从0到1。最近,修正线性单元(ReLU)在深度学习中变得普遍,因为它有助于克服与S型函数相关的数值问题。其他替代方案包括softplus和径向基函数,后者用于径向基网络。

通过反向传播学习

MLP中的学习通过处理每个数据点后调整连接权重来实现,基于输出与预期结果之间的误差。这是监督学习,通过反向传播进行,反向传播是线性感知器中使用的均方最小算法的推广。对于第n个训练样本上的输出节点j,误差定义为e_j(n) = d_j(n) - y_j(n),其中d_j(n)是期望目标,y_j(n)是实际输出。该算法将此误差通过网络向后传播以更新权重,通常使用随机梯度下降等优化方法。

现代变体与影响

2021年,研究人员设计了MLP-Mixer,这是一种结合两个深度MLP与跳跃连接和层归一化的简单架构。其实现,参数从1900万到4.31亿不等,在ImageNet及类似图像分类任务上表现与相似规模的视觉变换器相当。这表明,尽管Transformer (architecture)模型兴起,MLP在现代深度学习中仍具竞争力。MLP也是许多Neural network系统的组成部分,包括Large language model架构和Deep learning框架的组件。其简单性和有效性使其成为Machine learning研究和应用中的标准基线。

局限性与扩展

虽然MLP功能强大,但也有局限性。它们全连接,导致参数众多,对于图像等高维输入计算成本高。它们也不固有地捕获空间或序列结构,这促使了Residual Network (ResNet)Sequence-to-Sequence (Seq2Seq)模型等架构的发展。诸如DropoutBatch NormalizationLayer Normalization等技术常用于提高训练稳定性和泛化能力。尽管存在这些挑战,MLP仍是Artificial intelligence中的基本构建块,并继续为更复杂架构的设计提供信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:neural-networks·deep-learning·machine-learning·artificial-intelligence
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史