前馈是神经网络中的一种基本架构模式,其中信息严格单向流动:从输入层,经过隐藏层,到输出层,没有循环或反馈连接。这种设计与允许信息循环的循环架构形成对比,并且它支撑了当代绝大多数机器学习系统,包括深度学习模型和大型语言模型。
该术语源于控制理论和早期人工智能研究,其中前馈系统直接从其输入计算输出,而不依赖于任何先前的输出。在神经网络的背景下,这意味着每一层的激活仅由前一层的激活计算得出,形成一种简单、可组合的结构,可以通过反向传播高效训练。
历史发展
前馈网络的概念可以追溯到感知机,由弗兰克·罗森布拉特于1958年提出,这是一个单层前馈模型。1969年,马文·明斯基和西摩·帕珀特的著作《感知机》指出了单层前馈网络的局限性,减缓了研究进展。该领域在1980年代随着反向传播的普及而复兴,这使得训练多层前馈网络(通常称为多层感知机)成为可能。早期关键贡献者包括伯纳德·威德罗和伯克利人工智能研究的附属成员,他们推进了自适应滤波和学习算法。
到2010年代,前馈架构成为现代人工智能的支柱。Transformer架构在2017年论文《注意力就是你所需要的一切》中提出,作者包括雅各布·乌兹科雷特、卢卡什·凯泽和尼基·帕尔马,它严重依赖与注意力机制交错的前馈层。这种设计支撑了由OpenAI、Anthropic和Google DeepMind开发的系统。
核心组件
典型的前馈网络由输入层、一个或多个隐藏层和输出层组成。每一层应用线性变换,随后是非线性激活函数。常见的激活函数包括ReLU(修正线性单元)、sigmoid和tanh。权重和偏置通过优化算法学习,如Adam或随机梯度下降变体。
在现代架构中,前馈层通常被扩展和收缩。例如,在Transformer中,每个块包含一个前馈网络,首先将表示投影到更高维度(通常是模型宽度的4倍),然后投影回来,中间夹有非线性。这种设计有时被称为位置-wise前馈网络,独立处理每个标记。
在现代架构中的作用
前馈层在编码器-解码器模型和序列到序列系统中至关重要。在Transformer中,编码器和解码器堆栈都包含前馈子层。这些层负责转换由多头注意力机制产生的表示,使模型能够学习复杂的特征交互。
残差网络(ResNets)于2015年引入,包含跳跃连接,允许梯度更容易地流过深层前馈堆栈,从而支持数百层的网络。这一创新对于将模型扩展到现代生成式人工智能系统的规模至关重要。像批归一化和层归一化这样的技术进一步稳定了深层前馈网络的训练。
训练与优化
训练前馈网络依赖于反向传播,它计算损失函数相对于所有权重的梯度。关键实践包括权重初始化策略、学习率调度和梯度裁剪以防止梯度爆炸。正则化方法如dropout和数据增强有助于防止过拟合。
损失函数因任务而异:交叉熵损失用于分类,均方误差用于回归,以及用于生成模型的专门损失。推理通常使用解码策略,如束搜索或采样方法,包括top-k采样和top-p采样,并使用温度缩放来控制随机性。
应用与变体
前馈网络在各个领域都有应用。在计算机视觉中,卷积神经网络(CNN)本质上是前馈的,像U-Net(U-Net)这样的架构用于图像分割。在自然语言处理中,前馈层是用于GPT和Claude等大型语言模型的Transformer不可或缺的部分。来自NVIDIA等公司的硬件加速器(尽管不在提供的列表中,但注意AMD、Intel和Qualcomm也生产相关芯片)针对前馈计算核心的矩阵乘法进行了优化。
变体包括连接编码器和解码器前馈路径的交叉注意力机制,以及提供顺序信息的位置编码。高级训练方法如RLAIF(基于人工智能反馈的强化学习)和课程学习进一步优化模型行为。前馈网络也出现在专用硬件设计中,如来自Groq和SambaNova的设计,这些设计针对低延迟推理进行了优化。
局限性与未来方向
尽管取得了成功,前馈网络仍有局限性。它们缺乏对过去输入的内在记忆,使其在没有外部机制的情况下不适合处理序列数据。它们也可能计算密集,需要大量能量和专用硬件。研究继续探索更高效的架构,例如混合专家层,每个输入仅激活一部分前馈参数,以及理解其理论性质。
截至2020年代中期,前馈仍然是人工智能中的主导范式,来自斯坦福人工智能实验室和MIT CSAIL等学术机构以及工业实验室的持续创新不断涌现。前馈设计的简单性和可扩展性确保了其在研究和部署系统中的持续相关性。