译自英文

门控机制是神经网络中的一个组件,通过控制信息在层间的流动,利用学习到的门来决定保留或丢弃什么。它在LSTM和现代transformer等架构中至关重要,提升了长距离依赖处理能力和模型效率。

门控机制是神经网络中的一个组件,用于调节层间或循环单元内部的信息流动。它利用学习到的参数为每个元素生成一个介于0和1之间的值,实际上起到过滤器的作用,决定传入信号中有多少应被传递到下一层。这使得网络能够选择性地保留相关信息并抑制无关或含噪数据,这对于涉及序列数据、长程依赖和深层架构的任务至关重要。

这一概念源于早期循环网络的研究,当时梯度消失问题使得学习长期依赖变得困难。通过引入乘法门控,网络能够在多个时间步上维持记忆状态,从而捕捉跨扩展序列的模式。门控机制此后被以多种形式采用,从LSTM单元到Transformer中基于注意力的门控,并仍是现代深度学习系统中的基本构建模块。

历史发展

第一个突出的门控机制由Sepp Hochreiter和Jürgen Schmidhuber于1997年提出,即长短期记忆(LSTM)网络。LSTM单元包含三个门:输入门、遗忘门和输出门。每个门是一个sigmoid激活层,输出介于0和1之间的值,控制新输入进入单元状态的程度、前一个状态被遗忘的程度以及状态暴露给输出的程度。这一设计直接解决了梯度消失问题,使LSTM能够学习数百或数千步的序列。

2014年,Kyunghyun Cho及其同事提出了门控循环单元(GRU),这是一种简化变体,包含两个门:重置门和更新门。重置门决定遗忘多少过去信息,而更新门决定纳入多少新信息。GRU的参数少于LSTM,且通常表现相当,因此适用于资源受限的应用。

在现代架构中的作用

门控机制不仅限于循环网络。在Transformer中,它支撑了大多数大型语言模型(如来自OpenAIAnthropic的模型),门控出现在前馈层中。例如,门控线性单元(GLU)及其变体(如SwiGLU)使用门控信号来调制线性变换的输出。这已被证明能改善Google DeepMind的GShard和Meta的LLaMA等模型的性能和训练稳定性。

此外,注意力机制本身也可视为一种门控形式,其中注意力权重充当软门,选择输入中应关注的部分。多头注意力通过并行学习多个此类门来扩展这一点,使模型能够捕捉不同的关系。

技术实现

典型的门控机制使用sigmoid函数计算门向量\( g \):\( g = \sigma(W_g x + b_g) \),其中\( W_g \)和\( b_g \)是学习到的权重和偏置,\( x \)是输入。输出则为\( y = g \odot h \),其中\( h \)是候选值(通常来自tanh或线性变换),\( \odot \)表示逐元素乘法。在训练过程中,梯度流经门,使网络能够学习何时打开或关闭每个门。

在实践中,门控机制与其他技术(如层归一化残差连接)结合使用以稳定训练。例如,可以在门之前应用批归一化层,以将激活值保持在合适范围内。

应用与影响

门控机制在众多领域实现了突破。在自然语言处理的机器学习中,它们使模型能够处理长文档和对话。在计算机视觉中,门控卷积网络等门控架构改善了图像生成和分割。在强化学习中,门控循环策略帮助智能体记住过去的观察。

NVIDIAAMD等硬件公司已针对门控所需的矩阵乘法和逐元素运算优化了其芯片,而Amazon Web ServicesGoogle Cloud等云服务提供商则提供如AWS Trainium等专用加速器,以高效支持这些工作负载。

局限性与未来方向

尽管取得了成功,门控机制仍增加了计算开销,且可能难以解释。研究人员已探索替代方案,例如使用模型剪枝来移除冗余门,或使用Dropout来正则化它们。近期关于RLHF课程学习的研究也考察了门控与训练动态的交互。

截至2025年,门控仍是一个活跃的研究领域,不断有新的变体被提出以用于高效推理和更好的泛化。门控背后的原则,即选择性信息流动,很可能在未来的架构中持续存在,包括用于生成式AI和边缘设备的架构。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:neural-networks·deep-learning·machine-learning·sequence-modeling
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史