译自英文

Hochreiter和Schmidhuber在1997年发表的LSTM论文中引入了长短期记忆网络,这是一种循环神经网络架构,能够缓解梯度消失问题,从而支持对长序列的学习。该架构成为现代深度学习应用的基础。

1997年,Sepp Hochreiter和Jürgen Schmidhuber发表的论文《长短期记忆》引入了LSTM架构,这是一种循环神经网络,旨在解决传统RNN中困扰已久的梯度消失问题。该研究发表于期刊《神经计算》,提供了一种机制,使网络能够在数千个时间步长内保留信息,这一能力因其与认知心理学中长时记忆和短时记忆的区分相类比而得名“长短期记忆”。该论文为后来成为机器学习深度学习系统基石的一种模型奠定了基础,影响了从语音识别到大型语言模型等多个领域。

LSTM单元与标准RNN神经元的不同之处在于,它包含一个记忆单元和三个门控机制:输入门、输出门和遗忘门。记忆单元在任意时间间隔内存储信息,而门控则调节数据流。遗忘门在后续改进中引入,但对该架构的有效性至关重要,它通过将先前状态和当前输入映射到0到1之间的值来决定从先前状态中丢弃什么,其中1表示保留,0表示丢弃。输入门决定存储哪些新信息,输出门控制从单元状态中输出什么。这种门控结构允许梯度在反向传播过程中以最小衰减流动,缓解了梯度消失问题,并使得学习长距离依赖成为可能。

动机与问题背景

经典RNN理论上可以追踪任意的长期依赖,但在实践中由于计算问题而失败。在通过反向传播进行训练时,跨多个时间步长传播的梯度往往会消失,逐渐趋近于零并停止学习。这一问题在序列中存在数百或数千个元素间隔时尤为严重,例如自然语言或时间序列数据。LSTM论文提出了一种解决方案,通过创建一个额外的模块来学习何时记忆和何时遗忘信息,有效地提供了一种可持续较长时间的短期记忆。例如,在处理“Dave,由于他有争议的言论,现在成了被排斥的人”这样的句子时,LSTM可以保留主语“Dave”的语法性别和数,直到代词“his”需要时使用,然后在动词之后丢弃该信息。这一能力使LSTM在相关信息间隔可变且可能很长的任务中,比其他序列学习方法(包括隐马尔可夫模型)更具优势。

架构与数学表述

该论文详细描述了LSTM单元的前向传播方程,使用向量表示法,其中小写变量表示向量。矩阵\(W_q\)和\(U_q\)包含输入和循环连接的权重,下标\(q\)表示特定的门或单元:输入门\(i\)、输出门\(o\)、遗忘门\(f\)或记忆单元\(c\)。单元状态\(c_t \in \mathbb{R}^h\)表示\(h\)个LSTM单元,而非单个神经元。带有遗忘门的单元的紧凑方程如下:

\[ f_t = \sigma_g(W_f x_t + U_f h_{t-1} + b_f) \]

\[ i_t = \sigma_g(W_i x_t + U_i h_{t-1} + b_i) \]

\[ o_t = \sigma_g(W_o x_t + U_o h_{t-1} + b_o) \]

其中\(\sigma_g\)是sigmoid激活函数,\(x_t\)是时间\(t\)的输入,\(h_{t-1}\)是先前隐藏状态,\(b\)项是偏置。这些门产生0到1之间的值,控制信息流。单元状态更新结合了遗忘门的选择性保留和输入门的新信息,输出门则过滤单元状态以产生隐藏状态。这一表述使网络能够为当前和未来的预测维持有用的长期依赖。

应用与影响

1997年的论文确立了LSTM作为一种多功能工具的地位,后续研究将其应用扩展到众多领域。在人工智能中,LSTM网络被广泛用于分类、数据处理和时间序列分析。具体应用包括语音识别、机器翻译、语音活动检测、机器人控制、视频游戏、医疗保健和能源预测。该架构处理具有长距离依赖的序列数据的能力使其在自然语言处理任务中尤为有效,后来被集成到序列到序列模型和编码器-解码器框架中。LSTM的影响延伸到Transformer架构,后者后来出现并基于注意力机制的概念构建,尽管由于可并行性,Transformer最终在许多大规模应用中超越了LSTM。

遗产与演变

尽管Transformer和生成式人工智能模型兴起,LSTM仍然是深度学习教育和研究中的基础概念。其原理促进了相关技术的发展,如梯度裁剪以解决梯度爆炸问题,以及层归一化批归一化以稳定训练。该论文的贡献被公认为神经网络历史上的里程碑,Hochreiter和Schmidhuber的工作被数千项后续研究引用。LSTM网络继续用于资源受限的环境和实时应用中,在这些场景中,其顺序处理和相比Transformer更低的计算需求具有优势。该架构的设计也影响了现代残差网络和其他门控模型,巩固了其作为机器学习演变中关键创新的地位。

参考文献与进一步阅读

Hochreiter, S., & Schmidhuber, J. (1997). Long Short-Term Memory. Neural Computation, 9(8), 1735-1780. 这篇开创性论文仍然是LSTM架构的主要参考文献。后续其他研究人员的工作改进了遗忘门并探索了变体,但1997年的核心思想在当代AI系统中持续存在,包括OpenAIGoogle DeepMind等公司在其语言模型和其他应用中所使用的系统。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:neural-network·deep-learning·machine-learning·recurrent-neural-network
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史