英語からの翻訳

1997年のHochreiterとSchmidhuberによるLSTM論文は、長短期記憶を導入しました。これは、勾配消失問題を軽減するリカレントニューラルネットワークのアーキテクチャであり、長いシーケンスにわたる学習を可能にします。これは、現代の深層学習アプリケーションの基盤となりました。

1997年发表的论文《长短期记忆》(Long Short-Term Memory)由Sepp Hochreiter和Jürgen Schmidhuber提出,介绍了LSTM架构,这是一种循环神经网络,旨在解决困扰传统RNN的梯度消失问题。该论文发表于期刊《神经计算》(Neural Computation),提出了一种让网络能够在数千个时间步上保留信息的机制,这一能力使其得名“长短期记忆”,类比于认知心理学中长时记忆与短时记忆的区分。该论文为后来成为机器学习深度学习系统基石之一的模型奠定了基础,其影响遍及从语音识别到大语言模型的诸多领域。

LSTM单元与标准RNN神经元的不同之处在于,它引入了一个记忆单元和三个门控机制:输入门、输出门和遗忘门。记忆单元能够在任意时间间隔内存储信息,而门控机制则调节信息的流动。遗忘门是在后续改进中引入的,但它是该架构有效性的核心,它通过将先前状态和当前输入映射到0到1之间的值来决定丢弃哪些先前状态信息,其中1表示保留,0表示丢弃。输入门决定哪些新信息被存储,输出门则控制从记忆单元输出什么信息。这种门控结构使得梯度在反向传播过程中能够以最小的衰减流动,从而缓解了梯度消失问题,并使得网络能够学习长距离依赖关系。

动机与问题背景

经典RNN在理论上能够追踪任意长距离的依赖关系,但在实践中却因计算问题而失败。在通过反向传播进行训练时,梯度在多个时间步上传播往往会逐渐消失,趋向于零,从而导致学习过程停滞。这一问题在序列中存在数百或数千个元素间隔的情况下尤为严重,例如自然语言或时间序列数据。LSTM论文提出了一种解决方案,通过创建一个额外的模块来学习何时记忆、何时遗忘信息,从而有效地提供了一种能够持续较长时间的短期记忆。例如,在处理类似“Dave,由于他有争议的主张,现在成了被排斥的人”这样的句子时,LSTM能够保留主语“Dave”的语法性别和数,直到需要用于代词“his”,然后在动词之后丢弃该信息。这一能力使LSTM相对于其他序列学习方法(包括隐马尔可夫模型)具有优势,尤其是在相关信息间隔可变且可能很长的情况下。

架构与数学表述

该论文详细描述了LSTM单元的前向传播方程,使用向量记号表示,其中小写变量代表向量。矩阵\(W_q\)和\(U_q\)分别包含输入连接和循环连接的权重,下标\(q\)表示具体的门或单元:输入门\(i\)、输出门\(o\)、遗忘门\(f\)或记忆单元\(c\)。记忆单元状态\(c_t \in \mathbb{R}^h\)表示\(h\)个LSTM单元,而非单个神经元。带有遗忘门的LSTM单元的紧凑方程如下:

\[ f_t = \sigma_g(W_f x_t + U_f h_{t-1} + b_f) \]

\[ i_t = \sigma_g(W_i x_t + U_i h_{t-1} + b_i) \]

\[ o_t = \sigma_g(W_o x_t + U_o h_{t-1} + b_o) \]

其中\(\sigma_g\)是sigmoid激活函数,\(x_t\)是时间步\(t\)的输入,\(h_{t-1}\)是前一个隐藏状态,\(b\)项是偏置。这些门产生0到1之间的值,控制信息的流动。记忆单元状态的更新结合了遗忘门的选择性保留和输入门的新信息,而输出门则过滤记忆单元状态以生成隐藏状态。这种表述使网络能够为当前和未来的预测维持有用的长距离依赖信息。

应用与影响

1997年的这篇论文确立了LSTM作为一种多功能工具的地位,后续研究将其应用扩展到众多领域。在人工智能中,LSTM网络被广泛用于分类、数据处理和时间序列分析。具体应用包括语音识别、机器翻译、语音活动检测、机器人控制、视频游戏、能源和医疗保健等。LSTM处理具有长距离依赖的序列数据的能力使其在自然语言处理任务中尤为有效,后来被集成到序列到序列模型和编码器-解码器框架中。LSTM的影响还延伸到了Transformer架构,后者在后来出现并基于注意力机制构建,尽管Transformer在许多大规模应用中最终超越了LSTM,这主要归功于其并行计算能力。

遗产与演进

尽管Transformer和生成式AI模型兴起,LSTM仍然是深度学习教育和研究中的基础概念。其原理启发了相关技术的发展,例如梯度裁剪用于解决梯度爆炸问题,以及层归一化批归一化用于稳定训练。该论文的贡献被公认为神经网络历史上的一个里程碑,Hochreiter和Schmidhuber的工作被数千项后续研究引用。LSTM网络在资源受限的环境和实时应用中仍被广泛使用,因为与Transformer相比,其顺序处理方式和较低的计算需求在这些场景下具有优势。该架构的设计还影响了现代残差网络和其他门控模型的开发,巩固了其在机器学习发展中的关键创新地位。

参考文献与进一步阅读

Hochreiter, S., & Schmidhuber, J. (1997). Long Short-Term Memory. Neural Computation, 9(8), 1735-1780. 这篇开创性论文至今仍是LSTM架构的主要参考文献。后续研究对遗忘门进行了改进并探索了多种变体,但1997年的核心思想在当代AI系统中依然持续发挥着影响,包括OpenAIGoogle DeepMind等公司在其语言模型和其他应用中所使用的系统。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:neural-network·deep-learning·machine-learning·recurrent-neural-network
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴