长短期记忆网络,简称LSTM,是一种循环神经网络架构,旨在通过使用门控单元来学习序列数据中的长距离依赖关系,这些门控单元调节信息如何被添加、保留或从持久内部记忆单元中移除。它被专门引入以解决梯度消失问题,该问题使得普通RNN无法学习相隔多个时间步的事件之间的关系。
历史
LSTM由塞普·霍赫赖特和于尔根·施密德胡贝尔在1997年的一篇论文中提出,基于霍赫赖特1991年毕业论文中对标准循环神经网络在使用反向传播通过时间训练时梯度为何消失或爆炸的分析。原始架构在随后的十年中得到改进,最显著的是2000年由费利克斯·格斯及其同事添加的遗忘门,它使网络能够主动重置其记忆单元,而不仅仅是无限期地累积信息。LSTM在发表后多年内采用有限,但在2010年代随着更大数据集和GPU训练使其相对于普通RNN的优势变得清晰可测,成为深度学习中使用最广泛的架构之一。
架构
一个LSTM单元维护一个细胞状态,它像传送带一样在时间步之间基本不变地携带信息,同时还有三个门,即输入门、遗忘门和输出门,每个门是一个小型神经层,输出介于零和一之间的值以控制多少信息通过。遗忘门决定从细胞状态中丢弃什么,输入门决定添加什么新信息,输出门决定在该步将细胞状态的哪部分作为单元输出暴露。由于细胞状态通过加法而非重复乘法更新,梯度可以几乎不衰减地通过许多时间步反向流动,这是LSTM能够学习跨越数百步依赖关系的核心机制,而普通RNN通常仅能处理少数几步。
应用
堆叠和双向LSTM在2010年代成为机器翻译、语音识别和文本生成的标准架构,而基于注意力的LSTM序列到序列模型是Transformer架构的直接前身。谷歌的神经机器翻译系统于2016年部署,使用深层LSTM堆栈,代表了该架构最大规模的生产部署之一。LSTM也广泛用于语言之外领域,包括时间序列预测、手写识别,以及需要跨长动作序列记忆信息的早期强化学习智能体。
衰落与遗产
2017年Transformer架构的引入,通过自注意力并行处理整个序列,而非通过门控循环顺序处理,在GPU硬件上提供了更好的训练效率,并在大规模下提供更好的性能,LSTM在几年内基本被取代,不再是新自然语言处理和大语言模型系统的默认选择。霍赫赖特团队在2024年以xLSTM重新审视该架构,尝试用从Transformer中学到的技术现代化LSTM,主张循环架构在超长序列上仍具竞争力,尽管截至2025年它尚未在主流使用中取代Transformer或更新的状态空间模型。