Long Short-Term Memory(LSTM)は、リカレントニューラルネットワークアーキテクチャの一種であり、ゲート付きユニットを用いて情報を永続的な内部メモリセルに追加、保持、または除去する方法を調整することで、系列データにおける長距離依存関係を学習するように設計されています。これは、単純なRNNが多くのタイムステップで隔てられたイベント間の関係を学習できない原因となっていた勾配消失問題を解決するために、特に導入されました。
歴史
LSTMは、1997年のゼップ・ホフライターとユルゲン・シュミットフーバーによる論文で導入され、ホフライターの1991年の卒業論文における、標準的なリカレントニューラルネットワークをバックプロパゲーションで時系列に沿って学習させた際に勾配が消失または爆発する理由の分析に基づいています。元のアーキテクチャはその後10年間で改良され、特に2000年にフェリックス・ガースらによる忘却ゲートの追加により、ネットワークが情報を無期限に蓄積するだけでなく、メモリセルを能動的にリセットすることを学習できるようになりました。LSTMは発表後数年間は採用が限られていましたが、2010年代を通じて、より大規模なデータセットとGPUトレーニングにより、単純なRNNに対する利点が明確に測定可能になったことで、ディープラーニングで最も広く使用されるアーキテクチャの1つとなりました。
アーキテクチャ
LSTMユニットは、セル状態を維持します。これは、情報をほぼ変更せずにタイムステップ間で運ぶベルトコンベアのような役割を果たし、その周囲には入力ゲート、忘却ゲート、出力ゲートの3つのゲートがあり、それぞれが0から1の間の値を出力する小さなニューラル層で、通過する情報量を制御します。忘却ゲートはセル状態から破棄するものを決定し、入力ゲートは追加する新しい情報を決定し、出力ゲートはそのステップでのユニットの出力としてセル状態のどの部分を公開するかを決定します。セル状態は繰り返しの乗算ではなく加算によって更新されるため、勾配は多くのタイムステップをほぼ減衰せずに逆伝播でき、これがLSTMが単純なRNNが数ステップを超えて失敗することが多かった数百ステップに及ぶ依存関係を学習できるようにする中核的なメカニズムです。
応用
スタック化および双方向LSTMは、2010年代を通じて機械翻訳、音声認識、およびテキスト生成の標準的なアーキテクチャとなり、アテンションを備えたLSTMベースのシーケンス・ツー・シーケンスモデルは、トランスフォーマーアーキテクチャの直接の前身でした。2016年に展開されたGoogleのニューラル機械翻訳システムは、深層LSTMスタックを使用しており、このアーキテクチャの最大規模の本番展開の1つを代表しています。LSTMは言語以外でも広く使用され、時系列予測、手書き文字認識、および長いアクションシーケンスにわたって情報を記憶する必要がある初期の強化学習エージェントなどが含まれます。
衰退と遺産
2017年に導入されたトランスフォーマーアーキテクチャは、ゲート付きリカレンスを介して逐次的に処理するのではなく、自己アテンションを使用してシーケンス全体を並列処理し、GPUハードウェアでのトレーニング効率の向上と、大規模での性能向上の両方を提供し、LSTMは数年以内に新しい自然言語処理および大規模言語モデルシステムのデフォルトの選択肢として大部分が置き換えられました。ホフライターのグループは2024年にxLSTMでこのアーキテクチャを再検討し、トランスフォーマーから学んだ技術でLSTMを近代化する試みを行い、リカレントアーキテクチャが非常に長いシーケンスに対して依然として競争力を持つ可能性があると主張しましたが、2025年時点で主流の使用においてトランスフォーマーや新しい状態空間モデルを置き換えるには至っていません。