ニューラルチューリングマシン(NTM)は、チューリングマシンのリカレントニューラルネットワークモデルである。このアプローチは、2014年にAlex Gravesらによって発表され、ニューラルネットワークのファジーパターンマッチング能力と、プログラム可能なコンピュータのアルゴリズム的力を組み合わせたものである。NTMは、計算中に読み書きできる外部メモリを使用することで、例から単純なアルゴリズムを学習するように設計されている。
NTMは、ニューラルネットワークコントローラと外部メモリリソースを組み合わせたものであり、注意機構を通じてそれらと相互作用する。メモリの相互作用はエンドツーエンドで微分可能であり、勾配降下法を用いて最適化することが可能である。この微分可能性により、システム全体をバックプロパゲーションなどの標準的な機械学習技術で訓練でき、離散的または非微分可能な操作を必要としない。
アーキテクチャと動作
NTMのコントローラは、典型的には長短期記憶(LSTM)ネットワークなどのリカレントニューラルネットワークであり、入力を受け取り出力を生成すると同時に、外部メモリへの読み書きコマンドを発行する。メモリは実数値エントリの行列であり、コントローラは注意重みを使用してアクセスするメモリ位置を決定する。これらの重みは、コントローラの現在の状態をメモリ内容と比較するコンテンツベースアドレッシングと、反復などの操作をサポートするために注意のシフトを可能にするロケーションベースアドレッシングを用いて計算される。
読み取りおよび書き込み操作は微分可能に設計されている。読み取り操作はメモリ行の加重和を生成し、書き込み操作は消去ベクトルと加算ベクトルを組み合わせ、注意重みでスケーリングしてメモリエントリを更新する。この設計により、ネットワークは勾配ベースの最適化に適した方法で情報を保存および取得することを学習できる。
学習能力
LSTMネットワークコントローラを備えたNTMは、コピー、ソート、連想想起などの単純なアルゴリズムを例のみから推論できる。実験では、NTMは従来のリカレントネットワークよりも少ない訓練例でこれらのタスクを学習できる能力を示し、訓練中に見られたものよりも長い入力シーケンスに一般化できる。この能力は、コントローラが操作することを学習できる安定した記憶媒体を提供する明示的な外部メモリに起因する。
Gravesらによる元の論文は、NTMが任意の長さのシーケンスをコピーし、数値のリストをソートし、部分的な手がかりに基づいて保存された項目を取得する連想想起を実行できることを示した。これらのタスクは、パターン認識とアルゴリズム的推論を組み合わせるモデルの能力を強調している。
実装と課題
元のNTM論文の著者らは、ソースコードを公開しなかった。最初の安定したオープンソース実装は、2018年に第27回国際人工ニューラルネットワーク会議で公開され、最優秀論文賞を受賞した。他のオープンソース実装も存在するが、2018年時点では本番使用に十分な安定性がない。これらの実装の開発者は、訓練中に勾配が未知の理由でNaNになることがあり訓練が失敗する、収束が遅い、学習速度の報告がないなど、さまざまな問題を報告している。
これらの課題は、外部メモリを備えたリカレントネットワークの訓練の複雑さに起因し、注意機構とメモリ更新が不安定な勾配を引き起こす可能性がある。2018年の受賞実装は、アーキテクチャの改良と訓練戦略を導入することでこれらの問題の一部に対処したが、より広範な採用は依然として限られている。
影響と拡張
微分可能ニューラルコンピュータは、ニューラルチューリングマシンの発展形であり、メモリがアクティブな場所を制御する注意機構を備え、性能を向上させる。2016年にGoogle DeepMindの研究者らによって導入され、微分可能ニューラルコンピュータは、時間的リンクやメモリ割り当てなどのより洗練されたメモリアクセスパターンでNTMを拡張し、グラフ走査や質問応答などのタスクを解決できるようにする。
NTMの概念は、深層学習および人工知能のより広範な研究にも影響を与えており、特にモデルが長い時間軸にわたって構造化情報を保存および操作する必要がある分野で顕著である。トランスフォーマーなどの大規模モデルが多くのアプリケーションでNTMをほぼ取って代わったが、微分可能外部メモリのアイデアは、学習と記号的計算を組み合わせるニューラルアーキテクチャの研究における基礎的な概念であり続けている。
制限
理論的な魅力にもかかわらず、NTMには実用的な制限がある。訓練は計算コストが高く不安定になる可能性があり、実装課題で述べたとおりである。モデルはまた、注意機構がメモリ次元に応じてスケーリングするため、非常に大きなメモリサイズに苦労する。さらに、NTMは本番システムで広く採用されておらず、大規模言語モデルで使用されるトランスフォーマーなど、訓練とスケーリングが容易なアーキテクチャがほとんどの実用的アプリケーションで好まれている。
メモリ拡張ニューラルネットワークの改善に関する研究は続いており、最近の研究ではNTMの強みと現代のアーキテクチャを組み合わせたハイブリッドアプローチを探求している。しかし、2010年代後半時点では、NTMは主に研究ツールであり、展開された技術ではない。
参考文献
Graves, A., Wayne, G., & Danihelka, I. (2014). Neural Turing Machines. arXiv preprint arXiv:1410.5401.
Collier, M., & Beel, J. (2018). Implementing Neural Turing Machines. In Proceedings of the 27th International Conference on Artificial Neural Networks.