Una máquina de Turing neuronal (NTM) es un modelo de red neuronal recurrente que emula una máquina de Turing. Fue introducida por Alex Graves y sus colegas en 2014. Las NTM combinan las capacidades de coincidencia de patrones difusos de las redes neuronales con el poder algorítmico de las computadoras programables, lo que les permite aprender algoritmos simples a partir de ejemplos.
La arquitectura consiste en un controlador de red neuronal acoplado a recursos de memoria externa. El controlador interactúa con la memoria mediante mecanismos atencionales, y todo el sistema es diferenciable de extremo a extremo, lo que permite la optimización mediante el descenso de gradiente. Con un controlador de memoria a corto y largo plazo (LSTM), una NTM puede inferir algoritmos como copiar, ordenar y recuperación asociativa solo a partir de ejemplos.
Arquitectura y Operación
El controlador de la NTM es típicamente una red neuronal recurrente, como una LSTM o una red de avance. Recibe entrada y produce salida, mientras también genera operaciones de lectura y escritura en una matriz de memoria externa. La memoria se aborda mediante atención basada en contenido y en ubicación, lo que permite a la red enfocarse en ubicaciones específicas de memoria. La naturaleza diferenciable de estas operaciones permite el entrenamiento mediante retropropagación.
Contexto Histórico e Impacto
El artículo de 2014 de Graves et al. se publicó en un momento en que el aprendizaje profundo avanzaba rápidamente. Las NTM estuvieron entre los primeros modelos en integrar explícitamente memoria externa en redes neuronales, influyendo en arquitecturas posteriores como el transformador y los modelos de lenguaje grandes. El concepto se inspiró en la máquina de Turing y buscaba cerrar la brecha entre las redes neuronales y la computación simbólica.
Implementaciones y Desafíos
Los autores originales no publicaron su código fuente. La primera implementación estable de código abierto apareció en 2018 en la 27ª Conferencia Internacional sobre Redes Neuronales Artificiales, recibiendo un premio al mejor artículo. Existen otras implementaciones de código abierto, pero a partir de 2018 no eran suficientemente estables para uso en producción. Los desarrolladores informaron problemas como gradientes que se convierten en NaN durante el entrenamiento por razones desconocidas, convergencia lenta o falta de velocidad de aprendizaje reportada.
Extensiones y Legado
Las computadoras neuronales diferenciables son una extensión de las NTM, incorporando mecanismos atencionales más sofisticados para controlar la actividad de la memoria y mejorar el rendimiento. El concepto de NTM también ha influido en la investigación en redes neuronales y aprendizaje automático de manera más amplia, particularmente en áreas que requieren modelos aumentados con memoria.