Las redes neuronales entrenadas instantáneamente son una clase de redes neuronales artificiales de alimentación directa que crean un nuevo nodo de neurona oculta para cada muestra de entrenamiento novedosa que se encuentre. Los pesos asignados a esta neurona oculta recién creada están diseñados para separar no solo la muestra de entrenamiento específica, sino también otras muestras que se encuentran cerca de ella, proporcionando así una forma de generalización. Esta separación se logra utilizando el hiperplano más cercano que se puede escribir instantáneamente, sin optimización iterativa. En las dos implementaciones más destacadas, la vecindad de generalización varía con la muestra de entrenamiento (la red CC1) o permanece constante (la red CC4). Estas redes típicamente emplean codificación unaria para una representación efectiva de los conjuntos de datos de entrada.
El concepto fue propuesto por primera vez en un artículo de 1993 de Subhash Kak. Desde esa introducción, las redes neuronales entrenadas instantáneamente han sido sugeridas como modelos de aprendizaje a corto plazo en sistemas biológicos y se han aplicado a tareas prácticas como la búsqueda web, la predicción de series temporales financieras, la clasificación instantánea de documentos y como componentes en aprendizaje profundo y en tuberías de minería de datos. Como con la mayoría de las redes neuronales, su uso normal es como software, pero también se han implementado en hardware utilizando matrices de puertas programables en campo (FPGAs) y mediante implementaciones ópticas.
Arquitectura de la red CC4
La red CC4 es una arquitectura de alimentación directa de tres etapas. Su capa de entrada contiene un número de nodos igual al tamaño del vector de entrenamiento más un nodo adicional, que sirve como nodo de sesgo cuya entrada siempre se establece en 1. Para vectores de entrada binarios, los pesos desde los nodos de entrada a una neurona oculta (indexada por j) correspondientes a un vector entrenado se definen mediante una fórmula específica. Para cada componente de entrada xi, el peso wij se establece en -1 si xi es igual a 0, y +1 si xi es igual a 1. Para el nodo de sesgo (i = n+1), el peso se establece en r - s + 1, donde r es el radio de generalización y s es el peso de Hamming (el número de unos) de la secuencia binaria.
Las neuronas de la capa oculta y las neuronas de la capa de salida utilizan ambas una función de activación de umbral: emiten 1 si la suma ponderada de sus entradas es 0 o positiva, y 0 si la suma ponderada es negativa. Desde la capa oculta hasta la capa de salida, los pesos son 1 o -1, dependiendo de si el vector correspondiente pertenece a una clase de salida dada. Esta arquitectura permite a la red clasificar nuevas entradas basándose en su proximidad a muestras de entrenamiento previamente almacenadas, con el radio r controlando el tamaño de la vecindad de generalización.
Red CC1 y variaciones
La red CC1 difiere de la red CC4 en que el radio de generalización no es constante, sino que varía con cada muestra de entrenamiento. Esto permite a la red adaptar su comportamiento de generalización localmente, potencialmente proporcionando un mejor rendimiento en regiones del espacio de entrada con densidad de datos variable. La red CC4 también ha sido modificada para aceptar vectores de entrada no binarios, con radios de generalización variables, proporcionando efectivamente una implementación CC1 dentro del marco CC4. Estas modificaciones extienden la aplicabilidad de las redes neuronales entrenadas instantáneamente más allá de los datos puramente binarios.
Modelos de aprendizaje instantáneo relacionados
Más allá de las arquitecturas de alimentación directa, otros modelos de redes neuronales también exhiben capacidades de aprendizaje instantáneo. La red de Willshaw, un tipo de memoria asociativa, puede almacenar y recuperar patrones en una sola presentación. De manera similar, la red de Hopfield, una red neuronal recurrente utilizada para memoria asociativa y optimización, puede aprender patrones instantáneamente a través de una regla de aprendizaje hebbiana de una sola pasada. Estas redes de retroalimentación comparten la propiedad de aprendizaje rápido de una sola pasada con las redes neuronales entrenadas instantáneamente de alimentación directa, aunque sus principios operativos y aplicaciones difieren.
Aplicaciones e implementaciones
Las redes neuronales entrenadas instantáneamente se han aplicado en varios dominios debido a su rápida velocidad de entrenamiento y simplicidad. En la búsqueda web, se han utilizado para la clasificación instantánea de documentos, permitiendo una categorización rápida de páginas web o resultados de búsqueda. En la predicción de series temporales financieras, su capacidad para aprender de nuevos puntos de datos sin reentrenar toda la red las hace adecuadas para la previsión adaptativa. También se han explorado como modelos de aprendizaje a corto plazo en ciencia cognitiva, donde la adquisición rápida de nueva información es una característica clave. Se han demostrado implementaciones de hardware utilizando FPGAs, y se han propuesto implementaciones ópticas, aprovechando la naturaleza paralela de los cálculos de la red.