El algoritmo de Hebb generalizado (GHA, por sus siglas en inglés) es una regla de aprendizaje no supervisado para redes neuronales artificiales que realiza un análisis de componentes principales (PCA). Fue introducido por Terence D. Sanger en 1989 como una extensión de la regla de Oja, que extrae solo el primer componente principal. El GHA permite que una red neuronal lineal de una sola capa aprenda los primeros k componentes principales de la distribución de datos de entrada de manera secuencial, lo que lo convierte en un método fundamental en la reducción de dimensionalidad y la extracción de características basadas en redes neuronales.
A diferencia de los métodos de aprendizaje supervisado que requieren datos etiquetados, el GHA opera puramente con estadísticas de entrada. Sigue una regla de actualización inspirada en Hebb, donde los pesos sinápticos se fortalecen cuando las activaciones pre y postsinápticas están correlacionadas, pero con un paso crucial de normalización y decorrelación. Esta decorrelación, implementada mediante un proceso similar al de Gram-Schmidt, asegura que cada neurona de salida aprenda un componente principal distinto, ordenado por varianza decreciente.
Formulación matemática
Para un vector de entrada x ∈ ℝⁿ y un vector de salida y ∈ ℝᵏ, la red calcula y = W x, donde W es una matriz de pesos de k×n. La regla de actualización del GHA para cada peso wᵢⱼ (que conecta la entrada j con la salida i) es:
Δwᵢⱼ = η yᵢ ( xⱼ - Σ_{p=1}^{i} wₚⱼ yₚ )
Aquí, η es la tasa de aprendizaje, y la suma sobre p de 1 a i realiza una ortogonalización secuencial. Para la primera neurona de salida (i=1), la regla se reduce a la regla de Oja: Δw₁ⱼ = η y₁ (xⱼ - w₁ⱼ y₁). Para neuronas posteriores, el término resta las proyecciones de la entrada sobre los vectores de peso ya aprendidos, forzando a la nueva neurona a capturar varianza ortogonal a los componentes anteriores.
Esta actualización puede interpretarse como un ascenso de gradiente estocástico en la varianza explicada por cada salida, sujeto a restricciones de ortonormalidad. Bajo condiciones suaves en la tasa de aprendizaje (por ejemplo, que disminuya a cero), los vectores de peso convergen a los autovectores de la matriz de covarianza de entrada, ordenados por autovalor decreciente.
Relación con la regla de Oja y el PCA
La regla de Oja, propuesta por Erkki Oja en 1982, es una regla de Hebb de una sola neurona que normaliza el vector de peso a longitud unitaria, haciendo que converja al primer componente principal. El GHA generaliza esto mediante una cascada de neuronas, donde la actualización de cada neurona incluye una resta de las contribuciones de todas las neuronas anteriores. Esto es análogo al procedimiento de ortogonalización de Gram-Schmidt, pero realizado en línea y de manera estocástica.
En comparación con los algoritmos de PCA por lotes (por ejemplo, la descomposición en autovalores), el GHA es completamente incremental y puede procesar flujos de datos una muestra a la vez. No requiere almacenar la matriz de covarianza completa, lo que lo hace eficiente en memoria para datos de alta dimensionalidad. Sin embargo, converge más lentamente que los métodos por lotes y es sensible al programa de tasa de aprendizaje.
Aplicaciones y significado
El GHA se ha aplicado en diversos dominios, incluidos la compresión de imágenes, el procesamiento de señales y el reconocimiento de patrones. En la década de 1990, se utilizó para la extracción de características en el reconocimiento de dígitos manuscritos y para reducir la dimensionalidad en datos de radar y sonar. Su naturaleza en línea lo hizo atractivo para sistemas en tiempo real, como filtros adaptativos y robótica.
En el contexto de la investigación en Machine learning y Neural network, el GHA contribuyó a la comprensión teórica del aprendizaje hebbiano y la autoorganización. Demostró que reglas de aprendizaje locales simples podían lograr propiedades estadísticas globales, un tema que influyó en trabajos posteriores sobre Deep learning y aprendizaje de representaciones no supervisado. Aunque las redes profundas modernas suelen usar retropropagación y Adam (Optimizer), el GHA sigue siendo un ejemplo clásico de aprendizaje biológicamente plausible.
Limitaciones y contexto moderno
El GHA asume una red lineal y estadísticas de entrada similares a las gaussianas, lo que limita su capacidad para capturar estructuras no lineales. Extensiones como el PCA no lineal y métodos basados en núcleos abordan esto, pero pierden la forma hebbiana simple. Además, el GHA requiere un ajuste cuidadoso de la tasa de aprendizaje; una tasa demasiado alta conduce a divergencia, y demasiado baja ralentiza la convergencia. La naturaleza secuencial también implica que los errores en componentes tempranos se propagan a los posteriores.
Con el auge de Deep learning y las arquitecturas Transformer (architecture), el GHA rara vez se utiliza en sistemas de última generación. Sin embargo, sigue siendo una piedra angular pedagógica en cursos sobre computación neuronal y Artificial intelligence. Sus principios de decorrelación y maximización de varianza sustentan técnicas más avanzadas como Batch Normalization y Layer Normalization, que también buscan estabilizar y decorrelacionar las activaciones.
Véase también
- Regla de Oja (no en la lista, pero conceptualmente vinculado)
- análisis de componentes principales (no en la lista)
- aprendizaje no supervisado (no en la lista)
- red neuronal
- aprendizaje automático
Referencias
- Sanger, T. D. (1989). "Optimal unsupervised learning in a single-layer linear feedforward neural network." Neural Networks, 2(6), 459-473.
- Oja, E. (1982). "Simplified neuron model as a principal component analyzer." Journal of Mathematical Biology, 15(3), 267-273.