La regla delta es un algoritmo de aprendizaje fundamental en aprendizaje automático que se utiliza para ajustar los pesos de una red neuronal de una sola capa basándose en el error entre la salida de la red y el objetivo deseado. Es una forma de descenso de gradiente que minimiza el error cuadrático medio entre la salida predicha y el objetivo real. La regla actualiza cada peso proporcionalmente al negativo del gradiente del error, escalado por una tasa de aprendizaje. Es históricamente significativa como una de las primeras reglas de aprendizaje supervisado y sustenta desarrollos posteriores en aprendizaje profundo e inteligencia artificial.
La regla delta fue introducida en 1960 por Bernard Widrow y Marcian Hoff, quienes la desarrollaron para el modelo ADALINE (Adaptive Linear Neuron). Su trabajo en la Universidad de Stanford estableció un método fundamentado para entrenar clasificadores lineales, distinto de la regla del perceptrón anterior, que solo corregía pesos en ejemplos mal clasificados. La regla delta, en contraste, aplica una corrección de error continua, lo que la hace más robusta y capaz de manejar datos no separables.
Formulación Matemática
Para una red de una sola capa con vector de entrada \(x\), vector de pesos \(w\) y salida objetivo \(t\), la regla delta actualiza cada peso \(w_i\) como:
\[ \Delta w_i = \eta (t - y) x_i \]
donde \(y\) es la salida real (a menudo una combinación lineal \(w \cdot x\)), y \(\eta\) es la tasa de aprendizaje. El término \((t - y)\) es el error, y el producto con \(x_i\) proporciona el gradiente del error cuadrático con respecto a \(w_i\). Esta actualización puede derivarse de la pérdida de error cuadrático medio tomando su derivada con respecto a cada peso.
La regla asume una función de activación lineal, o al menos diferenciable, lo que permite la optimización basada en gradientes. Para activaciones no lineales, la regla delta generalizada, también conocida como retropropagación, extiende esta idea a redes multicapa propagando errores hacia atrás a través de capas ocultas.
Relación con la Regla del Perceptrón
La regla de aprendizaje del perceptrón, introducida por Frank Rosenblatt en 1958, actualiza los pesos solo cuando la red comete un error de clasificación, utilizando un umbral binario. La regla delta mejora esto al actualizar los pesos en cada ejemplo, proporcionalmente a la magnitud del error. Esto la hace más adecuada para tareas de regresión y para datos que no son linealmente separables, donde la regla del perceptrón puede fallar en converger. La regla delta converge a una solución que minimiza el error cuadrático medio, incluso si la clasificación perfecta es imposible.
Impacto Histórico y Limitaciones
El trabajo de Widrow y Hoff sobre ADALINE y la regla delta fue un hito en la investigación temprana de redes neuronales. Demostró que la optimización basada en gradientes podía entrenar sistemas adaptativos, influyendo en desarrollos posteriores como el optimizador Adam y otras variantes de descenso de gradiente estocástico utilizadas en el aprendizaje profundo moderno. Sin embargo, la regla delta se limita a redes de una sola capa con salidas lineales, lo que la restringe a problemas linealmente separables. Esta limitación contribuyó al llamado "invierno de la IA" en la década de 1970, ya que los investigadores reconocieron que los modelos de una sola capa no podían resolver problemas como la función XOR. El resurgimiento llegó en la década de 1980 con la retropropagación, que generalizó la regla delta a capas ocultas.
Relevancia Moderna
Aunque la regla delta en sí rara vez se usa directamente hoy en día, sus principios están integrados en casi todo el entrenamiento de redes neuronales. El concepto de calcular gradientes de error y actualizar pesos mediante métodos basados en gradientes sigue siendo central. La regla delta también introdujo la idea de la tasa de aprendizaje, un hiperparámetro que sigue siendo crítico en la programación de la tasa de aprendizaje. En los marcos modernos, la regla delta se presenta a menudo como un paso pedagógico hacia algoritmos más complejos, y sigue siendo un tema estándar en los cursos introductorios de aprendizaje automático. Su influencia se extiende a grandes modelos de lenguaje y transformadores, donde las técnicas de optimización trazan su linaje hasta esta regla temprana.