La règle delta est un algorithme d'apprentissage fondamental en apprentissage automatique, utilisé pour ajuster les poids d'un réseau de neurones monocouche en fonction de l'erreur entre la sortie du réseau et la cible souhaitée. Il s'agit d'une forme de descente de gradient qui minimise l'erreur quadratique moyenne entre la sortie prédite et la cible réelle. La règle met à jour chaque poids proportionnellement au négatif du gradient de l'erreur, mis à l'échelle par un taux d'apprentissage. Elle est historiquement significative en tant que l'une des premières règles d'apprentissage supervisé et sous-tend les développements ultérieurs en apprentissage profond et en intelligence artificielle.
La règle delta a été introduite en 1960 par Bernard Widrow et Marcian Hoff, qui l'ont développée pour le modèle ADALINE (Adaptive Linear Neuron). Leurs travaux à Stanford University ont établi une méthode fondée sur des principes pour entraîner des classificateurs linéaires, distincte de la règle du perceptron antérieure, qui ne corrigeait les poids que sur les exemples mal classés. La règle delta, en revanche, applique une correction d'erreur continue, ce qui la rend plus robuste et capable de traiter des données non séparables.
Formulation mathématique
Pour un réseau monocouche avec un vecteur d'entrée \(x\), un vecteur de poids \(w\) et une sortie cible \(t\), la règle delta met à jour chaque poids \(w_i\) comme suit :
\[ \Delta w_i = \eta (t - y) x_i \]
où \(y\) est la sortie réelle (souvent une combinaison linéaire \(w \cdot x\)), et \(\eta\) est le taux d'apprentissage. Le terme \((t - y)\) est l'erreur, et le produit avec \(x_i\) donne le gradient de l'erreur quadratique par rapport à \(w_i\). Cette mise à jour peut être dérivée de la perte d'erreur quadratique moyenne en prenant sa dérivée par rapport à chaque poids.
La règle suppose une fonction d'activation linéaire, ou au moins différentiable, permettant une optimisation par gradient. Pour les activations non linéaires, la règle delta généralisée, également connue sous le nom de rétropropagation, étend cette idée aux réseaux multicouches en propageant les erreurs en arrière à travers les couches cachées.
Relation avec la règle du perceptron
La règle d'apprentissage du perceptron, introduite par Frank Rosenblatt en 1958, ne met à jour les poids que lorsque le réseau commet une erreur de classification, en utilisant un seuil binaire. La règle delta améliore cela en mettant à jour les poids sur chaque exemple, proportionnellement à l'ampleur de l'erreur. Cela la rend plus adaptée aux tâches de régression et aux données qui ne sont pas linéairement séparables, où la règle du perceptron peut échouer à converger. La règle delta converge vers une solution qui minimise l'erreur quadratique moyenne, même si une classification parfaite est impossible.
Impact historique et limites
Les travaux de Widrow et Hoff sur ADALINE et la règle delta ont été une étape marquante dans la recherche précoce sur les réseaux de neurones. Ils ont démontré que l'optimisation par gradient pouvait entraîner des systèmes adaptatifs, influençant des développements ultérieurs tels que l'optimiseur Adam et d'autres variantes de descente de gradient stochastique utilisés dans le apprentissage profond moderne. Cependant, la règle delta est limitée aux réseaux monocouches avec des sorties linéaires, ce qui la restreint aux problèmes linéairement séparables. Cette limitation a contribué au soi-disant « hiver de l'IA » dans les années 1970, car les chercheurs ont reconnu que les modèles monocouches ne pouvaient pas résoudre des problèmes comme la fonction XOR. Le renouveau est venu dans les années 1980 avec la rétropropagation, qui a généralisé la règle delta aux couches cachées.
Pertinence moderne
Bien que la règle delta elle-même soit rarement utilisée directement aujourd'hui, ses principes sont intégrés dans presque tout l'entraînement des réseaux de neurones. Le concept de calcul des gradients d'erreur et de mise à jour des poids via des méthodes basées sur le gradient reste central. La règle delta a également introduit l'idée du taux d'apprentissage, un hyperparamètre toujours critique dans la planification du taux d'apprentissage. Dans les cadres modernes, la règle delta est souvent présentée comme une étape pédagogique vers des algorithmes plus complexes, et elle reste un sujet standard dans les cours d'introduction au apprentissage automatique. Son influence s'étend aux grands modèles de langage et aux transformeurs, où les techniques d'optimisation retracent leur lignée jusqu'à cette règle précoce.