Traduzido do inglês

A regra delta é uma regra de aprendizado baseada em gradiente descendente usada para atualizar pesos em redes neurais de camada única, minimizando o erro entre as saídas previstas e alvo. Foi introduzida em 1960 por Bernard Widrow e Marcian Hoff.

A regra delta é um algoritmo de aprendizado fundamental em aprendizado de máquina usado para ajustar os pesos de uma rede neural de camada única com base no erro entre a saída da rede e o alvo desejado. É uma forma de gradiente descendente que minimiza o erro quadrático médio entre a saída prevista e o alvo real. A regra atualiza cada peso proporcionalmente ao negativo do gradiente do erro, escalado por uma taxa de aprendizado. É historicamente significativa como uma das primeiras regras de aprendizado supervisionado e sustenta desenvolvimentos posteriores em aprendizado profundo e inteligência artificial.

A regra delta foi introduzida em 1960 por Bernard Widrow e Marcian Hoff, que a desenvolveram para o modelo ADALINE (Adaptive Linear Neuron). Seu trabalho na Universidade de Stanford estabeleceu um método fundamentado para treinar classificadores lineares, distinto da regra do perceptron anterior, que apenas corrigia pesos em exemplos classificados incorretamente. A regra delta, por outro lado, aplica uma correção de erro contínua, tornando-a mais robusta e capaz de lidar com dados não separáveis.

Formulação Matemática

Para uma rede de camada única com vetor de entrada \(x\), vetor de pesos \(w\) e saída alvo \(t\), a regra delta atualiza cada peso \(w_i\) como:

\[ \Delta w_i = \eta (t - y) x_i \]

onde \(y\) é a saída real (frequentemente uma combinação linear \(w \cdot x\)), e \(\eta\) é a taxa de aprendizado. O termo \((t - y)\) é o erro, e o produto com \(x_i\) fornece o gradiente do erro quadrático em relação a \(w_i\). Esta atualização pode ser derivada da função de perda de erro quadrático médio ao calcular sua derivada em relação a cada peso.

A regra assume uma função de ativação linear, ou pelo menos diferenciável, permitindo otimização baseada em gradiente. Para ativações não lineares, a regra delta generalizada, também conhecida como retropropagação, estende essa ideia a redes multicamadas propagando erros para trás através das camadas ocultas.

Relação com a Regra do Perceptron

A regra de aprendizado do perceptron, introduzida por Frank Rosenblatt em 1958, atualiza pesos apenas quando a rede comete um erro de classificação, usando um limiar binário. A regra delta melhora isso ao atualizar pesos em cada exemplo, proporcionalmente à magnitude do erro. Isso a torna mais adequada para tarefas de regressão e para dados que não são linearmente separáveis, onde a regra do perceptron pode falhar em convergir. A regra delta converge para uma solução que minimiza o erro quadrático médio, mesmo que a classificação perfeita seja impossível.

Impacto Histórico e Limitações

O trabalho de Widrow e Hoff sobre ADALINE e a regra delta foi um marco na pesquisa inicial de redes neurais. Demonstrou que a otimização baseada em gradiente poderia treinar sistemas adaptativos, influenciando desenvolvimentos posteriores como o otimizador Adam e outras variantes de gradiente descendente estocástico usadas no aprendizado profundo moderno. No entanto, a regra delta é limitada a redes de camada única com saídas lineares, o que a restringe a problemas linearmente separáveis. Essa limitação contribuiu para o chamado "inverno da IA" na década de 1970, quando pesquisadores reconheceram que modelos de camada única não podiam resolver problemas como a função XOR. O renascimento veio na década de 1980 com a retropropagação, que generalizou a regra delta para camadas ocultas.

Relevância Moderna

Embora a regra delta em si raramente seja usada diretamente hoje, seus princípios estão incorporados em quase todo treinamento de redes neurais. O conceito de calcular gradientes de erro e atualizar pesos via métodos baseados em gradiente permanece central. A regra delta também introduziu a ideia da taxa de aprendizado, um hiperparâmetro ainda crítico em agendamento de taxa de aprendizado. Em estruturas modernas, a regra delta é frequentemente apresentada como um degrau pedagógico para algoritmos mais complexos, e continua sendo um tópico padrão em cursos introdutórios de aprendizado de máquina. Sua influência se estende a modelos de linguagem de grande escala e transformadores, onde técnicas de otimização traçam sua linhagem até esta regra inicial.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·neural-networks·optimization·history-of-ai
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico