Traduzido do inglês

Regularization é um conjunto de técnicas, incluindo penalidades de peso, dropout e parada antecipada, usadas para reduzir o overfitting e melhorar o quão bem um modelo de aprendizado de máquina generaliza para novos dados.

Regularization refere-se a uma ampla família de técnicas usadas em aprendizado de máquina para reduzir superajuste, desencorajando um modelo de ajustar os dados de treinamento com precisão excessiva, de modo que ele generalize melhor para novos dados. Em vez de mudar o que um modelo tenta aprender, a maioria dos métodos de regularização altera como ele pode aprender, seja penalizando diretamente a complexidade, injetando ruído controlado durante o treinamento ou interrompendo o treinamento antes que o modelo tenha a chance de memorizar idiossincrasias do conjunto de treinamento.

Métodos baseados em pesos

A abordagem mais antiga e direta adiciona um termo de penalidade à função de perda com base no tamanho dos pesos do modelo, incentivando o otimizador a preferir valores de peso menores e mais simples, a menos que os dados justifiquem fortemente valores maiores. A regularização L2, também chamada de decaimento de peso ou regularização ridge, penaliza a soma dos pesos ao quadrado e tende a encolher todos os pesos suavemente em direção a zero. A regularização L1 penaliza a soma dos valores absolutos dos pesos e tende a empurrar alguns pesos para exatamente zero, efetivamente realizando seleção de características. No aprendizado profundo moderno, o decaimento de peso é tipicamente aplicado diretamente dentro do otimizador, por exemplo, como uma modificação do Adam conhecida como AdamW, em vez de um termo explícito adicionado à perda.

Métodos estruturais e estocásticos

O dropout, introduzido pelo grupo de Geoffrey Hinton por volta de 2012 e formalizado em um artigo amplamente citado de 2014, desativa aleatoriamente uma fração das unidades de uma rede neural durante cada etapa de treinamento, forçando a rede a evitar depender excessivamente de qualquer unidade única ou combinação fixa de unidades e efetivamente treinando um conjunto implícito de sub-redes que compartilham pesos. A normalização em lote e seus sucessores, embora introduzidos principalmente para estabilizar e acelerar o treinamento, também têm um efeito colateral regularizador ao adicionar ruído às entradas de cada camada durante o treinamento. Aumento de dados, que cria cópias modificadas de exemplos de treinamento, como imagens rotacionadas ou recortadas, ou texto parafraseado, expande artificialmente a diversidade efetiva dos dados de treinamento e reduz a chance de um modelo se agarrar a padrões superficiais e não generalizáveis.

Parada antecipada e seleção de modelo

A parada antecipada interrompe o treinamento assim que o desempenho em um conjunto de validação reservado para de melhorar, mesmo que a perda de treinamento continue caindo, visando diretamente a divergência entre o desempenho de treinamento e validação que define superajuste. Isso exige monitorar a perda de validação ao longo de todo o treinamento, e não apenas no final, e é uma das técnicas de regularização mais simples e amplamente usadas precisamente porque não requer mudança no modelo ou na função de perda em si, apenas uma regra de parada.

Regularização em modelos grandes

De forma um tanto contraintuitiva, os maiores modelos de linguagem de grande escala e sistemas de aprendizado profundo frequentemente usam regularização explícita mais leve do que modelos menores, porque treinar em dados de treinamento enormes e diversos com um número limitado de passagens fornece uma forma natural de regularização: o modelo raramente, ou nunca, vê o mesmo exemplo duas vezes, deixando pouca oportunidade para memorizá-lo. O dropout em particular é frequentemente reduzido ou removido completamente no pré-treinamento de transformadores em grande escala, embora permaneça comum em estágios de ajuste fino em menor escala, onde o superajuste a um conjunto de dados mais restrito é um risco mais realista.

Categorias:machine-learning·deep-learning·model-training
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico