Agendador de Taxa de Aprendizado

Traduzido do inglês

Um agendador de taxa de aprendizado ajusta a taxa de aprendizado durante o treinamento de redes neurais para melhorar a convergência e evitar mínimos locais. Agendamentos comuns incluem decaimento baseado em tempo, baseado em etapas e exponencial, além de métodos adaptativos como o Adam.

Em aprendizado de máquina e estatística, a taxa de aprendizado é um parâmetro de ajuste em um algoritmo de otimização que determina o tamanho do passo em cada iteração ao se mover em direção a um mínimo de uma função de perda. Como ela influencia até que ponto informações recém-adquiridas substituem informações antigas, representa metaforicamente a velocidade com que um modelo de aprendizado de máquina "aprende". Na literatura de controle adaptativo, a taxa de aprendizado é comumente referida como ganho.

Definir uma taxa de aprendizado envolve um trade-off entre a taxa de convergência e o overshooting. Embora a direção de descida seja geralmente determinada a partir do gradiente da função de perda, a taxa de aprendizado determina quão grande é o passo dado nessa direção. Uma taxa de aprendizado muito alta fará o aprendizado pular sobre mínimos, mas uma taxa muito baixa levará muito tempo para convergir ou ficará presa em um mínimo local indesejável. Para alcançar convergência mais rápida, prevenir oscilações e evitar ficar preso em mínimos locais indesejáveis, a taxa de aprendizado é frequentemente variada durante o treinamento, seja de acordo com um agendamento de taxa de aprendizado ou usando uma taxa de aprendizado adaptativa. A taxa de aprendizado e seus ajustes também podem diferir por parâmetro, caso em que é uma matriz diagonal que pode ser interpretada como uma aproximação da inversa da matriz Hessiana no método de Newton. A taxa de aprendizado está relacionada ao comprimento do passo determinado por busca de linha inexata em métodos quase-Newton e algoritmos de otimização relacionados.

Agendamentos de Taxa de Aprendizado

A taxa inicial pode ser deixada como padrão do sistema ou selecionada usando uma variedade de técnicas. Um agendamento de taxa de aprendizado altera a taxa durante o aprendizado e é mais frequentemente alterado entre épocas ou iterações. Isso é feito principalmente com dois parâmetros: decaimento e momentum. Existem muitos agendamentos diferentes de taxa de aprendizado, mas os mais comuns são baseados em tempo, baseados em etapas e exponenciais.

O decaimento serve para estabilizar o aprendizado em um bom ponto e evitar oscilações, uma situação que pode surgir quando uma taxa de aprendizado constante muito alta faz o aprendizado pular para frente e para trás sobre um mínimo. Ele é controlado por um hiperparâmetro.

O momentum é análogo a uma bola rolando colina abaixo; o objetivo é que a bola se estabilize no ponto mais baixo da colina (correspondente ao menor erro). O momentum tanto acelera o aprendizado (aumentando a taxa de aprendizado) quando o gradiente do custo do erro está na mesma direção por um longo tempo quanto evita mínimos locais ao "passar por cima" de pequenos obstáculos. O momentum é controlado por um hiperparâmetro análogo à massa de uma bola, que deve ser escolhido manualmente - muito alto e a bola passará por cima dos mínimos que desejamos encontrar, muito baixo e não cumprirá seu propósito. A fórmula para incorporar o momentum é mais complexa do que para o decaimento, mas é mais frequentemente incorporada em bibliotecas de aprendizado profundo, como Keras.

Agendamentos de aprendizado baseados em tempo alteram a taxa de aprendizado dependendo da taxa da iteração de tempo anterior. Incorporando o decaimento, a fórmula matemática para a taxa de aprendizado é:

η_{n+1} = η₀ / (1 + d n)

onde η é a taxa de aprendizado, η₀ é a taxa de aprendizado original, d é um parâmetro de decaimento e n é o passo da iteração.

Agendamentos de aprendizado baseados em etapas alteram a taxa de aprendizado de acordo com algumas etapas predefinidas. A fórmula de aplicação do decaimento é definida como:

η_n = η₀ d^(⌊(1+n)/r⌋)

onde η_n é a taxa de aprendizado na iteração n, η₀ é a taxa de aprendizado inicial, d é o quanto a taxa deve mudar em cada queda (0,5 corresponde a uma redução pela metade) e r corresponde à taxa de queda, ou com que frequência a taxa deve ser reduzida (10 corresponde a uma queda a cada 10 iterações). A função piso (⌊…⌋) reduz o valor de sua entrada para 0 para todos os valores menores que 1.

Agendamentos exponenciais são semelhantes aos baseados em etapas, mas em vez de etapas, uma função exponencial decrescente é usada. A fórmula matemática para incorporar o decaimento é:

η_n = η₀ e^(−d n)

onde d é um parâmetro de decaimento.

Taxa de Aprendizado Adaptativa

O problema com agendamentos de taxa de aprendizado é que todos dependem de hiperparâmetros que devem ser escolhidos manualmente para cada sessão de aprendizado e podem variar muito dependendo do problema em questão ou do modelo usado. Para combater isso, existem muitos tipos diferentes de algoritmos de descida de gradiente adaptativa, como Adagrad, Adadelta, RMSprop e Adam, que geralmente são incorporados em bibliotecas de aprendizado profundo, como Keras.

Papel no Aprendizado Profundo

Agendadores de taxa de aprendizado são um componente crítico no treinamento de redes neurais modernas, incluindo modelos de aprendizado profundo e modelos de linguagem de grande escala. Na prática, frameworks como TensorFlow e PyTorch fornecem implementações de agendadores integradas. Por exemplo, OpenAI e Anthropic usam técnicas sofisticadas de agendamento ao treinar seus modelos baseados em transformadores para garantir convergência estável. Da mesma forma, Google DeepMind e Meta AI empregam agendadores personalizados para execuções de treinamento em grande escala.

Considerações Práticas

Escolher um agendamento de taxa de aprendizado apropriado frequentemente envolve experimentação. Práticas comuns incluem usar uma fase de aquecimento onde a taxa de aprendizado aumenta linearmente a partir de um valor pequeno, seguida por uma fase de decaimento. Essa abordagem ajuda a estabilizar o treinamento nas primeiras iterações. Além disso, alguns agendadores como recozimento por cosseno e taxas de aprendizado cíclicas ganharam popularidade por sua capacidade de escapar de mínimos acentuados.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·optimization·deep-learning
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico