Taxas de Aprendizado Agendadas

Traduzido do inglês

Um cronograma de taxa de aprendizado é uma estratégia para ajustar o tamanho do passo de um algoritmo de otimização durante o treinamento, equilibrando a velocidade de convergência com a estabilidade. Cronogramas comuns incluem decaimento baseado em tempo, baseado em etapas e exponencial, frequentemente combinados com momento.

Em Machine learning e estatística, a taxa de aprendizado é um parâmetro de ajuste em um algoritmo de otimização que determina o tamanho do passo em cada iteração ao se mover em direção a um mínimo de uma função de perda. Como ela influencia até que ponto informações recém-adquiridas substituem informações antigas, representa metaforicamente a velocidade com que um modelo de aprendizado de máquina "aprende". Na literatura de controle adaptativo, a taxa de aprendizado é comumente referida como ganho.

Ao definir uma taxa de aprendizado, há um trade-off entre a taxa de convergência e o overshooting. Embora a direção de descida seja geralmente determinada a partir do gradiente da função de perda, a taxa de aprendizado determina o tamanho do passo dado nessa direção. Uma taxa de aprendizado muito alta fará o aprendizado saltar sobre mínimos, mas uma taxa muito baixa levará muito tempo para convergir ou ficará presa em um mínimo local indesejável.

Para alcançar convergência mais rápida, prevenir oscilações e ficar preso em mínimos locais indesejáveis, a taxa de aprendizado é frequentemente variada durante o treinamento, seja de acordo com um agendamento de taxa de aprendizado ou usando uma taxa de aprendizado adaptativa. A taxa de aprendizado e seus ajustes também podem diferir por parâmetro, caso em que é uma matriz diagonal que pode ser interpretada como uma aproximação da inversa da matriz Hessiana no método de Newton. A taxa de aprendizado está relacionada ao comprimento do passo determinado pela busca de linha inexata em métodos quase-Newton e algoritmos de otimização relacionados.

Conceitos Centrais: Decaimento e Momentum

Um agendamento de taxa de aprendizado altera a taxa de aprendizado durante o aprendizado e é mais frequentemente alterado entre épocas ou iterações. Isso é feito principalmente com dois parâmetros: decaimento e momentum. O decaimento serve para estabilizar o aprendizado em um bom ponto e evitar oscilações, uma situação que pode surgir quando uma taxa de aprendizado constante muito alta faz o aprendizado saltar para frente e para trás sobre um mínimo, e é controlado por um hiperparâmetro.

O momentum é análogo a uma bola rolando ladeira abaixo; o objetivo é que a bola se estabilize no ponto mais baixo da colina, correspondendo ao menor erro. O momentum tanto acelera o aprendizado (aumentando a taxa de aprendizado efetiva) quando o gradiente do custo do erro está indo na mesma direção por um longo tempo quanto evita mínimos locais ao 'rolar sobre' pequenos obstáculos. O momentum é controlado por um hiperparâmetro análogo à massa de uma bola, que deve ser escolhido manualmente - muito alto e a bola rolará sobre mínimos que desejamos encontrar, muito baixo e não cumprirá seu propósito. A fórmula para incorporar o momentum é mais complexa do que para o decaimento, mas é mais frequentemente incorporada em bibliotecas de aprendizado profundo, como Keras.

Agendamentos Baseados em Tempo

Agendamentos de aprendizado baseados em tempo alteram a taxa de aprendizado dependendo da taxa de aprendizado da iteração de tempo anterior. Incorporando o decaimento, a fórmula matemática para a taxa de aprendizado é:

\[ \eta_{n+1} = \frac{\eta_0}{1 + dn} \]

onde \(\eta\) é a taxa de aprendizado, \(\eta_0\) é a taxa de aprendizado original, \(d\) é um parâmetro de decaimento e \(n\) é o passo da iteração. Este agendamento reduz a taxa de aprendizado suave e monotonamente, com a redução se tornando menos agressiva conforme o treinamento progride. É simples de implementar e requer apenas a taxa inicial e uma constante de decaimento, tornando-o uma escolha comum para experimentos iniciais com redes neurais.

Agendamentos Baseados em Passos

Agendamentos de aprendizado baseados em passos alteram a taxa de aprendizado de acordo com alguns passos predefinidos. A fórmula de aplicação do decaimento é aqui definida como:

\[ \eta_n = \eta_0 d^{\left\lfloor \frac{1+n}{r} \right\rfloor} \]

onde \(\eta_n\) é a taxa de aprendizado na iteração \(n\), \(\eta_0\) é a taxa de aprendizado inicial, \(d\) é o quanto a taxa de aprendizado deve mudar em cada queda (0,5 corresponde a uma redução pela metade) e \(r\) corresponde à taxa de queda, ou com que frequência a taxa deve ser reduzida (10 corresponde a uma queda a cada 10 iterações). A função piso (\(\lfloor \dots \rfloor\)) aqui reduz o valor de sua entrada para 0 para todos os valores menores que 1. Esta abordagem é amplamente usada no treinamento de grandes modelos de linguagem e transformadores, onde profissionais frequentemente reduzem a taxa por um fator de 0,1 ou 0,5 em marcos predeterminados, como após uma certa fração do total de passos de treinamento.

Agendamentos Exponenciais

Agendamentos de aprendizado exponenciais são semelhantes aos baseados em passos, mas em vez de passos, uma função exponencial decrescente é usada. A fórmula matemática para incorporar o decaimento é:

\[ \eta_n = \eta_0 e^{-dn} \]

onde \(d\) é um parâmetro de decaimento. Este agendamento fornece um decaimento suave e contínuo que é mais rápido do que o decaimento baseado em tempo nos estágios iniciais e mais lento depois. É frequentemente preferido quando a paisagem de perda é relativamente suave e uma redução suave é desejada. Variações incluem decaimento exponencial com reinicializações quentes, onde a taxa de aprendizado é periodicamente redefinida para um valor mais alto para escapar de mínimos locais, uma técnica explorada em pesquisas recentes sobre aprendizado curricular e recorte de gradiente.

Agendamentos de Cosseno e Warmup

Além dos agendamentos clássicos, a prática moderna frequentemente emprega o recozimento por cosseno, onde a taxa de aprendizado segue uma curva de cosseno de um valor inicial até próximo de zero. Este agendamento é frequentemente combinado com uma fase de warmup linear, durante a qual a taxa de aprendizado aumenta de um valor pequeno até o máximo inicial ao longo de algumas centenas ou milhares de passos. O warmup é particularmente importante para treinar redes muito profundas e grandes transformadores, pois previne instabilidade precoce causada por grandes atualizações em pesos inicializados aleatoriamente. Agendamentos de cosseno com warmup se tornaram uma escolha padrão em muitas implementações de pesquisa do OpenAI e Google DeepMind, pois tendem a produzir melhor desempenho final do que o decaimento baseado em passos para o mesmo orçamento de treinamento.

Métodos de Taxa de Aprendizado Adaptativa

O problema com agendamentos de taxa de aprendizado é que todos dependem de hiperparâmetros que devem ser escolhidos manualmente para cada sessão de aprendizado e podem variar muito dependendo do problema em questão ou do modelo usado. Para combater isso, existem muitos tipos diferentes de algoritmos de descida de gradiente adaptativa, como Adagrad, Adadelta, RMSprop e Adam, que são geralmente incorporados em bibliotecas de aprendizado profundo, como Keras. Esses métodos ajustam a taxa de aprendizado por parâmetro com base em informações históricas de gradiente, efetivamente removendo a necessidade de um agendamento ajustado manualmente em muitos casos. Por exemplo, Adam mantém taxas de aprendizado por parâmetro que são escaladas pela inversa da raiz quadrada da soma dos gradientes passados ao quadrado, fornecendo uma forma de recozimento automático. Embora métodos adaptativos frequentemente convirjam mais rápido, eles podem às vezes generalizar pior do que agendamentos bem ajustados em certas tarefas, levando a abordagens híbridas que usam um agendamento fixo sobre um otimizador adaptativo.

Considerações Práticas e Seleção

Escolher um agendamento de taxa de aprendizado envolve equilibrar vários fatores: a arquitetura do modelo, o tamanho do conjunto de dados, o algoritmo de otimização e o orçamento computacional disponível. Para modelos pequenos em conjuntos de dados simples, uma taxa de aprendizado constante ou um decaimento baseado em tempo simples pode ser suficiente. Para execuções de treinamento em larga escala, como aquelas para sistemas de IA generativa, profissionais frequentemente usam uma combinação de warmup, decaimento por cosseno e reinicializações ocasionais. A taxa de aprendizado inicial em si é tipicamente escolhida via um teste de faixa de taxa de aprendizado, onde a taxa é aumentada linearmente ao longo de um pequeno número de iterações e o valor que produz a diminuição mais acentuada da perda é selecionado. Muitos frameworks, incluindo AWS e Google Cloud, fornecem agendadores incorporados e ferramentas de ajuste automatizado que reduzem o fardo manual.

Relação com Outras Técnicas

Agendamentos de taxa de aprendizado interagem intimamente com outras técnicas de treinamento. Normalização em lote e normalização de camada podem estabilizar a paisagem de perda, permitindo taxas de aprendizado mais altas e agendamentos mais simples. Inicialização de pesos afeta a taxa inicial apropriada, pois pesos iniciais mal escalados podem exigir taxas mais baixas para evitar divergência. Recorte de gradiente previne gradientes explosivos, o que é especialmente relevante ao usar agendamentos agressivos ou arquiteturas recorrentes. Em aprendizado por reforço, agendamentos são frequentemente ligados a estratégias de exploração, e em RLHF para alinhar modelos de linguagem, a taxa de aprendizado é tipicamente recozida cuidadosamente para preservar conhecimento pré-treinado enquanto se adapta ao feedback humano.

Contexto Histórico e Pesquisa

O conceito de variar a taxa de aprendizado remonta a trabalhos iniciais em controle adaptativo e descida de gradiente estocástica. Pesquisadores em instituições como MIT CSAIL e Stanford AI Lab estudaram as propriedades teóricas de diferentes funções de decaimento, mostrando que uma taxa decrescente é necessária para convergência em configurações não convexas. A introdução do momentum por Bernard Widrow e outros na década de 1980 lançou as bases para otimizadores modernos. Mais tarde, o desenvolvimento de métodos adaptativos como Adagrad e Adam, pioneiros de pesquisadores incluindo David Kaplan e outros, mudou o foco de agendamentos manuais para ajustes automáticos por parâmetro. Hoje, a escolha do agendamento permanece uma área ativa de pesquisa, com estudos comparando as propriedades de generalização de várias formas de decaimento em diferentes famílias de modelos, incluindo redes residuais e U-Nets.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·optimization·training-techniques
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico