Agendamento de Taxa de Aprendizado

Traduzido do inglês

O agendamento da taxa de aprendizado é a prática de variar o tamanho do passo de otimização durante o treinamento de redes neurais para equilibrar velocidade de convergencia e estabilidad, utilizando métodos como decaimento, momentum ou algoritmos adaptativos.

Em Machine learning, a taxa de aprendizado é um parâmetro de ajuste em um algoritmo de otimização que determina o tamanho do passo em cada iteração ao se mover em direção a um mínimo de uma função de perda. Ela influencia o quanto informações recém-adquiridas sobrescrevem informações antigas, representando metaforicamente a velocidade com que um modelo aprende. Na literatura de controle adaptativo, é frequentemente chamada de ganho. Definir uma taxa de aprendizado envolve um trade-off: uma taxa muito alta faz o modelo ultrapassar os mínimos, enquanto uma taxa muito baixa desacelera a convergência ou arrisca ficar preso em mínimos locais indesejáveis. O agendamento da taxa de aprendizado aborda isso variando a taxa durante o treinamento, seja por meio de cronogramas predefinidos ou métodos adaptativos.

Papel na Otimização

A taxa de aprendizado determina a magnitude do passo dado na direção de descida, que geralmente é derivada do gradiente da função de perda. Em Deep learning, os modelos são treinados ajustando iterativamente os pesos para minimizar uma função de perda, e a taxa de aprendizado controla quão agressivamente esses ajustes são feitos. Uma taxa alta constante pode levar a oscilações em torno de um mínimo, enquanto uma taxa baixa constante pode tornar o treinamento impraticavelmente lento. Agendar a taxa ao longo do tempo ajuda a alcançar convergência mais rápida, prevenir oscilações e evitar mínimos locais ruins. A taxa de aprendizado também pode diferir por parâmetro, caso em que se torna uma matriz diagonal que aproxima a inversa da matriz Hessiana, como no método de Newton. Isso se relaciona ao comprimento do passo em métodos quase-Newton e busca de linha inexata.

Cronogramas Baseados em Tempo

Cronogramas baseados em tempo ajustam a taxa de aprendizado a cada iteração com base na taxa anterior e em um parâmetro de decaimento. A fórmula é \eta_{n+1} = \eta_0 / (1 + d n), onde \eta_0 é a taxa inicial, d é o parâmetro de decaimento e n é o passo da iteração. Este cronograma reduz a taxa gradualmente, permitindo passos maiores no início do treinamento e ajustes mais finos depois. É simples de implementar e requer apenas um hiperparâmetro, o decaimento d. No entanto, a taxa diminui monotonicamente, o que pode não ser ideal para todos os problemas.

Cronogramas Baseados em Etapas

Cronogramas baseados em etapas mudam a taxa de aprendizado em intervalos predefinidos. A taxa na iteração n é \eta_n = \eta_0 d^{\lfloor (1+n)/r \rfloor}, onde d é o fator multiplicativo (por exemplo, 0,5 para reduzir pela metade) e r é a taxa de queda (por exemplo, a cada 10 iterações). A função piso garante que a taxa permaneça constante entre as quedas. Este cronograma é comum na prática porque é fácil de ajustar e fornece reduções discretas que podem ajudar o modelo a se estabelecer em um mínimo. A escolha de d e r depende do conjunto de dados e da arquitetura do modelo.

Cronogramas Exponenciais

Cronogramas exponenciais usam uma função exponencial decrescente: \eta_n = \eta_0 e^{-d n}, onde d é um parâmetro de decaimento. Isso fornece uma redução suave e contínua na taxa de aprendizado, ao contrário das quedas discretas dos cronogramas baseados em etapas. O decaimento exponencial é frequentemente usado no treinamento de Neural network porque equilibra exploração inicial com refinamento posterior. O parâmetro de decaimento d controla a rapidez com que a taxa cai; um d maior leva a um decaimento mais rápido, o que pode causar convergência prematura.

Aquecimento e Annealing de Cosseno

O treinamento moderno, especialmente para Large language models, frequentemente emprega aquecimento, onde a taxa de aprendizado aumenta de um valor pequeno para um pico nos primeiros milhares de passos. Isso previne instabilidade no início do treinamento, quando os pesos são aleatórios e os gradientes podem ser grandes. Após o aquecimento, a taxa pode decair usando annealing de cosseno, que segue uma curva de cosseno do pico até um valor próximo de zero. O annealing de cosseno demonstrou melhorar o desempenho final em muitos modelos baseados em Transformer (architecture). Alguns cronogramas combinam aquecimento com padrões cíclicos, onde a taxa oscila entre limites, permitindo que o modelo escape de mínimos locais e explore diferentes regiões da paisagem de perda.

Momentum e Decaimento

Momentum é uma técnica frequentemente combinada com cronogramas de taxa de aprendizado. É análogo a uma bola rolando colina abaixo, onde a velocidade da bola a carrega sobre pequenas saliências e acelera quando a direção do gradiente é consistente. O momentum é controlado por um hiperparâmetro semelhante à massa; um valor muito alto faz o modelo ultrapassar os mínimos, enquanto um valor muito baixo reduz seu benefício. O decaimento, por outro lado, serve para estabilizar o aprendizado e evitar oscilações, reduzindo o tamanho do passo ao longo do tempo. Ambos são tipicamente incorporados em bibliotecas de aprendizado profundo, como Keras, que fornecem implementações padrão e parâmetros ajustáveis.

Taxas de Aprendizado Adaptativas

Uma limitação chave dos cronogramas fixos é sua dependência de hiperparâmetros escolhidos manualmente, que variam por problema e modelo. Algoritmos de descida de gradiente adaptativos abordam isso ajustando a taxa de aprendizado por parâmetro com base em gradientes históricos. Métodos comuns incluem Adagrad, Adadelta, RMSprop e Adam. Esses algoritmos são geralmente incorporados em estruturas de aprendizado profundo e se tornaram padrão para treinar modelos de Artificial intelligence. Adam, introduzido em 2014, combina momentum com escalonamento por parâmetro e é amplamente usado em Generative AI e outras aplicações. Métodos adaptativos reduzem a necessidade de ajuste manual de cronogramas, embora muitos profissionais ainda usem um cronograma além deles para melhores resultados.

Considerações Práticas

Escolher uma taxa de aprendizado inicial é crítico. Técnicas comuns incluem usar um valor padrão, como 0,01 ou 0,001, ou realizar um teste de faixa de taxa de aprendizado, onde a taxa é aumentada linearmente ao longo de algumas épocas para encontrar uma faixa adequada. O cronograma ideal frequentemente depende do tamanho do modelo, conjunto de dados e otimizador. Por exemplo, OpenAI e Google DeepMind relataram o uso de aquecimento e decaimento de cosseno para treinar modelos grandes. Na prática, cronogramas são frequentemente combinados com parada antecipada, onde o treinamento é interrompido quando o desempenho de validação para de melhorar. A escolha do cronograma pode afetar significativamente a qualidade final do modelo, o tempo de treinamento e a estabilidade, tornando-o um hiperparâmetro chave em qualquer pipeline de treinamento.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·optimization·training
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico