Traduzido do inglês

Um hiperparâmetro é uma configuração definida antes do treinamento que controla o processo de aprendizado de um modelo de aprendizado de máquina, distinto dos parâmetros aprendidos a partir dos dados. Ele requer ajuste para otimizar o desempenho e a reprodutibilidade.

Em aprendizado de máquina, um hiperparâmetro é um parâmetro que pode ser definido para configurar qualquer parte do processo de aprendizado de um modelo. Hiperparâmetros são classificados como hiperparâmetros de modelo, como a topologia e o tamanho de uma rede neural, ou hiperparâmetros de algoritmo, como a taxa de aprendizado e o tamanho do lote de um otimizador. Eles são chamados de hiperparâmetros em contraste com os parâmetros, que são características que o modelo aprende a partir dos dados durante o treinamento.

Hiperparâmetros não são exigidos por todos os modelos ou algoritmos. Alguns algoritmos simples, como a regressão de mínimos quadrados ordinários, não exigem nenhum. No entanto, o algoritmo LASSO, por exemplo, adiciona um hiperparâmetro de regularização aos mínimos quadrados ordinários que deve ser definido antes do treinamento. Mesmo modelos e algoritmos sem a exigência estrita de definir hiperparâmetros podem não produzir resultados significativos se estes não forem cuidadosamente escolhidos. Valores ótimos para hiperparâmetros nem sempre são fáceis de prever; alguns hiperparâmetros podem não ter efeito significativo, ou uma variável importante pode ser condicional ao valor de outra. Frequentemente, um processo separado de ajuste de hiperparâmetros é necessário para encontrar uma combinação adequada para os dados e a tarefa. Além de melhorar o desempenho do modelo, os hiperparâmetros podem ser usados por pesquisadores para introduzir robustez e reprodutibilidade em seu trabalho, especialmente se ele usar modelos que incorporam geração de números aleatórios.

Considerações

O tempo necessário para treinar e testar um modelo pode depender da escolha de seus hiperparâmetros. Um hiperparâmetro geralmente é do tipo contínuo ou inteiro, levando a problemas de otimização de tipo misto. A existência de alguns hiperparâmetros é condicional ao valor de outros, por exemplo, o tamanho de cada camada oculta em uma rede neural pode ser condicional ao número de camadas. Consequentemente, os hiperparâmetros podem formar espaços de configuração hierárquicos ou condicionais, onde uma escolha de design determina quais hiperparâmetros adicionais são relevantes.

Parâmetros difíceis de aprender

A função objetivo é tipicamente não diferenciável em relação aos hiperparâmetros. Como resultado, na maioria dos casos, os hiperparâmetros não podem ser aprendidos usando métodos de otimização baseados em gradiente, como descida do gradiente, que são comumente empregados para aprender os parâmetros do modelo. Esses hiperparâmetros descrevem uma representação do modelo que não pode ser aprendida por métodos de otimização comuns, mas que, no entanto, afetam a função de perda. Um exemplo é o hiperparâmetro de tolerância para erros em máquinas de vetores de suporte.

Parâmetros não treináveis

Às vezes, os hiperparâmetros não podem ser aprendidos a partir dos dados de treinamento porque aumentam agressivamente a capacidade de um modelo e podem empurrar a função de perda para um mínimo indesejado, levando ao sobreajuste dos dados, em vez de mapear corretamente a riqueza da estrutura nos dados. Por exemplo, se o grau de uma equação polinomial que ajusta um modelo de regressão for tratado como um parâmetro treinável, o grau aumentaria até que o modelo se ajustasse perfeitamente aos dados, produzindo baixo erro de treinamento, mas desempenho de generalização ruim.

Ajustabilidade

A maior parte da variação de desempenho pode ser atribuída a apenas alguns hiperparâmetros. A ajustabilidade de um algoritmo, hiperparâmetro ou hiperparâmetros interativos é uma medida de quanto desempenho pode ser ganho ao ajustá-lo. Para um LSTM, embora a taxa de aprendizado seguida pelo tamanho da rede sejam seus hiperparâmetros mais cruciais, o agrupamento em lotes e o momentum não têm efeito significativo em seu desempenho. Embora algumas pesquisas tenham defendido o uso de tamanhos de mini-lote na casa dos milhares, outros trabalhos encontraram o melhor desempenho com tamanhos de mini-lote entre 2 e 32.

Robustez

Uma estocasticidade inerente no aprendizado implica diretamente que o desempenho empírico do hiperparâmetro não é necessariamente seu desempenho verdadeiro. Métodos que não são robustos a mudanças simples em hiperparâmetros, sementes aleatórias, ou até mesmo diferentes implementações do mesmo algoritmo não podem ser integrados em sistemas de controle de missão crítica sem simplificação e robustificação significativas. Por sua vez, as escolhas de hiperparâmetros podem afetar não apenas o desempenho preditivo, mas também a robustez e a estabilidade das saídas de um modelo sob condições de entrada alteradas ou ruidosas. Algoritmos de aprendizado por reforço, em particular, exigem medir seu desempenho sobre um grande número de sementes aleatórias e também medir sua sensibilidade às escolhas de hiperparâmetros. Sua avaliação com um pequeno número de sementes aleatórias não captura o desempenho adequadamente devido à alta variância. Alguns métodos de aprendizado por reforço, como DDPG (Deep Deterministic Policy Gradient), são mais sensíveis às escolhas de hiperparâmetros do que outros.

Otimização

A otimização de hiperparâmetros encontra uma tupla de hiperparâmetros que produz um modelo ótimo que minimiza uma função de perda predefinida em determinados dados de teste. A função objetivo recebe uma tupla de hiperparâmetros e retorna a perda associada. Tipicamente, esses métodos não são baseados em gradiente e, em vez disso, aplicam conceitos de otimização sem derivadas ou otimização de caixa preta. Técnicas comuns incluem busca em grade, busca aleatória e otimização bayesiana, embora a fonte não especifique esses detalhes.

Reprodutibilidade

Além de ajustar hiperparâmetros, o aprendizado de máquina envolve armazenar e organizar os parâmetros e resultados, e garantir que sejam reproduzíveis. Na ausência de uma infraestrutura robusta para esse fim, o código de pesquisa frequentemente evolui rapidamente e compromete aspectos essenciais como manutenção de registros e reprodutibilidade. Plataformas de colaboração online para aprendizado de máquina vão além, permitindo que cientistas compartilhem, organizem e discutam automaticamente experimentos, dados e algoritmos. A reprodutibilidade pode ser particularmente difícil para modelos de aprendizado profundo. Por exemplo, pesquisas mostraram que modelos de aprendizado profundo dependem muito até mesmo da seleção da semente aleatória do gerador de números aleatórios.

Ver também

  • Hiper-heurística
  • Crise de replicação
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·hyperparameter-tuning·optimization·model-configuration
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico