En aprendizaje automático, un hiperparámetro es un parámetro que se puede establecer para definir cualquier parte configurable del proceso de aprendizaje de un modelo. Los hiperparámetros se clasifican como hiperparámetros de modelo, como la topología y el tamaño de una red neuronal, o hiperparámetros de algoritmo, como la tasa de aprendizaje y el tamaño de lote de un optimizador. Se denominan hiperparámetros en contraste con los parámetros, que son características que el modelo aprende de los datos durante el entrenamiento.
Los hiperparámetros no son necesarios para todos los modelos o algoritmos. Algunos algoritmos simples, como la regresión de mínimos cuadrados ordinarios, no requieren ninguno. Sin embargo, el algoritmo LASSO, por ejemplo, añade un hiperparámetro de regularización a los mínimos cuadrados ordinarios que debe establecerse antes del entrenamiento. Incluso los modelos y algoritmos sin un requisito estricto de definir hiperparámetros pueden no producir resultados significativos si estos no se eligen cuidadosamente. Los valores óptimos para los hiperparámetros no siempre son fáciles de predecir; algunos hiperparámetros pueden no tener un efecto significativo, o una variable importante puede depender del valor de otra. A menudo se necesita un proceso separado de ajuste de hiperparámetros para encontrar una combinación adecuada para los datos y la tarea. Además de mejorar el rendimiento del modelo, los hiperparámetros pueden ser utilizados por los investigadores para introducir robustez y reproducibilidad en su trabajo, especialmente si utiliza modelos que incorporan generación de números aleatorios.
Consideraciones
El tiempo requerido para entrenar y probar un modelo puede depender de la elección de sus hiperparámetros. Un hiperparámetro suele ser de tipo continuo o entero, lo que lleva a problemas de optimización de tipo mixto. La existencia de algunos hiperparámetros es condicional al valor de otros, por ejemplo, el tamaño de cada capa oculta en una red neuronal puede ser condicional al número de capas. En consecuencia, los hiperparámetros pueden formar espacios de configuración jerárquicos o condicionales, donde una elección de diseño determina qué hiperparámetros adicionales son relevantes.
Parámetros difíciles de aprender
La función objetivo es típicamente no diferenciable con respecto a los hiperparámetros. Como resultado, en la mayoría de los casos, los hiperparámetros no pueden aprenderse utilizando métodos de optimización basados en gradientes, como descenso de gradiente, que se emplean comúnmente para aprender los parámetros del modelo. Estos hiperparámetros describen una representación del modelo que no puede aprenderse mediante métodos de optimización comunes, pero que sin embargo afectan a la función de pérdida. Un ejemplo es el hiperparámetro de tolerancia para errores en máquinas de vectores de soporte.
Parámetros no entrenables
A veces los hiperparámetros no pueden aprenderse de los datos de entrenamiento porque aumentan agresivamente la capacidad de un modelo y pueden llevar la función de pérdida a un mínimo no deseado, lo que conduce a un sobreajuste de los datos, en lugar de mapear correctamente la riqueza de la estructura en los datos. Por ejemplo, si el grado de una ecuación polinómica que ajusta un modelo de regresión se trata como un parámetro entrenable, el grado aumentaría hasta que el modelo ajustara perfectamente los datos, produciendo un error de entrenamiento bajo pero un rendimiento de generalización pobre.
Ajustabilidad
La mayor parte de la variación en el rendimiento puede atribuirse a solo unos pocos hiperparámetros. La ajustabilidad de un algoritmo, hiperparámetro o hiperparámetros interactuantes es una medida de cuánto rendimiento se puede ganar ajustándolo. Para un LSTM, aunque la tasa de aprendizaje seguida del tamaño de la red son sus hiperparámetros más cruciales, el batching y el momentum no tienen un efecto significativo en su rendimiento. Aunque algunas investigaciones han abogado por el uso de tamaños de mini-lote en los miles, otros trabajos han encontrado el mejor rendimiento con tamaños de mini-lote entre 2 y 32.
Robustez
Una estocasticidad inherente en el aprendizaje implica directamente que el rendimiento empírico de los hiperparámetros no es necesariamente su rendimiento verdadero. Los métodos que no son robustos a cambios simples en los hiperparámetros, semillas aleatorias, o incluso diferentes implementaciones del mismo algoritmo no pueden integrarse en sistemas de control de misión crítica sin una simplificación y robustificación significativas. A su vez, las elecciones de hiperparámetros pueden afectar no solo al rendimiento predictivo sino también a la robustez y estabilidad de las salidas de un modelo bajo condiciones de entrada cambiantes o ruidosas. Los algoritmos de aprendizaje por refuerzo, en particular, requieren medir su rendimiento sobre un gran número de semillas aleatorias y también medir su sensibilidad a las elecciones de hiperparámetros. Su evaluación con un pequeño número de semillas aleatorias no captura adecuadamente el rendimiento debido a la alta varianza. Algunos métodos de aprendizaje por refuerzo, como DDPG (Deep Deterministic Policy Gradient), son más sensibles a las elecciones de hiperparámetros que otros.
Optimización
La optimización de hiperparámetros encuentra una tupla de hiperparámetros que produce un modelo óptimo que minimiza una función de pérdida predefinida en datos de prueba dados. La función objetivo toma una tupla de hiperparámetros y devuelve la pérdida asociada. Típicamente estos métodos no se basan en gradientes y en su lugar aplican conceptos de optimización sin derivadas u optimización de caja negra. Las técnicas comunes incluyen la búsqueda en cuadrícula, la búsqueda aleatoria y la optimización bayesiana, aunque la fuente no especifica estos detalles.
Reproducibilidad
Aparte de ajustar los hiperparámetros, el aprendizaje automático implica almacenar y organizar los parámetros y resultados, y asegurarse de que sean reproducibles. En ausencia de una infraestructura robusta para este propósito, el código de investigación a menudo evoluciona rápidamente y compromete aspectos esenciales como el registro y la reproducibilidad. Las plataformas de colaboración en línea para el aprendizaje automático van más allá al permitir a los científicos compartir, organizar y discutir automáticamente experimentos, datos y algoritmos. La reproducibilidad puede ser particularmente difícil para los modelos de aprendizaje profundo. Por ejemplo, la investigación ha demostrado que los modelos de aprendizaje profundo dependen muy fuertemente incluso de la selección de la semilla aleatoria del generador de números aleatorios.
Véase también
- Hiperheurística
- Crisis de replicación