Programación de la tasa de aprendizaje

Traducido del inglés

La programación de la tasa de aprendizaje es la práctica de variar el tamaño del paso de optimización durante el entrenamiento de redes neuronales para equilibrar la velocidad de convergencia y la estabilidad, utilizando métodos como la disminución, el impulso o algoritmos adaptativos.

En Machine learning, la tasa de aprendizaje es un parámetro de ajuste en un algoritmo de optimización que determina el tamaño del paso en cada iteración mientras se avanza hacia un mínimo de una función de pérdida. Influye en cuánto la información recién adquirida supera a la información antigua, representando metafóricamente la velocidad a la que aprende un modelo. En la literatura de control adaptativo, a menudo se denomina ganancia. Establecer una tasa de aprendizaje implica un equilibrio: una tasa demasiado alta hace que el modelo sobrepase los mínimos, mientras que una tasa demasiado baja ralentiza la convergencia o corre el riesgo de quedarse atascado en mínimos locales no deseados. La programación de la tasa de aprendizaje aborda esto variando la tasa durante el entrenamiento, ya sea mediante programas predefinidos o métodos adaptativos.

Rol en la Optimización

La tasa de aprendizaje determina la magnitud del paso dado en la dirección de descenso, que generalmente se deriva del gradiente de la función de pérdida. En Deep learning, los modelos se entrenan ajustando iterativamente los pesos para minimizar una función de pérdida, y la tasa de aprendizaje controla cuán agresivamente se realizan esos ajustes. Una tasa alta constante puede provocar oscilaciones alrededor de un mínimo, mientras que una tasa baja constante puede hacer que el entrenamiento sea impracticablemente lento. Programar la tasa a lo largo del tiempo ayuda a lograr una convergencia más rápida, prevenir oscilaciones y evitar mínimos locales deficientes. La tasa de aprendizaje también puede diferir por parámetro, en cuyo caso se convierte en una matriz diagonal que aproxima la inversa de la matriz hessiana, como en el método de Newton. Esto se relaciona con la longitud del paso en métodos cuasi-Newton y la búsqueda de línea inexacta.

Programas Basados en el Tiempo

Los programas basados en el tiempo ajustan la tasa de aprendizaje en cada iteración según la tasa anterior y un parámetro de decaimiento. La fórmula es \eta_{n+1} = \eta_0 / (1 + d n), donde \eta_0 es la tasa inicial, d es el parámetro de decaimiento y n es el paso de iteración. Este programa reduce la tasa gradualmente, permitiendo pasos más grandes al inicio del entrenamiento y ajustes más finos más adelante. Es simple de implementar y requiere solo un hiperparámetro, el decaimiento d. Sin embargo, la tasa disminuye monótonamente, lo que puede no ser óptimo para todos los problemas.

Programas Basados en Pasos

Los programas basados en pasos cambian la tasa de aprendizaje en intervalos predefinidos. La tasa en la iteración n es \eta_n = \eta_0 d^{\lfloor (1+n)/r \rfloor}, donde d es el factor multiplicativo (por ejemplo, 0.5 para reducir a la mitad) y r es la tasa de caída (por ejemplo, cada 10 iteraciones). La función suelo asegura que la tasa permanezca constante entre caídas. Este programa es común en la práctica porque es fácil de ajustar y proporciona reducciones discretas que pueden ayudar al modelo a asentarse en un mínimo. La elección de d y r depende del conjunto de datos y la arquitectura del modelo.

Programas Exponenciales

Los programas exponenciales utilizan una función exponencial decreciente: \eta_n = \eta_0 e^{-d n}, donde d es un parámetro de decaimiento. Esto proporciona una reducción suave y continua en la tasa de aprendizaje, a diferencia de las caídas discretas de los programas basados en pasos. El decaimiento exponencial se usa a menudo en el entrenamiento de Neural network porque equilibra la exploración temprana con el refinamiento posterior. El parámetro de decaimiento d controla cuán rápido cae la tasa; un d más grande conduce a un decaimiento más rápido, lo que puede causar una convergencia prematura.

Calentamiento y Recocido de Coseno

El entrenamiento moderno, especialmente para Large language models, a menudo emplea calentamiento, donde la tasa de aprendizaje aumenta desde un valor pequeño hasta un pico durante los primeros miles de pasos. Esto previene la inestabilidad en las primeras etapas del entrenamiento cuando los pesos son aleatorios y los gradientes pueden ser grandes. Después del calentamiento, la tasa puede decaer usando recocido de coseno, que sigue una curva de coseno desde el pico hasta un valor cercano a cero. Se ha demostrado que el recocido de coseno mejora el rendimiento final en muchos modelos basados en Transformer (architecture). Algunos programas combinan el calentamiento con patrones cíclicos, donde la tasa oscila entre límites, permitiendo que el modelo escape de mínimos locales y explore diferentes regiones del paisaje de pérdida.

Momento y Decaimiento

El momento es una técnica a menudo combinada con programas de tasa de aprendizaje. Es análogo a una bola rodando cuesta abajo, donde la velocidad de la bola la lleva sobre pequeñas protuberancias y se acelera cuando la dirección del gradiente es consistente. El momento se controla mediante un hiperparámetro similar a la masa; un valor demasiado alto hace que el modelo sobrepase los mínimos, mientras que un valor demasiado bajo reduce su beneficio. El decaimiento, por otro lado, sirve para asentar el aprendizaje y evitar oscilaciones al reducir el tamaño del paso con el tiempo. Ambos suelen estar integrados en bibliotecas de aprendizaje profundo como Keras, que proporcionan implementaciones predeterminadas y parámetros ajustables.

Tasas de Aprendizaje Adaptativas

Una limitación clave de los programas fijos es su dependencia de hiperparámetros elegidos manualmente, que varían según el problema y el modelo. Los algoritmos de descenso de gradiente adaptativo abordan esto ajustando la tasa de aprendizaje por parámetro según los gradientes históricos. Los métodos comunes incluyen Adagrad, Adadelta, RMSprop y Adam. Estos algoritmos generalmente están integrados en marcos de aprendizaje profundo y se han convertido en estándar para entrenar modelos de Artificial intelligence. Adam, introducido en 2014, combina el momento con el escalado por parámetro y se usa ampliamente en Generative AI y otras aplicaciones. Los métodos adaptativos reducen la necesidad de ajuste manual de programas, aunque muchos profesionales aún usan un programa además de ellos para obtener mejores resultados.

Consideraciones Prácticas

Elegir una tasa de aprendizaje inicial es crítico. Las técnicas comunes incluyen usar un valor predeterminado, como 0.01 o 0.001, o realizar una prueba de rango de tasa de aprendizaje, donde la tasa se aumenta linealmente durante unas pocas épocas para encontrar un rango adecuado. El programa óptimo a menudo depende del tamaño del modelo, el conjunto de datos y el optimizador. Por ejemplo, OpenAI y Google DeepMind han informado el uso de calentamiento y decaimiento de coseno para entrenar modelos grandes. En la práctica, los programas a menudo se combinan con detención temprana, donde el entrenamiento se detiene cuando el rendimiento de validación deja de mejorar. La elección del programa puede afectar significativamente la calidad final del modelo, el tiempo de entrenamiento y la estabilidad, convirtiéndolo en un hiperparámetro clave en cualquier canal de entrenamiento.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·optimization·training
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial