Traducido del inglés

AMSGrad es un algoritmo de optimización de tasa de aprendizaje adaptativa para entrenar redes neuronales, introducido como una variante de Adam que utiliza el máximo de los gradientes cuadrados pasados para abordar problemas de convergencia.

AMSGrad es un algoritmo de optimización utilizado en aprendizaje automático y aprendizaje profundo para entrenar redes neuronales. Fue propuesto en 2018 por Sashank J. Reddi, Satyen Kale y Sanjiv Kumar en un artículo titulado 'On the Convergence of Adam and Beyond'. AMSGrad es una variante del popular optimizador Adam, diseñada para corregir un problema teórico de convergencia en Adam modificando cómo se agregan los gradientes pasados. El cambio clave es que AMSGrad mantiene un máximo acumulado de los gradientes al cuadrado pasados, en lugar de un promedio móvil exponencial, lo que asegura que la tasa de aprendizaje efectiva no aumente con el tiempo. Este ajuste mejora las garantías de convergencia del algoritmo en ciertos contextos, particularmente para problemas de optimización convexos y no convexos. AMSGrad ha sido ampliamente adoptado en la investigación y la práctica, aunque sus beneficios prácticos sobre Adam son a menudo modestos y dependen del problema.

El algoritmo mantiene dos variables de estado para cada parámetro: una estimación del primer momento (la media de los gradientes) y una estimación del segundo momento (el máximo de los gradientes al cuadrado). En cada iteración, el primer momento se actualiza como un promedio móvil exponencial del gradiente, similar a Adam. El segundo momento se actualiza tomando el máximo elemento a elemento del gradiente al cuadrado actual y la estimación del segundo momento anterior. La actualización de parámetros luego divide el primer momento por la raíz cuadrada del segundo momento, con un pequeño término épsilon para estabilidad numérica. Este diseño evita que el segundo momento disminuya, lo que a su vez evita que la tasa de aprendizaje aumente, un comportamiento que puede ocurrir en Adam cuando la magnitud del gradiente se reduce.

La motivación para AMSGrad surgió de un contraejemplo que muestra que Adam puede fallar en converger a la solución óptima en ciertos problemas convexos simples. Reddi, Kale y Kumar demostraron que el promedio móvil exponencial de los gradientes al cuadrado en Adam puede hacer que la tasa de aprendizaje efectiva se vuelva demasiado grande, lo que lleva a oscilaciones y divergencia. Al usar el máximo, AMSGrad asegura una tasa de aprendizaje monótonamente no creciente, lo que restaura las garantías de convergencia. El artículo también proporcionó cotas de arrepentimiento para AMSGrad, mostrando que logra el mismo orden de arrepentimiento que Adam en entornos estocásticos.

Antecedentes y el optimizador Adam

Adam (Estimación Adaptativa de Momentos) fue introducido por Diederik Kingma y Jimmy Ba en 2014 y se ha convertido en uno de los optimizadores más utilizados en el aprendizaje profundo. Adam combina las ventajas de dos extensiones del descenso de gradiente estocástico: AdaGrad, que adapta las tasas de aprendizaje por parámetro basándose en la suma de gradientes al cuadrado, y RMSProp, que utiliza un promedio móvil exponencial de gradientes al cuadrado. Adam mantiene tanto un primer momento (media) como un segundo momento (varianza) de los gradientes, y aplica corrección de sesgo para tener en cuenta la inicialización cero inicial. El algoritmo es conocido por su robustez a la elección de hiperparámetros y su capacidad para manejar gradientes dispersos y datos ruidosos.

Sin embargo, en 2018, Reddi, Kale y Kumar identificaron una falla en la prueba de convergencia de Adam. Construyeron un problema de optimización convexo simple donde Adam falla en converger al óptimo global, incluso con una tasa de aprendizaje constante. El problema surge del hecho de que la estimación del segundo momento de Adam puede disminuir con el tiempo, lo que puede hacer que el tamaño de paso efectivo aumente, potencialmente llevando a sobrepasar el objetivo. Este contraejemplo teórico motivó el desarrollo de AMSGrad.

El algoritmo AMSGrad

El algoritmo AMSGrad se define formalmente de la siguiente manera. Sea \(\theta_t\) el vector de parámetros en la iteración \(t\), y \(g_t\) el gradiente de la función de pérdida con respecto a \(\theta_t\). El algoritmo utiliza hiperparámetros \(\alpha\) (tasa de aprendizaje), \(\beta_1\), \(\beta_2\) (tasas de decaimiento exponencial para el primer y segundo momento), y \(\epsilon\) (una pequeña constante para estabilidad numérica). Las reglas de actualización son:

  1. Calcular el gradiente \(g_t\).
  2. Actualizar la estimación del primer momento: \(m_t = \beta_1 m_{t-1} + (1 - \beta_1) g_t\).
  3. Actualizar la estimación del segundo momento usando el máximo: \(v_t = \max(v_{t-1}, \beta_2 v_{t-1} + (1 - \beta_2) g_t^2)\).
  4. Calcular el primer momento corregido por sesgo: \(\hat{m}_t = m_t / (1 - \beta_1^t)\).
  5. Actualizar parámetros: \(\theta_{t+1} = \theta_t - \alpha \hat{m}_t / (\sqrt{v_t} + \epsilon)\).

La diferencia clave con Adam está en el paso 3, donde Adam usa \(v_t = \beta_2 v_{t-1} + (1 - \beta_2) g_t^2\) (un promedio móvil exponencial), mientras que AMSGrad toma el máximo elemento a elemento del \(v_{t-1}\) anterior y el promedio móvil actual. Esto asegura que \(v_t\) no sea decreciente, por lo que la tasa de aprendizaje efectiva \(\alpha / (\sqrt{v_t} + \epsilon)\) no es creciente.

Propiedades teóricas

AMSGrad fue diseñado para proporcionar garantías de convergencia más fuertes que Adam. El artículo demostró que AMSGrad logra una cota de arrepentimiento de \(O(\sqrt{T})\) para optimización convexa, que es óptima para el aprendizaje en línea. En contraste, se mostró que Adam tiene una cota de arrepentimiento que puede ser peor en ciertos casos. Para problemas no convexos, AMSGrad también proporciona convergencia a un punto estacionario bajo supuestos estándar. El uso del máximo asegura que el algoritmo mantenga un tamaño de paso monótonamente decreciente, que es un requisito común en las pruebas de convergencia para optimización estocástica.

Sin embargo, algunos investigadores han señalado que las ventajas teóricas de AMSGrad no siempre se traducen en un mejor rendimiento práctico. En muchas tareas de aprendizaje profundo, Adam y AMSGrad se comportan de manera similar, y a veces Adam puede superar a AMSGrad. La elección entre ambos a menudo depende del problema específico y del ajuste de hiperparámetros.

Uso práctico e impacto

AMSGrad ha sido implementado en los principales marcos de aprendizaje profundo, incluidos TensorFlow, PyTorch y Keras, a menudo como una opción dentro del optimizador Adam (por ejemplo, amsgrad=True en PyTorch). Se utiliza en el entrenamiento de varios modelos, desde ResNets hasta transformers, aunque es menos comúnmente la opción predeterminada en comparación con Adam o SGD con momento. En la práctica, AMSGrad a menudo se prueba cuando Adam exhibe un entrenamiento inestable o cuando se sospechan problemas de convergencia.

La investigación ha demostrado que AMSGrad puede ser beneficioso en ciertos escenarios, como el entrenamiento con gradientes dispersos o cuando el paisaje de pérdida tiene mínimos pronunciados. Sin embargo, un estudio de 2019 de Lucas et al. encontró que AMSGrad no supera consistentemente a Adam en una variedad de tareas, y sus ventajas son limitadas. No obstante, AMSGrad sigue siendo una contribución importante a la familia de variantes de SGD y ha inspirado más investigación en métodos de optimización adaptativa.

Relación con otros optimizadores

AMSGrad es parte de una familia más amplia de métodos de tasa de aprendizaje adaptativa que incluye AdaGrad, RMSProp y Adam. También está relacionado con desarrollos posteriores como AdamW, que desacopla la decaimiento de peso de la tasa de aprendizaje adaptativa, y Nadam, que incorpora el momento de Nesterov. La idea de usar un máximo de gradientes pasados también se ha explorado en otros contextos, como en el optimizador RAdam, que rectifica la varianza de la tasa de aprendizaje adaptativa. El enfoque de AMSGrad en asegurar una tasa de aprendizaje no creciente ha influido en el diseño de optimizadores más estables.

Críticas y limitaciones

A pesar de su atractivo teórico, AMSGrad ha enfrentado críticas. Algunos investigadores argumentan que el contraejemplo utilizado para motivar AMSGrad es artificial y no refleja problemas de optimización del mundo real. Otros han señalado que la operación de máximo puede hacer que el algoritmo sea más sensible a los gradientes iniciales y puede llevar a actualizaciones demasiado conservadoras, ralentizando la convergencia. Además, la sobrecarga de memoria y computación de mantener el máximo es insignificante, pero las ganancias prácticas a menudo son marginales.

Una crítica notable provino de un artículo de 2019 de Chen y Gu, que mostró que la garantía de convergencia de AMSGrad depende de una elección específica de hiperparámetros y que, en la práctica, el algoritmo aún puede fallar en converger en algunos entornos no convexos. Esto ha llevado a una investigación continua sobre optimizadores adaptativos que combinan las fortalezas de Adam y AMSGrad.

Legado e influencia

AMSGrad ha tenido un impacto duradero en el campo de la optimización para el aprendizaje profundo. Destacó la importancia del análisis teórico para comprender el comportamiento de los optimizadores y provocó una ola de investigación sobre las propiedades de convergencia de los métodos adaptativos. El algoritmo se cita a menudo en artículos que proponen nuevos optimizadores, y sigue siendo una línea base estándar en la investigación de optimización. Aunque puede no ser la opción predeterminada en la mayoría de las aplicaciones, AMSGrad es una herramienta valiosa en el conjunto de herramientas de optimizadores, particularmente para investigadores y profesionales que encuentran problemas de convergencia con Adam.

Véase también

Referencias

  • Reddi, S. J., Kale, S., & Kumar, S. (2018). On the Convergence of Adam and Beyond. International Conference on Learning Representations (ICLR).
  • Kingma, D. P., & Ba, J. (2015). Adam: A Method for Stochastic Optimization. ICLR.
  • Loshchilov, I., & Hutter, F. (2019). Decoupled Weight Decay Regularization. ICLR.
  • Lucas, J., et al. (2019). On the Convergence of Adam and Beyond: A Closer Look. arXiv preprint.

Nota: Las referencias se proporcionan para completitud, pero el artículo no incluye enlaces externos según las pautas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:optimization·deep-learning·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial