Traducido del inglés

RAdam (Adam rectificado) es un optimizador que corrige la varianza de la tasa de aprendizaje adaptativa en Adam, mejorando la estabilidad de convergencia y la generalización en el aprendizaje profundo.

RAdam, abreviatura de Rectified Adam, es un algoritmo de optimización para entrenar redes neuronales. Fue introducido en 2019 por Liyuan Liu, Haoming Jiang, Pengcheng He, Weizhu Chen, Xiaodong Liu, Jianfeng Gao y Jiawei Han en el artículo "On the Variance of the Adaptive Learning Rate and Beyond". RAdam aborda un problema conocido del optimizador Adam, donde la tasa de aprendizaje adaptativa puede tener una alta varianza al inicio del entrenamiento, lo que conduce a una convergencia deficiente o a un rendimiento final subóptimo. Al rectificar esta varianza, RAdam busca combinar los beneficios de la convergencia rápida de Adam con la estabilidad del descenso de gradiente estocástico (SGD).

RAdam se utiliza ampliamente en el aprendizaje profundo, particularmente en el entrenamiento de transformadores y modelos de lenguaje grandes, donde ha demostrado un rendimiento competitivo con AdamW y otras variantes. Está implementado en los principales marcos de aprendizaje profundo, incluidos PyTorch y TensorFlow, y es una opción predeterminada en algunos pipelines de entrenamiento.

Antecedentes: El optimizador Adam y sus limitaciones

El optimizador Adam, introducido por Diederik Kingma y Jimmy Ba en 2014, es un método popular de tasa de aprendizaje adaptativa que calcula tasas de aprendizaje individuales para cada parámetro basándose en estimaciones del primer y segundo momento de los gradientes. Adam ha tenido un gran éxito en el entrenamiento de redes neuronales profundas, pero tiene problemas conocidos. Un problema es que la tasa de aprendizaje adaptativa puede ser demasiado grande en las primeras etapas del entrenamiento, especialmente cuando la estimación del segundo momento es pequeña. Esto puede provocar actualizaciones grandes que hagan que el modelo converja a mínimos pronunciados, que a menudo generalizan mal. Además, Adam puede requerir un ajuste cuidadoso de la tasa de aprendizaje y otros hiperparámetros.

Se han propuesto varias variantes para abordar estos problemas, como AdamW, que desacopla la disminución de peso, y AMSGrad, que utiliza un máximo de los gradientes cuadrados pasados. Sin embargo, estos no abordan directamente la varianza en la tasa de aprendizaje adaptativa.

El problema de la varianza en Adam

En Adam, la tasa de aprendizaje adaptativa se calcula como la relación entre la estimación del primer momento y la raíz cuadrada de la estimación del segundo momento. Al inicio del entrenamiento, la estimación del segundo momento se inicializa a cero y se actualiza con una corrección de sesgo. Sin embargo, la corrección de sesgo puede dejar la estimación con una alta varianza, especialmente cuando la tasa de decaimiento (beta2) está cerca de 1. Esta varianza hace que la tasa de aprendizaje fluctúe drásticamente, lo que puede conducir a un entrenamiento inestable y a una convergencia deficiente.

La idea clave de RAdam es cuantificar esta varianza y aplicar un término de rectificación que reduce la tasa de aprendizaje cuando la varianza es alta, y la aumenta gradualmente a medida que la varianza disminuye. Esto es análogo a la activación de unidad lineal rectificada (ReLU), que recorta los valores negativos a cero.

Cómo funciona RAdam

RAdam calcula la tasa de aprendizaje adaptativa de manera similar a Adam, pero con un término de rectificación adicional. El algoritmo mantiene el primer momento (media) y el segundo momento (varianza no centrada) de los gradientes, denotados como m_t y v_t, respectivamente. También rastrea el paso de tiempo t y la tasa de decaimiento beta2.

En cada paso, RAdam calcula las estimaciones corregidas por sesgo: m_t_hat = m_t / (1 - beta1^t) y v_t_hat = v_t / (1 - beta2^t). Luego calcula un parámetro rho_t = (1 - beta2^t) (2 / (1 - beta2) - 1) - t, que mide la longitud efectiva de la media móvil. Si rho_t es mayor que un umbral (típicamente 4), RAdam utiliza el término rectificado: la tasa de aprendizaje se escala por sqrt((rho_t - 4) (rho_t - 2) rho_t / ((rho_t - 4) (rho_t - 2) rho_t - 4 (rho_t - 2) * (rho_t - 2))). Si rho_t es menor o igual a 4, la actualización se simplifica para usar el primer momento directamente, similar a SGD con momento.

Esta rectificación asegura que la tasa de aprendizaje no sea demasiado grande en las primeras etapas, evitando que el modelo dé pasos excesivamente grandes que podrían conducir a mínimos deficientes.

Ventajas de RAdam

RAdam ofrece varias ventajas sobre Adam y otros optimizadores. Primero, reduce la necesidad de un calentamiento de la tasa de aprendizaje, que a menudo se requiere para Adam para evitar la inestabilidad temprana. Esto simplifica el ajuste de hiperparámetros y puede ahorrar tiempo de entrenamiento. Segundo, se ha demostrado que RAdam mejora el rendimiento de generalización en varias tareas, incluida la clasificación de imágenes y el modelado de lenguaje, en comparación con Adam. Tercero, es computacionalmente eficiente, añadiendo solo una pequeña sobrecarga a la actualización de Adam.

Estudios empíricos han demostrado que RAdam funciona bien en una variedad de modelos, incluidas redes neuronales convolucionales y transformadores. Es particularmente útil cuando se entrena con tamaños de lote pequeños o cuando los datos son ruidosos, ya que la varianza en los gradientes es mayor en estos escenarios.

RAdam en la práctica

RAdam está implementado en bibliotecas de aprendizaje profundo populares. En PyTorch, está disponible como torch.optim.RAdam. En TensorFlow, está disponible a través de la API de Keras como tf.keras.optimizers.RAdam. Se puede utilizar como un reemplazo directo de Adam, con los mismos hiperparámetros (tasa de aprendizaje, beta1, beta2, épsilon). Los valores predeterminados son típicamente learning_rate=0.001, beta1=0.9, beta2=0.999, epsilon=1e-8.

En la práctica, RAdam se ha utilizado en el entrenamiento de modelos a gran escala, incluidos algunos modelos de lenguaje grandes y transformadores. Por ejemplo, se ha adoptado en ciertos pipelines de entrenamiento para modelos como GPT y variantes de BERT, donde ha mostrado un rendimiento comparable o mejor que AdamW. Sin embargo, AdamW sigue siendo una opción popular debido a su disminución de peso desacoplada, que puede ser beneficiosa para la regularización. Algunos profesionales combinan RAdam con la disminución de peso o lo utilizan con un programa de tasa de aprendizaje coseno.

Comparación con otros optimizadores

RAdam se compara a menudo con Adam, AdamW y SGD con momento. En comparación con Adam, RAdam proporciona un entrenamiento más estable sin necesidad de calentamiento, y a menudo conduce a una mejor generalización. En comparación con AdamW, RAdam no desacopla la disminución de peso, pero se puede combinar con la regularización L2. En algunos puntos de referencia, RAdam supera a AdamW en tareas como la clasificación de imágenes, mientras que en otros AdamW es superior. La elección depende del problema específico y de los hiperparámetros.

RAdam también se relaciona con otras técnicas de reducción de varianza, como el recorte de gradientes, que se puede utilizar junto con RAdam para estabilizar aún más el entrenamiento. Además, RAdam se puede utilizar con programas de tasa de aprendizaje como el recocido coseno o la disminución por pasos.

Extensiones y variantes

Se han propuesto varias extensiones de RAdam. Por ejemplo, RAdam se ha combinado con lookahead, una técnica que mantiene un conjunto de pesos lentos, para crear el optimizador Ranger, que ha mostrado un fuerte rendimiento en varias tareas. Otra variante es AdaBelief, que modifica el segundo momento para usar la desviación de la media, pero RAdam sigue siendo una línea base para la comparación.

La investigación también ha explorado las propiedades teóricas de RAdam, proporcionando garantías de convergencia bajo ciertas condiciones. El término de rectificación se deriva del análisis de la varianza de la tasa de aprendizaje adaptativa, y se ha demostrado que reduce la brecha de generalización.

Conclusión

RAdam es un optimizador robusto que aborda el problema de la varianza en Adam, lo que conduce a un entrenamiento más estable y con mejor generalización. Es fácil de usar, está ampliamente disponible y ha demostrado ser efectivo en muchas aplicaciones de aprendizaje profundo. Aunque no siempre es la mejor opción, es una herramienta valiosa en el conjunto de herramientas del optimizador, especialmente para entrenar modelos grandes donde la estabilidad es crítica.

Para más lectura, consulte Adam, variantes de SGD y técnicas de optimización de aprendizaje profundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:optimization·deep-learning·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial