Trust Region Policy Optimization (TRPO) es un algoritmo de aprendizaje por refuerzo (RL) para entrenar a un agente inteligente a tomar decisiones secuenciales. Es un método de gradiente de políticas, utilizado a menudo en RL profundo cuando la red de políticas es grande, y fue introducido en 2015 como respuesta a problemas de inestabilidad en algoritmos anteriores. TRPO restringe el cambio en la política en cada actualización mediante una región de confianza, que limita la divergencia de Kullback-Leibler (KL) entre las políticas antigua y nueva, garantizando así mejoras más fiables.
TRPO es un algoritmo on-policy, lo que significa que actualiza la política utilizando datos recopilados de la política actual. Es aplicable a entornos con espacios de acción discretos o continuos. El algoritmo itera recopilando trayectorias, estimando ventajas, calculando un gradiente de políticas y aplicando un paso de optimización con restricciones para actualizar los parámetros de la política.
Antecedentes y Motivación
El aprendizaje por refuerzo tiene como objetivo entrenar agentes maximizando la recompensa acumulada mediante prueba y error. Los primeros métodos de RL profundo, como la Deep Q-Network (DQN), lograron éxitos notables pero sufrieron de inestabilidad durante el entrenamiento. La DQN, introducida por investigadores de Google DeepMind en 2013, utilizaba una red neuronal para aproximar la función de valor Q, pero podía mostrar actualizaciones erráticas. TRPO fue desarrollado para abordar estos problemas proporcionando un mecanismo de actualización de políticas más estable.
La idea central detrás de TRPO es limitar cuánto puede cambiar la política en una sola actualización. Esto se logra imponiendo una restricción sobre la divergencia KL entre las políticas antigua y nueva. Al mantener la política dentro de una región de confianza, TRPO evita actualizaciones grandes y destructivas que pueden ocurrir en métodos ingenuos de gradiente de políticas.
Detalles del Algoritmo
TRPO opera recopilando iterativamente un conjunto de trayectorias ejecutando la política actual en el entorno. Para cada trayectoria, calcula recompensas acumuladas y estimaciones de ventaja, que miden cuánto mejor es una acción en comparación con el promedio. El gradiente de políticas se estima entonces como el gradiente esperado de la log-probabilidad de las acciones ponderado por estas ventajas.
Un desafío computacional clave es imponer la restricción de divergencia KL. TRPO utiliza la matriz Hessiana - una matriz de segundas derivadas - de la divergencia KL para aproximar la restricción. Sin embargo, calcular la Hessiana directamente es computacionalmente costoso para problemas a gran escala. Para mitigar esto, TRPO emplea el algoritmo de gradiente conjugado para resolver el sistema lineal resultante de forma aproximada, evitando la necesidad de formar explícitamente la Hessiana completa. Además, una búsqueda de línea con retroceso asegura que la política actualizada satisfaga la restricción.
Relación con PPO
TRPO es el predecesor directo de Proximal Policy Optimization (PPO), que fue publicado en 2017. PPO simplifica TRPO aproximando la restricción de divergencia KL con una función objetivo recortada, eliminando la necesidad de calcular la Hessiana. Esto hace que PPO sea computacionalmente más eficiente y más fácil de implementar, manteniendo beneficios de estabilidad similares. Desde 2018, PPO ha sido el algoritmo de RL predeterminado en OpenAI, y se ha aplicado a una amplia gama de tareas, incluyendo el control de brazos robóticos, jugar juegos de Atari y derrotar a jugadores profesionales en Dota 2 como parte del proyecto OpenAI Five.
A pesar de la popularidad de PPO, TRPO sigue siendo un algoritmo fundacional importante en RL. Su enfoque de región de confianza ha influido en muchos métodos posteriores, y todavía se utiliza en escenarios donde el costo computacional adicional es aceptable.
Aplicaciones e Impacto
TRPO se ha aplicado a diversas tareas de control continuo, como locomoción y manipulación, donde las actualizaciones estables de políticas son cruciales. También se ha utilizado en entornos de investigación para estudiar la optimización de políticas en entornos complejos. El énfasis del algoritmo en la mejora monótona lo ha convertido en un punto de referencia para comparar métodos de RL más nuevos.
En el contexto más amplio de aprendizaje automático y inteligencia artificial, TRPO contribuyó al desarrollo de técnicas de entrenamiento más robustas para redes neuronales en RL. Sus ideas han sido extendidas y adaptadas en numerosos trabajos posteriores, consolidando su lugar en la historia del RL profundo.
Limitaciones
La principal limitación de TRPO es su sobrecarga computacional debido al cálculo de la Hessiana y las iteraciones de gradiente conjugado. Esto lo hace más lento que métodos más simples como PPO, especialmente cuando la red de políticas es muy grande. Además, TRPO requiere un ajuste cuidadoso de hiperparámetros, como el límite de divergencia KL y los coeficientes de retroceso, que pueden afectar el rendimiento.
A pesar de estos inconvenientes, las garantías teóricas y las propiedades de estabilidad de TRPO lo han convertido en una herramienta valiosa para comprender la optimización de políticas. Sigue siendo un punto de referencia para evaluar nuevos algoritmos en el campo.