La optimización de política proximal (PPO, por sus siglas en inglés) es un algoritmo de aprendizaje por refuerzo (RL) utilizado para entrenar un agente inteligente. Específicamente, es un método de gradiente de política, a menudo empleado en RL profundo cuando la red de política es muy grande. PPO fue introducido en 2017 como una aproximación de la optimización de política de región de confianza (TRPO), diseñado para mejorar la estabilidad del entrenamiento sin el costo computacional de calcular derivadas de segundo orden. Desde 2018, PPO ha sido el algoritmo de RL predeterminado en OpenAI y se ha aplicado a dominios como el control de brazos robóticos, jugar videojuegos de Atari y derrotar a jugadores profesionales en Dota 2 mediante el proyecto OpenAI Five.
PPO pertenece a la familia de métodos de gradiente de política, que optimizan una política directamente estimando gradientes de la recompensa esperada. A diferencia de los métodos basados en valores, como las redes Q profundas (DQN), PPO es un algoritmo de política activa (on-policy), lo que significa que actualiza la política utilizando datos recopilados de la política actual. Admite tanto espacios de acción discretos como continuos, lo que lo hace versátil para una amplia variedad de entornos.
Antecedentes: Optimización de política de región de confianza
El predecesor de PPO, la optimización de política de región de confianza (TRPO), fue publicado en 2015. TRPO abordó los problemas de inestabilidad de DQN mediante el uso de un método de región de confianza para limitar la divergencia Kullback-Leibler entre las políticas antigua y actual. Esta restricción garantiza que la política no cambie drásticamente durante una actualización, lo que ayuda a mantener un aprendizaje estable. Sin embargo, TRPO hace cumplir esta restricción calculando la matriz Hessiana, una matriz de derivadas de segundo orden, lo cual es computacionalmente costoso e ineficiente para problemas a gran escala. Esta limitación motivó el desarrollo de PPO, que aproxima la restricción de TRPO sin requerir la matriz Hessiana.
El algoritmo PPO
PPO simplifica TRPO reemplazando la restricción de divergencia Kullback-Leibler por una función objetivo recortada. La idea central es limitar la actualización de la política recortando la razón de probabilidad entre la política nueva y la antigua. Este mecanismo de recorte previene actualizaciones excesivamente grandes, las cuales pueden desestabilizar el entrenamiento. La función objetivo está diseñada para proporcionar un límite inferior en la mejora de la política, asegurando que las actualizaciones sean conservadoras pero efectivas.
El algoritmo típicamente sigue los siguientes pasos:
- Recopilar trayectorias ejecutando la política actual en el entorno.
- Calcular recompensas acumuladas y estimaciones de ventaja (por ejemplo, mediante estimación de ventaja generalizada).
- Actualice la política maximizando el objetivo cercenado, a menudo utilizando el método de ascenso de gradiente estocástico.
- De manera opcional, actualizar una función de valor para mejorar la estimación de ventaja.
POO es conocido por su simplicidad y facilidad de implementación en comparación con Trpo, mientras alcanza desempeño comparable o superior en muchas tareas. Se ha convertido en una línea base estándar en la investigación de aprendizaje por refuerzo.
Aplicaciones e impacto
POO ha sido ampliamente adoptado tanto en la investigación como en la industria. En OpenAI, se convirtió en el algoritmo predeterminado de RL en 2018, empleado en proyectos como OpenAI Five, el cual en 2019 derrotó a los campeones mundiales reinantes en Dota 2. POO también se ha utilizado para el control robótico, incluyendo el entrenamiento de un brazo robótico para llevar a cabo tareas de manipulación, así como para jugar juegos de Atari, logrando desempeño sobrehumano en muchos de estos juegos.
La estabilidad y la eficiencia de muestra del algoritmo lo El hecho probable para adaptar modelos de lenguaje grandes, particularmente en el contexto de aprendizaje por refuerzo a partir de retroalimentación humana (RLHF). Muchos modelos de lenguaje grandes modelos de lenguaje grandes han sido alineados usando POO o variantes similares, lo que contribuye al desarrollo de sistemas de IA generativa.
Comparación con otros métodos
POO es frecuentemente comparado con otros algoritmos de gradiente de político que son como A2C (Actor-Critic) y DDPG (Deep Deterministic Policy Gradient). A diferencia de A2C, que usa múltiples entornos paralelos, POO puede funcionar con un solo entorno y emplea ``importance sampling'' para reutilizar datos. En comparación con GNU, que es fuera de política y determinista, POO es de política y de carácter estocástico, lo que lo hace más agradable a variaciones de hiperparámetros. El objetivo recortado de POO también ofrece una alternativa más simple al mecan Nismo de región de confianza de trpo, reduciendo la sobrecarga computacional y manteniendo la estabilidad.
Limitaciones y extensiones
A pesar de su éxito, POO tiene limitaciones. Puede ser sensible al parámetro de recorte y a la elección de método de estimación de ventaja. También requiere una oída de ajuste de hiperparámetros como la tasa de aprendizaje y el tamaño del mini- lote. Se han propuesto extensiones de este como POO-λ, que incorpora la estimación de ventaja generalizada, y variantes que ajustan adaptativamente el rango de recorte. Además, la naturaleza de aprendizaje determina el acceso a datos de forma eficiente, pero clasifica la comparándola con métodos fuera de política, aunque esto suele ser potencialmente compensado por su estabilidad.