Optimisation de la politique proximale

Traduit de l'anglais

Proximal policy optimization (PPO) est un algorithme d'apprentissage par renforcement pour entraîner des agents intelligents, plus précisément une méthode de gradient de politique utilisée en apprentissage par renforcement profond pour de grands réseaux de politiques.

L'optimisation de politique proximale (PPO) est un algorithme d'apprentissage par renforcement (RL) utilisé pour entraîner un agent intelligent. Plus précisément, il s'agit d'une méthode de gradient de politique, souvent employée en RL profond lorsque le réseau de politique est très grand. Le PPO a été introduit en 2017 comme une approximation de l'optimisation de politique par région de confiance (TRPO), conçue pour améliorer la stabilité de l'entraînement sans le coût computationnel du calcul des dérivées secondes. Depuis 2018, le PPO est l'algorithme RL par défaut chez OpenAI et a été appliqué à des domaines tels que le contrôle de bras robotiques, le jeu à des jeux Atari, et la victoire contre des joueurs professionnels à Dota 2 via le projet OpenAI Five.

Le PPO appartient à la famille des méthodes de gradient de politique, qui optimisent directement une politique en estimant les gradients de la récompense attendue. Contrairement aux méthodes basées sur la valeur comme les réseaux Q profonds (DQN), le PPO est un algorithme on-policy, ce qui signifie qu'il met à jour la politique en utilisant des données collectées à partir de la politique actuelle. Il prend en charge à la fois les espaces d'actions discrets et continus, ce qui le rend polyvalent pour une large gamme d'environnements.

Contexte : Optimisation de politique par région de confiance

Le prédécesseur du PPO, l'optimisation de politique par région de confiance (TRPO), a été publié en 2015. Le TRPO a résolu les problèmes d'instabilité du DQN en utilisant une méthode de région de confiance pour limiter la divergence KL entre les anciennes et nouvelles politiques. Cette contrainte garantit que la politique ne change pas trop radicalement lors d'une mise à jour, ce qui aide à maintenir un apprentissage stable. Cependant, le TRPO impose cette contrainte en calculant la matrice hessienne, une matrice de dérivées secondes, ce qui est coûteux en calcul et inefficace pour les problèmes à grande échelle. Cette limitation a motivé le développement du PPO, qui approxime la contrainte du TRPO sans nécessiter la hessienne.

L'algorithme PPO

Le PPO simplifie le TRPO en remplaçant la contrainte de divergence KL par une fonction objectif écrêtée. L'idée centrale est de limiter la mise à jour de la politique en écrêtant le rapport de probabilité entre les nouvelles et anciennes politiques. Ce mécanisme d'écrêtage empêche des mises à jour excessivement grandes, qui peuvent déstabiliser l'entraînement. La fonction objectif est conçue pour fournir une borne inférieure sur l'amélioration de la politique, garantissant que les mises à jour sont conservatrices mais efficaces.

L'algorithme suit généralement ces étapes :

  1. Collecter des trajectoires en exécutant la politique actuelle dans l'environnement.
  2. Calculer les récompenses à venir et les estimations d'avantage (par exemple, en utilisant l'estimation d'avantage généralisée).
  3. Mettre à jour la politique en maximisant l'objectif substitut écrêté, souvent en utilisant une ascension de gradient stochastique.
  4. Optionnellement, mettre à jour une fonction de valeur pour améliorer l'estimation d'avantage.

Le PPO est connu pour sa simplicité et sa facilité d'implémentation par rapport au TRPO, tout en atteignant des performances comparables ou supérieures dans de nombreuses tâches. Il est devenu une référence standard dans la recherche en apprentissage par renforcement.

Applications et impact

Le PPO a été largement adopté tant dans la recherche que dans l'industrie. Chez OpenAI, il est devenu l'algorithme RL par défaut en 2018, utilisé dans des projets tels qu'OpenAI Five, qui a vaincu les champions du monde en titre à Dota 2 en 2019. Le PPO a également été utilisé pour le contrôle robotique, y compris l'entraînement d'un bras robotique à effectuer des tâches de manipulation, et pour jouer à des jeux Atari, où il a atteint des performances surhumaines sur de nombreux titres.

La stabilité et l'efficacité d'échantillonnage de l'algorithme en ont fait un choix populaire pour le réglage fin des grands modèles de langage, en particulier dans le contexte de l'apprentissage par renforcement à partir de retours humains (RLHF). De nombreux grands modèles de langage modernes ont été alignés en utilisant le PPO ou des variantes de celui-ci, contribuant au développement de systèmes de IA générative.

Comparaison avec d'autres méthodes

Le PPO est souvent comparé à d'autres algorithmes de gradient de politique tels que A2C (Advantage Actor-Critic) et DDPG (Deep Deterministic Policy Gradient). Contrairement à A2C, qui utilise plusieurs environnements parallèles, le PPO peut fonctionner avec un seul environnement et utilise l'échantillonnage d'importance pour réutiliser les données. Par rapport à DDPG, qui est off-policy et déterministe, le PPO est on-policy et stochastique, ce qui le rend plus robuste aux variations d'hyperparamètres. L'objectif écrêté du PPO offre également une alternative plus simple à la région de confiance du TRPO, réduisant la surcharge computationnelle tout en maintenant la stabilité.

Limites et extensions

Malgré son succès, le PPO présente des limites. Il peut être sensible au paramètre d'écrêtage et au choix de la méthode d'estimation d'avantage. Il nécessite également un réglage minutieux des hyperparamètres tels que le taux d'apprentissage et la taille des mini-lots. Des chercheurs ont proposé des extensions telles que PPO-λ, qui intègre l'estimation d'avantage généralisée, et des variantes qui ajustent adaptativement la plage d'écrêtage. De plus, la nature on-policy du PPO peut être moins efficace en termes d'échantillons par rapport aux méthodes off-policy, bien que cela soit souvent compensé par sa stabilité.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:reinforcement-learning·machine-learning·openai·algorithms
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique