Traduit de l'anglais

Trust Region Policy Optimization (TRPO) est un algorithme d'apprentissage par renforcement pour entraîner des agents, publié en 2015 comme précurseur de PPO. Il utilise une contrainte de région de confiance sur les mises à jour de politique pour améliorer la stabilité.

Trust Region Policy Optimization (TRPO) est un algorithme d'apprentissage par renforcement (RL) conçu pour entraîner un agent intelligent à prendre des décisions séquentielles. Il s'agit d'une méthode de gradient de politique, souvent utilisée en RL profond lorsque le réseau de politique est volumineux, et il a été introduit en 2015 en réponse aux problèmes d'instabilité des algorithmes antérieurs. TRPO contraint le changement de politique à chaque mise à jour en utilisant une région de confiance, ce qui limite la divergence de Kullback-Leibler (KL) entre l'ancienne et la nouvelle politique, garantissant ainsi des améliorations plus fiables.

TRPO est un algorithme on-policy, ce qui signifie qu'il met à jour la politique en utilisant des données collectées à partir de la politique actuelle. Il est applicable à des environnements avec des espaces d'actions discrets ou continus. L'algorithme collecte itérativement des trajectoires, estime les avantages, calcule un gradient de politique, puis applique une étape d'optimisation sous contraintes pour mettre à jour les paramètres de la politique.

Contexte et Motivation

L'apprentissage par renforcement vise à entraîner des agents en maximisant la récompense cumulative par essais et erreurs. Les premières méthodes de RL profond, telles que le Deep Q-Network (DQN), ont obtenu des succès notables mais souffraient d'instabilité pendant l'entraînement. DQN, introduit par des chercheurs de Google DeepMind en 2013, utilisait un réseau de neurones pour approximer la fonction de valeur Q, mais pouvait présenter des mises à jour erratiques. TRPO a été développé pour résoudre ces problèmes en offrant un mécanisme de mise à jour de politique plus stable.

L'idée centrale derrière TRPO est de limiter la mesure dans laquelle la politique peut changer lors d'une seule mise à jour. Cela est réalisé en imposant une contrainte sur la divergence KL entre l'ancienne et la nouvelle politique. En maintenant la politique dans une région de confiance, TRPO évite les mises à jour importantes et destructrices qui peuvent se produire dans les méthodes de gradient de politique naïves.

Détails de l'Algorithme

TRPO fonctionne en collectant itérativement un ensemble de trajectoires en exécutant la politique actuelle dans l'environnement. Pour chaque trajectoire, il calcule les récompenses à venir et les estimations d'avantage, qui mesurent à quel point une action est meilleure par rapport à la moyenne. Le gradient de politique est ensuite estimé comme le gradient attendu de la log-probabilité des actions pondéré par ces avantages.

Un défi computationnel clé est de faire respecter la contrainte de divergence KL. TRPO utilise la matrice hessienne - une matrice de dérivées secondes - de la divergence KL pour approximer la contrainte. Cependant, calculer directement la hessienne est coûteux en calcul pour les problèmes à grande échelle. Pour atténuer cela, TRPO emploie l'algorithme du gradient conjugué pour résoudre approximativement le système linéaire résultant, évitant ainsi de former explicitement la hessienne complète. De plus, une recherche linéaire avec retour en arrière garantit que la politique mise à jour satisfait la contrainte.

Relation avec PPO

TRPO est le prédécesseur direct de Proximal Policy Optimization (PPO), publié en 2017. PPO simplifie TRPO en approximant la contrainte de divergence KL avec une fonction objectif écrêtée, éliminant ainsi le besoin de calculer la hessienne. Cela rend PPO plus efficace en calcul et plus facile à implémenter, tout en conservant des avantages de stabilité similaires. Depuis 2018, PPO est l'algorithme RL par défaut chez OpenAI, et il a été appliqué à une large gamme de tâches, notamment le contrôle de bras robotiques, la résolution de jeux Atari et la victoire contre des joueurs professionnels dans Dota 2 dans le cadre du projet OpenAI Five.

Malgré la popularité de PPO, TRPO reste un algorithme fondamental important en RL. Son approche de région de confiance a influencé de nombreuses méthodes ultérieures, et il est encore utilisé dans des scénarios où le coût computationnel supplémentaire est acceptable.

Applications et Impact

TRPO a été appliqué à diverses tâches de contrôle continu, telles que la locomotion et la manipulation, où des mises à jour de politique stables sont cruciales. Il a également été utilisé dans des contextes de recherche pour étudier l'optimisation de politique dans des environnements complexes. L'accent mis par l'algorithme sur l'amélioration monotone en a fait une référence pour comparer les nouvelles méthodes RL.

Dans le contexte plus large du machine learning et de l'intelligence artificielle, TRPO a contribué au développement de techniques d'entraînement plus robustes pour les réseaux de neurones en RL. Ses idées ont été étendues et adaptées dans de nombreux travaux ultérieurs, consolidant sa place dans l'histoire du RL profond.

Limitations

La principale limitation de TRPO est son surcoût computationnel dû au calcul de la hessienne et aux itérations du gradient conjugué. Cela le rend plus lent que des méthodes plus simples comme PPO, surtout lorsque le réseau de politique est très volumineux. De plus, TRPO nécessite un réglage minutieux des hyperparamètres, tels que la limite de divergence KL et les coefficients de retour en arrière, ce qui peut affecter les performances.

Malgré ces inconvénients, les garanties théoriques et les propriétés de stabilité de TRPO en ont fait un outil précieux pour comprendre l'optimisation de politique. Il reste un point de référence pour évaluer de nouveaux algorithmes dans le domaine.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:reinforcement-learning·machine-learning·optimization·policy-gradient
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique