Les méthodes de gradient de politique sont une classe d'algorithmes d'apprentissage par renforcement et une sous-classe de méthodes d'optimisation de politique. Contrairement aux méthodes basées sur la valeur, qui apprennent une fonction de valeur pour dériver une politique, les méthodes d'optimisation de politique apprennent directement une fonction de politique qui sélectionne des actions sans consulter une fonction de valeur. Pour que le gradient de politique s'applique, la fonction de politique est paramétrée par un paramètre différentiable, généralement noté thêta, et l'objectif est de maximiser la récompense cumulée attendue par une ascension de gradient sur les paramètres de la politique.
Ces méthodes sont centrales pour l'apprentissage par renforcement moderne et ont été appliquées dans des domaines tels que la robotique, les jeux et les systèmes autonomes. Elles sont particulièrement utiles dans des environnements avec des espaces d'action continus, où les méthodes basées sur la valeur ont souvent du mal. Les méthodes de gradient de politique sont également étudiées sous le titre de « estimation de gradient de Monte Carlo » car elles reposent sur un échantillonnage stochastique pour estimer le gradient.
Aperçu
Dans l'apprentissage par renforcement basé sur la politique, l'acteur est une fonction de politique paramétrée qui mappe les états à une distribution de probabilité sur les actions. Pour un état donné, la politique génère des probabilités pour chaque action possible, avec la somme ou l'intégrale sur toutes les actions égale à 1, selon que l'espace d'action est discret ou continu. L'objectif est de trouver des paramètres qui maximisent la récompense épisodique attendue, définie comme la somme actualisée des récompenses sur un horizon temporel, à partir d'un état initial.
Le gradient de politique est le gradient de cette récompense attendue par rapport aux paramètres de la politique. Différentes méthodes de gradient de politique estiment ce gradient de manière stochastique de différentes façons, mais toutes visent à améliorer itérativement la politique en ascendant le gradient. Le défi clé est d'obtenir une estimation non biaisée et à faible variance du gradient, ce qui a conduit à diverses techniques telles que les lignes de base et les architectures acteur-critique.
REINFORCE
L'algorithme REINFORCE, introduit par Ronald J. Williams en 1992, a été la première méthode de gradient de politique. Il repose sur une identité fondamentale qui exprime le gradient de politique comme une espérance sur les trajectoires du produit du gradient de la log-politique et de la récompense totale. Une amélioration clé est l'« astuce de causalité », qui pondère chaque action uniquement par les récompenses à partir de ce pas de temps, réduisant la variance sans introduire de biais. REINFORCE est une méthode de Monte Carlo, ce qui signifie qu'elle utilise des épisodes complets pour estimer le gradient, ce qui peut entraîner une variance élevée mais est simple à implémenter.
Méthodes Acteur-Critique
Les méthodes acteur-critique combinent le gradient de politique avec une approximation de fonction de valeur pour réduire la variance. L'acteur est le réseau de politique, tandis que le critique estime la fonction de valeur, qui est utilisée pour calculer une ligne de base ou une fonction d'avantage. Cela permet un apprentissage plus stable et plus efficace en termes d'échantillons par rapport à REINFORCE pur. Des exemples notables incluent A2C (Advantage Actor-Critic) et A3C (Asynchronous Advantage Actor-Critic), qui ont été largement utilisés dans l'apprentissage par renforcement profond.
Variantes Modernes
Les méthodes de gradient de politique modernes incluent l'Optimisation de Politique Proximale (PPO) et l'Optimisation de Politique de Région de Confiance (TRPO), qui contraignent la mise à jour de la politique pour éviter des pas destructeurs trop importants. Ces méthodes sont devenues standard dans l'apprentissage par renforcement profond en raison de leur fiabilité et de leurs performances. Elles sont utilisées pour entraîner des agents pour des jeux comme Dota 2 et StarCraft II, ainsi que dans la recherche en robotique et en conduite autonome.
Applications et Défis
Les méthodes de gradient de politique ont été appliquées dans divers domaines, notamment la recherche en intelligence artificielle, les systèmes de apprentissage automatique et les cadres de apprentissage profond. Elles sont particulièrement efficaces pour les tâches de contrôle continu, comme la manipulation robotique et la locomotion. Cependant, elles rencontrent des défis tels qu'une complexité d'échantillonnage élevée et une sensibilité aux hyperparamètres. La recherche continue de traiter ces problèmes, avec des avancées dans les architectures de réseaux de neurones et les techniques d'optimisation.
Les méthodes de gradient de politique sont également pertinentes pour l'entraînement des modèles de langage de grande taille, où l'apprentissage par renforcement à partir de retours humains (RLHF) utilise des mises à jour de type gradient de politique pour aligner les modèles avec les préférences humaines. Cette connexion met en évidence la large applicabilité de ces algorithmes au-delà des contextes traditionnels d'apprentissage par renforcement.