Traduit de l'anglais

L'algorithme Deep Deterministic Policy Gradient (DDPG) est un algorithme d'apprentissage par renforcement acteur-critique hors politique, sans modèle, conçu pour les espaces d'actions continus, combinant le replay d'expérience et les réseaux cibles de DQN avec les gradients de politique déterministes.

Deep Deterministic Policy Gradient (DDPG) est un algorithme d'apprentissage par renforcement qui combine l'architecture acteur-critique avec des réseaux de neurones profonds pour traiter les espaces d'actions continus. Il a été introduit par des chercheurs de Google DeepMind en 2016, s'appuie sur le théorème du gradient de politique déterministe et adapte des techniques de l'apprentissage Q profond telles que la relecture d'expériences et les réseaux cibles pour améliorer la stabilité de l'entraînement. DDPG est conçu pour des environnements où les actions sont des valeurs continues plutôt que des choix discrets, ce qui le rend adapté aux tâches de contrôle en robotique et en simulation.

L'algorithme fonctionne dans le cadre standard de l'apprentissage par renforcement, où un agent interagit avec un environnement modélisé comme un processus de décision markovien. À chaque pas de temps, l'agent observe un état, sélectionne une action, reçoit une récompense et passe à un nouvel état. DDPG apprend une politique qui maximise le signal de récompense cumulé en utilisant deux réseaux de neurones : un acteur qui mappe les états aux actions et un critique qui estime le retour attendu pour une paire état-action donnée.

Architecture de l'algorithme

DDPG utilise une architecture acteur-critique, qui sépare l'apprentissage de la politique et de la fonction de valeur. Le réseau acteur produit une action déterministe pour un état donné, tandis que le réseau critique évalue la qualité de cette action en estimant la fonction de valeur d'action, souvent notée Q(s,a). L'entraînement alterne entre la mise à jour du critique pour mieux approximer les retours réels et la mise à jour de l'acteur pour sélectionner des actions qui maximisent l'estimation du critique.

Pour améliorer la stabilité, DDPG emploie des réseaux cibles avec des mises à jour douces. Les réseaux cibles sont des copies de l'acteur et du critique qui suivent lentement les réseaux appris en utilisant un paramètre de mélange, typiquement 0,001. Cette technique réduit le risque de divergence pendant l'entraînement et est empruntée aux méthodes d'apprentissage Q profond.

Exploration et relecture d'expériences

Parce que DDPG apprend une politique déterministe, il aborde le dilemme exploration-exploitation en ajoutant du bruit à la sélection d'actions pendant l'entraînement, généralement en utilisant un processus d'Ornstein-Uhlenbeck. Cela permet à l'agent d'explorer son environnement tout en se dirigeant vers un comportement optimal. L'algorithme utilise également un tampon de relecture qui stocke les transitions passées ; pendant l'apprentissage, des mini-lots d'expériences sont échantillonnés uniformément à partir de ce tampon pour briser les corrélations temporelles et améliorer l'efficacité d'échantillonnage. Ces choix de conception permettent à DDPG de gérer des espaces d'actions continus, courants en robotique et dans les applications de contrôle.

Description de l'algorithme

Le cœur de DDPG est l'architecture acteur-critique. Le critique est entraîné pour approximer la fonction de valeur d'action en utilisant l'équation de Bellman, minimisant l'erreur quadratique moyenne entre les valeurs Q prédites et cibles. L'acteur est mis à jour en utilisant le théorème du gradient de politique déterministe, qui calcule le gradient du retour attendu par rapport aux paramètres de l'acteur via la règle de chaîne appliquée à la sortie du critique. Les réseaux cibles, mis à jour par remplacement doux (moyenne de Polyak), stabilisent l'entraînement.

Espaces d'actions continus

Contrairement aux méthodes basées sur la valeur comme DQN qui gèrent des actions discrètes, DDPG produit des actions continues directement à partir d'un réseau de politique. Cela est réalisé en faisant produire à l'acteur des valeurs d'action déterministes plutôt que des probabilités sur un ensemble discret. Cela rend DDPG adapté au contrôle robotique, à la conduite autonome et à d'autres tâches de contrôle avec des espaces d'actions continus de haute dimension.

Applications et variantes

DDPG a été appliqué en robotique, dans des benchmarks de contrôle simulé (par exemple, MuJoCo) et dans la recherche sur les véhicules autonomes. C'est un algorithme fondateur pour des méthodes ultérieures telles que twin delayed DDPG (TD3) et soft actor-critic (SAC), qui améliorent l'efficacité d'échantillonnage et la stabilité. DDPG est également étroitement lié aux méthodes de gradient de politique déterministe et aux architectures acteur-critique dans Deep learning.

Relation avec d'autres méthodes d'apprentissage par renforcement

DDPG opère dans le champ plus large du Machine learning et spécifiquement du Reinforcement learning, où les agents apprennent des politiques à partir d'interactions. Contrairement au Supervised learning, DDPG ne nécessite pas de données étiquetées ; il apprend à partir de signaux de récompense. Sa nature hors-politique lui permet de réutiliser les expériences passées stockées dans un tampon de relecture, permettant un apprentissage efficace en termes d'échantillons par rapport aux algorithmes sur-politique tels que les méthodes de gradient de politique. En tant que l'un des premiers algorithmes d'apprentissage profond par renforcement pour le contrôle continu, il a influencé la recherche ultérieure en Artificial intelligence et dans les systèmes autonomes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:reinforcement-learning·deep-learning·actor-critic·continuous-control
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique