TD3 (Twin Delayed Deep Deterministic Policy Gradient) est un algorithme d'apprentissage profond par renforcement conçu pour les espaces d'actions continus. Il s'agit d'une extension de la méthode Deep Deterministic Policy Gradient (DDPG), introduite pour remédier au biais de surestimation qui dégrade couramment les performances des méthodes acteur-critique. TD3 a été proposé par Scott Fujimoto, Herke van Hoof et David Meger dans leur article de 2018 intitulé « Addressing Function Approximation Error in Actor-Critic Methods ».
L'algorithme combine une architecture acteur-critique avec trois modifications clés : l'apprentissage double-Q écrêté, les mises à jour retardées de la politique et le lissage de la politique cible. Ces changements réduisent collectivement la variance et améliorent la stabilité, faisant de TD3 une référence largement utilisée pour les tâches de contrôle continu dans la recherche en apprentissage automatique.
Mécanisme central
TD3 opère dans le cadre standard de l'apprentissage par renforcement, où un agent interagit avec un environnement pour maximiser une récompense cumulative. Le réseau acteur fait correspondre les états aux actions, tandis que les réseaux critiques estiment le retour attendu (valeur Q) pour les paires état-action. Contrairement à DDPG, qui utilise un seul critique, TD3 maintient deux réseaux critiques et utilise le minimum de leurs estimations lors du calcul des valeurs cibles. Cet apprentissage double-Q écrêté atténue le biais de surestimation résultant des erreurs d'approximation de fonction.
L'algorithme retarde également les mises à jour de la politique : l'acteur est mis à jour moins fréquemment que les critiques (typiquement toutes les deux mises à jour des critiques). Cela permet aux critiques de devenir plus précis avant que la politique ne soit ajustée, réduisant ainsi le risque de mises à jour déstabilisantes. De plus, le lissage de la politique cible ajoute un léger bruit aléatoire aux actions cibles, ce qui régularise les estimations de valeur et empêche la politique d'exploiter des pics étroits dans la fonction Q.
Comparaison avec DDPG
DDPG, introduit par Timothy P. Lillicrap et al. en 2016, a été un algorithme pionnier pour le contrôle continu utilisant des réseaux de neurones profonds. Cependant, il souffrait souvent d'une surestimation des valeurs Q, conduisant à des politiques sous-optimales. TD3 cible directement ce problème en intégrant le mécanisme du double critique et d'autres stabilisations. Des études empiriques sur des tâches de référence telles que les environnements de locomotion MuJoCo (par exemple, HalfCheetah, Walker2d, Hopper) montrent que TD3 surpasse systématiquement DDPG en termes de performance finale et d'efficacité d'échantillonnage.
Contrairement à DDPG, qui met à jour la politique à chaque étape, les mises à jour retardées de TD3 réduisent la corrélation entre les mises à jour de la politique et celles de la fonction de valeur, un facteur contribuant à sa stabilité accrue. Le terme de lissage de la cible agit également comme une forme de régularisation en intelligence artificielle, semblable à l'ajout de bruit dans l'apprentissage supervisé.
Détails d'implémentation
En pratique, TD3 utilise un tampon de relecture d'expérience pour stocker les transitions, à partir duquel des mini-lots sont échantillonnés pour l'entraînement. Les deux réseaux critiques sont mis à jour en utilisant la même valeur cible, calculée comme le minimum des sorties des deux critiques cibles. L'acteur est mis à jour en utilisant le gradient de politique déterministe, mais seulement après un nombre fixe de mises à jour des critiques. Les réseaux cibles pour l'acteur et les critiques sont mis à jour via des mises à jour douces (moyenne de Polyak) avec un petit paramètre tau, typiquement 0,005.
Les hyperparamètres de l'algorithme sont relativement standard : des taux d'apprentissage autour de 1e-3 pour les critiques et de 1e-4 pour l'acteur, un facteur d'actualisation de 0,99 et une taille de lot de 256. Le bruit d'exploration est généralement gaussien avec un écart type de 0,1, tandis que le bruit de lissage de la cible utilise un écart type de 0,2 et est écrêté à une plage de -0,5 à 0,5.
Applications et impact
TD3 est devenu une référence standard dans la recherche en apprentissage par renforcement, en particulier pour les tâches de robotique et de contrôle. Il est fréquemment utilisé dans Berkeley AI Research et d'autres laboratoires académiques pour évaluer de nouveaux algorithmes. Ses principes ont influencé des méthodes ultérieures, telles que Soft Actor-Critic (SAC), qui aborde également la surestimation mais par le biais de la régularisation par l'entropie plutôt que par le double critique.
L'algorithme a été appliqué dans des environnements simulés pour la conduite autonome et la chirurgie robotique, bien que les déploiements dans le monde réel restent limités. Dans l'industrie, OpenAI et Google DeepMind ont exploré des approches acteur-critique similaires pour le contrôle continu, bien que TD3 lui-même soit principalement un outil de recherche.
Limites et extensions
TD3 suppose que l'environnement est markovien et que la politique est déterministe, ce qui peut limiter l'exploration. Des variantes telles que TD3+BC (avec clonage de comportement) ont été proposées pour l'apprentissage par renforcement hors ligne, où l'agent apprend à partir d'un ensemble de données fixe. D'autres extensions incluent des critiques distributionnels et des méthodes d'ensemble pour réduire davantage la variance.
Malgré ses forces, TD3 peut être sensible au réglage des hyperparamètres et peut rencontrer des difficultés dans des environnements de grande dimension ou partiellement observables. Les chercheurs continuent de développer son cadre, ce qui en fait une contribution fondamentale à l'apprentissage par renforcement profond moderne.
Voir aussi
- Apprentissage par renforcement profond
- Méthodes acteur-critique
- Contrôle continu
- Soft Actor-Critic