DDPG(深度确定性策略梯度)

英語からの翻訳

Deep Deterministic Policy Gradient(DDPG)是一种无模型的离策略演员-评论家强化学习算法,专为连续动作空间设计,结合了DQN的经验回放和目标网络与确定性策略梯度。

Deep Deterministic Policy Gradient(DDPG)は、アクター・クリティックアーキテクチャと深層ニューラルネットワークを組み合わせて連続行動空間を扱う強化学習アルゴリズムである。2016年にGoogle DeepMindの研究者によって導入され、決定論的方策勾配定理に基づき、経験再生やターゲットネットワークなどの深層Q学習の手法を適応させて学習の安定性を向上させている。DDPGは、行動が離散的な選択ではなく連続値である環境向けに設計されており、ロボット工学やシミュレーションにおける制御タスクに適している。

このアルゴリズムは、エージェントがマルコフ決定過程としてモデル化された環境と相互作用する標準的な強化学習フレームワーク内で動作する。各タイムステップで、エージェントは状態を観測し、行動を選択し、報酬を受け取り、新しい状態へ遷移する。DDPGは、累積報酬信号を最大化する方策を学習するために、状態を行動にマッピングするアクターと、与えられた状態・行動ペアに対する期待報酬を推定するクリティックという2つのニューラルネットワークを使用する。

アルゴリズムのアーキテクチャ

DDPGは、方策学習と価値関数学習を分離するアクター・クリティックアーキテクチャを使用する。アクターネットワークは、与えられた状態に対して決定論的な行動を出力し、クリティックネットワークは、行動価値関数(しばしばQ(s,a)と表記される)を推定することでその行動の質を評価する。学習は、クリティックを真の報酬に近づけるように更新することと、アクターをクリティックの推定値を最大化する行動を選択するように更新することの間で交互に行われる。

安定性を向上させるため、DDPGはソフト更新を伴うターゲットネットワークを採用している。ターゲットネットワークは、学習されたネットワークをゆっくりと追跡するアクターとクリティックのコピーであり、通常0.001の混合パラメータを使用する。この手法は、学習中の発散リスクを低減し、深層Q学習の手法から借用されている。

探索と経験再生

DDPGは決定論的な方策を学習するため、学習中の行動選択にノイズを加えることで探索と活用のジレンマに対処しており、通常はOrnstein-Uhlenbeck過程を使用する。これにより、エージェントは最適な行動へ向かいながら環境を探索できる。また、アルゴリズムは過去の遷移を保存する再生バッファを使用し、学習中に経験のミニバッチをこのバッファから一様にサンプリングして、時間的相関を断ち切りサンプル効率を向上させる。これらの設計選択により、DDPGはロボット工学や制御アプリケーションで一般的な連続行動空間を扱うことができる。

アルゴリズムの説明

DDPGの中核はアクター・クリティックアーキテクチャである。クリティックは、ベルマン方程式を用いて行動価値関数を近似するように訓練され、予測されたQ値とターゲットQ値の間の平均二乗誤差を最小化する。アクターは、決定論的方策勾配定理を用いて更新され、クリティックの出力に連鎖律を適用することで、アクターのパラメータに関する期待報酬の勾配を計算する。ソフト置換(ポリアック平均)によって更新されるターゲットネットワークが、学習を安定させる。

連続行動空間

離散的な行動を扱うDQNのような価値ベースの手法とは異なり、DDPGは方策ネットワークから直接連続的な行動を出力する。これは、アクターが離散的な集合上の確率ではなく決定論的な行動値を生成することで実現される。これにより、DDPGはロボット制御、自動運転、および高次元の連続行動空間を持つ他の制御タスクに適している。

応用と変種

DDPGは、ロボット工学、シミュレーション制御ベンチマーク(例:MuJoCo)、および自動運転車の研究に応用されている。これは、後の手法であるTwin Delayed DDPG(TD3)やSoft Actor-Critic(SAC)などの基礎となるアルゴリズムであり、これらはサンプル効率と安定性を改善している。DDPGはまた、深層学習における決定論的方策勾配法やアクター・クリティックアーキテクチャと密接に関連している。

他のRL手法との関係

DDPGは、エージェントが相互作用から方策を学習する機械学習、特に強化学習の広範な分野内で動作する。教師あり学習とは異なり、DDPGはラベル付きデータを必要とせず、報酬信号から学習する。そのオフポリシーな性質により、再生バッファに保存された過去の経験を再利用でき、ポリシー勾配法などのオンポリシーアルゴリズムと比較してサンプル効率的な学習を可能にする。連続制御のための初期の深層RLアルゴリズムの1つとして、その後の人工知能や自律システムの研究に影響を与えた。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:reinforcement-learning·deep-learning·actor-critic·continuous-control
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴