Deep Deterministic Policy Gradient(DDPG)은 연속적인 행동 공간을 처리하기 위해 배우-비평가 구조와 심층 신경망을 결합한 강화 학습 알고리즘이다. 이 알고리즘은 2016년 구글 딥마인드 연구자들에 의해 소개되었으며, 결정적 정책 기울기 정리에 기반을 두고, 경험 재생 및 목표 네트워크와 같은 심층 Q-러닝의 기법을 적용하여 훈련 안정성을 향상시킨다. DDPG는 행동이 이산적 선택이 아닌 연속적인 값인 환경을 위해 설계되어, 로봇 공학 및 시뮬레이션의 제어 작업에 적합하다.
이 알고리즘은 에이전트가 마르코프 결정 과정으로 모델링된 환경과 상호작용하는 표준 강화 학습 프레임워크 내에서 작동한다. 각 시간 단계에서 에이전트는 상태를 관찰하고, 행동을 선택하며, 보상을 받고, 새로운 상태로 전환한다. DDPG는 상태를 행동에 매핑하는 배우와 주어진 상태-행동 쌍에 대한 기대 수익을 추정하는 비평가라는 두 개의 신경망을 사용하여 누적 보상 신호를 최대화하는 정책을 학습한다.
알고리즘 구조
DDPG는 정책과 가치 함수 학습을 분리하는 배우-비평가 구조를 사용한다. 배우 네트워크는 주어진 상태에 대해 결정적 행동을 출력하고, 비평가 네트워크는 종종 Q(s,a)로 표시되는 행동-가치 함수를 추정하여 해당 행동의 품질을 평가한다. 훈련은 비평가가 실제 수익을 더 잘 근사하도록 업데이트하고, 배우가 비평가의 추정치를 최대화하는 행동을 선택하도록 업데이트하는 것을 번갈아 수행한다.
안정성을 향상시키기 위해 DDPG는 소프트 업데이트가 있는 목표 네트워크를 사용한다. 목표 네트워크는 일반적으로 0.001인 혼합 매개변수를 사용하여 학습된 네트워크를 천천히 추적하는 배우와 비평가의 복사본이다. 이 기법은 훈련 중 발산 위험을 줄이며, 심층 Q-러닝 방법에서 차용되었다.
탐험과 경험 재생
DDPG는 결정적 정책을 학습하기 때문에, 일반적으로 Ornstein-Uhlenbeck 과정을 사용하여 훈련 중 행동 선택에 노이즈를 추가함으로써 탐험-활용 딜레마를 해결한다. 이를 통해 에이전트는 최적 행동으로 이동하면서도 환경을 탐험할 수 있다. 이 알고리즘은 또한 과거 전환을 저장하는 재생 버퍼를 사용하며, 학습 중에 경험의 미니 배치가 이 버퍼에서 균일하게 샘플링되어 시간적 상관관계를 깨고 샘플 효율성을 향상시킨다. 이러한 설계 선택은 DDPG가 로봇 공학 및 제어 응용 분야에서 흔한 연속 행동 공간을 처리할 수 있게 한다.
알고리즘 설명
DDPG의 핵심은 배우-비평가 구조이다. 비평가는 벨만 방정식을 사용하여 행동-가치 함수를 근사하도록 훈련되며, 예측된 Q-값과 목표 Q-값 사이의 평균 제곱 오차를 최소화한다. 배우는 결정적 정책 기울기 정리를 사용하여 업데이트되며, 비평가의 출력에 적용된 연쇄 법칙을 통해 배우의 매개변수에 대한 기대 수익의 기울기를 계산한다. 소프트 대체(폴리악 평균화)를 통해 업데이트되는 목표 네트워크는 훈련을 안정화한다.
연속 행동 공간
이산 행동을 처리하는 DQN과 같은 가치 기반 방법과 달리, DDPG는 정책 네트워크에서 직접 연속 행동을 출력한다. 이는 배우가 이산 집합에 대한 확률이 아닌 결정적 행동 값을 생성함으로써 달성된다.这使得DDPG适用于机器人控制、自动驾驶以及其他具有高维连续动作空间的控制任务。
응용 및 변형
DDPG는 로봇 공학, 시뮬레이션 제어 벤치마크(예: MuJoCo) 및 자율 주행 차량 연구에 적용되었다. 이는 샘플 효율성과 안정성을 개선하는 트윈 지연 DDPG(TD3) 및 소프트 배우-비평가(SAC)와 같은 후속 방법의 기초 알고리즘이다. DDPG는 또한 심층 학습의 결정적 정책 기울기 방법 및 배우-비평가 구조와 밀접하게 관련되어 있다.
다른 RL 방법과의 관계
DDPG는 에이전트가 상호작용에서 정책을 학습하는 기계 학습 및 특히 강화 학습의 더 넓은 분야 내에서 작동한다. 지도 학습과 달리, DDPG는 레이블된 데이터를 요구하지 않으며 보상 신호에서 학습한다. 그 오프-정책 특성은 재생 버퍼에 저장된 과거 경험을 재사용할 수 있게 하여, 정책 기울기 방법과 같은 온-정책 알고리즘에 비해 샘플 효율적인 학습을 가능하게 한다. 연속 제어를 위한 초기 심층 RL 알고리즘 중 하나로서, 인공 지능 및 자율 시스템의 후속 연구에 영향을 미쳤다.