개요
정책 경사 방법은 강화 학습 알고리즘의 한 종류이며, 정책 최적화 방법의 하위 분류입니다. 가치 함수를 학습하여 정책을 도출하는 가치 기반 방법과 달리, 정책 최적화 방법은 가치 함수를 참조하지 않고 행동을 선택하는 정책 함수를 직접 학습합니다. 정책 경사를 적용하려면 정책 함수가 미분 가능한 매개변수(일반적으로 세타로 표기)로 매개변수화되어야 하며, 목표는 정책 매개변수에 대한 경사 상승법을 통해 기대 누적 보상을 최대화하는 것입니다.
이러한 방법들은 현대 강화 학습의 핵심이며, 로봇 공학, 게임, 자율 시스템 등 다양한 분야에 적용되었습니다. 특히 연속적인 행동 공간을 가진 환경에서 유용한데, 이러한 환경에서는 가치 기반 방법이 종종 어려움을 겪습니다. 정책 경사 방법은 확률적 샘플링에 의존하여 경사를 추정하기 때문에 "몬테카를로 경사 추정"이라는 이름으로도 연구됩니다.
REINFORCE
REINFORCE 알고리즘은 1992년 Ronald J. Williams에 의해 소개된 최초의 정책 경사 방법입니다. 이는 정책 경사를 궤적의 로그 정책과 총 보상의 곱에 대한 기대값으로 표현하는 기본적인 항등식에 기반합니다. 주요 개선점은 "인과성 트릭"으로, 각 행동을 해당 시점 이후의 보상으로만 가중하여 분산을 줄이면서도 편향을 도입하지 않습니다. REINFORCE는 몬테카를로 방법으로, 전체 에피소드를 사용하여 경사를 추정하므로 분산이 높을 수 있지만 구현이 간단하다는 장점이 있습니다.
행위자-비평가 방법
행위자-비평가 방법은 정책 경사와 가치 함수 근사를 결합하여 분산을 줄입니다. 행위자(actor)는 정책 네트워크를, 비평가(critic)는 가치 함수를 추정하며, 이 가치 함수는 기준선이나 우세 함수를 계산하는 데 사용됩니다. 이를 통해 순수한 REINFORCE보다 더 안정적이고 샘플 효율적인 학습이 가능합니다. 대표적인 예로 A2C(Advantage Actor-Critic)와 A3C(Asynchronous Advantage Actor-Critic)가 있으며, 이들은 심층 강화 학습에서 널리 사용되었습니다.
현대적 변형
현대의 정책 경사 방법으로는 PPO(Proximal Policy Optimization)와 TRPO(Trust Region Policy Optimization)가 있습니다. 이들은 정책 업데이트를 제한하여 파괴적인 큰 변화를 방지합니다. 이러한 방법들은 심층 강화 학습에서 표준이 되었으며, Dota 2나 StarCraft II와 같은 게임, 로봇 공학, 자율 주행 연구 등에 사용됩니다.
응용 및 과제
정책 경사 방법은 인공지능 연구, 머신 러닝 시스템, 딥 러닝 프레임워크 등 다양한 분야에 적용되었습니다. 특히 로봇 조작 및 보행과 같은 연속 제어 작업에 효과적입니다. 그러나 높은 샘플 복잡성과 하이퍼파라미터에 대한 민감성 같은 과제가 남아 있으며, 신경망 아키텍처와 최적화 기법의 발전을 통해 이러한 문제를 해결하기 위한 연구가 계속되고 있습니다.
정책 경사 방법은 또한 대규모 언어 모델 훈련과도 관련이 있습니다. RLHF(Reinforcement Learning from Human Feedback)는 정책 경사 스타일의 업데이트를 사용하여 모델을 인간의 선호에 맞춰 정렬합니다. 이는 전통적인 강화 학습 환경을 넘어선 이러한 알고리즘의 광범위한 적용 가능성을 보여줍니다.