분포형 소프트 액터-크리틱(DSAC)은 연속 제어 작업을 위해 개발된 강화 학습 알고리즘이다. 이는 소프트 액터-크리틱(SAC) 프레임워크를 기반으로 분포형 강화 학습 원리를 통합한다. 기대 수익을 단일 스칼라 값으로 추정하는 대신, DSAC는 가능한 수익의 전체 분포를 학습하여 더 풍부한 훈련 신호를 제공하고 확률적 동역학 또는 보상 잡음이 있는 환경에서 성능을 향상시킨다. 이 알고리즘은 2020년 Jingliang Duan, Yang Guan, Shengbo Eben Li를 포함한 연구자들에 의해 소개되었으며, 자율 주행 및 로봇 제어 벤치마크에 적용되었다.
DSAC는 최대 엔트로피 강화 학습과 분포형 가치 추정을 통합한다. 핵심 아이디어는 수익 분포와 목표 분포 사이의 Kullback-Leibler 발산을 최소화하면서, 동시에 정책 엔트로피를 최대화하여 탐험을 장려하는 것이다. 이러한 결합을 통해 DSAC는 MuJoCo 및 OpenAI Gym 작업과 같은 표준 연속 제어 벤치마크에서 최첨단 샘플 효율성을 달성하며, 종종 SAC 및 분포형 DQN과 같은 다른 분포형 변형을 능가한다.
알고리즘 개요
DSAC는 세 가지 주요 구성 요소를 유지한다: 정책 네트워크, 가치 분포 네트워크, 목표 가치 분포 네트워크. 가치 분포 네트워크는 C51 및 기타 분포형 Q-러닝 방법에서 사용되는 접근 방식과 유사하게 수익 값에 대한 범주형 분포를 출력한다. 정책은 엔트로피 보너스를 더한 기대 수익을 최대화하도록 훈련되며, 가치 분포는 예측 분포와 목표 분포 사이의 교차 엔트로피를 최소화하는 분포형 벨만 백업을 사용하여 업데이트된다.
DSAC의 주요 혁신은 수익 분포에 엔트로피를 통합하는 소프트 Q-함수의 사용이다. 이는 일반적으로 가치 분포에서 엔트로피를 무시하는 표준 분포형 방법과 다르다. 엔트로피를 포함함으로써 DSAC는 최대 엔트로피 강화 학습의 탐험 이점을 유지하면서 분포형 가치 추정의 이점을 활용한다.
훈련 안정성 및 샘플 효율성
DSAC는 액터-크리틱 방법에서 흔한 여러 안정성 문제를 해결한다. 분포형 표현은 목표 값의 분산을 줄여 더 안정적인 경사 업데이트를 가능하게 한다. 이 알고리즘은 또한 TD3 및 SAC와 유사하게 과대추정 편향을 완화하기 위해 쌍둥이 가치 분포 네트워크를 사용한다. 이러한 설계 선택 덕분에 DSAC는 SAC에 비해 더 적은 환경 상호작용으로 학습할 수 있으며, 데이터 수집 비용이 높은 실제 응용 분야에 특히 적합하다.
실증 결과에 따르면 DSAC는 HalfCheetah, Walker2d, Ant와 같은 작업에서 SAC보다 더 높은 누적 보상을 달성하며, 특히 훈련 초기 단계에서 그러하다. 이 알고리즘은 또한 하이퍼파라미터 변동에 대한 견고성을 보여주어 광범위한 튜닝의 필요성을 줄인다.
응용 분야
DSAC는 복잡한 교통 시나리오에서 차량 가속 및 조향을 제어하는 자율 주행 시뮬레이션에 성공적으로 적용되었다. 가치 함수의 분포형 특성은 교통 동역학의 내재적 불확실성을 처리하는 데 도움이 된다. 로봇 공학에서 DSAC는 조작 작업에 사용되어 에이전트가 고차원 센서 입력에서 정교한 정책을 학습할 수 있게 한다. 이 알고리즘의 샘플 효율성은 물리적 시행이 제한된 실제 로봇 학습에 실현 가능하게 만든다.
확장 및 변형
DSAC의 여러 확장이 제안되었다. 자동 온도 조정이 있는 DSAC(DSAC-T)는 학습 가능한 엔트로피 계수를 도입하여 수동 튜닝의 필요성을 제거한다. 또 다른 변형인 앙상블 분포가 있는 DSAC는 여러 가치 분포를 결합하여 분산을 더욱 줄인다. 연구자들은 또한 학습된 동역학 모델을 사용하여 추가 훈련을 위한 합성 경험을 생성하는 모델 기반 계획과 DSAC를 통합했다.
관련 방법과의 비교
DSAC는 주로 가치 추정 접근 방식에서 SAC와 다르다. SAC는 Q-함수의 점 추정을 학습하는 반면, DSAC는 분포를 학습하여 수익의 불확실성에 대한 더 많은 정보를 제공한다. 분포형 DQN과 비교하여 DSAC는 연속 행동 공간에서 작동하고 최대 엔트로피 탐험을 통합한다. 이 알고리즘은 또한 정책 및 가치 네트워크 모두에 깊은 함수 근사기를 의존하므로 딥러닝 및 신경망 기술과 관련이 있다.
한계 및 향후 방향
DSAC는 분포형 강화 학습에서 일부 한계를 상속받으며, 수익 분포를 유지하는 데 따른 계산 비용 증가가 포함된다. 분포 표현(범주형, 가우시안 또는 분위수)의 선택은 성능에 영향을 미치며 신중한 선택이 필요하다. 향후 연구 방향에는 DSAC를 다중 에이전트 설정으로 확장하고 트랜스포머 아키텍처를 시퀀스 기반 의사 결정에 통합하는 것이 포함되지만, 이러한 확장은 2025년 현재 실험 단계에 머물러 있다.