심층 강화 학습(deep reinforcement learning, deep RL)은 강화 학습(RL)과 심층 학습을 결합한 기계 학습의 하위 분야이다. RL은 계산 에이전트가 시행착오를 통해 의사 결정을 학습하는 방법에 초점을 맞추는 반면, 심층 학습은 복잡하고 고차원적인 데이터를 처리하는 도구를 제공한다. 심층 신경망을 통합함으로써, deep RL은 에이전트가 수동 특징 공학 없이 원시 카메라 이미지나 센서 판독값과 같은 비구조화된 입력에서 직접 정책을 도출할 수 있게 한다. 이러한 접근 방식은 비디오 게임과 로봇 공학에서 자연어 처리와 의료에 이르기까지 다양한 분야에서 돌파구를 마련했다.
RL의 핵심 문제는 종종 마르코프 결정 과정(MDP)으로 모델링되며, 에이전트는 각 시간 단계에서 상태를 점유하고, 행동을 선택하고, 스칼라 보상을 받고, 환경 역학에 따라 새로운 상태로 전환한다. 에이전트의 목표는 기대 누적 보상을 최대화하는 정책(관찰에서 행동으로의 매핑)을 학습하는 것이다. 전통적인 RL 알고리즘은 상태가 비디오 프레임의 모든 픽셀과 같이 고차원적일 때 어려움을 겪는다. Deep RL은 정책이나 가치 함수, Q-함수와 같은 다른 학습 함수를 신경망으로 표현함으로써 이 문제를 해결하여 복잡한 환경에서 확장 가능한 의사 결정을 가능하게 한다.
역사적 발전
신경망과 강화 학습의 결합에 대한 관심은 1980년대 중반 신경망 부흥과 함께 성장했다. 이러한 시스템에서 센서에서 모터까지의 전체 의사 결정 파이프라인은 단일 네트워크가 될 수 있으며, 때로는 종단 간 강화 학습이라고도 한다. 가장 초기의 성공 사례 중 하나는 1992년에 개발된 백개먼 프로그램인 TD-Gammon이었다. 이 프로그램은 말 위치를 나타내는 198개의 입력 신호를 사용했으며, 내장된 도메인 지식 없이 자기 대결과 TD(λ) 알고리즘을 통해 중간 수준으로 플레이하는 법을 학습했다.
Sutton과 Barto의 강화 학습 연구와 Bertsekas 및 Tsitiklis의 신경 역학 프로그래밍 연구를 포함한 기념비적인 교과서는 이론적 이해를 발전시켰다. Katsunari Shibata 그룹과 같은 연구자들은 이미지 인식, 색상 항상성, 손-눈 협응, 선택적 주의와 같은 다양한 인지 기능이 이 프레임워크 내에서 나타날 수 있음을 입증했다. 그러나 진행은 계산 제약과 심층 네트워크를 효과적으로 훈련하는 어려움으로 인해 제한되었다.
2012년경의 심층 학습 혁명은 많은 분야에서 함수 근사기로서 심층 신경망을 사용하는 데 대한 관심을 다시 불러일으켰다. 이는 연구자들이 RL 알고리즘을 재검토하고 정책, 가치 함수 및 Q-함수를 표현하기 위해 심층 네트워크를 적용하도록 촉발했다. 이러한 결합은 변혁적임이 입증되었으며, 알고리즘 설계와 실제 응용 모두에서 빠른 발전을 이끌었다.
게임에서의 주요 돌파구
2013년경부터 DeepMind는 deep RL을 사용하여 Atari 비디오 게임을 플레이하는 인상적인 결과를 입증했다. 그들의 심층 Q-네트워크(DQN)는 84x84 RGB 픽셀의 4개 프레임을 입력으로 처리하는 합성곱 신경망을 사용했으며, 게임 점수를 보상으로 사용했다. 49개의 게임에서 동일한 아키텍처와 최소한의 사전 지식으로 거의 모든 타이틀에서 경쟁 방법을 능가했으며, 전문 인간 테스터와 비슷하거나 우수한 성능을 달성했다.
2015년, AlphaGo는 전체 19x19 보드에서 핸디캡 없이 인간 프로 바둑 기사를 이긴 최초의 컴퓨터 프로그램이 되었으며, 이는 수십 년 후에나 가능할 것으로 여겨졌던 이정표였다. AlphaGo는 심층 신경망과 몬테카를로 트리 탐색을 결합했으며, 인간 게임과 자기 대결에서 학습했다. 2017년, AlphaZero는 이 접근 방식을 일반화하여 규칙 외에는 게임별 지식 없이 동일한 알고리즘으로 바둑, 체스, 쇼기를 초인간적 수준으로 마스터했다. 2019년에 도입된 MuZero는 환경 모델 자체를 학습함으로써 더욱 개선되었다.
다른 주목할 만한 성과로는 2019년 카네기 멜론 대학 연구자들이 개발한 Pluribus가 있으며, 이는 멀티플레이어 노리밋 텍사스 홀덤에서 프로 선수를 이긴 최초의 프로그램이 되었다. 같은 해, OpenAI Five는 5대5 Dota 2 시범 경기에서 현 세계 챔피언을 물리치고 복잡한 다중 에이전트 전략 게임을 처리하는 deep RL의 능력을 보여주었다.
핵심 알고리즘 및 기법
Deep RL 알고리즘은 일반적으로 여러 범주로 나뉜다. DQN과 같은 가치 기반 방법은 기대 수익을 추정하는 행동-가치 함수 Q(s,a)를 학습한 다음 가장 높은 Q-값을 가진 행동을 선택하여 정책을 도출한다. 정책 기반 방법은 종종 정책 경사 기법을 사용하여 정책 네트워크를 직접 최적화한다. 행위자-비평가 방법은 정책을 위한 행위자 네트워크와 가치 추정을 위한 비평가 네트워크로 둘 다 결합하여 안정성과 샘플 효율성을 개선한다.
훈련 안정성을 위해 몇 가지 혁신이 중요했다. 경험 재생은 과거 전환을 저장하고 무작위로 샘플링하여 순차 데이터의 상관 관계를 깨뜨린다. 대상 네트워크는 고정된 Q-값 대상을 제공하여 발산을 줄인다. Gradient Clipping 및 Batch Normalization과 같은 기법은 훈련 역학을 관리하는 데 도움이 된다. 연속 제어 작업의 경우 DDPG 및 SAC와 같은 알고리즘이 이러한 아이디어를 확장하며, Residual Network (ResNet) 아키텍처와 Layer Normalization은 심층 네트워크를 효과적으로 처리하기 위해 자주 사용된다.
게임 외 응용 분야
Deep RL은 다양한 분야에서 응용을 찾았다. 로봇 공학에서는 에이전트가 카메라나 센서 입력에서 직접 파악 및 조작과 같은 복잡한 운동 기술을 학습할 수 있게 한다. 이는 시뮬레이션 및 실제 환경 모두에서 입증되었으며, Figure AI 및 Sanctuary AI와 같은 회사는 RL로 훈련된 휴머노이드 로봇을 탐구하고 있다. 자율 주행에서 deep RL은 Waymo 및 Tesla의 노력에서 볼 수 있듯이 내비게이션과 의사 결정에 도움이 된다.
자연어 처리에서 deep RL은 보상이 인간 피드백이나 작업별 지표에서 올 수 있는 대화 생성 및 요약과 같은 작업에 사용된다. 의료 응용에는 개인화된 치료 정책과 약물 발견이 포함되며, RL은 순차적 결정을 최적화한다. 금융에서 deep RL은 알고리즘 거래와 포트폴리오 관리를 지원하며, 교육에서는 학생 요구에 맞게 콘텐츠를 조정하는 적응형 튜터링 시스템을 구동한다.
과제 및 한계
성공에도 불구하고 deep RL은 상당한 과제에 직면한다. 샘플 효율성은 여전히 주요 문제로, 많은 알고리즘이 학습하는 데 수백만 번의 상호 작용을 필요로 하여 실제 배포를 제한한다. 보상 설계는 종종 어렵고, 희소하거나 잘못 지정된 보상은 학습을 방해할 수 있다. 탐험-활용 트레이드오프는 고차원 공간에서 특히 심각하며, 무작위 탐험은 비효율적이다.
안정성과 재현성도 우려 사항이다. Deep RL 훈련은 하이퍼파라미터, 무작위 시드 및 네트워크 아키텍처에 민감할 수 있어 실행 간에 일관되지 않은 결과를 초래한다. 심층 함수 근사기에 대한 이론적 보장이 부족하다는 것은 성능이 예측 불가능할 수 있음을 의미한다. 또한 의료 및 자율 주행과 같은 분야에서는 오류가 심각한 결과를 초래하므로 안전성과 해석 가능성이 중요하다. 연구자들은 Curriculum Learning, Reinforcement Learning from AI Feedback (RLAIF) 및 개선된 탐험 방법과 같은 기법을 통해 이러한 문제를 적극적으로 해결하고 있다.
다른 AI 분야와의 관계
Deep RL은 여러 AI 학문의 교차점에 있다. 표현 학습을 위해 Deep learning을, 의사 결정을 위해 Reinforcement learning을, 함수 근사를 위해 Neural network 이론을 활용한다. 레이블된 데이터에 의존하는 Supervised learning 접근 방식과 명시적 보상 없이 패턴을 찾는 Unsupervised learning과는 구별된다. 그러나 deep RL은 종종 모방 학습이나 전문가 시연에 대한 사전 훈련과 같은 지도 구성 요소를 통합한다.
이 분야는 또한 콘텐츠 생성 또는 상호 작용 환경을 위한 정책을 학습하는 모델을 통해 Generative AI와 연결된다. Large language model 연구는 특히 RLHF와 같은 기법을 통해 RL을 통합하기 시작했으며, 여기서 모델은 인간 선호도에 따라 미세 조정된다. 이러한 시너지는 OpenAI, Anthropic 및 Google DeepMind와 같은 조직의 작업에서 분명하며, 이들은 deep RL을 다른 방법과 결합하여 더 강력한 시스템을 만든다.
미래 방향
앞으로 deep RL은 더 나은 탐험 전략, 환경 역학을 학습하는 모델 기반 방법, 새로운 작업에 빠르게 적응하는 메타 학습 접근 방식을 통해 샘플 효율성을 개선하는 데 초점을 맞출 가능성이 높다. 여러 에이전트가 학습하고 상호 작용하는 다중 에이전트 deep RL은 게임, 경제 및 로봇 공학에 응용되는 활발한 영역이다. 작업 간 전이 학습과 일반화는 핵심 목표로 남아 있으며, deep RL을 더 견고하고 해석 가능하게 만드는 것도 마찬가지이다.
AWS Trainium 및 Google Cloud TPU와 같은 특수 가속기와 같은 하드웨어 발전은 더 큰 규모의 훈련을 가능하게 하고 있다. MIT CSAIL, Stanford AI Lab 및 BAIR (Berkeley AI Research)와 같은 연구 기관은 이론적 및 실용적 경계를 계속 확장하고 있다. Deep RL이 성숙함에 따라 다른 AI 패러다임과의 통합은 자율 시스템, 개인화 서비스 및 과학적 발견에서 새로운 능력을 잠금 해제할 것을 약속한다.