Dreamer는 모델 기반 강화 학습 알고리즘 계열로, Google DeepMind에서 개발되었으며, 이미지 입력으로부터 복잡한 행동을 높은 샘플 효율로 학습하는 것으로 유명하다. 핵심 아이디어는 에이전트가 과거 경험으로부터 환경의 역학을 반영하는 컴팩트한 잠재 공간 세계 모델을 학습한 다음, 그 잠재 표현 내에서만 미래 상태의 롤아웃을 "상상"하여 정책과 가치 함수를 훈련하는 것이다. 이 접근 방식은 광범위한 실제 상호작용을 요구하는 모델 프리 방식과 대조되며, Dreamer는 더 샘플 효율적인 인공 에이전트를 향한 핵심 단계로 간주된다.
첫 번째 버전인 Dreamer는 2020년 Danijar Hafner, Timothy Lillicrap, Jimmy Ba, Mohammad Norouzi의 논문에서 소개되었다. 이는 잠재 상상(latent imagination) 패러다임을 확립했으며, 에이전트는 순환 상태 공간 모델(RSSM)을 학습하여 관측과 행동을 확률적 잠재 상태로 인코딩한다. 정책은 상상된 잠재 궤적을 통해 가치 기울기를 역전파하여 업데이트된다. DeepMind Control Suite와 Atari 게임의 벤치마크 작업에서 Dreamer는 DQN 및 D4PG와 같은 모델 프리 알고리즘의 성능을 능가하거나 동등했으며, 훨씬 적은 환경 상호작용을 요구했다.
알고리즘 진화
2021년에 발표된 DreamerV2는 세계 모델에서 범주형 분포를 가진 이산 잠재 변수를 도입하여 아키텍처를 개선했다. 이 변경은 KL 균형 및 자유 비트와 같은 기법과 함께 모델의 다중 모드 역학 포착 능력을 향상시켰다. DreamerV2는 단일 하이퍼파라미터 세트로 55개 Atari 게임을 모두 마스터한 최초의 에이전트가 되었으며, 인간 수준 점수를 능가하고 해당 벤치마크에서 샘플 효율적인 RL의 새로운 최첨단을 세웠다.
2023년에 출시된 DreamerV3는 로코모션, 조작, 비디오 게임의 150개 다양한 작업에서 작업별 튜닝 없이 강력한 성능을 달성하여 광범위한 일반성을 입증했다. 안정적인 방법에는 정규화된 예측, symlog 손실 스케일링, 견고한 가치 추정을 위한 기준선 정규화가 포함된다. DreamerV3는 특히 원시 픽셀과 행동만으로 Minecraft 게임에서 다이아몬드를 수집한 최초의 에이전트가 되었으며, 이는 장기 계획과 희소 보상이 필요한 작업으로, 알고리즘의 실용적 견고성을 강조한다.
핵심 구성 요소
Dreamer 계열은 세 가지 학습된 구성 요소에 의존한다. 첫째, 세계 모델 - 잠재 역학을 학습하는 RSSM: 고차원 관측(예: 픽셀)을 컴팩트한 잠재 벡터로 인코딩하고, 행동이 주어졌을 때 후속 잠재 상태를 예측하며, 관측과 보상을 재구성한다. 둘째, 비평가(가치 네트워크)는 모든 잠재 상태에서 기대 할인 수익을 추정한다. 셋째, 행위자(정책 네트워크)는 현재 잠재 상태가 주어졌을 때 행동을 출력한다. 훈련 중에 에이전트는 세계 모델을 사용하여 초기 잠재 상태에서 최대 여러 시간 단계를 상상하고, 비평가를 사용하여 수익을 평가하며, 행위자를 훈련하여 이를 최대화하며, 종종 기울기의 직통 추정을 사용한다.
영향 및 응용
Dreamer의 잠재 상상 접근 방식은 모델 기반 RL의 많은 후속 연구에 영감을 주었으며, 학습된 모델을 사용하지만 다른 표현을 사용하는 MuZero와 같은 알고리즘과 다른 잠재 공간 플래너를 포함한다. 샘플 효율성은 실제 상호작용이 비용이 많이 드는 로봇 공학 및 제어 분야에서 매력적으로 만든다. 연구자들은 휴머노이드를 사용한 로봇 파지 및 자율 주행 시뮬레이션과 같은 실제 작업에 Dreamer 변형을 적용했다. 코드는 오픈 소스로 제공되어 산업 및 학계에서 광범위하게 채택되었으며, 강화 학습에 대한 연구에서 기준선으로 자주 사용된다.
모델 프리 방법과의 비교
심층 Q-네트워크 및 정책 기울기와 같은 모델 프리 알고리즘은 역학 구조를 무시하기 때문에 작업을 마스터하는 데 수백만 단계가 필요하다. Dreamer는 학습된 모델을 활용하여 가상 경험을 생성하므로 로코모션 및 내비게이션과 같은 작업에서 유사한 성능을 위해 실제 환경 상호작용을 최대 10-100배 줄인다. 그러나 모델 기반 방법은 세계 모델의 예측 오류가 누적되는 문제를 겪을 수 있으며, Dreamer는 짧은 상상 지평과 확률적 잠재 상태를 사용하여 이를 완화한다. 매우 고차원적인 관측이나 비정상 역학에서는 모델 프리 방법이 여전히 선호될 수 있다.
더 넓은 맥락
Dreamer는 인공 지능에서 자기 지도 학습과 세계 모델로 향하는 더 큰 추세의 일부이며, 이는 생성형 AI와 모델 기반 계획에도 영향을 미친다. 이는 의사 결정 메커니즘으로서의 정신 시뮬레이션과 상상에 관한 인지 과학의 아이디어와 연결된다. 대규모 언어 모델의 부상과 함께 Dreamer 스타일 세계 모델을 트랜스포머 아키텍처와 통합하여 텍스트와 물리적 환경 모두에 대해 추론할 수 있는 에이전트를 구축하는 연구가 진행 중이다. 알고리즘의 오픈 소스 생태계와 재현 가능한 결과는 현대 AI 연구에서 기본 참고 자료로 만든다.
미래 방향
진행 중인 작업에는 Dreamer를 다중 에이전트 설정으로 확장하고, 계층적 행동 공간과 결합하며, 포인트 클라우드 입력과 같은 고차원 관측을 통한 연속 제어로 확장성을 개선하는 것이 포함된다. 연구자들은 또한 개방형 환경에서 견고성을 개선하기 위해 세계 모델 내 불확실성 정량화를 탐구하고 있다. 계산 리소스가 증가함에 따라 Dreamer 스타일의 잠재 상상은 제한된 데이터로 장기 지평을 계획해야 하는 에이전트의 핵심 구성 요소가 될 것으로 기대된다.