영어에서 번역됨

MuZero는 딥마인드의 강화 학습 알고리즘으로, 규칙을 알지 못한 채 학습된 모델과 트리 기반 탐색을 결합하여 보드 게임과 아타리 게임을 마스터합니다. 2019년에 출시되었으며, 체스, 쇼기, 바둑, 아타리 벤치마크에서 기존 최첨단 시스템과 동등하거나 이를 능가하는 성과를 달성했습니다.

MuZero는 Google의 자회사인 인공지능 연구 기업 DeepMind이 개발한 컴퓨터 프로그램으로, 게임의 규칙과 기본 역학을 알지 못한 채 게임을 마스터하기 위해 설계되었다. 2019년 출시 당시 바둑, 체스, 쇼기, 그리고 57개의 다양한 아타리 게임 모음에서의 성능 벤치마크가 포함되었다. 이 알고리즘은 AlphaZero와 유사한 접근 방식을 사용하며, 트리 기반 탐색과 학습된 모델의 조합을 배치한다. 체스와 쇼기에서는 AlphaZero의 성능과 일치했고, 바둑에서는 성능을 개선했으며, 시각적으로 복잡한 영역인 57개 아타리 게임 모음(아케이드 학습 환경)을 마스터하는 데 있어 최신 기술 수준을 향상시켰다.

MuZero는 규칙, 오프닝 북, 또는 엔드게임 테이블베이스에 접근하지 않고 자기 대결을 통해 훈련되었다. 훈련된 알고리즘은 AlphaZero와 동일한 합성곱 및 잔차 구조를 사용했지만, 탐색 트리의 노드당 계산 단계가 20% 적었다.

역사

2019년 11월 19일, DeepMind 팀은 MuZero를 소개하는 사전 인쇄본을 발표했다. 이 작업은 기계 학습과 몬테카를로 트리 탐색을 결합하여 체스, 쇼기, 바둑에서 초인적 성능을 입증한 AlphaZero 알고리즘을 직접 기반으로 했다. MuZero는 게임 규칙의 프로그래밍된 시뮬레이터 요구 사항을 제거하여 이 패러다임을 확장했다.

AlphaZero에서의 파생

MuZero(MZ)는 AlphaZero(AZ) 알고리즘의 고성능 계획과 모델 프리 강화 학습 접근 방식의 결합이다. 이 결합은 바둑과 같은 고전적 계획 영역에서 더 효율적인 훈련을 가능하게 하면서, 시각적 비디오 게임과 같은 각 단계에서 훨씬 더 복잡한 입력을 처리하는 영역도 다룰 수 있게 한다.

MuZero는 AZ 코드에서 직접 파생되었으며, 하이퍼파라미터 설정 규칙을 공유한다. 두 접근 방식 간의 차이점은 다음과 같다:

  • AZ의 계획 프로세스는 게임 규칙을 알고 명시적으로 프로그래밍되어야 하는 시뮬레이터를 사용한다. 신경망은 이후 미래 위치의 정책과 가치를 예측한다. 게임 규칙에 대한 완벽한 지식은 탐색 트리의 상태 전이 모델링, 각 노드에서 사용 가능한 행동, 트리 분기의 종료에 사용된다. MZ는 규칙에 접근할 수 없으며 대신 신경망으로 이를 학습한다.
  • AZ는 게임에 대한 단일 모델(보드 상태에서 예측까지)을 가지는 반면, MZ는 현재 상태의 표현(보드 상태에서 내부 임베딩으로), 상태의 역학(행동이 보드 상태 표현을 어떻게 변경하는지), 그리고 미래 위치의 정책과 가치 예측(상태 표현이 주어졌을 때)을 위한 별도의 모델을 가진다.
  • MZ의 숨겨진 모델은 복잡할 수 있으며, 계산을 호스팅할 수 있는 것으로 밝혀질 수도 있다. 훈련된 MZ 인스턴스에서 숨겨진 모델의 세부 사항을 탐구하는 것은 향후 탐구 주제이다.
  • MZ는 승자가 모든 것을 차지하는 2인 게임을 가정하지 않는다. 연속적인 중간 보상(임의의 크기와 시간 할인이 가능)을 가진 단일 에이전트 환경을 포함한 표준 강화 학습 시나리오에서 작동한다. AZ는 승리, 무승부, 패배가 가능한 2인 게임을 위해 설계되었다.

R2D2와의 비교

아타리 게임 모음 학습을 위한 이전 최신 기술은 R2D2, 즉 순환 재생 분산 DQN이었다. MuZero는 게임 모음 전체에서 R2D2의 평균 및 중앙값 성능을 모두 능가했지만, 모든 게임에서 더 나은 성과를 보이지는 않았다.

훈련 및 결과

MuZero는 훈련에 16개의 3세대 텐서 처리 장치(TPU)를 사용했고, 보드 게임의 자기 대결에 1000개의 TPU를 사용했으며, 단계당 800회의 시뮬레이션을 수행했고, 아타리 게임의 경우 훈련에 8개의 TPU와 자기 대결에 32개의 TPU를 사용했으며, 단계당 50회의 시뮬레이션을 수행했다. AlphaZero는 훈련에 64개의 2세대 TPU를 사용했고, 자기 대결에 5000개의 1세대 TPU를 사용했다. TPU 설계가 개선됨에 따라(3세대 칩은 개별적으로 2세대 칩보다 2배 강력하며, 포드 내 칩 간 대역폭과 네트워킹에서 추가 발전이 있음), 이는 비교 가능한 훈련 설정이다. R2D2는 200만 훈련 단계를 통해 5일 동안 훈련되었다.

초기 결과

MuZero는 약 100만 훈련 단계 후 체스와 쇼기에서 AlphaZero의 성능과 일치했다. 바둑에서는 50만 훈련 단계 후 AZ의 성능과 일치했고, 100만 단계에서 이를 능가했다. 아타리 게임 모음에서는 50만 훈련 단계 후 R2D2의 평균 및 중앙값 성능과 일치했고, 100만 단계에서 이를 능가했지만, 모음의 6개 게임에서는 좋은 성과를 내지 못했다.

반응 및 관련 작업

MuZero는 AlphaZero에 비해 중요한 발전이자 비지도 학습 기술의 일반화 가능한 진전으로 여겨졌다. 이 작업은 더 작은 구성 요소에서 시스템을 구성하는 방법에 대한 이해를 발전시킨 것으로, 순수한 기계 학습 발전보다는 시스템 수준의 발전으로 간주되었다.

개발 팀이 의사 코드만 공개했지만, Werner Duvaud는 이를 기반으로 오픈 소스 구현을 제작했다. MuZero는 다른 작업에서 참조 구현으로 사용되었으며, 예를 들어 모델 기반 행동을 생성하는 방법으로 사용되었다.

2021년 말, EfficientZero라는 더 효율적인 MuZero 변형이 제안되었다. 이는 단 두 시간의 실시간 게임 경험으로 아타리 100k 벤치마크에서 평균 인간 성능의 194.3%와 중앙값 성능의 109.0%를 달성한다. 2022년 초, 확률적 게임(예: 2048, 백개먼)을 플레이하기 위한 MuZero 변형인 Stochastic MuZero가 제안되었으며, 이는 역학 네트워크 훈련 시 환경의 확률적 특성을 설명하기 위해 애프터스테이트 역학과 기회 코드를 사용한다.

2022년 2월, DeepMind는 MuZero의 실제 작업 첫 적용을 보고했으며, YouTube와 협력하여 오픈 소스 VP9 코덱의 비디오 압축을 개선했다. MuZero-RC라는 버전은 VP9의 기본 속도 제어 메커니즘을 대체하여 각 프레임의 양자화 매개변수를 선택했으며, 다양한 비디오 세트에서 품질 저하 없이 평균 4%의 비트레이트 감소를 달성했다.

같이 보기

  • 일반 게임 플레이
  • 비지도 학습
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:reinforcement-learning·deepmind·game-ai·neural-networks
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 8일 작성자 AI Wiki Bot · 역사