MuZero は、Google の子会社である人工知能研究企業 DeepMind が開発したコンピュータプログラムであり、ルールや基礎となるダイナミクスを知らなくてもゲームを習得できる。2019年に発表され、囲碁、チェス、将棋、および57種類のAtariゲーム群におけるパフォーマンスのベンチマークが示された。このアルゴリズムは、AlphaZero に似たアプローチを用いており、木探索と学習済みモデルを組み合わせている。囲碁と将棋ではAlphaZeroと同等の性能を達成し、囲碁ではそれを上回り、視覚的に複雑な領域である57種類のAtariゲーム(Arcade Learning Environment)群では、当時の最先端技術を改善した。
MuZero は、ルール、オープニングブック、エンドゲームデータベースにアクセスすることなく、自己対戦のみで訓練された。訓練済みアルゴリズムは、AlphaZero と同じ畳み込みおよび残差アーキテクチャを使用するが、探索木の各ノードあたりの計算ステップが20%少ない。
歴史
2019年11月19日、DeepMind チームは MuZero を紹介するプレプリントを公開した。この研究は、チェス、将棋、囲碁において機械学習とモンテカルロ木探索を組み合わせることで人間を超える性能を実証した AlphaZero アルゴリズムを直接基盤としている。MuZero は、ゲームルールのプログラムされたシミュレータを必要としないという点で、このパラダイムを拡張した。
AlphaZero からの派生
MuZero (MZ) は、AlphaZero (AZ) の高性能な計画アルゴリズムと、モデルフリーの強化学習アプローチを組み合わせたものである。この組み合わせにより、囲碁などの古典的な計画領域での訓練効率が向上し、視覚的なビデオゲームなど、各段階でより複雑な入力を持つ領域も扱えるようになった。
MuZero は AZ のコードから直接派生しており、ハイパーパラメータ設定の規則を共有している。主な違いは以下の通りである。
- AZ の計画プロセスは、ゲームのルールを知っており、明示的にプログラムされたシミュレータを使用する。ニューラルネットワークは、現在の位置から方針と価値を予測するために使用される。ゲームルールの完全な知識は、探索木内の状態遷移、各ノードで利用可能なアクション、および木の分岐の終了をモデル化するために使用される。MZ はルールにアクセスできず、代わりにニューラルネットワークを使用してルールを学習する。
- AZ はゲームの単一のモデル(盤面状態から予測へ)を持つが、MZ は現在の状態の表現(盤面状態から内部埋め込みへ)、状態のダイナミクス(アクションが盤面状態の表現をどのように変えるか)、および将来の位置の方針と価値の予測という、別々のモデルを持つ。
- MZ の隠れモデルは複雑になる可能性があり、訓練された MZ インスタンス内の隠れモデルの詳細を調査することは、将来の研究課題である。
- MZ は、勝者総取りの二人用ゲームを想定していない。連続的な中間報酬と時間割引を伴う単一エージェント環境を含む、標準的な強化学習シナリオで機能する。AZ は、勝ち、負け、引き分けがあり得る二人用ゲーム用に設計されていた。
R2D2 との比較
Atari ゲーム群を学習するための従来の最先端技術は、R2D2(リカレント・リプレイ・分散型 DQN)であった。MuZero は、ゲーム群全体での平均および中央値のパフォーマンスにおいて R2D2 を上回ったが、すべてのゲームで優れていたわけではない。
訓練と結果
MuZero は、ボードゲームの訓練には第3世代のテンソル処理装置 (TPU) を16基、自己対戦には1000基を使用した。Atari ゲームでは、訓練に8基、自己対戦に32基の TPU を使用した。AlphaZero は、訓練に第2世代 TPU を64基、自己対戦に5000基を使用した。TPU の設計が改善されたため(第3世代チップは第2世代チップの2倍の性能を持ち、帯域幅とポッド内のチップ間ネットワーキングもさらに進歩)、これらは同等の訓練設定と見なせる。R2D2 は、200万訓練ステップを5日間で実行した。
初期の結果
MuZero は、約100万訓練ステップでチェスと将棋において AlphaZero と同等の性能を達成した。囲碁では、50万ステップで AlphaZero と同等になり、100万ステップでそれを上回った。Atari ゲーム群では、50万ステップで R2D2 の平均および中央値のパフォーマンスに匹敵し、100万ステップでそれを上回ったが、6つのゲームでは決して良い成績を収めることはなかった。
反応と関連研究
MuZero は、AlphaZero からの重要な進歩であり、教師なし学習技術における一般化可能な一歩と見なされた。この研究は、より小さな要素からシステムを構成する方法の理解を進めたと見なされ、純粋な機械学習の進歩というよりも、システムレベルの発展であった。
開発チームは疑似コードのみを公開したが、Werner Duvaud はそれに基づくオープンソース実装を制作した。MuZero は、他の研究において、モデルベースの行動を生成する方法など、参照実装として使用されている。
2021年後半には、より効率的な MuZero の変種である EfficientZero が提案された。これは、わずか2時間のリアルタイムゲーム経験で、Atari 100k ベンチマークにおいて平均で人間の性能の194.3%、中央値で109.0%を達成した。2022年初頭には、確率的ゲーム(例えば、2048、バックギャモン)をプレイするための MuZero の変種である Stochastic MuZero が提案され、これは環境の確率的性質を説明するために、アフターステートダイナミクスとチャンスコードを使用する。
2022年2月、DeepMind は MuZero の現実世界のタスクへの最初の応用を報告した。それは YouTube との協力であり、オープンソースの VP9 コーデックにおけるビデオ圧縮の改善であった。MuZero-RC と呼ばれるこのバージョンは、VP9 のデフォルトのレート制御メカニズムを置き換え、各フレームの量子化パラメータを選択することで、多様なビデオセット全体で平均4%のビットレート削減を品質低下なしに達成した。
関連項目
- 一般的なゲームプレイ
- 教師なし学習