AlphaZeroは、強化学習システムであり、DeepMindによって開発されたもので、チェス、将棋、囲碁を、単一の汎用アルゴリズムと人間が生成したゲームデータを用いずに、超人レベルでプレイすることを学習した。DeepMindは2017年12月に発表した論文でAlphaZeroを発表し、各ゲームのルールのみから始めて、完全に自己対戦を通じて学習するシステムを説明した。このシステムは、深層ニューラルネットワークをモンテカルロ木探索と組み合わせて局面を評価し手を選択し、その後、自分自身との対戦結果を通じてそのネットワークを改善するものである。
AlphaGoとの関係
AlphaZeroは、AlphaGo Zeroで初めて実証された自己対戦アプローチを一般化したものである。AlphaGo Zeroは、AlphaGoのバージョンで、人間のゲームデータなしに純粋に自己対戦を通じて囲碁を学習していた。AlphaGoとAlphaGo Zeroが囲碁のみに特化していたのに対し、AlphaZeroは同じ基盤となるアーキテクチャとトレーニング手順を使用し、ルール自体以外にゲーム固有の調整を一切行わずに、チェスと将棋でも超人レベルに達し、自己対戦強化学習アプローチが囲碁特有のトリックではなく、完全情報ゲームを習得するための真に一般的な方法であることを実証した。
チェスでの結果
AlphaZeroのチェスでの結果は、AIコミュニティとチェスコミュニティの両方で特に注目を集めた。なぜなら、チェスは囲碁よりもはるかに長いコンピュータエンジン開発の歴史を持ち、20年にわたって深く手調整されたブルートフォース探索を用いる伝統的なエンジン、最も有名なのはStockfishが支配していたからである。わずか4時間の自己対戦トレーニングの後、オープニングブック、エンドゲームテーブルベース、または基本ルール以外のチェス固有の人間知識を一切使用せずに、AlphaZeroは100ゲームのマッチでStockfishを破った。ゲームをレビューしたグランドマスターを含む解説者たちは、AlphaZeroのチェスのプレイが独特のスタイルを示し、伝統的なエンジンに組み込まれた駒の数え方のヒューリスティックよりも長期的な駒の機動性とキングの安全性を優先し、即時の駒の獲得ではなく持続的な位置的な優位性を生み出す犠牲を頻繁に行い、そのスタイルは以前のエンジンよりも直感的または美的に印象的であると評する者もいた。
意義
AlphaZeroが、単一の自己対戦強化学習アルゴリズムが、ドメイン固有のエンジニアリングなしに複数の異なる完全情報ゲームを習得できることを実証したことは、より汎用的な学習システムへの重要な一歩と見なされた。ただし、AlphaZeroは完全に観測可能で決定論的な二人プレイヤーゲームに限定されており、汎用人工知能に関連するようなオープンエンドで現実世界のタスクには拡張されなかった。そのアーキテクチャと自己対戦トレーニング方法論は、その後のDeepMindの研究に影響を与え、MuZeroは、ルールが不明なゲームを含むゲームを、ルールを直接与えられるのではなく、環境の内部ワールドモデルを学習することでプレイすることを学んだフォローアップシステムである。AlphaZeroのチェスのゲームはその後、プロのチェスプレイヤーやエンジン開発者によって広く研究され、そのスタイルの傾向の一部は、後のチェスエンジンの設計と評価に影響を与え、同様の自己対戦トレーニング方法を採用したオープンソースのニューラルネットワークベースのエンジンも含まれる。
受け止め方
AlphaZeroは、AI研究において、自己対戦強化学習と深層ニューラルネットワークおよび探索を組み合わせた力の画期的な実証として広く引用されており、AlphaGoの初期の結果、特に2016年の李世ドル戦での勝利の意義を拡張し、十分な計算能力が与えられれば、一般的な学習アルゴリズムが明確に定義されたドメインにおける数十年にわたる人間の知識や手調整されたドメイン知識に匹敵するか、それを超えることができるというDeepMindのより広範な研究ナラティブを強化している。