デビッド・シルバーは、イギリスの計算機科学者であり、Google DeepMindの主任研究員である。AlphaGo、AlphaZero、MuZeroを生み出したReinforcement learningプログラムを指揮したことで最もよく知られている。彼はケンブリッジ大学で博士号を取得し、その後、アルバータ大学でRichard Suttonとともに時間差学習法に取り組み、ユニバーシティ・カレッジ・ロンドンの講師を経て、2013年にDeepMindの創設研究チームに加わった。その学術的な道のり以前には、Demis Hassabisが共同設立したロンドンのゲーム会社エリクシア・スタジオでゲームAIプログラマーとして働いており、この初期の協力関係は、両者がDeepMindに加わった際に再開されることとなった。
AlphaGoと自己対戦強化学習
シルバーは2014年頃からAlphaGoプロジェクトを率い、深層ニューラルネットワークとモンテカルロ木探索を組み合わせ、Reinforcement learningと自己対戦を通じて訓練した。このシステムは2015年10月に欧州チャンピオンのファン・フイを破り、その後2016年3月にソウルで開催されたAlphaGo versus Lee Sedol対局で世界チャンピオンのイ・セドルに4対1で勝利した。この結果は、囲碁においてほとんどの専門家が予測していたよりも数年早いものだった。シルバーとDeepMindの同僚たちは、Demis Hassabisの下で、2016年にAlphaGoの方法論をNature誌に発表し、シルバーはその論文の筆頭著者に指名された。
彼は2017年にAlphaZeroを率い、このアプローチを一般化して、人間の棋譜や手作りの特徴量を使わず、純粋に自己対戦のみでチェス、将棋、囲碁を学習させ、各ゲームで最強の既存プログラムに匹敵または凌駕する性能を、わずか数時間の訓練で達成した。後継システムであるMuZeroは2019年に登場し、環境のルールが事前に与えられていない設定にも方法を拡張し、エージェントがゲームやタスクの内部予測モデルを自ら学習するようにした。
報酬があれば十分
この一連の研究は、シルバーが提唱する汎用知能に関するより広範な研究テーゼに結びついている。2021年の論文「Reward Is Enough」では、サティンダー・シン、ドイナ・プレカップ、Richard Suttonと共同執筆し、十分に豊かな報酬信号を最大化するように訓練されたエージェントは、十分に複雑な環境において、計画、探索、記憶、一般化など、知能行動の多くの特徴を、それらの能力を個別に設計することなく、原理的には発達させ得ると主張した。この論文は、Reinforcement learningを、より高性能なシステムを実現するための汎用フレームワークの候補として位置づけた。この主張は、大規模言語モデルによるスケーリングベースのアプローチと並んで、依然として議論の的となっている。
評価
AlphaGoの業績により、シルバーは2019年のACM計算機賞を共同受賞した。彼は現在もユニバーシティ・カレッジ・ロンドンで教授職を務めながら、Google DeepMindで研究役を続けており、自己対戦とモデルベースのReinforcement learningに関する彼の論文は、この分野で最も引用されているものの一つである。