David Silver는 영국의 컴퓨터 과학자이자 Google DeepMind의 수석 연구원으로, AlphaGo, AlphaZero, MuZero를 만든 Reinforcement learning 프로그램을 지휘한 것으로 가장 잘 알려져 있다. 그는 케임브리지 대학교에서 박사 학위를 받았으며, 이후 앨버타 대학교에서 Richard Sutton과 함께 시간차 학습 방법을 연구했다. 그 후 런던 대학 칼리지에서 강사로 재직하다가 2013년 DeepMind의 창립 연구팀에 합류했다. 학계 경력 이전에 Silver는 Demis Hassabis가 공동 설립한 런던 게임 회사인 Elixir Studios에서 게임 AI 프로그래머로 일했으며, 이는 두 사람이 나중에 DeepMind에 함께 합류하면서 재개된 초기 협력 관계였다.
AlphaGo와 자기 대국 강화 학습
Silver는 약 2014년부터 AlphaGo 프로젝트를 이끌며, 깊은 신경망과 몬테카를로 트리 탐색을 결합하고 Reinforcement learning과 자기 대국을 통해 훈련시켰다. 이 시스템은 2015년 10월 유럽 챔피언 판 후이를 꺾었고, 2016년 3월 서울에서 열린 AlphaGo versus Lee Sedol 대국에서 세계 챔피언 이세돌을 4-1로 이겼다. 이 결과는 대부분의 전문가들이 바둑에서 예측했던 시기보다 몇 년이나 빨리 나온 것이었다. Silver와 DeepMind 동료들은 Demis Hassabis의 지휘 아래 2016년 Nature지에 AlphaGo 방법론을 발표했으며, Silver는 그 논문의 주저자로 이름을 올렸다.
그는 2017년 AlphaZero를 계속 이끌었는데, 이는 인간의 기보나 수작업 특징 없이 오직 자기 대국만으로 체스, 쇼기, 바둑을 학습하도록 접근 방식을 일반화한 것으로, 각 게임에서 훈련 몇 시간 만에 기존 최강 프로그램과 대등하거나 능가하는 성과를 냈다. 2019년에는 후속 시스템인 MuZero가 나왔으며, 이는 환경의 규칙이 사전에 주어지지 않는 상황에서 에이전트가 게임이나 작업에 대한 자체 내부 예측 모델을 학습하도록 하여 방법을 확장했다.
보상이면 충분하다
이 일련의 작업은 Silver가 일반 지능에 대해 주장한 더 넓은 연구 테제를 뒷받침했다. 2021년 Satinder Singh, Doina Precup, Richard Sutton과 공동 저술한 "Reward Is Enough"라는 제목의 논문에서, 그는 충분히 풍부한 보상 신호를 충분히 복잡한 환경에서 극대화하도록 훈련된 에이전트가 원칙적으로 계획, 탐색, 기억, 일반화를 포함한 지능적 행동의 많은 특징을 개별적으로 설계하지 않고도 개발할 수 있다고 주장했다. 이 논문은 Reinforcement learning을 더 강력한 시스템에 도달하기 위한 일반적 프레임워크의 후보로 제시했으며, 이 주장은 대규모 언어 모델이 취하는 확장 기반 접근 방식과 함께 논쟁의 대상이 되고 있다.
수상 경력
AlphaGo 작업으로 Silver는 2019년 ACM 컴퓨팅 상을 공동 수상했다. 그는 Google DeepMind에서 연구 역할을 계속하면서 런던 대학 칼리지의 교수직을 유지하고 있으며, 자기 대국 및 모델 기반 Reinforcement learning에 관한 그의 논문은 이 분야에서 가장 많이 인용된 논문 중 하나로 남아 있다.