David Silver é um cientista da computação britânico e pesquisador principal no Google DeepMind, mais conhecido por dirigir os programas de Reinforcement learning que produziram o AlphaGo, o AlphaZero e o MuZero. Ele obteve o doutorado na Universidade de Cambridge e, posteriormente, trabalhou com Richard Sutton na Universidade de Alberta em métodos de aprendizagem por diferença temporal, antes de ingressar no University College London como professor e, em seguida, na equipe fundadora de pesquisa da DeepMind em 2013. Antes desse percurso acadêmico, Silver trabalhou como programador de IA para jogos na Elixir Studios, uma empresa de jogos de Londres cofundada por Demis Hassabis, uma colaboração inicial que os dois renovaram mais tarde quando ambos se juntaram à DeepMind.
AlphaGo e aprendizagem por reforço com autojogo
Silver liderou o projeto AlphaGo a partir de cerca de 2014, combinando redes neurais profundas com busca em árvore de Monte Carlo treinada por meio de Reinforcement learning e autojogo. O sistema derrotou o campeão europeu Fan Hui em outubro de 2015 e, em seguida, o campeão mundial Lee Sedol por 4 a 1 na partida AlphaGo versus Lee Sedol realizada em Seul em março de 2016, um resultado que chegou anos antes do que a maioria dos especialistas havia previsto para o jogo de Go. Silver e colegas da DeepMind, sob a liderança de Demis Hassabis, publicaram a metodologia do AlphaGo na Nature em 2016, e Silver foi nomeado autor principal do artigo.
Ele passou a liderar o AlphaZero em 2017, que generalizou a abordagem para aprender xadrez, shogi e Go puramente por meio de autojogo, sem registros de partidas humanas ou características artesanais, igualando ou superando os programas existentes mais fortes em cada jogo após apenas horas de treinamento. Um sistema sucessor, o MuZero, seguiu-se em 2019, estendendo o método para cenários em que as regras do ambiente não são fornecidas antecipadamente, fazendo com que o agente aprenda seu próprio modelo preditivo interno do jogo ou da tarefa.
Recompensa é suficiente
Esse corpo de trabalho alimentou uma tese de pesquisa mais ampla que Silver avançou sobre inteligência geral. Em um artigo de 2021 intitulado "Reward Is Enough", coautorado com Satinder Singh, Doina Precup e Richard Sutton, ele argumentou que agentes treinados puramente para maximizar um sinal de recompensa suficientemente rico em um ambiente suficientemente complexo poderiam, em princípio, desenvolver muitas marcas de comportamento inteligente, incluindo planejamento, exploração, memória e generalização, sem que essas habilidades fossem projetadas separadamente. O artigo posicionou o Reinforcement learning como um framework geral candidato para alcançar sistemas mais capazes, uma afirmação que permanece em debate juntamente com a abordagem baseada em escala adotada por grandes modelos de linguagem.
Reconhecimento
Pelo trabalho do AlphaGo, Silver compartilhou o Prêmio ACM em Computação de 2019. Ele continua a ocupar uma cátedra no University College London, além de seu papel de pesquisa no Google DeepMind, e seus artigos sobre autojogo e Reinforcement learning baseado em modelos permanecem entre os mais citados na área.