Traduit de l'anglais

David Silver est un informaticien britannique chez Google DeepMind qui a dirigé la recherche en apprentissage par renforcement derrière AlphaGo, AlphaZero et MuZero.

David Silver est un informaticien britannique et chercheur principal chez Google DeepMind, surtout connu pour avoir dirigé les programmes d'apprentissage par renforcement qui ont produit AlphaGo, AlphaZero et MuZero. Il a obtenu un doctorat à l'Université de Cambridge et a ensuite travaillé avec Richard Sutton à l'Université de l'Alberta sur les méthodes d'apprentissage par différences temporelles, avant de rejoindre l'University College London en tant que chargé de cours, puis l'équipe fondatrice de recherche de DeepMind en 2013. Avant ce parcours académique, Silver a travaillé comme programmeur d'IA de jeux chez Elixir Studios, une société de jeux londonienne cofondée par Demis Hassabis, une collaboration précoce que les deux ont renouvelée plus tard lorsqu'ils ont tous deux rejoint DeepMind.

AlphaGo et apprentissage par renforcement par auto-jeu

Silver a dirigé le projet AlphaGo à partir d'environ 2014, combinant des réseaux de neurones profonds avec une recherche arborescente de Monte Carlo entraînée par apprentissage par renforcement et auto-jeu. Le système a vaincu le champion européen Fan Hui en octobre 2015, puis le champion du monde Lee Sedol 4-1 lors du match AlphaGo versus Lee Sedol tenu à Séoul en mars 2016, un résultat arrivé des années plus tôt que ce que la plupart des experts avaient prédit pour le jeu de Go. Silver et ses collègues de DeepMind, sous la direction de Demis Hassabis, ont publié la méthodologie d'AlphaGo dans Nature en 2016, et Silver a été nommé auteur principal de l'article.

Il a ensuite dirigé AlphaZero en 2017, qui a généralisé l'approche pour apprendre les échecs, le shogi et le Go uniquement par auto-jeu, sans enregistrements de parties humaines ni caractéristiques conçues à la main, égalant ou dépassant les programmes existants les plus forts dans chaque jeu après seulement quelques heures d'entraînement. Un système successeur, MuZero, a suivi en 2019, étendant la méthode à des contextes où les règles de l'environnement ne sont pas données à l'avance, en faisant apprendre à l'agent son propre modèle prédictif interne du jeu ou de la tâche.

La récompense suffit

Ce corpus de travaux a alimenté une thèse de recherche plus large que Silver a avancée sur l'intelligence générale. Dans un article de 2021 intitulé « Reward Is Enough », coécrit avec Satinder Singh, Doina Precup et Richard Sutton, il a soutenu que des agents entraînés uniquement à maximiser un signal de récompense suffisamment riche dans un environnement suffisamment complexe pourraient, en principe, développer de nombreuses caractéristiques du comportement intelligent, y compris la planification, l'exploration, la mémoire et la généralisation, sans que ces capacités soient conçues séparément. L'article a positionné l'apprentissage par renforcement comme un cadre général candidat pour atteindre des systèmes plus capables, une affirmation qui reste débattue aux côtés de l'approche basée sur la mise à l'échelle adoptée par les grands modèles de langage.

Reconnaissance

Pour le travail sur AlphaGo, Silver a partagé le prix ACM en informatique 2019. Il continue d'occuper un poste de professeur à l'University College London en parallèle de son rôle de recherche chez Google DeepMind, et ses articles sur l'auto-jeu et l'apprentissage par renforcement basé sur modèle restent parmi les plus cités dans le domaine.

Catégories:reinforcement-learning·deepmind·game-playing-ai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique