Timothy P. Lillicrap est un neuroscientifique et chercheur en intelligence artificielle canadien. Il est chercheur scientifique permanent à Google DeepMind et professeur adjoint à University College London. Ses recherches portent sur l'apprentissage automatique et les statistiques pour le contrôle optimal et la prise de décision, et il utilise ces cadres mathématiques pour étudier comment le cerveau apprend. Il a développé des algorithmes pour appliquer les réseaux de neurones profonds à l'apprentissage par renforcement et a introduit des architectures de mémoire récurrentes pour l'apprentissage en une seule fois.
Lillicrap a participé aux projets AlphaGo et AlphaZero chez DeepMind, qui ont atteint la maîtrise dans les jeux de Go, d'échecs, et de Shogi. Ses contributions lui ont valu plusieurs distinctions, notamment la Médaille académique du Gouverneur général, une bourse NSERC, le Prix d'excellence du Centre d'études en neurosciences, et plusieurs subventions du Conseil européen de la recherche.
Vie et formation
Lillicrap a obtenu un B.Sc. en sciences cognitives et intelligence artificielle de l'Université de Toronto en 2005. Il a ensuite poursuivi un doctorat en neurosciences des systèmes à l'Université Queen's, le complétant en 2012 sous la supervision de Stephen H. Scott. Sa thèse de doctorat, intitulée « Modélisation du cortex moteur à l'aide de lois de contrôle par réseaux de neurones », a été soumise au Centre d'études en neurosciences de l'Université Queen's.
Carrière chez DeepMind
Après son doctorat, Lillicrap a travaillé comme chercheur postdoctoral à l'Université d'Oxford. En 2014, il a rejoint Google DeepMind comme chercheur scientifique. Il a été promu chercheur scientifique permanent en 2016, un poste qu'il a continué à occuper jusqu'en 2021. En 2016, il a également accepté un professorat adjoint à University College London.
Chez DeepMind, Lillicrap a contribué au développement de l'algorithme de gradient de politique déterministe profond (DDPG), une méthode pour le contrôle continu avec apprentissage par renforcement. Il a co-écrit l'article de 2015 « Contrôle continu avec apprentissage par renforcement profond », qui a introduit DDPG et a démontré son efficacité sur des tâches robotiques simulées. Ce travail a été influent dans le domaine de l'intelligence artificielle et de la robotique.
Contributions de recherche
Les recherches de Lillicrap couvrent plusieurs domaines de l'apprentissage automatique et des neurosciences. Il a travaillé sur le contrôle basé sur la mémoire avec des réseaux de neurones récurrents, explorant comment ces architectures peuvent soutenir l'apprentissage et la prise de décision. Son article de 2015 avec Nicolas Heess et David Silver a abordé le contrôle basé sur la mémoire, et des travaux ultérieurs avec Jack W. Rae et Peter Dayan ont introduit l'apprentissage paramétrique rapide avec mémorisation d'activation.
Il a également été co-auteur sur l'article de 2016 « Méthodes asynchrones pour l'apprentissage par renforcement profond », qui a introduit l'algorithme A3C, et sur plusieurs articles sur le Q-learning profond continu et la manipulation robotique. Son travail sur le méta-apprentissage, tel que « Apprendre à apprendre sans descente de gradient par descente de gradient », a contribué à comprendre comment les réseaux de neurones peuvent acquérir de nouvelles compétences efficacement.
AlphaGo et AlphaZero
Lillicrap a été co-auteur sur l'article fondateur de 2016 dans Nature « Maîtriser le jeu de Go avec des réseaux de neurones profonds et recherche d'arbre », qui a décrit le système AlphaGo. Il a également contribué à l'article de 2017 dans Nature « Maîtriser le jeu de Go sans connaissance humaine », qui a introduit une version d'AlphaGo apprenant uniquement par auto-jeu. En 2017 et 2018, il faisait partie de l'équipe qui a développé AlphaZero, un algorithme général d'apprentissage par renforcement qui a maîtrisé les échecs, le shogi, et le Go par auto-jeu, comme décrit dans l'article de Science « Un algorithme général d'apprentissage par renforcement qui maîtrise les échecs, le shogi, et le Go par auto-jeu. »
Prix et reconnaissance
Lillicrap a reçu de nombreux prix tout au long de sa carrière. Ceux-ci incluent la bourse NSERC, la Médaille académique du Gouverneur général, et le Prix d'excellence du Centre d'études en neurosciences. Il a également remporté le Tournoi des stratégies d'apprentissage social à deux reprises et a reçu une subvention de preuve de concept du Conseil européen de la recherche. Ses premières réalisations académiques ont été reconnues avec la bourse d'entrée Howard Ferguson de l'University College et la bourse HPCVL / Sun Microsystems of Canada, Inc. en sciences computationnelles et ingénierie.
Publications sélectionnées
Lillicrap a un dossier de publications étendu. Les travaux clés incluent:
- Timothy Lillicrap, Jonathan J. Hunt, Alexander Pritzel, Nicolas Heess, Tom Erez, Yuval Tassa, David Silver, Daan Wierstra(2015). « Contrôle continu avec apprentissage par renforcement profond. » arXiv:1509.02971.
- David Silver, Aja Huang, Chris J. Maddison, et al.(2016). « Maîtriser le jeu de Go avec des réseaux de neurones profonds et recherche d'arbre. » Nature, Vol. 529.
- Volodymyr Mnih, Adrià Puigdomènech Badia, Mehdi Mirza, Alex Graves, Timothy Lillicrap, et al.(2016). « Méthodes asynchrones pour l'apprentissage par renforcement profond. » arXiv:1602.01783.
- David Silver, Julian Schrittwieser, Karen Simonyan, et al.(2017).« Maîtriser le jeu de Go sans connaissance humaine. » Nature, Vol. 550.
- David Silver, Thomas Hubert, Julian Schrittwieser, et al.(2018).« Un algorithme général d'apprentissage par renforcement qui maîtrise les échecs, le shogi,et le Go par auto-jeu. » Science, Vol. 362, No. 6419.
Références
Le contenu de cet article a été adapté de Timothy Lillicrap sur le wiki Chess Programming, qui est sous licence Creative Commons Attribution-Share Alike 3.0(Unported)(CC-BY-SA 3.0) license.