Timothy P. Lillicrap ist ein kanadischer Neurowissenschaftler und Forscher im Bereich der künstlichen Intelligenz. Er ist wissenschaftlicher Mitarbeiter bei Google DeepMind und außerordentlicher Professor am University College London. Seine Forschung konzentriert sich auf maschinelles Lernen und Statistik für optimale Steuerung und Entscheidungsfindung, und er nutzt diese mathematischen Rahmenwerke, um zu untersuchen, wie das Gehirn lernt. Er hat Algorithmen zur Anwendung von tiefen neuronalen Netzen auf Bestärkendes Lernen entwickelt und rekurrente Gedächtnisarchitekturen für das Ein-Schuss-Lernen eingeführt.
Lillicrap war an den Projekten AlphaGo und AlphaZero bei DeepMind beteiligt, die Meisterschaft in den Spielen Go, Schach und Shogi erreichten. Seine Beiträge brachten ihm mehrere Auszeichnungen ein, darunter die Governor General's Academic Medal, ein NSERC-Stipendium, den Centre for Neuroscience Studies Award for Excellence und mehrere Stipendien des Europäischen Forschungsrats.
Frühes Leben und Ausbildung
Lillicrap erwarb 2005 einen B.Sc. in Kognitionswissenschaft und künstlicher Intelligenz an der University of Toronto. Anschließend promovierte er in Systemneurowissenschaften an der Queen's University, die er 2012 unter der Leitung von Stephen H. Scott abschloss. Seine Doktorarbeit mit dem Titel „Modelling Motor Cortex using Neural Network Controls Laws" wurde am Centre for Neuroscience Studies der Queen's University eingereicht.
Karriere bei DeepMind
Nach seiner Promotion arbeitete Lillicrap als Postdoktorand an der Oxford University. 2014 trat er als Forschungswissenschaftler in Google DeepMind ein. 2016 wurde er zum leitenden Forschungswissenschaftler befördert, eine Position, die er bis 2021 innehatte. 2016 nahm er außerdem eine außerordentliche Professur am University College London an.
Bei DeepMind trug Lillicrap zur Entwicklung des Deep Deterministic Policy Gradient (DDPG)-Algorithmus bei, einer Methode für kontinuierliche Steuerung mit bestärkendem Lernen. Er war Mitautor des Papiers „Continuous Control with Deep Reinforcement Learning" von 2015, das DDPG einführte und seine Wirksamkeit an simulierten Roboteraufgaben demonstrierte. Diese Arbeit war einflussreich auf dem Gebiet der künstlichen Intelligenz und Robotik.
Forschungsbeiträge
Lillicraps Forschung erstreckt sich über mehrere Bereiche des maschinellen Lernens und der Neurowissenschaften. Er hat an gedächtnisbasierter Steuerung mit rekurrenten neuronalen Netzen gearbeitet und untersucht, wie diese Architekturen Lernen und Entscheidungsfindung unterstützen können. Sein Papier von 2015 mit Nicolas Heess und David Silver befasste sich mit gedächtnisbasierter Steuerung, und spätere Arbeiten mit Jack W. Rae und Peter Dayan führten schnelles parametrisches Lernen mit Aktivierungsspeicherung ein.
Er war außerdem Mitautor des Papiers „Asynchronous Methods for Deep Reinforcement Learning" von 2016, das den A3C-Algorithmus einführte, sowie mehrerer Arbeiten zu kontinuierlichem Deep Q-Learning und Roboter-Manipulation. Seine Arbeit zum Meta-Lernen, wie „Learning to Learn without Gradient Descent by Gradient Descent", hat zum Verständnis beigetragen, wie neuronale Netze effizient neue Fähigkeiten erwerben können.
AlphaGo und AlphaZero
Lillicrap war Mitautor des wegweisenden Nature-Papiers von 2016 „Mastering the game of Go with deep neural networks and tree search", das das AlphaGo-System beschrieb. Er trug auch zum Nature-Papier von 2017 „Mastering the game of Go without human knowledge" bei, das eine Version von AlphaGo einführte, die ausschließlich durch Selbstspiel lernte. In den Jahren 2017 und 2018 war er Teil des Teams, das AlphaZero entwickelte, einen allgemeinen Bestärkendes-Lernen-Algorithmus, der Schach, Shogi und Go durch Selbstspiel meisterte, wie im Science-Papier „A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play" beschrieben.
Auszeichnungen und Anerkennung
Lillicrap hat im Laufe seiner Karriere zahlreiche Auszeichnungen erhalten. Dazu gehören das NSERC-Stipendium, die Governor General's Academic Medal und der Centre for Neuroscience Studies Award for Excellence. Er hat außerdem zweimal das Social Learning Strategies Tournament gewonnen und ein Proof-of-Concept-Stipendium des Europäischen Forschungsrats erhalten. Seine frühen akademischen Leistungen wurden mit dem University College Howard Ferguson Entrance Scholarship und dem HPCVL / Sun Microsystems of Canada, Inc. Scholarship in Computational Sciences and Engineering gewürdigt.
Ausgewählte Veröffentlichungen
Lillicrap hat eine umfangreiche Publikationsliste. Zu den wichtigsten Werken gehören:
- Timothy Lillicrap, Jonathan J. Hunt, Alexander Pritzel, Nicolas Heess, Tom Erez, Yuval Tassa, David Silver, Daan Wierstra (2015). „Continuous Control with Deep Reinforcement Learning." arXiv:1509.02971.
- David Silver, Aja Huang, Chris J. Maddison, et al. (2016). „Mastering the game of Go with deep neural networks and tree search." Nature, Bd. 529.
- Volodymyr Mnih, Adrià Puigdomènech Badia, Mehdi Mirza, Alex Graves, Timothy Lillicrap, et al. (2016). „Asynchronous Methods for Deep Reinforcement Learning." arXiv:1602.01783.
- David Silver, Julian Schrittwieser, Karen Simonyan, et al. (2017). „Mastering the game of Go without human knowledge." Nature, Bd. 550.
- David Silver, Thomas Hubert, Julian Schrittwieser, et al. (2018). „A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play." Science, Bd. 362, Nr. 6419.
Referenzen
Der Inhalt dieses Artikels wurde von Timothy Lillicrap im Chess-Programming-Wiki übernommen, das unter der Creative-Commons-Lizenz Namensnennung - Weitergabe unter gleichen Bedingungen 3.0 (Unported) (CC-BY-SA 3.0) lizenziert ist.