티모시 P. 릴리크랩은 캐나다의 신경과학자이자 인공지능 연구원이다. 그는 Google DeepMind의 스태프 연구 과학자이자 유니버시티 칼리지 런던의 겸임 교수이다. 그의 연구는 최적 제어와 의사 결정을 위한 머신 러닝과 통계에 중점을 두며, 이러한 수학적 프레임워크를 사용하여 뇌가 학습하는 방식을 조사한다. 그는 심층 신경망을 강화 학습에 적용하는 알고리즘을 개발했으며, 원샷 학습을 위한 순환 메모리 아키텍처를 도입했다.
릴리크랩은 DeepMind의 AlphaGo 및 AlphaZero 프로젝트에 참여했으며, 이 프로젝트는 바둑, 체스, 쇼기 게임에서 숙련을 달성했다. 그의 기여는 총독 총리 학술 메달, NSERC 펠로우십, 신경과학 연구 센터 우수상, 그리고 여러 유럽 연구 위원회 보조금을 포함한 여러 영예를 안겼다.
초기 생애 및 교육
릴리크랩은 2005년 토론토 대학교에서 인지 과학 및 인공지능 학사 학위를 취득했다. 그 후 그는 Queen's University에서 시스템 신경과학 박사 과정을 밟아 2012년 Stephen H. Scott의 지도 아래 완료했다. 그의 박사 논문은 "신경망 제어 법칙을 사용한 운동 피질 모델링"이라는 제목으로 Queen's University의 신경과학 연구 센터에 제출되었다.
DeepMind에서의 경력
박사 학위 후, 릴리크랩은 옥스퍼드 대학교에서 박사후 연구원으로 일했다. 2014년에 그는 Google DeepMind에 연구 과학자로 합류했다. 그는 2016년에 스태프 연구 과학자로 승진했으며, 이 직위는 2021년 기준으로 계속 유지했다. 2016년에는 유니버시티 칼리지 런던에서 겸임 교수직을 수락했다.
DeepMind에서 릴리크랩은 강화 학습을 통한 연속 제어 방법인 심층 결정적 정책 경사(DDPG) 알고리즘 개발에 기여했다. 그는 DDPG를 소개하고 시뮬레이션된 로봇 작업에서 효과를 입증한 2015년 논문 "연속 제어와 심층 강화 학습"을 공동 저술했다. 이 작업은 인공지능 및 로봇 공학 분야에서 영향력이 있었다.
연구 기여
릴리크랩의 연구는 머신 러닝과 신경과학의 여러 영역에 걸쳐 있다. 그는 순환 신경망을 사용한 메모리 기반 제어에 대해 연구했으며, 이러한 아키텍처가 학습과 의사 결정을 지원할 수 있는 방법을 탐구했다. Nicolas Heess 및 David Silver와의 2015년 논문은 메모리 기반 제어를 다루었으며, Jack W. Rae 및 Peter Dayan과의 후속 작업은 활성화 기억을 통한 빠른 매개변수 학습을 도입했다.
그는 또한 2016년 논문 "심층 강화 학습을 위한 비동기 방법"의 공동 저자였으며, 이 논문은 A3C 알고리즘을 소개했고, 연속 심층 Q-러닝 및 로봇 조작에 관한 여러 논문에도 기여했다. "경사 하강 없이 경사 하강으로 학습하는 법"과 같은 메타 학습에 대한 그의 작업은 신경망이 새로운 기술을 효율적으로 습득할 수 있는 방법을 이해하는 데 기여했다.
AlphaGo 및 AlphaZero
릴리크랩은 AlphaGo 시스템을 설명한 2016년 Nature 논문 "심층 신경망과 트리 탐색으로 바둑 게임 마스터하기"의 공동 저자였다. 그는 또한 자기 대국을 통해서만 학습한 AlphaGo 버전을 소개한 2017년 Nature 논문 "인간 지식 없이 바둑 게임 마스터하기"에도 기여했다. 2017년과 2018년에는 자기 대국을 통해 체스, 쇼기, 바둑을 마스터한 일반 강화 학습 알고리즘인 AlphaZero를 개발한 팀의 일원이었으며, 이는 Science 논문 "자기 대국을 통해 체스, 쇼기, 바둑을 마스터하는 일반 강화 학습 알고리즘"에 설명되어 있다.
수상 및 인정
릴리크랩은 경력 전반에 걸쳐 많은 상을 받았다. 여기에는 NSERC 펠로우십, 총독 총리 학술 메달, 신경과학 연구 센터 우수상이 포함된다. 그는 또한 사회적 학습 전략 토너먼트에서 두 번 우승했으며 유럽 연구 위원회 개념 증명 보조금을 받았다. 그의 초기 학문적 성취는 유니버시티 칼리지 하워드 퍼거슨 입학 장학금과 HPCVL / Sun Microsystems of Canada, Inc. 계산 과학 및 공학 장학금으로 인정받았다.
주요 출판물
릴리크랩은 광범위한 출판 기록을 가지고 있다. 주요 작업은 다음과 같다:
- Timothy Lillicrap, Jonathan J. Hunt, Alexander Pritzel, Nicolas Heess, Tom Erez, Yuval Tassa, David Silver, Daan Wierstra (2015). "연속 제어와 심층 강화 학습." arXiv:1509.02971.
- David Silver, Aja Huang, Chris J. Maddison, et al. (2016). "심층 신경망과 트리 탐색으로 바둑 게임 마스터하기." Nature, Vol. 529.
- Volodymyr Mnih, Adrià Puigdomènech Badia, Mehdi Mirza, Alex Graves, Timothy Lillicrap, et al. (2016). "심층 강화 학습을 위한 비동기 방법." arXiv:1602.01783.
- David Silver, Julian Schrittwieser, Karen Simonyan, et al. (2017). "인간 지식 없이 바둑 게임 마스터하기." Nature, Vol. 550.
- David Silver, Thomas Hubert, Julian Schrittwieser, et al. (2018). "자기 대국을 통해 체스, 쇼기, 바둑을 마스터하는 일반 강화 학습 알고리즘." Science, Vol. 362, No. 6419.
참고 문헌
이 문서의 내용은 크리에이티브 커먼즈 저작자표시-동일조건변경허락 3.0 (Unported) (CC-BY-SA 3.0) 라이선스에 따라 제공되는 체스 프로그래밍 위키의 Timothy Lillicrap에서 각색되었다.