AlphaGo 논문 (2016)

영어에서 번역됨

DeepMind의 2016년 Nature 논문은 알파고(AlphaGo)를 소개했는데, 이는 딥 뉴럴 네트워크와 몬테 카를로 트리 탐색을 사용하여 핸디캡 없이 프로 바둑 기사를 이긴 최초의 컴퓨터 프로그램이다. 이 논문은 판후이(Fan Hui)를 상대로 한 5-0 승리를 기록했으며, 리세돌(Lee Sedol)을 상대로 한 역사적인 4-1 승리에 앞선 것이었다.

AlphaGo는 구글의 자회사인 런던 소재 딥마인드 테크놀로지스가 개발한 보드 게임 바둑을 두는 컴퓨터 프로그램이다. 이 프로그램과 그 알고리즘은 2016년 1월 27일 학술지 《네이처》에 게재된 논문에 기술되었으며, 이는 유럽 챔피언 판후이를 상대로 한 승리 발표와 동시에 이루어졌다. 이 논문은 인공지능의 이정표를 세웠는데, AlphaGo는 정규 크기 19×19 바둑판에서 핸디캡 없이 프로 인간 기사를 꺾은 최초의 컴퓨터 바둑 프로그램이 되었다. 이 승리는 2016년 12월 22일 《사이언스》가 선정한 올해의 돌파구(Breakthrough of the Year) 준우승 중 하나로 인정받았다.

AlphaGo는 기계 학습인공 신경망의 조합을 사용하여 바둑판의 위치를 평가하고 수를 선택한다. 이는 딥러닝 정책 네트워크와 가치 네트워크가 안내하는 몬테카를로 트리 탐색 알고리즘을 사용하며, 인간 기보의 지도 학습과 자가 대국의 강화 학습을 통해 훈련되었다. 이러한 접근 방식 덕분에 AlphaGo는 바둑의 큰 분기 계수로 인해 이전의 인공지능 방법들을 어렵게 만들었던 문제를 극복할 수 있었다.

개발 및 배경

바둑은 체스와 같은 다른 게임보다 컴퓨터가 이기기가 훨씬 어려운 것으로 간주된다. 그 이유는 바둑의 전략적이고 심미적인 특성 때문에 평가 함수를 직접 구성하기 어렵고, 분기 계수가 훨씬 커서 알파-베타 가지치기, 트리 탐색, 휴리스틱 탐색과 같은 전통적인 AI 방법을 사용하기가 매우 어렵기 때문이다. IBM의 컴퓨터 딥 블루가 1997년 대국에서 세계 체스 챔피언 개리 카스파로프를 꺾은 지 거의 20년이 지난 후에도, 인공지능 기술을 사용한 최강의 바둑 프로그램은 아마추어 5단 수준에 그쳤으며, 여전히 핸디캡 없이는 프로 기사를 이길 수 없었다. 2012년, 4대의 PC 클러스터에서 실행된 소프트웨어 프로그램 Zen은 다섯 수와 네 수의 핸디캡으로 다케미야 마사키(9단)를 두 번 이겼다. 2013년, Crazy Stone은 네 수의 핸디캡으로 이시다 요시오(9단)를 꺾었다.

딥마인드의 데이비드 실버에 따르면, AlphaGo 연구 프로젝트는 딥러닝을 사용한 신경망이 바둑에서 얼마나 경쟁력이 있는지 시험하기 위해 2014년경에 구성되었다. AlphaGo는 이전 바둑 프로그램들에 비해 상당한 개선을 나타낸다. 다른 사용 가능한 바둑 프로그램(크레이지 스톤, 젠 포함)과의 500게임에서 단일 컴퓨터에서 실행된 AlphaGo는 단 한 게임만 제외하고 모두 이겼다. 유사한 대결에서 여러 컴퓨터에서 실행된 AlphaGo는 다른 바둑 프로그램과의 500게임 모두에서 승리했으며, 단일 컴퓨터에서 실행된 AlphaGo와의 게임에서는 77%를 이겼다. 2015년 10월의 분산 버전은 1,202개의 CPU와 176개의 GPU를 사용했다.

판후이와의 대국

2015년 10월, 분산 버전의 AlphaGo는 유럽 바둑 챔피언인 판후이(프로 2단, 9단 만점)를 5대 0으로 꺾었다. 이는 컴퓨터 바둑 프로그램이 정규 크기 바둑판에서 핸디캡 없이 프로 인간 기사를 꺾은 최초의 사례였다. 이 소식의 발표는 알고리즘을 설명하는 《네이처》 논문 게재 시점에 맞추어 2016년 1월 27일까지 지연되었다.

이세돌과의 대국

AlphaGo는 9단으로 세계 최고 수준의 바둑 기사 중 한 명인 한국 프로 기사 이세돌과 대국을 펼쳤으며, 2016년 3월 9일, 10일, 12일, 13일, 15일에 서울의 포시즌스 호텔에서 다섯 게임이 진행되었고, 이는 실시간으로 영상 중계되었다. 다섯 게임 중 AlphaGo는 네 게임을 이겼고, 이세돌은 네 번째 게임에서 승리하여 AlphaGo의 공식 74게임 전체에서 AlphaGo를 꺾은 유일한 인간 기사로 기록되었다. AlphaGo는 미국에 위치한 서버를 사용하는 구글의 클라우드 컴퓨팅에서 실행되었다. 이 대국은 7.5점의 컴이 적용된 중국식 규칙을 사용했으며, 각 측은 2시간의 사고 시간과 3개의 60초 초읽기(byoyomi) 기간을 가졌다. 이세돌과 대국한 AlphaGo 버전은 판후이 대국에서 사용된 것과 유사한 양의 컴퓨팅 성능을 사용했다. 《이코노미스트》는 1,920개의 CPU와 280개의 GPU를 사용했다고 보도했다. 당시 이세돌은 세계 바둑 국제 대회 우승 횟수에서 한국 기사 이창호(16년간 세계 챔피언 타이틀을 보유) 다음으로 세계 2위였다. 국제 바둑에는 공식적인 단일 순위 방법이 없기 때문에 순위는 출처에 따라 다를 수 있다. 그는 때때로 1위로 평가되기도 했지만, 일부 출처에서는 당시 이세돌을 세계 4위로 평가하기도 했다. AlphaGo는 이세돌을 겨냥해 특별히 훈련된 것도, 특정 인간 기사와 겨루도록 설계된 것도 아니었다.

처음 세 게임은 이세돌의 기권으로 AlphaGo가 승리했다. 그러나 이세돌은 네 번째 게임에서 180수에서 기권으로 이겨 AlphaGo를 꺾었다. AlphaGo는 이후 다섯 번째 게임에서 기권으로 승리하여 네 번째 승리를 이어갔다. 상금은 100만 달러였다. AlphaGo가 다섯 게임 중 네 게임을 이겨 시리즈에서 승리했으므로, 상금은 유니세프를 포함한 자선 단체에 기부될 예정이다. 이세돌은 다섯 게임 모두 참가에 대해 15만 달러를 받았고, 4번째 게임의 승리로 추가로 2만 달러를 받았다.

2016년 6월, 네덜란드의 한 대학에서 열린 발표에서 딥마인드 팀의 아자 황은 AlphaGo와 이세돌의 대국 중 4번째 게임에서 발생한 논리적 약점을 패치했으며, 78수(많은 전문가들이 "신의 한 수"라고 부른) 이후에는 의도한 대로 작동하여 흑의 우위를 유지할 것이라고 밝혔다. 78수 이전에는 AlphaGo가 게임 내내 앞서고 있었지만, 이세돌의 수로 인해 프로그램의 컴퓨팅 능력이 분산되고 혼란스러워졌다. 황은 AlphaGo의 정책 네트워크가 위치를 잘못 판단하여 패배로 이어졌다고 설명했다.

여파와 유산

이 승리를 기념하여 AlphaGo는 한국기원으로부터 명예 9단을 수여받았다. 이세돌과의 도전 대국 준비 과정과 경기는 그렉 코스가 감독한 다큐멘터리 영화 《AlphaGo》에 기록되었다. 2017년 미래의 바둑 정상 회담에서 Master 버전의 AlphaGo는 당시 세계 랭킹 1위인 커제를 3게임 대국에서 꺾었고, 이후 AlphaGo는 중국기원으로부터 프로 9단을 수여받았다. AlphaGo와 커제의 대국 이후, 딥마인드는 AlphaGo를 은퇴시키고 다른 분야의 AI 연구를 계속했다. 스스로 학습한 AlphaGo Zero는 초기 경쟁 버전의 AlphaGo를 상대로 100-0 승리를 거두었고, 그 후속작인 AlphaZero는 2010년대 말까지 바둑에서 세계 최고의 기사로 인식되었다. AlphaZero는 차례로 규칙을 배우지 않고 학습하는 프로그램인 MuZero로 계승되었다. 원래 AlphaGo와 동일한 원리를 기반으로 구축된 이러한 후속 프로그램들은 딥마인드와 그 너머의 연구에 영향을 미쳐 생성형 AI 및 다른 분야의 발전에 기여했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·deep-learning·go-game·deepmind
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사