AlphaGo Zero는 2017년 Google DeepMind가 개발한 컴퓨터 프로그램으로, 자기 대국 강화 학습을 통해 보드 게임 바둑에서 인간을 능가하는 성능을 달성했다. 수천 판의 인간 아마추어 및 프로 기보로 훈련된 이전 버전 AlphaGo와 달리, AlphaGo Zero는 무작위 수에서 시작하여 오로지 자기 자신과의 대국을 통해서만 실력을 향상시키며 완전히 처음부터 학습했다. 이 프로그램은 2017년 10월 네이처 저널에 게재된 "인간의 지식 없이 바둑 마스터하기"라는 제목의 논문에서 소개되었다.
이 시스템은 심층 신경망과 기계 학습 알고리즘인 몬테카를로 트리 탐색을 결합했다. 신경망은 바둑판의 위치를 평가하고 승리 확률을 예측했으며, 트리 탐색은 수 선택을 안내했다. 훈련은 강화 학습 루프를 사용했다. 신경망은 수백만 판의 자기 대국을 두었고, 게임 결과를 더 잘 예측하고 수 선택을 개선하도록 매개변수가 업데이트되었다. 이 접근 방식은 인간 전문가 데이터의 필요성을 제거하여, AI가 복잡한 전략을 독립적으로 발견할 수 있음을 입증했다.
아키텍처 및 훈련
AlphaGo Zero의 아키텍처는 이전 버전보다 더 단순했다. 매우 깊은 신경망 훈련을 돕는 딥 러닝 구조 유형인 잔차 블록이 있는 단일 신경망을 사용했다. 신경망은 현재 바둑판 상태를 입력으로 받아 정책 벡터(각 가능한 수의 확률)와 가치 스칼라(추정 승리 확률) 두 값을 출력했다. 훈련은 Adam 옵티마이저와 정책 및 가치 오류를 결합한 사용자 정의 손실 함수를 사용했다.
자기 대국 게임은 여러 머신에서 병렬로 생성되었다. 각 게임은 현재 최고의 신경망에 의해 진행되었으며, 그 결과는 확률적 경사 하강법을 통해 신경망을 업데이트하는 데 사용되었다. 훈련 과정은 Google이 설계한 맞춤형 하드웨어 가속기인 64개의 텐서 처리 장치(TPU)에서 약 72시간 동안 실행되었다. 이 기간 동안 프로그램은 약 490만 판의 자기 대국을 두었는데, 이는 다른 일부 AI 훈련 방식에서 사용된 수십억 판보다 훨씬 적은 수치이다.
성능 및 결과
3일간의 훈련 후, AlphaGo Zero는 2016년 세계 챔피언 이세돌을 이겼던 이전 AlphaGo 버전을 능가하는 수준에 도달했다. 21일 후에는 약 5185 Elo 등급에 도달하여 어떤 인간 선수나 이전 AI 시스템보다 높았다. 일련의 평가 게임에서 AlphaGo Zero는 AlphaGo Lee를 100대 0으로 이겼고, 이전의 개선된 버전인 AlphaGo Master도 89대 11로 이겼다.
이 프로그램은 "3-3 포인트" 침입과 같은 포석 패턴과 복잡한 중반 전술을 포함한 많은 알려진 바둑 전략을 스스로 발견했다. 또한 인간의 대국에서 흔하지 않은 독특한 전략, 예를 들어 프로 선수들을 놀라게 한 특이한 초반 수를 개발했다. 이는 자기 대국 학습이 인간의 지도 없이 창의적인 해결책을 만들어낼 수 있음을 보여주었다.
의의 및 영향
AlphaGo Zero는 인공 지능 연구의 주요 이정표를 나타냈다. 충분한 계산 능력과 결합된 범용 학습 알고리즘이 사전 지식 없이 복잡한 영역을 마스터할 수 있음을 입증했다. 이는 인간의 전문성이나 수작업으로 만든 특징에 크게 의존했던 이전 접근 방식과 대조되었다. AlphaGo Zero의 성공은 이후 강화 학습 연구, 특히 다른 게임과 단백질 접힘 및 칩 설계와 같은 실제 문제에 대한 응용에 영향을 미쳤다.
이 방법은 또한 계산 자원의 중요성을 강조했다. 알고리즘은 개념적으로 단순했지만, 수백만 판의 자기 대국을 실행하려면 상당한 하드웨어가 필요했다. 이는 DeepMind와 같은 대규모 조직만이 필요한 인프라를 감당할 수 있었기 때문에 이러한 기술의 접근성에 대한 의문을 제기했다. 그러나 핵심 아이디어는 이후 더 작은 규모의 문제와 오픈 소스 구현에 적용되었다.
유산 및 후속 작업
AlphaGo Zero의 원리는 다른 영역으로 확장되었다. 2019년 DeepMind는 동일한 자기 대국 접근 방식을 사용하여 바둑, 체스, 쇼기를 둘 수 있는 더 일반적인 버전인 AlphaZero를 출시했다. AlphaZero는 세 게임 모두에서 인간을 능가하는 성능을 달성하여 이 방법의 다재다능함을 더욱 입증했다. 이러한 시스템의 성공은 딥 러닝의 더 넓은 분야에 기여했으며 AI 개발에서 강화 학습의 잠재력을 강화했다.
AlphaGo Zero는 또한 AI의 창의성과 직관의 본질에 대한 논의를 촉발했다. 인간의 입력 없이 새로운 전략을 발견하는 능력은 기계가 복잡한 환경에서 독창적인 해결책을 생성할 수 있음을 시사했다. 이는 게임을 넘어 과학적 발견과 최적화 문제를 포함한 분야에 영향을 미친다. 이 프로그램은 충분한 계산과 결합될 때 단순한 학습 규칙이 정교한 행동으로 이어질 수 있는 방법의 상징적인 예로 남아 있다.
평가 및 비판
AlphaGo Zero는 기술적 성과로 널리 칭찬받았지만, 일부 연구자들은 한계를 지적했다. 훈련 과정은 엄청난 계산 자원을 필요로 하여 많은 학술 연구실에서 실용적이지 않았다. 또한 프로그램은 바둑에 특화되어 있어 상당한 수정 없이는 다른 작업으로 일반화되지 않았다. 비판자들은 자기 대국 접근 방식이 명확한 규칙이 있는 잘 정의된 환경에 의존하며, 이는 불확실성과 불완전한 정보가 있는 실제 문제에는 적용되지 않을 수 있다고 지적했다.
이러한 주의에도 불구하고 AlphaGo Zero가 AI 연구에 미친 영향은 상당했다. 이는 자기 대국 및 커리큘럼 학습에 대한 새로운 작업에 영감을 주었으며, 그 성공은 단순한 학습 메커니즘에서 지능적 행동이 나타날 수 있다는 아이디어를 검증하는 데 도움이 되었다. 이 프로그램은 현대 기계 학습 기술의 힘의 핵심 사례로 자주 인용되며, AI 과정과 연구 논문에서 여전히 연구 대상으로 남아 있다.