DeepMind 알파제로

영어에서 번역됨

AlphaZero는 딥마인드(DeepMind)의 컴퓨터 프로그램으로, 신경망과 규칙 외의 도메인 지식 없이 자기 대국(self-play) 강화 학습을 통해 체스, 쇼기, 바둑을 마스터했다.

AlphaZero는 인공지능 연구 회사인 DeepMind가 개발한 컴퓨터 프로그램으로, 체스, 쇼기, 바둑과 같은 보드 게임을 숙달하기 위해 만들어졌다. 이전의 게임 플레이 시스템과 달리, 규칙 외에는 인간의 지식 없이 오직 자기 대국(self-play)을 통해 완전히 학습했다. 이 프로그램은 신경망을 몬테카를로 트리 탐색과 결합하여 사용하는데, 이 접근법은 전작인 AlphaGo Zero에서 처음으로 입증되었다. 회사는 2017년 12월 5일에 AlphaZero를 소개하는 사전 인쇄 논문을 발표했고, 이후 2018년 12월 7일에 저널 Science에 동료 심사 논문을 게재했다.

AlphaZero의 훈련 방식에는 오프닝 북, 엔드게임 테이블, 또는 인간이 만든 휴리스틱이 필요 없었다. 대신 강화 학습 알고리즘에 의해 수백만 번의 자기 대국을 통해 스스로 경험을 생성했다. 이 접근법은 전통적인 엔진보다 초당 훨씬 적은 수의 위치를 탐색했음에도 불구하고, 세 게임 모두에서 몇 시간 만에 초인간적 성능을 달성하게 했다. DeepMind는 결과적으로 나타난 플레이 스타일이 독특하며, 일부 수는 인간 관찰자에게 비직관적으로 보인다고 설명했다.

훈련 방법

훈련 과정은 5,000개의 1세대 텐서 처리 장치(TPU)를 사용해 자기 대국 게임을 생성하고, 64개의 2세대 TPU를 사용해 신경망 가중치를 업데이트했으며, 이 모든 것이 병렬로 실행되었다. 훈련 중인 시스템은 진행 상황을 측정하기 위해 주기적으로 벤치마크 프로그램과 짧은 시범 경기에서 대결했다. 체스 엔진 Stockfish와의 대결에서 AlphaZero는 약 4시간의 훈련 후 벤치마크 성능을 초과했고, 쇼기 엔진 Elmo와의 대결에서는 약 2시간이 걸렸으며, 3일 버전의 AlphaGo Zero와의 대결에서는 약 8시간이 걸렸다.

신경망은 훈련 중에 지속적으로 업데이트되었다. 전작인 시스템과 달리, AlphaZero는 게임 대칭성을 사용하여 훈련 데이터를 증강하지 않았고, 바둑에는 없지만 체스와 쇼기에는 가능한 무승부의 가능성을 통합했다. 이 알고리즘은 초기 AlphaGo Zero 접근법을 일반화하여 이러한 추가 무승부를 처리한다.

경기 결과

체스에서, 9시간의 훈련 후 AlphaZero는 Stockfish 8(2016년 TCEC 세계 챔피언)과 100게임 경기를 치렀으며, 각 측은 수당 1분을 받았다. Stockfish는 64개의 스레드와 1GB의 해시 크기를 사용한 반면, AlphaZero는 4개의 TPU를 갖춘 단일 머신에서 실행되었다. 결과는 28승, 0패, 72무승부였다. 인기 있는 인간 오프닝으로 시작한 100게임 경기 12회 시리즈에서 AlphaZero는 290승, 886무, 24패를 기록했다.

쇼기에서, 2시간의 훈련 후 AlphaZero는 Elmo 엔진(2017년 여름 세계 컴퓨터 쇼기 선수권대회 27위 버전, YaneuraOu 4.73 포함)을 100게임에서 90승, 8패, 2무로 물리쳤다. 바둑에서, 34시간의 자가 학습 후 AlphaZero는 3일 버전의 AlphaGo Zero와 대결하여 60승 40패를 기록했다.

평가된 위치 수는 극적으로 달랐다. AlphaZero는 체스에서 초당 약 80개, 쇼기에서 40,000개의 위치를 탐색한 반면, Stockfish는 7,000만 개, Elmo는 3,500만 개를 탐색했다. 이는 유망한 수에 대한 깊은 신경망의 선택적 집중으로 보완되었다.

성능 평가

DeepMind 연구원들은 이 알고리즘들이 규칙 외에는 도메인 지식 없이도 여러 보드 게임에서 초인간적 수준에 도달할 수 있는 일반적인 Reinforcement learning 접근법을 입증했다고 밝혔다. 그들은 최첨단 체스 엔진이 일반적으로 인간이 만든 전문성을 사용하여 수백만 개의 위치를 탐색하는 반면, AlphaZero는 몇 시간 만에 수천 배 적은 위치를 탐색했다고 언급했다. DeepMind의 Demis Hassabis는 자신이 체스 아마추어이기도 한데, AlphaZero의 스타일을 외계적이라고 묘사하며, 퀸과 비숍을 위치적 이점을 위해 희생하는 비직관적인 희생과 같은 예를 언급했다.

그러나 일부 전문가들은 주의를 표명했다. 그랜드마스터 Hikaru Nakamura와 Komodo 개발자 Larry Kaufman은 Stockfish가 오프닝 데이터베이스를 사용했다면 결과가 더 경쟁적이었을 수 있다고 제안했는데, 이는 엔진이 그런 상황에 최적화되어 있기 때문이다. Stockfish 개발자 Dario Romstad는 그 엔진이 고정된 시간에 최적화되어 있지 않으며, 사용된 버전은 이미 경기 당시에 구식이었다고 언급했다. 마찬가지로, 일부 쇼기 관찰자들은 Elmo의 해시 크기가 너무 낮았고, 항복 또는 입장 설정이 부적절했을 수 있다고 생각했다.

유산

DeepMind는 AlphaZero의 전체 코드를 공개하지 않았다. 그러나 Science 논문의 알고리즘 설명 덕분에 대중은 유사한 시스템을 재현할 수 있었다. 2019년에 DeepMind는 MuZero라는 더 강력한 일반화를 발표했는데, 이는 규칙이나 게임 표현을 배우지 않고도 Atari 게임과 보드 게임에서 강력한 성능을 달성하여, 핵심 아이디어가 인간이 정의한 게임 규칙에 국한되지 않음을 보여주었다.

관찰자들은 AlphaZero의 데뷔를 Chess computer 개발의 역사적 이정표와 비교했다. 1997년, Deep Blue는 경기에서 세계 챔피언 Garry Kasparov를 이긴 최초의 컴퓨터가 되었다. AlphaZero는 다른 전선을 대표했다: 수백만 개의 위치에 초점을 맞춘 특수하고 탐색 중심의 휴리스틱을 사용하는 대신, 자기 대국을 통해 훈련된 신경망이 인간이 엔지니어링한 시스템의 성능을 능가하는 기계 학습을 통해 자체 코드와 경쟁력을 학습했다.

유산

DeepMind는 AlphaZero의 전체 코드를 공개하지 않았다. 그러나 Science 논문의 알고리즘 설명 덕분에 대중은 유사한 시스템을 재현할 수 있었다. 2019년, DeepMind는 MuZero라는 더 강력한 일반화 버전을 발표했는데, 이는 게임 규칙이나 표현에 대한 지식 없이도 아타리 게임과 보드 게임에서 강력한 성능을 달성하여 이 접근법이 인간이 정의한 게임 규칙에 국한되지 않음을 보여주었다.

관찰자들은 AlphaZero의 데뷔를 Chess computer의 역사적 이정표와 비교했다. 1997년, Deep Blue는 세계 챔피언 Garry Kasparov를 대회에서 물리친 최초의 컴퓨터가 되었다. AlphaZero는 다른 전선을 대표했다: 수백만 개의 위치에 초점을 맞춘 특수화된 휴리스틱을 사용하는 대신, 자기 대국을 통해 훈련된 신경망이 인간이 설계한 시스템의 성능을 능가하는 Machine learning을 통해 스스로를 학습하고 경쟁에서 앞서 나가는 방식을 보여주었다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·reinforcement-learning·game-playing·deepmind
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사