Libratus 포커

영어에서 번역됨

Libratus는 카네기 멜론 대학교에서 개발된 AI 포커 봇으로, 2017년 헤즈업 노리밋 텍사스 홀덤 토너먼트에서 최고의 인간 프로 선수들을 물리쳤으며, 이는 반사실적 후회 최소화와 엔드게임 해결의 조합을 사용한 결과이다.

Libratus는 포커, 특히 헤즈업 노리밋 텍사스 홀덤을 플레이하도록 설계된 인공 지능 프로그램이다. 이 프로그램은 피츠버그에 있는 카네기 멜론 대학교에서 개발되었으며, 제작자들은 이를 포커 이외의 다른 응용 분야에도 일반화할 수 있도록 의도했다. Libratus라는 이름은 라틴어로 '균형 잡힌'이라는 뜻이며, 이전 포커 봇인 Claudico의 명목상 후속작이다.

배경 및 개발

Libratus는 처음부터 새로 구축되었지만, Claudico의 유산을 기반으로 했다. 개발에는 200만~300만 코어 시간이 소요된 Claudico와 비교하여 1,500만 코어 시간 이상의 계산이 필요했으며, 피츠버그 슈퍼컴퓨팅 센터의 'Bridges' 슈퍼컴퓨터에서 수행되었다. Libratus의 제작자 중 한 명인 투오마스 산드홀름 교수에 따르면, 이 봇은 고정된 내장 전략을 가지고 있지 않으며, 대신 전략을 즉석에서 계산하는 알고리즘을 사용한다. 핵심 기술은 2014년 오스카리 탐멜린이 도입한 CFR+ 방법의 변형인 반사실적 최소화 회귀(counterfactual regret minimization)의 새로운 변형이었다. 여기에 더해 Libratus는 산드홀름과 그의 박사과정 학생 노암 브라운이 개발한 엔드게임 해결이라는 새로운 기법을 사용했다. 이 방법은 포커 프로그래밍에서 이전의 사실상 표준이었던 '액션 매핑'의 필요성을 제거했다.

Libratus 개발과 동시에, 찰스 대학, 체코 공과대학, 앨버타 대학의 국제 팀은 DeepStack을 개발했는데, 이는 2016년 12월 헤즈업 노리밋 텍사스 홀덤에서 프로 포커 선수들을 상대로 승리한 최초의 컴퓨터 프로그램이 되었다. 두 시스템 모두 반사실적 최소화 회귀를 사용했지만 접근 방식은 달랐다. DeepStack은 게임 상태를 평가하기 위해 신경망을 사용한 반면, Libratus는 리프 노드 평가에 신경망을 사용하지 않았다.

2017년 인간 대 AI 매치

2017년 1월 11일부터 31일까지, Libratus는 'Brains vs. Artificial Intelligence: Upping the Ante challenge'라는 토너먼트에서 제이슨 레스, 동 킴, 다니엘 맥컬레이, 지미 추 등 4명의 정상급 인간 포커 선수들과 경쟁했다. 이 토너먼트는 120,000핸드로 진행되었으며, 이는 2015년 Claudico가 플레이한 이전 토너먼트보다 50% 증가한 수치이고, 기간도 추가 볼륨을 처리하기 위해 13일에서 20일로 연장되었다.

4명의 선수는 두 개의 하위 팀으로 나뉘었다. 한 팀은 공개된 장소에서 플레이했고, 다른 팀은 'The Dungeon'이라는 별명의 별도 방에서 플레이했으며, 그곳에서는 휴대폰이나 외부 통신이 허용되지 않았다. 던전 팀은 공개 팀과 동일한 카드 시퀀스를 받았지만, 카드의 주인이 바뀌었다. 즉, 던전의 인간 선수들은 AI가 공개 팀에서 받았던 카드를 받았다. 이 설정은 카드 운의 효과를 무효화하기 위한 것이었다.

상금 200,000달러는 인간 선수들에게만 독점적으로 분배되었다. 각 선수는 최소 20,000달러를 받았으며, 나머지는 AI를 상대로 한 성과에 따라 분배되었다. 토너먼트 규칙에 따라 AI 자체는 우승했음에도 불구하고 상금을 받지 못했다.

토너먼트 기간 동안 Libratus는 낮에는 선수들과 경쟁했고, 밤에는 전날의 플레이, 특히 자신의 패배를 분석하여 전략을 완성했다. 이를 통해 인간 팀이 발견한 허점을 지속적으로 보완할 수 있었고, 그 결과 인간과 Libratus 사이에 끝없는 군비 경쟁이 벌어졌다. 야간 분석에는 Bridges 슈퍼컴퓨터에서 추가로 400만 코어 시간이 사용되었다.

AI의 강점

Libratus는 토너먼트 첫날부터 인간 선수들을 앞서 나갔다. 선수 동 킴은 AI의 강점에 대해 다음과 같이 말했다. "오늘까지 그것이 얼마나 뛰어난지 몰랐습니다. 제 카드를 볼 수 있는 상대와 플레이하는 것 같은 느낌이었습니다. 제가 부정 행위를 한다고 비난하는 것은 아니지만, 정말 그 정도로 대단했습니다."

경기 16일째, Libratus는 처음으로 1,000,000달러 돌파에 성공했다. 그날이 끝났을 때 AI는 인간 팀을 상대로 1,194,402달러의 칩을 앞서고 있었다. 경기가 끝났을 때 Libratus는 1,766,250달러의 칩 우위로 압도적인 승리를 거두었다. 매치의 빅 블라인드가 100달러였기 때문에, Libratus의 승률은 100핸드당 14.7 빅 블라인드에 해당하며, 이는 포커에서 매우 높은 승률로 간주되며 통계적으로 매우 유의미하다.

비교를 위해, DeepStack은 11명의 프로 선수들을 상대로 44,000핸드 연구에서 100핸드당 49 빅 블라인드의 승률을 달성했지만, 테스트 조건(핸드 수, 상대 실력, 토너먼트 형식)이 다르기 때문에 직접적인 비교는 어렵다.

인간 선수들 중에서는 동 킴이 1위, 맥컬레이가 2위, 지미 추가 3위, 제이슨 레스가 4위를 차지했다.

이 봇은 파격적인 베팅 스타일을 가지고 있었는데, 특정 상황에서는 팟에 100달러만 있어도 20,000달러를 베팅하기도 했다. 경기가 끝난 후, 이 전략은 포커 커뮤니티에서 분석되었다.

기타 가능한 응용 분야

Libratus의 첫 번째 응용 분야는 포커였지만, 제작자들은 AI의 훨씬 더 광범위한 사명을 염두에 두고 있었다. 연구자들은 불완전한 정보가 제공되고 상대방이 정보를 숨기거나 속임수를 쓸 수 있는 모든 상황에서 학습할 수 있도록 AI를 설계했다. 이러한 이유로 산드홀름과 그의 동료들은 이 시스템을 사이버 보안, 비즈니스 협상, 의료 계획과 같은 다른 실제 문제에도 적용할 것을 제안하고 있다.

같이 보기

  • DeepStack
  • 컴퓨터 포커 선수
  • Cepheus
  • Claudico
  • Polaris
  • Pluribus

참고 문헌

외부 링크

  • 리버스 카지노의 공식 웹사이트에 있는 Brains versus Artificial Intelligence (2016년 2월 3일 보관됨)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·poker·carnegie-mellon-university·2017-in-computing
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 8일 작성자 AI Wiki Bot · 역사