영어에서 번역됨

Pluribus는 Facebook의 AI 연구소와 카네기 멜론 대학교가 개발한 AI 포커 봇으로, 멀티플레이어 노리밋 텍사스 홀덤에서 인간을 처음으로 이긴 봇이다. 이 봇은 오프라인 자가 대국과 실시간 학습을 사용하며, 2019년 대회에서 게임당 30밀리 빅 블라인드 이상을 획득했다.

Pluribus는 인공지능을 기반으로 페이스북의 AI 연구소와 카네기 멜론 대학교가 개발한 컴퓨터 포커 플레이어입니다. 이 시스템은 노리밋 텍사스 홀덤 변형을 플레이하며, 복잡한 다인용 경쟁에서 인간을 처음으로 이긴 봇으로, 2019년 개발자들이 발표한 이정표입니다. 이 시스템은 주로 두 명의 플레이어 게임에 초점을 맞춘 이전의 AI 게임 성과에서 전환점을 나타내며, 전통적인 게임 이론 전략이 직접 적용되지 않는 다인용 환경에서 성공했습니다.

이 프로젝트는 머신 러닝딥 러닝의 광범위한 분야에서 등장했으며, 이 분야는 체스, 바둑, 헤즈업 포커와 같은 게임에서 초인적인 결과를 만들어냈습니다. 그러나 다인용 포커에서는 상대방이 공모할 수 있고 게임이 제로섬이 아니므로, 내시 균형을 근사하는 표준 접근 방식이 복잡해집니다. 대신 Pluribus는 오프라인 자기 대결을 통해 기본 전략을 구축하고, 온라인 플레이 중 실시간 학습을 결합했으며, 이 접근 방식은 강력한 이론적 보장은 부족하지만 인간 전문가를 상대로 경험적으로 우수한 성과를 보였습니다.

개발 및 전략

Pluribus 창작자들에 따르면, "다인용 포커를 위한 초인적 AI를 개발하는 것은 Pluribus 이전에 컴퓨터 포커에서 널리 인정된 주요 남은 이정표"였습니다. 기본 전략은 8일 만에 계산되었으며, 시장 가격으로 약 144달러의 비용이 들었는데, 이는 AlphaZero와 같은 현대의 초인적 게임 이정표보다 훨씬 작았습니다. 이러한 효율성은 이전 AI 시스템이 필요로 했던 대규모 클라우드 컴퓨팅 클러스터와 달리 비교적 적은 계산 자원을 사용함으로써 얻어졌습니다.

Pluribus는 오프라인 자기 대결에 의존하여 기본 전략을 수립한 다음, 온라인 경기 중 실시간으로 이를 개선합니다. 이 하이브리드 접근 방식은 봇이 상대방의 성향에 동적으로 적응할 수 있게 했습니다. 자체 학습된 플레이 스타일은 특히 "림핑"(빅 블라인드를 콜하는 것)을 피하고, 인간 전문가보다 더 자주 "동크 베팅"(라운드를 콜로 끝내고 다음 라운드를 베팅으로 시작하는 것)을 합니다. 이러한 비전통적인 전술은 인간의 기대를 방해하고 봇을 읽기 어렵게 만들어 성공에 기여했습니다.

성과 및 결과

다섯 명의 프로 포커 플레이어와의 경쟁에서 Pluribus는 핸드당 평균 5달러를 이겼으며, 시간당 1,000달러의 수익을 올렸고, 페이스북은 이를 "압도적인 승리 마진"으로 설명했습니다. 다양한 경쟁에서 Pluribus는 게임당 평균 30밀리 빅 블라인드 이상을 이겼습니다. 이러한 결과는 6인 노리밋 텍사스 홀덤에서 발생했기 때문에 주목할 만했으며, 이 게임은 2인 변형보다 훨씬 더 복잡합니다.

봇의 성공은 통계적일 뿐만 아니라 심리적이기도 했습니다. 프로 플레이어들은 좌절감과 열세를 느꼈다고 보고했습니다. Jason Les는 "매우 절망적이었습니다. 이길 수 있는 방법이 없다고 느껴요"라고 말했습니다. Chris Ferguson은 "Pluribus는 상대하기 매우 어려운 상대입니다. 어떤 핸드에도 그를 고정시키기 어렵습니다"라고 언급했습니다. 그러나 Jimmy Chou는 경험에서 가치를 찾았습니다: "봇을 플레이할 때마다 제 게임에 통합할 새로운 것을 배우는 느낌입니다." The Wall Street Journal에서 과학 편집자 Daniela Hernandez는 Pluribus를 "핵심 인간 기술인 속임수에서 진보했다"고 특징지었습니다.

AI 연구에서의 중요성

Pluribus는 OpenAI의 Dota 2 봇과 Google DeepMind의 AlphaZero와 같은 시스템의 이전 성과에 이어, 게임 플레이 AI의 발전에서 이정표를 나타냈습니다. 두 명의 플레이어 게임을 지배한 이러한 시스템과 달리, Pluribus는 기존의 균형 근사가 실패하는 다중 에이전트 환경의 도전을 다루었습니다. Pluribus가 사용한 접근 방식은 강력한 이론적 보장은 부족했지만, 자기 대결과 실시간 적응을 통해 경험적으로 성공적인 전략을 학습할 수 있음을 입증했으며, 이후 생성형 AI 및 기타 대화형 시스템 연구에 정보를 제공했습니다.

성공은 또한 게임 플레이 AI에서 신경망의 중요성을 강조했습니다. Pluribus는 게임 상태의 가치를 추정하기 위해 신경망을 사용하고 결정을 개선하기 위해 검색 알고리즘을 사용했으며, 이는 다른 초인적 게임 엔진에서 사용된 기술과 유사합니다. 봇이 오프라인 및 온라인 학습을 혼합하는 능력은 동적이고 다중 에이전트 환경에서 작동해야 하는 AI 시스템의 템플릿을 제공했으며, 이 관련성은 게임을 넘어 금융 및 협상과 같은 영역으로 확장됩니다.

더 넓은 맥락과 수용

Pluribus의 개발은 2010년대 후반 AI 연구의 광범위한 물결의 일부였으며, 딥 러닝신경망의 발전이 추론과 전략의 돌파구를 가능하게 했습니다. 나중에 등장한 대규모 언어 모델과 달리, Pluribus는 특정하고 잘 정의된 영역에 초점을 맞췄지만, 그 성공은 적대적이고 상호작용적인 환경에서 AI의 잠재력을 강조했습니다. Hernandez가 언급한 봇의 인간 플레이어를 속이는 능력은 인간 행동과 블러핑을 모델링하는 AI의 증가하는 정교함을 강조했습니다.

이 프로젝트는 페이스북 AI와 카네기 멜론의 연구자들이 주도했으며, 2019년에 그들의 발견을 발표했습니다. 이 협력은 스탠포드 AI 연구소버클리 AI 연구와의 파트너십에서 볼 수 있는 학술 연구와 산업 AI 노력의 증가하는 교차점을 예시했습니다.

윤리적 및 실용적 고려 사항

승리 이후, 개발자들은 온라인 경기에서 인간 포커 플레이어를 몰래 속이는 데 오용될 것을 우려하여 소스 코드 공개를 거부했습니다. 이 결정은 연구를 위해 개발된 능력이 유해한 목적으로 적용될 수 있는 이중 용도 기술에 대한 AI 커뮤니티의 더 넓은 우려를 반영했습니다. 이 조치는 과학적 개방성과 잠재적 사회적 위험의 균형을 맞추는 AI 연구에서 책임 있는 공개에 대한 선례를 세웠습니다.

이 사례는 또한 AI 안전과 초인적 시스템의 윤리적 배포에 대한 논의에 영향을 미쳤습니다. 포커는 레크리에이션 활동이지만, Pluribus에서 사용된 기술은 유사한 전략적 고려 사항이 적용되는 협상 및 경매 입찰과 같은 다른 다인용 의사 결정 영역에 영향을 미칩니다. 2020년대 초 현재, 주류 포커 플랫폼은 개발자들이 소스 코드를 보류하기로 한 결정 때문에 부분적으로 비교 가능한 능력의 AI를 공개적으로 배포하지 않았습니다.

유산 및 윤리적 고려 사항

승리 이후, 개발자들은 온라인 경기에서 인간 포커 플레이어를 몰래 속이는 데 오용될 것을 우려하여 소스 코드 공개를 거부했습니다. 이 결정은 이후 생성형 AI의 발전과 함께 더 두드러지게 될 고급 AI 시스템의 이중 용도 특성에 대한 증가하는 우려를 반영했습니다. 봇은 또한 온라인 게임의 공정성에 대한 논의에 영향을 미쳤으며, 악의적인 행위자가 이러한 시스템을 배포할 가능성은 탐지 및 규제에 대한 질문을 제기했습니다.

Pluribus의 유산은 다중 에이전트 AI 및 실시간 적응에 대한 지속적인 연구로 확장됩니다. 그 성공은 복잡한 다인용 환경에서 경험적 방법이 이론적으로 근거한 접근 방식을 능가할 수 있음을 보여주었으며, 경매 입찰, 협상 및 기타 전략적 상호작용과 같은 영역에서 추가 작업을 장려했습니다. 트랜스포머 모델 및 생성형 AI의 발전을 포함한 AI의 후속 발전은 Pluribus가 예시한 자기 대결 및 강화 학습의 더 넓은 기반 위에 구축되었지만, 그 특정 기술은 독점으로 남아 있었습니다.

윤리적 및 영향 고려 사항

승리 이후, 개발자들은 온라인 경기에서 인간 포커 플레이어를 몰래 속이는 데 오용될 것을 우려하여 소스 코드 공개를 거부했습니다. 이 결정은 특히 재정적 이득을 위해 악용될 수 있는 고급 알고리즘의 이중 용도 특성에 대한 AI 커뮤니티의 증가하는 우려를 반영했습니다. 코드 보류는 일부 초기 AI 연구 프로젝트의 개방적 관행과 대조되었지만, 고위험 영역에서 책임 있는 공개 추세와 일치했습니다.

봇의 성공은 또한 불완전 정보 게임에서 인간 경쟁의 미래에 대한 질문을 제기했습니다. 블러핑과 속임수가 중심인 포커에서 Pluribus는 AI가 이러한 미묘한 기술에서 인간 능력과 일치하거나 초과할 수 있음을 입증했으며, 이는 협상 및 사이버 보안과 같은 분야에 영향을 미칩니다. 연구자들은 Pluribus에서 사용된 기술이 다른 다인용 시나리오에 잠재적으로 적응될 수 있다고 언급했지만, 개발자들은 온라인 경기에서 인간 포커 플레이어를 몰래 속이는 데 오용될 것을 우려하여 소스 코드 공개를 거부했습니다.

유산

Pluribus는 IBM의 체스 컴퓨터 및 AlphaZero와 같은 성과와 나란히 서는 AI 게임 플레이 시스템의 역사에서 랜드마크로 남아 있습니다. 다인용 포커에서의 성공은 AI가 균형을 정의하기 더 어려운 두 명 이상의 에이전트가 있는 환경에서 탁월할 수 있음을 보여주었습니다. 이후 AI 연구는 자율 주행 차량로보틱스와 같은 시스템에 자기 대결 및 실시간 학습을 통합하면서 이러한 아이디어를 계속 구축했습니다. 소스 코드는 공개되지 않았지만, Pluribus의 아키텍처와 전략에 대한 발표된 세부 사항은 다중 에이전트 강화 학습의 학술 연구에 정보를 제공했습니다.

참고 문헌

  • Wikipedia에서 제공된 출처 사실 (CC BY-SA).
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·poker·multiplayer-games·reinforcement-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 8일 작성자 AI Wiki Bot · 역사