Pluribusは、FacebookのAIラボとカーネギーメロン大学によって構築された人工知能を用いたコンピュータポーカープレイヤーである。これはノーリミットテキサスホールデムというポーカーの変種をプレイし、複雑なマルチプレイヤー競技で人間を打ち負かした最初のボットである。開発者らは2019年にその結果を発表し、人工知能とゲームプレイシステムの分野における重要なマイルストーンとなった。
開発者らによると、マルチプレイヤーポーカー向けの超人級AIの開発は、Pluribus以前のコンピュータポーカーにおいて広く認識された主要な残存マイルストーンであった。このシステムは、オフラインの自己対戦に依存して基本戦略を構築するが、その後、オンラインプレイ中にリアルタイムで学習を継続する。基本戦略は8日間で計算され、市場価格で約144ドルのコストで生産され、AlphaZeroなどの現代の超人級ゲームプレイのマイルストーンと比較してはるかに小規模であった。
技術的アプローチ
AIにおいて、2人プレイヤーのゼロサムゲーム(ヘッズアップホールデムなど)は通常、ナッシュ均衡戦略を近似することで勝利するが、このアプローチは3人以上のプレイヤーがいるゲームには機能しない。Pluribusは代わりに、強い理論的保証を欠くが、それでも人間プレイヤーを打ち負かす際に経験的にうまく機能するように見えるアプローチを使用する。このシステムの設計は機械学習と深層学習の技術を活用しているが、多くの現代のAIシステムと同じようにニューラルネットワークに依存しているわけではない。そのリアルタイム学習能力により、プレイ中に対戦相手の傾向に適応でき、これは以前のポーカーボットと区別される特徴である。
パフォーマンスと結果
競技全体を通じて、Pluribusは1ゲームあたり平均30ミリビッグブラインド以上を獲得した。5人のプロポーカープレイヤーに対してノーリミットホールデムをプレイし、Pluribusは1ハンドあたり平均5ドル、1時間あたり1,000ドルの賞金を獲得し、Facebookはこれを決定的な勝利の差と表現した。このボットの自己学習によるプレイスタイルは、リンプ(ビッグブラインドをコールすること)を避け、人間の専門家よりも頻繁にドンクベット(ラウンドをコールで終え、次のラウンドをベットで始めること)を行う。これらの型破りな戦略は、トップレベルの対戦相手に対して効果的であることが証明された。
専門家からの反き
専門のポーカープレイヤーの中では、ジェイソン・レスは非常に無力感を感じたと述べ、「勝るためにできることは何もないように感じる」と語語った。クリス・ファーガソンは「Pluribusは対戦するのが非常に難しい相手だ。どんな手で相手を特定することが本当に難しい」と述べた。ジミー・チョウは「ボットとプレイするたびに、自分のゲームに取り取り入れる新しい何かを学んでいるように感じる」と述べた。ウォール・ストリート・ジャーナルでは、科学編集者のダニエラ・ヘルナンデスがPluribusを人間の重要なスキルである欺瞞に優れていると特徴づけた。
広範な文脈と遺産
Pluribusの開発は、2人プレイヤーゲームで以前に超人級の性能を達成していたヘッズアップボットを含む、コンピュータポーカーにおける初期の研究に基づいていた。マルチプレイヤーのノーリミットホールデムでの成功は、このゲームが不完全情報、ブラフ、複数のプレイヤー間の複雑な戦略的相互作用を伴うため、大きな突破口と見なされた。Pluribusが使用したアフローチは、オフラインの自己対戦とリアルタイムの適応を組み合わせたものであり、その後のゲームプレイAIとマルチエージェントシステムの研究に影響を与えた。
ソースコードと倫理的考慮事項
勝利後、開発者らはソースコードの公開を拒否した。これは、オンラインポーカーマッチで人間プレイヤーに対して秘密裏に不正行為をするために悪用されることを恐れたためである。この決定は、競争的および金銭的文脈における高度なAIシステムの潜在的な悪用に対する懸念の高まりを浮き彫りにした。Pluribusの事例は、Google DeepMindやOpenAIなどの組織によって開発された他の注目すべきシステムと並んで、AI安全性と強力なアルゴリリズムの責任ある展開の文脈で議論されてきた。
参考文献
- Facebook AIラボおよびカーネギーメメロン大学の研究出版物(2019年)
- ダニエラ・ヘルナンデスによるウォール・ストリート・ジャーナルの報道
- プロポーカープレイヤーのジェイソン・レス、クリス・ファーガソン、ジミー・チョウからの声明