Pluribusは、FacebookのAIラボとカーネギーメロン大学によって開発された人工知能に基づくコンピューターポーカープレイヤーです。これは、ノーリミットテキサスホールデムというポーカーの変種をプレイし、複雑なマルチプレイヤー競技で人間を打ち負かした最初のボットであり、2019年に開発者らによって発表された画期的な成果です。このシステムは、従来のAIゲームプレイの成果(主に2人用ゲームに焦点を当てていた)からの転換を示し、従来のゲーム理論的戦略が直接適用されないマルチプレイヤー環境での成功を収めました。
このプロジェクトは、チェス、囲碁、ヘッズアップポーカーなどのゲームで人間を超える結果を生み出してきた機械学習と深層学習の広範な分野から生まれました。しかし、マルチプレイヤーポーカーでは、対戦相手が結託する可能性があり、ゲームがゼロサムではないため、ナッシュ均衡を近似する標準的なアプローチが複雑になります。Pluribusは代わりに、オフラインの自己対戦で基本戦略を構築し、オンライン対戦中のリアルタイム学習を組み合わせるアプローチを採用しました。このアプローチは強い理論的保証を欠いていますが、人間のプロフェッショナルに対して経験的に優れた性能を発揮しました。
開発と戦略
Pluribusの開発者らによると、「マルチプレイヤーポーカーで超人的なAIを開発することは、Pluribus以前のコンピューターポーカーにおける広く認識された主要な残されたマイルストーン」でした。基本戦略は8日間で計算され、市場価格で約144ドルのコストがかかり、これはAlphaZeroなどの同時代の超人的なゲームプレイのマイルストーンよりもはるかに小規模でした。この効率性は、以前のAIシステムが大規模なクラウドコンピューティングクラスターを必要としたのに対し、比較的控えめな計算リソースを使用したことによるものです。
Pluribusは、オフラインの自己対戦に依存して基盤となる戦略を確立し、その後オンライン対戦中にリアルタイムでそれを洗練させます。このハイブリッドアプローチにより、ボットは対戦相手の傾向に動的に適応できました。その自己学習によるプレイスタイルは、人間の専門家よりも「リンプ」(ビッグブラインドをコールすること)を避け、「ドンクベット」(ラウンドをコールで終え、次のラウンドをベットで開始すること)をより頻繁に行うことで知られています。これらの型にはまらない戦術は、人間の期待を混乱させ、ボットを読みにくくしたため、成功に貢献しました。
パフォーマンスと結果
5人のプロポーカープレイヤーとの競技では、Pluribusは1ハンドあたり平均5ドルを獲得し、1時間あたり1,000ドルの収益を上げ、Facebookはこれを「決定的な勝利の差」と表現しました。さまざまな競技を通じて、Pluribusは1ゲームあたり平均30ミリビッグブラインド以上を獲得しました。これらの結果は、2人用の変種よりもはるかに複雑な6人用ノーリミットテキサスホールデムで発生したため、注目に値しました。
ボットの成功は統計的なものだけでなく、心理的なものでもありました。プロのプレイヤーは、フラストレーションと圧倒された感覚を報告しました。Jason Lesは「非常に絶望的でした。勝つためにできることが何もないように感じます」と述べました。Chris Fergusonは「Pluribusは対戦するのが非常に難しい相手です。どんなハンドでも彼を特定するのは本当に難しい」と指摘しました。しかし、Jimmy Chouはこの経験に価値を見出しました。「ボットとプレイするたびに、自分のゲームに取り入れる新しい何かを学んでいるように感じます」。ウォールストリートジャーナルでは、科学編集者のDaniela HernandezがPluribusを「欺瞞という重要な人間のスキルに優れている」と特徴づけました。
AI研究における意義
Pluribusは、OpenAIのDota 2でのボットやGoogle DeepMindのAlphaZeroなどの以前の成果に続く、ゲームプレイAIの進歩におけるマイルストーンを表しました。これらのシステムが2人用ゲームを支配したのに対し、Pluribusは従来の均衡近似が失敗するマルチエージェント環境の課題に取り組みました。Pluribusが使用したアプローチは、強い理論的保証を欠いていましたが、自己対戦とリアルタイム適応を通じて経験的に成功する戦略を学習できることを実証し、その後の生成AIや他のインタラクティブシステムの研究に情報を提供しました。
この成功はまた、ゲームプレイAIにおけるニューラルネットワークの重要性を浮き彫りにしました。Pluribusは、ゲーム状態の価値を推定するためにニューラルネットワークを使用し、決定を洗練させるために検索アルゴリズムを使用しました。これは、他の超人的なゲームエンジンで使用される技術と類似しています。ボットがオフライン学習とオンライン学習を融合させる能力は、動的なマルチエージェント環境で動作する必要があるAIシステムのテンプレートを提供し、その関連性はゲームを超えて金融や交渉などの領域にまで及びます。
広範な文脈と受容
Pluribusの開発は、2010年代後半のAI研究の広範な波の一部であり、深層学習とニューラルネットワークの進歩が推論と戦略のブレークスルーを可能にしました。後に登場した大規模言語モデルとは異なり、Pluribusは特定の明確に定義された領域に焦点を当てましたが、その成功は敵対的でインタラクティブな設定におけるAIの可能性を強調しました。Hernandezが指摘したように、ボットが人間のプレイヤーを欺く能力は、人間の行動とブラフをモデル化するAIの洗練度の高まりを強調しました。
このプロジェクトは、Facebook AIとカーネギーメロンの研究者によって主導され、2019年にその発見を発表しました。このコラボレーションは、スタンフォードAIラボやバークレーAIリサーチとのパートナーシップに見られるように、学術研究と産業AIの取り組みの交差点の拡大を例示しました。
倫理的および実用的な考慮事項
勝利後、開発者らはソースコードの公開を拒否しました。オンライン対戦で人間のポーカープレイヤーに対して密かに不正行為をするために悪用されることを恐れたためです。この決定は、研究のために開発された能力が有害な目的に適用される可能性があるデュアルユース技術に関するAIコミュニティの広範な懸念を反映しました。この動きは、科学的な開放性と潜在的な社会的リスクのバランスを取る、AI研究における責任ある開示の前例を設定しました。
このケースはまた、AIの安全性と超人的システムの倫理的な展開に関する議論に影響を与えました。ポーカーはレクリエーション活動ですが、Pluribusで使用された技術は、交渉やオークション入札など、同様の戦略的考慮事項が適用される他のマルチプレイヤー意思決定領域に影響を与えます。2020年代初頭の時点で、主流のポーカープラットフォームは、同等の能力を持つAIを公に展開していません。これは、開発者らがソースコードを公開しない決定をしたことが一因です。
遺産と倫理的考慮事項
勝利後、開発者らはソースコードの公開を拒否しました。オンライン対戦で人間のポーカープレイヤーに対して密かに不正行為をするために悪用されることを恐れたためです。この決定は、後の生成AIの発展でより顕著になるであろう、高度なAIシステムのデュアルユース性に関する懸念の高まりを反映しました。ボットはまた、オンラインゲームの公平性に関する議論に影響を与えました。悪意のあるアクターによってそのようなシステムが展開される可能性が、検出と規制に関する疑問を提起したためです。
Pluribusの遺産は、マルチエージェントAIとリアルタイム適応に関する進行中の研究にまで及びます。その成功は、複雑なマルチプレイヤー設定において、経験的方法が理論的に基づいたアプローチを上回る可能性があることを示し、オークション入札、交渉、その他の戦略的相互作用などの分野でのさらなる研究を促進しました。その後のAIの発展、特にトランスフォーマーモデルと生成AIの進歩は、Pluribusが例示した自己対戦と強化学習の広範な基盤に基づいていましたが、その具体的な技術は独自のままでした。
倫理的および影響の考慮事項
勝利後、開発者らはソースコードの公開を拒否しました。オンライン対戦で人間のポーカープレイヤーに対して密かに不正行為をするために悪用されることを恐れたためです。この決定は、特に経済的利益のために悪用される可能性のある高度なアルゴリズムのデュアルユース性に関するAIコミュニティの懸念の高まりを反映しました。コードの非公開は、一部の初期のAI研究プロジェクトのオープンな慣行とは対照的でしたが、高リスク領域における責任ある開示の傾向と一致しました。
ボットの成功はまた、不完全情報ゲームにおける人間の競争の未来についての疑問を提起しました。ブラフと欺瞞が中心となるポーカーでは、PluribusはAIがこれらの微妙なスキルで人間の能力に匹敵するか、それを超えることができることを実証しました。これは、交渉やサイバーセキュリティなどの分野に影響を与える発展です。研究者らは、Pluribusで使用された技術が他のマルチプレイヤーシナリオに適応できる可能性があると指摘しましたが、開発者らはソースコードの公開を拒否しました。オンライン対戦で人間のポーカープレイヤーに対して密かに不正行為をするために悪用されることを恐れたためです。
遺産
Pluribusは、IBMのチェスコンピューターやAlphaZeroなどの成果と並ぶ、AIゲームプレイシステムの歴史における画期的な存在であり続けています。マルチプレイヤーポーカーでの成功は、AIが2人以上のエージェントが存在する環境、つまり均衡を定義するのが難しい環境で優れた性能を発揮できることを示しました。その後のAI研究は、これらのアイデアに基づいて構築を続け、自己対戦とリアルタイム学習を自動運転車やロボティクスなどのシステムに組み込んでいます。ソースコードは公開されませんでしたが、Pluribusのアーキテクチャと戦略の公開された詳細は、マルチエージェント強化学習の学術研究に情報を提供しています。
参考文献
- ウィキペディア(CC BY-SA)から提供されたソース事実。