Pluribus एक कंप्यूटर पोकर खिलाड़ी है जो फेसबुक की एआई लैब और कार्नेगी मेलन विश्वविद्यालय द्वारा निर्मित कृत्रिम बुद्धिमत्ता का उपयोग करता है। यह पोकर के प्रकार नो-लिमिट टेक्सास होल्ड 'एम खेलता है और पहला बॉट है जिसने जटिल मल्टीप्लेयर प्रतियोगिता में मनुष्यों को हराया। डेवलपर्स ने 2019 में अपने परिणाम प्रकाशित किए, जो कृत्रिम बुद्धिमत्ता और गेम-प्लेइंग सिस्टम के क्षेत्र में एक महत्वपूर्ण मील का पत्थर साबित हुआ।
इसके रचनाकारों के अनुसार, मल्टीप्लेयर पोकर के लिए एक सुपरह्यूमन एआई विकसित करना प्लुरिबस से पहले कंप्यूटर पोकर में व्यापक रूप से मान्यता प्राप्त मुख्य शेष मील का पत्थर था। यह सिस्टम आधार रणनीति बनाने के लिए ऑफ़लाइन सेल्फ-प्ले पर निर्भर करता है, लेकिन फिर अपने ऑनलाइन खेल के दौरान वास्तविक समय में सीखना जारी रखता है। आधार रणनीति की गणना आठ दिनों में की गई थी, और बाजार दरों पर इसे तैयार करने में लगभग $144 की लागत आती, जो अल्फाज़ीरो जैसे समकालीन सुपरह्यूमन गेम-प्लेइंग मील के पत्थरों की तुलना में बहुत कम है।
तकनीकी दृष्टिकोण
एआई में, दो-खिलाड़ी शून्य-योग खेल (जैसे हेड्स-अप होल्ड 'एम) आमतौर पर नैश संतुलन रणनीति का अनुमान लगाकर जीते जाते हैं; हालाँकि, यह दृष्टिकोण तीन या अधिक खिलाड़ियों वाले खेलों के लिए काम नहीं करता है। प्लुरिबस इसके बजाय एक ऐसा दृष्टिकोण उपयोग करता है जिसमें मजबूत सैद्धांतिक गारंटी का अभाव है, लेकिन फिर भी मानव खिलाड़ियों को हराने में अनुभवजन्य रूप से अच्छा काम करता प्रतीत होता है। सिस्टम का डिज़ाइन मशीन लर्निंग और डीप लर्निंग की तकनीकों पर आधारित है, हालाँकि यह कई समकालीन एआई सिस्टम की तरह न्यूरल नेटवर्क पर उसी तरह निर्भर नहीं करता है। इसकी वास्तविक समय की सीखने की क्षमता इसे खेल के दौरान विरोधियों की प्रवृत्तियों के अनुकूल होने की अनुमति देती है, एक विशेषता जो इसे पहले के पोकर बॉट्स से अलग करती है।
प्रदर्शन और परिणाम
प्रतियोगिताओं के दौरान, प्लुरिबस ने प्रति खेल औसतन 30 मिली बिग ब्लाइंड्स से अधिक जीते। पांच पेशेवर पोकर खिलाड़ियों के खिलाफ नो-लिमिट होल्ड 'एम खेलते हुए, प्लुरिबस ने प्रति हाथ औसतन $5 जीते, जिसमें प्रति घंटे $1,000 की जीत थी, जिसे फेसबुक ने जीत का निर्णायक अंतर बताया। बॉट की स्व-सीखी खेल शैली लिम्पिंग (बिग ब्लाइंड को कॉल करना) से बचती है, और मानव विशेषज्ञों की तुलना में अधिक बार डॉन्क बेटिंग (एक राउंड को कॉल के साथ समाप्त करना और अगले राउंड की शुरुआत बेट के साथ करना) में संलग्न होती है। ये अपरंपरागत रणनीतियाँ शीर्ष-स्तरीय विरोधियों के खिलाफ प्रभावी साबित हुईं।
विशेषज्ञों की प्रतिक्रियाएँ
विशेषज्ञ पोकर खिलाड़ियों में, जेसन लेस ने कहा कि उन्होंने बहुत निराश महसूस किया, यह कहते हुए, "आपको ऐसा नहीं लगता कि जीतने के लिए आप कुछ भी कर सकते हैं।" क्रिस फर्ग्यूसन ने कहा, "प्लुरिबस के खिलाफ खेलना बहुत कठिन है। किसी भी प्रकार के हाथ पर उसे पकड़ना वास्तव में कठिन है।" जिमी चाउ ने कहा, "जब भी बॉट के खिलाफ खेलता हूँ, मुझे लगता है कि मैं अपने खेल में शामिल करने के लिए कुछ नया सीखता हूँ।" द वॉल स्ट्रीट जर्नल में, विज्ञान संपादक डेनिएला हर्नांडेज़ ने प्लुरिबस को एक प्रमुख मानव कौशल - धोखे में उन्नत बताया।
व्यापक संदर्भ और विरासत
प्लुरिबस का विकास कंप्यूटर पोकर में पहले के काम पर आधारित था, जिसमें हेड्स-अप बॉट्स शामिल थे जिन्होंने पहले दो-खिलाड़ी खेलों में सुपरह्यूमन प्रदर्शन हासिल किया था। मल्टीप्लेयर नो-लिमिट होल्ड 'एम में सफलता को एक बड़ी सफलता माना गया क्योंकि इस खेल में अपूर्ण जानकारी, ब्लफिंग और कई खिलाड़ियों के बीच जटिल रणनीतिक बातचीत शामिल है। प्लुरिबस द्वारा उपयोग किया गया दृष्टिकोण, जो ऑफ़लाइन सेल्फ-प्ले को वास्तविक समय के अनुकूलन के साथ जोड़ता है, ने गेम-प्लेइंग एआई और मल्टी-एजेंट सिस्टम में बाद के शोध को प्रभावित किया है।
स्रोत कोड और नैतिक विचार
जीत के बाद, डेवलपर्स ने स्रोत कोड जारी करने से इनकार कर दिया, इस डर से कि इसका दुरुपयोग ऑनलाइन मैचों में मानव पोकर खिलाड़ियों के खिलाफ गुप्त रूप से धोखा देने के लिए किया जाएगा। इस निर्णय ने प्रतिस्पर्धी और वित्तीय संदर्भों में उन्नत एआई सिस्टम के संभावित दुरुपयोग के बारे में बढ़ती चिंताओं को उजागर किया। प्लुरिबस के मामले पर एआई सुरक्षा और शक्तिशाली एल्गोरिदम की जिम्मेदार तैनाती के संदर्भ में चर्चा की गई है, साथ ही गूगल डीपमाइंड और ओपनएआई जैसे संगठनों द्वारा विकसित अन्य उल्लेखनीय सिस्टम के साथ।
संदर्भ
- फेसबुक एआई लैब और कार्नेगी मेलन विश्वविद्यालय के शोध प्रकाशन (2019)
- डेनिएला हर्नांडेज़ द्वारा द वॉल स्ट्रीट जर्नल कवरेज
- पेशेवर पोकर खिलाड़ियों जेसन लेस, क्रिस फर्ग्यूसन और जिमी चाउ के बयान