Pluribus एक कंप्यूटर पोकर खिलाड़ी है जो कृत्रिम बुद्धिमत्ता पर आधारित है, जिसे Facebook की AI प्रयोगशाला और कार्नेगी मेलन विश्वविद्यालय द्वारा विकसित किया गया है। यह पोकर के नो-लिमिट टेक्सास होल्ड 'एम संस्करण खेलता है और पहला बॉट था जिसने एक जटिल बहु-खिलाड़ी प्रतियोगिता में मनुष्यों को हराया, जो 2019 में इसके डेवलपर्स द्वारा प्रकाशित एक मील का पत्थर था। यह प्रणाली पिछली AI गेम-खेलने की उपलब्धियों से एक बदलाव को चिह्नित करती है, जो मुख्य रूप से दो-खिलाड़ी खेलों पर केंद्रित थी, एक बहु-खिलाड़ी सेटिंग में सफल होकर जहां पारंपरिक गेम-सैद्धांतिक रणनीतियाँ सीधे लागू नहीं होती हैं।
यह परियोजना मशीन लर्निंग और डीप लर्निंग के व्यापक क्षेत्र से उभरी, जिसने शतरंज, गो और हेड्स-अप पोकर जैसे खेलों में मानव-श्रेष्ठ परिणाम उत्पन्न किए थे। हालांकि, बहु-खिलाड़ी पोकर में, प्रतिद्वंद्वी मिलीभगत कर सकते हैं और खेल शून्य-योग नहीं है, जो नैश संतुलन का अनुमान लगाने के मानक दृष्टिकोण को जटिल बनाता है। Pluribus ने इसके बजाय ऑफ़लाइन सेल्फ-प्ले को एक आधार रणनीति बनाने के लिए और ऑनलाइन खेल के दौरान वास्तविक समय में सीखने को जोड़ा, एक दृष्टिकोण जिसमें मजबूत सैद्धांतिक गारंटी का अभाव है लेकिन पेशेवर मनुष्यों के खिलाफ अनुभवजन्य रूप से अच्छा प्रदर्शन किया।
विकास और रणनीति
Pluribus के रचनाकारों के अनुसार, "बहु-खिलाड़ी पोकर के लिए एक मानव-श्रेष्ठ AI विकसित करना Pluribus से पहले कंप्यूटर पोकर में व्यापक रूप से मान्यता प्राप्त मुख्य शेष मील का पत्थर था।" आधार रणनीति आठ दिनों में गणना की गई थी, और बाजार दरों पर इसका उत्पादन लगभग $144 होता, जो AlphaZero जैसे समकालीन मानव-श्रेष्ठ गेम-खेलने के मील के पत्थरों से बहुत छोटा था। यह दक्षता अपेक्षाकृत मामूली कंप्यूटिंग संसाधनों का उपयोग करने से आई, जो पहले के AI सिस्टम के विपरीत थी जिन्हें विशाल क्लाउड कंप्यूटिंग क्लस्टर की आवश्यकता होती थी।
Pluribus एक मौलिक रणनीति स्थापित करने के लिए ऑफ़लाइन सेल्फ-प्ले पर निर्भर करता है, फिर ऑनलाइन मैचों के दौरान इसे वास्तविक समय में परिष्कृत करता है। इस हाइब्रिड दृष्टिकोण ने बॉट को प्रतिद्वंद्वियों की प्रवृत्तियों के अनुकूल गतिशील रूप से ढलने की अनुमति दी। इसकी स्व-सीखी खेल शैली विशेष रूप से "लिम्पिंग" (बड़े ब्लाइंड को कॉल करना) से बचती है और मानव विशेषज्ञों की तुलना में अधिक बार "डॉन्क बेटिंग" (एक राउंड को कॉल के साथ समाप्त करना और अगले राउंड को बेटिंग के साथ शुरू करना) में संलग्न होती है। इन अपरंपरागत रणनीतियों ने इसकी सफलता में योगदान दिया, क्योंकि उन्होंने मानव अपेक्षाओं को बाधित किया और बॉट को पढ़ना मुश्किल बना दिया।
प्रदर्शन और परिणाम
पांच पेशेवर पोकर खिलाड़ियों के खिलाफ प्रतियोगिताओं में, Pluribus ने प्रति हाथ औसतन $5 जीते, प्रति घंटे $1,000 की जीत के साथ, एक परिणाम जिसे Facebook ने "जीत का निर्णायक अंतर" बताया। विभिन्न प्रतियोगिताओं में, Pluribus ने प्रति गेम औसतन 30 मिली बिग ब्लाइंड्स से अधिक जीते। ये परिणाम उल्लेखनीय थे क्योंकि वे छह-खिलाड़ी नो-लिमिट टेक्सास होल्ड 'एम में हुए, एक खेल जो दो-खिलाड़ी संस्करणों की तुलना में काफी अधिक जटिलता रखता है।
बॉट की सफलता केवल सांख्यिकीय नहीं थी बल्कि मनोवैज्ञानिक भी थी। पेशेवर खिलाड़ियों ने निराश और बेहतर महसूस करने की सूचना दी। Jason Les ने कहा कि वह "बहुत निराश महसूस करते हैं। आपको लगता है कि जीतने के लिए आप कुछ नहीं कर सकते।" Chris Ferguson ने नोट किया कि "Pluribus के खिलाफ खेलना बहुत कठिन है। किसी भी प्रकार के हाथ पर उसे पिन करना वास्तव में कठिन है।" Jimmy Chou, हालांकि, अनुभव में मूल्य पाया: "जब भी बॉट के खिलाफ खेलते हैं, मुझे लगता है कि मैं अपने खेल में शामिल करने के लिए कुछ नया उठाता हूं।" The Wall Street Journal में, विज्ञान संपादक Daniela Hernandez ने Pluribus को "एक प्रमुख मानव कौशल - धोखे में उन्नत" के रूप में चित्रित किया।
AI अनुसंधान में महत्व
Pluribus ने गेम-खेलने वाले AI की प्रगति में एक मील का पत्थर प्रस्तुत किया, जो OpenAI के Dota 2 में बॉट्स और Google DeepMind के AlphaZero जैसे सिस्टम की पहले की उपलब्धियों के बाद आया। इन प्रणालियों के विपरीत, जो दो-खिलाड़ी खेलों पर हावी थीं, Pluribus ने बहु-एजेंट वातावरण की चुनौती को संबोधित किया जहां पारंपरिक संतुलन अनुमान विफल हो जाता है। Pluribus द्वारा उपयोग किया गया दृष्टिकोण, हालांकि मजबूत सैद्धांतिक गारंटी के बिना, प्रदर्शित किया कि अनुभवजन्य रूप से सफल रणनीतियाँ सेल्फ-प्ले और वास्तविक समय अनुकूलन के माध्यम से सीखी जा सकती हैं, जो जनरेटिव AI और अन्य इंटरैक्टिव सिस्टम में बाद के अनुसंधान को सूचित करती हैं।
सफलता ने गेम-खेलने वाले AI में तंत्रिका नेटवर्क के महत्व को भी उजागर किया। Pluribus ने गेम राज्यों के मूल्य का अनुमान लगाने के लिए एक तंत्रिका नेटवर्क और निर्णयों को परिष्कृत करने के लिए एक खोज एल्गोरिदम का उपयोग किया, एक तकनीक जो अन्य मानव-श्रेष्ठ गेम इंजनों में उपयोग की जाने वाली तकनीकों के समान है। ऑफ़लाइन और ऑनलाइन सीखने को मिश्रित करने की बॉट की क्षमता ने AI सिस्टम के लिए एक टेम्पलेट प्रदान किया जिन्हें गतिशील, बहु-एजेंट वातावरण में काम करना चाहिए, एक प्रासंगिकता जो खेलों से परे वित्त और बातचीत जैसे डोमेन तक फैली हुई है।
व्यापक संदर्भ और स्वागत
Pluribus का विकास 2010 के दशक के अंत में AI अनुसंधान की एक व्यापक लहर का हिस्सा था, जब डीप लर्निंग और तंत्रिका नेटवर्क में प्रगति ने तर्क और रणनीति में सफलताओं को सक्षम किया। बाद में उभरे बड़े भाषा मॉडल के विपरीत, Pluribus एक विशिष्ट, अच्छी तरह से परिभाषित डोमेन पर केंद्रित था, लेकिन इसकी सफलता ने प्रतिकूल, इंटरैक्टिव सेटिंग्स में AI की क्षमता को उजागर किया। मानव खिलाड़ियों को धोखा देने की बॉट की क्षमता, जैसा कि Hernandez ने नोट किया, मानव व्यवहार और ब्लफिंग के मॉडलिंग में AI की बढ़ती परिष्कार को रेखांकित किया।
यह परियोजना Facebook AI और Carnegie Mellon के शोधकर्ताओं द्वारा नेतृत्व की गई थी, जिन्होंने 2019 में अपने निष्कर्ष प्रकाशित किए। सहयोग ने शैक्षणिक अनुसंधान और औद्योगिक AI प्रयासों के बढ़ते प्रतिच्छेदन का उदाहरण दिया, जो स्टैनफोर्ड AI प्रयोगशाला और बर्कले AI अनुसंधान के साथ देखी गई साझेदारियों के समान है।
नैतिक और व्यावहारिक विचार
जीत के बाद, डेवलपर्स ने स्रोत कोड जारी करने से इनकार कर दिया, इस डर से कि इसका दुरुपयोग ऑनलाइन मैचों में मानव पोकर खिलाड़ियों के खिलाफ गुप्त रूप से धोखा देने के लिए किया जाएगा। यह निर्णय AI समुदाय में दोहरे-उपयोग प्रौद्योगिकियों के बारे में व्यापक चिंताओं को दर्शाता है, जहां अनुसंधान के लिए विकसित क्षमताओं को हानिकारक उद्देश्यों के लिए लागू किया जा सकता है। इस कदम ने AI अनुसंधान में जिम्मेदार प्रकटीकरण के लिए एक मिसाल स्थापित की, वैज्ञानिक खुलेपन को संभावित सामाजिक जोखिमों के साथ संतुलित किया।
मामले ने AI सुरक्षा और मानव-श्रेष्ठ प्रणालियों के नैतिक तैनाती के बारे में चर्चाओं को भी प्रभावित किया। जबकि पोकर एक मनोरंजक गतिविधि है, Pluribus में उपयोग की जाने वाली तकनीकों के अन्य बहु-खिलाड़ी निर्णय लेने वाले डोमेन, जैसे बातचीत और नीलामी बोली, पर निहितार्थ हैं, जहां समान रणनीतिक विचार लागू होते हैं। 2020 के दशक की शुरुआत तक, किसी भी मुख्यधारा पोकर प्लेटफॉर्म ने सार्वजनिक रूप से तुलनीय क्षमता का AI तैनात नहीं किया है, आंशिक रूप से डेवलपर्स के स्रोत कोड को रोकने के निर्णय के कारण।
विरासत और नैतिक विचार
अपनी जीत के बाद, डेवलपर्स ने स्रोत कोड जारी करने से इनकार कर दिया, इस डर से कि इसका दुरुपयोग ऑनलाइन मैचों में मानव पोकर खिलाड़ियों के खिलाफ गुप्त रूप से धोखा देने के लिए किया जा सकता है। यह निर्णय उन्नत AI प्रणालियों की दोहरे-उपयोग प्रकृति के बारे में बढ़ती चिंताओं को दर्शाता है, एक विषय जो जनरेटिव AI में बाद के विकास के साथ अधिक प्रमुख हो जाएगा। बॉट ने ऑनलाइन गेमिंग में निष्पक्षता के बारे में चर्चाओं को भी प्रभावित किया, क्योंकि दुर्भावनापूर्ण अभिनेताओं द्वारा ऐसी प्रणालियों की तैनाती की संभावना ने पहचान और विनियमन के बारे में प्रश्न उठाए।
Pluribus की विरासत बहु-एजेंट AI और वास्तविक समय अनुकूलन पर चल रहे अनुसंधान तक फैली हुई है। इसकी सफलता ने दिखाया कि अनुभवजन्य तरीके जटिल बहु-खिलाड़ी सेटिंग्स में सैद्धांतिक रूप से आधारित दृष्टिकोणों से बेहतर प्रदर्शन कर सकते हैं, जो नीलामी बोली, बातचीत और अन्य रणनीतिक इंटरैक्शन जैसे क्षेत्रों में आगे के काम को प्रोत्साहित करते हैं। AI में बाद के विकास, जिसमें ट्रांसफार्मर मॉडल और जनरेटिव AI में प्रगति शामिल है, ने सेल्फ-प्ले और सुदृढीकरण सीखने की व्यापक नींव पर निर्माण किया जो Pluribus ने उदाहरण दिया, हालांकि इसकी विशिष्ट तकनीकें मालिकाना बनी रहीं।
नैतिक और प्रभाव विचार
अपनी जीत के बाद, डेवलपर्स ने स्रोत कोड जारी करने से इनकार कर दिया, इस डर से कि इसका दुरुपयोग ऑनलाइन मैचों में मानव पोकर खिलाड़ियों के खिलाफ गुप्त रूप से धोखा देने के लिए किया जाएगा। यह निर्णय AI समुदाय में उन्नत एल्गोरिदम की दोहरे-उपयोग प्रकृति के बारे में बढ़ती चिंताओं को दर्शाता है, विशेष रूप से उन लोगों के बारे में जिनका वित्तीय लाभ के लिए शोषण किया जा सकता है। कोड को रोकना कुछ पहले के AI अनुसंधान परियोजनाओं की खुली प्रथाओं के विपरीत था, लेकिन उच्च-दांव डोमेन में जिम्मेदार प्रकटीकरण की प्रवृत्ति के साथ संरेखित था।
बॉट की सफलता ने अपूर्ण जानकारी के खेलों में मानव प्रतिस्पर्धा के भविष्य के बारे में भी प्रश्न उठाए। पोकर में, जहां ब्लफिंग और धोखा केंद्रीय हैं, Pluribus ने प्रदर्शित किया कि AI इन सूक्ष्म कौशलों में मानव क्षमता से मेल खा सकता है या उससे अधिक कर सकता है, एक विकास जिसके बातचीत और साइबर सुरक्षा जैसे क्षेत्रों के लिए निहितार्थ हैं। शोधकर्ताओं ने नोट किया कि Pluribus में उपयोग की जाने वाली तकनीकों को संभावित रूप से अन्य बहु-खिलाड़ी परिदृश्यों के लिए अनुकूलित किया जा सकता है, हालांकि डेवलपर्स ने स्रोत कोड जारी करने से इनकार कर दिया, इस डर से कि इसका दुरुपयोग ऑनलाइन मैचों में मानव पोकर खिलाड़ियों के खिलाफ गुप्त रूप से धोखा देने के लिए किया जाएगा।
विरासत
Pluribus AI गेम-खेलने वाली प्रणालियों के इतिहास में एक मील का पत्थर बना हुआ है, जो IBM के शतरंज कंप्यूटर और AlphaZero जैसी उपलब्धियों के साथ खड़ा है। बहु-खिलाड़ी पोकर में इसकी सफलता ने दिखाया कि AI दो से अधिक एजेंटों वाले वातावरण में उत्कृष्ट हो सकता है, जहां संतुलन को परिभाषित करना कठिन होता है। बाद के AI अनुसंधान ने इन विचारों पर निर्माण जारी रखा है, सेल्फ-प्ले और वास्तविक समय सीखने को स्वायत्त वाहनों और रोबोटिक्स जैसी प्रणालियों में शामिल किया है। जबकि स्रोत कोड कभी जारी नहीं किया गया था, Pluribus की वास्तुकला और रणनीति के प्रकाशित विवरणों ने बहु-एजेंट सुदृढीकरण सीखने में शैक्षणिक अध्ययन को सूचित किया है।
संदर्भ
- स्रोत तथ्य जैसा कि विकिपीडिया से प्रदान किया गया है (CC BY-SA)।