गेम थ्योरी गणित और अर्थशास्त्र की एक शाखा है जो तर्कसंगत निर्णयकर्ताओं, जिन्हें खिलाड़ी कहा जाता है, के बीच रणनीतिक अंतःक्रियाओं का अध्ययन करती है। यह उन स्थितियों के लिए औपचारिक मॉडल प्रदान करती है जहाँ प्रत्येक भागीदार का परिणाम न केवल उनके अपने कार्यों पर बल्कि दूसरों के कार्यों पर भी निर्भर करता है। यह क्षेत्र विश्लेषण करता है कि व्यक्ति या संगठन प्रतिपक्षों के अपेक्षित विकल्पों को देखते हुए अपने अपेक्षित लाभ को अधिकतम करने के लिए रणनीतियाँ कैसे चुनते हैं। इसके सिद्धांत अर्थशास्त्र, राजनीति विज्ञान, जीव विज्ञान और तेजी से कृत्रिम बुद्धिमत्ता प्रणालियों के डिजाइन सहित विभिन्न विषयों पर लागू होते हैं।
गेम थ्योरी की औपचारिक नींव 20वीं सदी के मध्य में उभरी, जिसमें 1944 में जॉन वॉन न्यूमैन और ऑस्कर मॉर्गनस्टर्न द्वारा थ्योरी ऑफ गेम्स एंड इकोनॉमिक बिहेवियर का प्रकाशन शामिल था। इस कार्य ने खिलाड़ियों, रणनीतियों और लाभ फलनों के समूह के रूप में एक खेल की अवधारणा पेश की, और शून्य-योग खेलों के लिए मिनिमैक्स प्रमेय स्थापित किया। 1950 में, जॉन नैश ने नैश संतुलन विकसित किया, एक समाधान अवधारणा जहाँ कोई भी खिलाड़ी दूसरों की रणनीतियों को देखते हुए अपनी रणनीति को एकतरफा बदलकर अपने लाभ में सुधार नहीं कर सकता। नैश के कार्य, जिसके लिए उन्हें 1994 में आर्थिक विज्ञान में नोबेल मेमोरियल पुरस्कार मिला, ने गेम थ्योरी की प्रयोज्यता को गैर-शून्य-योग और सहकारी सेटिंग्स तक बढ़ाया।
मुख्य अवधारणाएँ और समाधान अवधारणाएँ
एक खेल को औपचारिक रूप से उसके खिलाड़ियों, प्रत्येक के लिए उपलब्ध रणनीतियों के समूह और लाभ फलनों द्वारा परिभाषित किया जाता है जो रणनीति संयोजनों को परिणामों से मैप करते हैं। खेलों को सहकारी या गैर-सहकारी के रूप में वर्गीकृत किया जा सकता है, यह इस पर निर्भर करता है कि बाध्यकारी समझौते संभव हैं या नहीं, और शून्य-योग या गैर-शून्य-योग के रूप में इस आधार पर कि कुल लाभ स्थिर है या नहीं। नैश संतुलन केंद्रीय समाधान अवधारणा बनी हुई है, लेकिन अन्य परिशोधन भी मौजूद हैं, जैसे विस्तृत-रूप खेलों के लिए उप-खेल पूर्ण संतुलन और सहसंबद्ध संतुलन, जो बाहरी संकेतों की अनुमति देता है।
विस्तृत-रूप खेल एक खेल वृक्ष के साथ अनुक्रमिक निर्णय लेने का मॉडल बनाते हैं, जिसमें अपूर्ण जानकारी का प्रतिनिधित्व करने के लिए सूचना समूह शामिल होते हैं। इसके विपरीत, सामान्य-रूप खेल एक साथ चालों के लिए मैट्रिक्स प्रतिनिधित्व का उपयोग करते हैं। दोहराए गए खेल, जहाँ एक ही चरण खेल कई बार खेला जाता है, टिट-फॉर-टैट जैसी रणनीतियों के माध्यम से सहयोग बनाए रख सकते हैं, जैसा कि रॉबर्ट एक्सेलरोड के 1980 के दशक के कंप्यूटर टूर्नामेंटों में प्रदर्शित किया गया था।
अर्थशास्त्र और जीव विज्ञान में अनुप्रयोग
अर्थशास्त्र में, गेम थ्योरी नीलामी सिद्धांत, अल्पाधिकार मॉडल और तंत्र डिजाइन को रेखांकित करती है। 1994 का नोबेल पुरस्कार नैश, जॉन हरसानी और रेनहार्ड सेल्टेन को गैर-सहकारी गेम थ्योरी में उनके योगदान के लिए मान्यता दी गई। 2005 में, रॉबर्ट ऑमैन और थॉमस शेलिंग ने दोहराए गए खेलों और विकासवादी गेम थ्योरी के माध्यम से संघर्ष और सहयोग की समझ बढ़ाने के लिए पुरस्कार जीता। गूगल क्लाउड और अमेज़न वेब सर्विसेज द्वारा क्लाउड संसाधन आवंटन के लिए उपयोग की जाने वाली नीलामी डिज़ाइन, दक्षता और राजस्व अधिकतमकरण सुनिश्चित करने के लिए अक्सर गेम-सैद्धांतिक सिद्धांतों को शामिल करती हैं।
विकासवादी गेम थ्योरी, जिसे 1970 के दशक में जॉन मेनार्ड स्मिथ द्वारा पेश किया गया था, गेम-सैद्धांतिक अवधारणाओं को जीव विज्ञान पर लागू करती है, जहाँ रणनीतियाँ फेनोटाइप का प्रतिनिधित्व करती हैं और लाभ फिटनेस परिणाम हैं। विकासवादी स्थिर रणनीति (ESS) पशु आबादी में परोपकारिता और आक्रामकता जैसे व्यवहारों की दृढ़ता की व्याख्या करती है। इस ढांचे ने मशीन लर्निंग एल्गोरिदम को भी प्रभावित किया है, विशेष रूप से बहु-एजेंट सुदृढीकरण सीखने में।
कृत्रिम बुद्धिमत्ता में गेम थ्योरी
गेम थ्योरी आधुनिक कृत्रिम बुद्धिमत्ता अनुसंधान का अभिन्न अंग बन गई है, विशेष रूप से बहु-एजेंट प्रणालियों और रणनीतिक योजना में। सुदृढीकरण सीखने (मशीन लर्निंग से संबंधित) में, एजेंट अक्सर स्टोकेस्टिक खेलों के रूप में मॉडल किए गए वातावरण में बातचीत करते हैं, जहाँ प्रत्येक एजेंट का पुरस्कार संयुक्त क्रियाओं पर निर्भर करता है। काल्पनिक खेल और प्रति-तथ्यात्मक पछतावा न्यूनीकरण जैसे एल्गोरिदम ने पोकर और शतरंज जैसे खेलों में मानव-से-अधिक प्रदर्शन हासिल किया है, जैसा कि गूगल डीपमाइंड और अन्य प्रयोगशालाओं द्वारा विकसित प्रणालियों में देखा गया है।
नैश संतुलन की अवधारणा का उपयोग जनरेटिव मॉडल को प्रशिक्षित करने के लिए किया जाता है, जैसे जनरेटिव एआई प्रणालियाँ, जहाँ एक जनरेटर और एक विभेदक मिनिमैक्स खेल में प्रतिस्पर्धा करते हैं। 2014 में पेश किया गया यह प्रतिकूल ढांचा, छवि संश्लेषण और बड़े भाषा मॉडल प्रशिक्षण में प्रगति को बढ़ावा दिया है। इसके अतिरिक्त, तंत्र डिजाइन वितरित प्रणालियों में कम्प्यूटेशनल संसाधनों के आवंटन की जानकारी देता है, जिसमें एडब्ल्यूएस ट्रेनियम और एज़्योर बुनियादी ढाँचा शामिल है।
सीमाएँ और आलोचनाएँ
गेम थ्योरी तर्कसंगतता मानती है, जिसका अर्थ है कि खिलाड़ियों के पास सुसंगत प्राथमिकताएँ और पूर्ण या अपूर्ण जानकारी होती है। आलोचकों का तर्क है कि वास्तविक दुनिया के निर्णयकर्ता अक्सर सीमित तर्कसंगतता प्रदर्शित करते हैं, जो संज्ञानात्मक पूर्वाग्रहों और अपूर्ण जानकारी से प्रभावित होते हैं। डैनियल काह्नमैन और अमोस टावर्सकी जैसे शोधकर्ताओं द्वारा विकसित व्यवहारिक गेम थ्योरी, नैश भविष्यवाणियों से विचलन की व्याख्या करने के लिए मनोवैज्ञानिक अंतर्दृष्टि को शामिल करती है। प्रायोगिक अर्थशास्त्र ने दिखाया है कि मनुष्य अक्सर एक-शॉट कैदी की दुविधा खेलों में सहयोग करते हैं, जो सख्त स्व-हित धारणाओं का खंडन करता है।
एक और सीमा कई खेलों में संतुलन की बहुलता है, जो पूर्वानुमान शक्ति को कम करती है। कांपते हाथ पूर्णता और उचित संतुलन जैसे परिशोधन इस समस्या को हल करने का प्रयास करते हैं, लेकिन कोई सार्वभौमिक रूप से स्वीकृत समाधान मौजूद नहीं है। इसके अलावा, कम्प्यूटेशनल जटिलता बड़े खेलों के लिए संतुलन खोजना असंभव बना सकती है, एक चुनौती जिसे एल्गोरिदमिक गेम थ्योरी में हाल के कार्यों द्वारा संबोधित किया गया है।
आधुनिक विकास
समकालीन शोध गेम थ्योरी को गतिशील और नेटवर्क वाले वातावरण तक विस्तारित करता है। 2000 के दशक में विकसित मीन-फील्ड गेम थ्योरी, एजेंटों की बड़ी आबादी के बीच अंतःक्रियाओं का विश्लेषण करती है, जिसमें अर्थशास्त्र और तंत्रिका नेटवर्क प्रशिक्षण में अनुप्रयोग हैं। पछतावा न्यूनीकरण जैसे ऑनलाइन सीखने के एल्गोरिदम, दोहराए गए खेलों में सहसंबद्ध संतुलन के लिए अभिसरण गारंटी प्रदान करते हैं। ये विधियाँ संसाधन आवंटन और स्वचालित बातचीत के लिए गहन सीखने प्रणालियों में उपयोग की जाती हैं।
गेम थ्योरी कृत्रिम बुद्धिमत्ता प्रणालियों के नैतिक डिजाइन को भी सूचित करती है, विशेष रूप से प्रतिकूल हमलों के खिलाफ मजबूती सुनिश्चित करने में। मिनिमैक्स ढांचा प्रतिकूल प्रशिक्षण पर लागू होता है, जहाँ मॉडल को सबसे खराब स्थिति की गड़बड़ी का सामना करने के लिए अनुकूलित किया जाता है। जैसे-जैसे एआई सिस्टम अधिक स्वायत्त होते जाते हैं, अंतःक्रिया के गेम-सैद्धांतिक मॉडल, जिनमें एमआईटी सीएसएआईएल और स्टैनफोर्ड एआई लैब में अध्ययन किए गए शामिल हैं, बहु-एजेंट सेटिंग्स में सुरक्षित और सहकारी व्यवहार सुनिश्चित करने के लिए आवश्यक हैं।