मिनिमैक्स (कभी-कभी मिनमैक्स, एमएम या सैडल पॉइंट) एक निर्णय नियम है जिसका उपयोग आर्टिफिशियल इंटेलिजेंस, निर्णय सिद्धांत, संयोजनात्मक खेल सिद्धांत, सांख्यिकी, और दर्शन में किया जाता है। इसका उद्देश्य सबसे खराब स्थिति (अधिकतम हानि परिदृश्य) के लिए संभावित हानि को न्यूनतम करना है। जब लाभ से निपटा जाता है, तो इसे 'मैक्सिमिन' कहा जाता है – न्यूनतम लाभ को अधिकतम करने के लिए। मूल रूप से कई-खिलाड़ी शून्य-योग खेल सिद्धांत के लिए तैयार किया गया, जिसमें दोनों स्थितियाँ शामिल हैं जहाँ खिलाड़ी बारी-बारी से चाल चलते हैं और जहाँ वे एक साथ चाल चलते हैं, इसे अधिक जटिल खेलों और अनिश्चितता की उपस्थिति में सामान्य निर्णय-निर्माण तक भी विस्तारित किया गया है।
यह अवधारणा प्रतिकूल परिदृश्यों में केंद्रीय है, जहाँ एक खिलाड़ी का लाभ दूसरे की हानि है। ऐसे संदर्भों में, मिनिमैक्स एक रूढ़िवादी रणनीति प्रदान करता है: मान लें कि प्रतिद्वंद्वी हमेशा वह कार्रवाई चुनेगा जो आपके लिए सबसे खराब है, और वह चाल चुनें जो आपके गारंटीकृत भुगतान को अधिकतम करे। यह सिद्धांत मशीन लर्निंग और डीप लर्निंग में कई एल्गोरिदम को रेखांकित करता है, विशेष रूप से जनरेटिव मॉडल के प्रशिक्षण और मजबूत प्रणालियों के डिज़ाइन में।
खेल सिद्धांत की नींव
खेल सिद्धांत में, मैक्सिमिन मान वह उच्चतम मान है जो एक खिलाड़ी अन्य खिलाड़ियों की कार्रवाइयों को जाने बिना पाने के लिए सुनिश्चित हो सकता है; समकक्ष रूप से, यह सबसे न्यूनतम मान है जो अन्य खिलाड़ी खिलाड़ी को प्राप्त करने के लिए मजबूर कर सकते हैं जब वे खिलाड़ी की कार्रवाई जानते हैं। औपचारिक परिभाषा है: v_i_underline = max_{a_i} min_{a_{-i}} v_i(a_i, a_{-i}), जहाँ i खिलाड़ी का सूचकांक है, a_i खिलाड़ी i द्वारा ली गई कार्रवाई है, a_{-i} अन्य सभी खिलाड़ियों की कार्रवाइयों को दर्शाता है, और v_i खिलाड़ी i का मान फलन है।
मैक्सिमिन मान की गणना एक सबसे-खराब-स्थिति दृष्टिकोण का उपयोग करती है: खिलाड़ी की प्रत्येक संभावित कार्रवाई के लिए, अन्य सभी की संभावित कार्रवाइयों की जाँच करें और सबसे खराब संयोजन निर्धारित करें – वह जो सबसे छोटा मान देता है। फिर, वह कार्रवाई चुनें जो इस सबसे छोटे मान को यथासंभव उच्च बनाती है। उदाहरण के लिए, एक दो-खिलाड़ी खेल पर विचार करें जहाँ पंक्ति खिलाड़ी T, M, या B चुन सकता है, और स्तंभ खिलाड़ी L या R चुन सकता है, एक तालिका में दिखाए गए भुगतान के साथ। पंक्ति खिलाड़ी T खेल सकता है, कम से कम 2 का भुगतान गारंटी करते हुए (B जोखिम भरा है −100 के साथ, M −10 दे सकता है), इसलिए v_row_underline = 2। स्तंभ खिलाड़ी L खेल सकता है, कम से कम 0 सुरक्षित करते हुए (R −20 का जोखिम उठाता है), इसलिए v_col_underline = ०। यदि दोनों अपनी मैक्सिमिन रणनीतियाँ खेलते हैं(T, L), भुगतान वेक्टर है (3, 1)।
एक खिलाड़ी का मिनिमैक्स मान वह सबसे छोटा मान है जो अन्य खिलाड़ी खिलाड़ी को प्राप्त करने के लिए मजबूर कर सकते हैं, खिलाड़ी की कार्रवाइयों को जाने बिना; समकक्ष रूप से, यह सबसे बड़ा मान है जो खिलाड़ी पाने के लिए सुनिश्चित हो सकता है जब वे अन्य की कार्रवाइयाँ जानते हैं। इसकी औपचारिक परिभाषा है: v_i_overline = min_{a_{-i}} max_{a_i} v_i(a_i, a_{-i})। शून्य-योग खेलों में, प्रत्येक खिलाड़ी के लिए मिनिमैक्स मान मैक्सिमिन मान के बराबर होता है, जो मिनिमैक्स प्रमेय की ओर ले जाता है।
मिनिमैक्स प्रमेय और शून्य-योग खेल
मिनिमैक्स प्रमेय, जॉन वॉन न्यूमैन द्वारा 1928 में सिद्ध किया गया, बताता है कि मिश्रित रणनीतियों के साथ सीमित, दो-खिलाड़ी, शून्य-योग खेलों में, मैक्सिमिन मान मिनिमैक्स मान के बराबर होता है। यह प्रमेय संतुलन विश्लेषण के लिए एक नींव प्रदान करता है। ऐसे खेलों में, खेल का मान अपेक्षित भुगतान है जब दोनों खिलाड़ी इष्टतम खेलते हैं। प्रमेय सुनिश्चित करता है कि एक खिलाड़ी कम से कम इस मान की गारंटी ले सकता है, और प्रतिद्वंद्वी उन्हें अधिक से अधिक इस मान तक रोक सकता है।
एक साथ-चाल खेलों के लिए, अवधारणा मिश्रित रणनीतियों तक विस्तारित होती है, जहाँ खिलाड़ी शुद्ध कार्रवाइयों पर यादृच्छिकरण करते हैं। मिनिमैक्स प्रमेय मिश्रित रणनीतियों में एक सैडल पॉइंट के अस्तित्व की गारंटी देता है, जो रणनीतियों की एक जोड़ी है जहाँ कोई भी खिलाड़ी एकतरफा विचलन द्वारा अपना भुगतान सुधार नहीं सकता। यह परिणाम न्यूरल नेटवर्क प्रशिक्षण में मौलिक है, जहाँ प्रतिकूल उदाहरणों का विश्लेषण समान सबसे-खराब-स्थिति सिद्धांतों का उपयोग करके किया जाता है।
आर्टिफिशियल इंटेलिजेंस में अनुप्रयोग
आर्टिफिशियल इंटेलिजेंस में, मिनिमैक्स खेलों और प्रतिकूल परिदृश्यों में निर्णय-निर्माण के लिए व्यापक रूप से उपयोग किया जाता है। क्लासिक उदाहरण शतरंज, चेकर्स, या टिक-टैक-टो जैसे दो-खिलाड़ी बारी-आधारित खेलों के लिए मिनिमैक्स एल्गोरिदम है। एल्गोरिदम खेल वृक्ष का पुनरावर्ती मूल्यांकन करता है, यह मानते हुए कि प्रतिद्वंद्वी इष्टतम खेलता है। प्रत्येक नोड पर, खिलाड़ी वह चाल चुनता है जो उनके न्यूनतम लाभ को अधिकतम करता है, जबकि प्रतिद्वंद्वी वह चाल चुनता है जो खिलाड़ी के अधिकतम लाभ को न्यूनतम करता है। इसे अक्सर कम्प्यूटेशनल जटिलता को कम करने के लिए अल्फा-बीटा प्रूनिंग के साथ जोड़ा जाता है।
बड़े भाषा मॉडल और ट्रांसफॉर्मर आर्किटेक्चर में, मिनिमैक्स सिद्धांत प्रतिकूल प्रशिक्षण में दिखाई देते हैं, जहाँ मॉडल को सबसे-खराब-स्थिति व्यवधानों के खिलाफ मजबूत होने के लिए प्रशिक्षित किया जाता है। उदाहरण के लिए, जनरेटिव एडवर्सेरियल नेटवर्क (GANs) एक मिनिमैक्स उद्देश्य का उपयोग करते हैं: जनरेटर असली और नकली डेटा के बीच अंतर करने की डिस्क्रिमिनेटर की क्षमता को न्यूनतम करने की कोशिश करता है, जबकि डिस्क्रिमिनेटर अपनी सटीकता को अधिकतम करने की कोशिश करता है। यह प्रतिकूल प्रक्रिया डीप लर्निंग में मिनिमैक्स का एक प्रत्यक्ष अनुप्रयोग है।
विस्तार और विविधताएँ
मिनिमैक्स को अधिक जटिल खेलों तक विस्तारित किया गया है, जिसमें संयोग वाले खेल शामिल हैं(जैसे बैकगैमन) एक्सपेक्टिमिनिमैक्स का उपयोग करते हुए, और अपूर्ण जानकारी वाले खेल काउंटरफैक्चुअल रिग्रेट मिनिमाइजेशन जैसी तकनीकों का उपयोग करते हुए। रिइन्फोर्समेंट लर्निंग में, मिनिमैक्स मजबूत नियंत्रण और बहु-एजेंट सेटिंग्स में उपयोग किया जाता है, जहाँ एजेंटों को सबसे-खराब-स्थिति प्रतिद्वंद्वी व्यवहार के लिए जिम्मेदार होना चाहिए। अवधारणा अनुकूलन और सांख्यिकी में भी दिखाई देती है, जहाँ मिनिमैक्स अनुमानक अधिकतम जोखिम को न्यूनतम करते हैं।
कम्प्यूटर शतरंज और अन्य खेल-खेलने वाले आर्टिफिशियल इंटेलिजेंस में, अल्फा-बीटा प्रूनिंग के साथ मिनिमैक्स एक मुख्य तकनीक बनी हुई है, हालांकि OpenAI और Google DeepMind जैसी आधुनिक प्रणालियाँ अक्सर मशीन लर्निंग दृष्टिकोणों का उपयोग करती हैं जो मिनिमैक्स-जैसे उद्देश्यों को शामिल करते हैं। सिद्धांत अनिश्चितता के तहत कार्रवाइयों को चुनने के लिए निर्णय सिद्धांत में भी प्रासंगिक है, जहाँ एक निर्णय-निर्माता वह विकल्प चुनता है जो सबसे-खराब-स्थिति हानि को न्यूनतम करता है।
ऐतिहासिक संदर्भ और संबंधित अवधारणाएँ
मिनिमैक्स नियम की जड़ें खेल सिद्धांत और निर्णय सिद्धांत में हैं, जॉन वॉन न्यूमैन और ऑस्कर मॉर्गनस्टर्न जैसे गणितज्ञों के योगदान के साथ। यह अनुकूलन में सैडल पॉइंट की अवधारणा और गैर-शून्य-योग खेलों में नैश संतुलन से निकटता से संबंधित है। दर्शन में, मिनिमैक्स तर्कसंगतता और जोखिम-प्रतिकूलता की चर्चाओं में उपयोग किया जाता है।
आधुनिक आर्टिफिशियल इंटेलिजेंस में, मिनिमैक्स अक्सर बायेसियन निर्णय सिद्धांत के साथ विपरीत किया जाता है, जो सबसे-खराब-स्थिति धारणाओं के बजाय पूर्व संभावनाओं का उपयोग करता है। जबकि मिनिमैक्स रूढ़िवादी है, बायेसियन विधियाँ अधिक लचीली हो सकती हैं। उनके बीच चुनाव संभाव्य सूचना की उपलब्धता पर निर्भर करता है। आर्टिफिशियल इंटेलिजेंस अनुसंधान में, मिनिमैक्स निर्णय-निर्माण एल्गोरिदम के मूल्यांकन के लिए एक बेंचमार्क बना हुआ है, विशेष रूप से प्रतिकूल वातावरणों में।
यह भी देखें
- अल्फा-बीटा प्रूनिंग
- खेल सिद्धांत
- शून्य-योग खेल
- प्रतिकूल मशीन लर्निंग