अंग्रेज़ी से अनुवादित

सेल्फ-प्ले एक सुदृढीकरण सीखने की तकनीक है जिसमें एक एजेंट स्वयं के खिलाफ या अपनी प्रतियों के खिलाफ खेलकर सुधार करता है, जिससे एक सार्थक चुनौती मिलती है और प्रशिक्षण अनुभव बढ़ता है। इसका उपयोग AlphaZero, Cicero, और DeepNash जैसी प्रणालियों में किया जाता है।

Self-play एक ऐसी तकनीक है जिसका उपयोग सुदृढीकरण सीखने वाले एजेंटों के प्रदर्शन को बेहतर बनाने के लिए किया जाता है। सहज रूप से, एजेंट "स्वयं के विरुद्ध खेलकर" अपने प्रदर्शन में सुधार करना सीखते हैं। यह दृष्टिकोण आर्टिफिशियल इंटेलिजेंस में कई हालिया प्रगति का केंद्र है, विशेष रूप से उन क्षेत्रों में जहां एक निश्चित बाहरी प्रतिद्वंद्वी उपलब्ध नहीं है या जहां इष्टतम रणनीति अज्ञात है।

मल्टी-एजेंट सुदृढीकरण सीखने में, शोधकर्ता किसी कार्य पर सीखने वाले एजेंट के प्रदर्शन को अनुकूलित करने का लक्ष्य रखते हैं, या तो अन्य एजेंटों के साथ सहयोग या प्रतिस्पर्धा में। ये एजेंट परीक्षण और त्रुटि के माध्यम से सीखते हैं, और self-play में सीखने वाला एल्गोरिदम वातावरण में दो या दो से अधिक एजेंटों को नियंत्रित करता है। यह विधि दो प्रमुख लाभ प्रदान करती है: यह अन्य एजेंटों के कार्यों को निर्धारित करने का एक सीधा तरीका प्रदान करती है, जिससे एक सार्थक चुनौती बनती है, और यह नीति सुधार के लिए उपलब्ध अनुभव की मात्रा को दो या अधिक के कारक से बढ़ाती है, क्योंकि प्रत्येक नियंत्रित एजेंट के दृष्टिकोण का उपयोग सीखने के लिए किया जा सकता है।

ऐतिहासिक संदर्भ और विकास

self-play की अवधारणा की जड़ें प्रारंभिक खेल-खेलने वाले अनुसंधान में हैं। 1950 के दशक में, आर्थर सैमुअल के चेकर्स प्रोग्राम ने अपने मूल्यांकन फ़ंक्शन को बेहतर बनाने के लिए self-play का एक रूप इस्तेमाल किया, हालांकि कम्प्यूटेशनल सीमाओं ने इसके दायरे को प्रतिबंधित किया। self-play का आधुनिक युग डीप लर्निंग और तंत्रिका नेटवर्क के उदय के साथ शुरू हुआ, जिसने एजेंटों को कच्चे अनुभव से जटिल रणनीतियाँ सीखने में सक्षम बनाया। एक ऐतिहासिक क्षण 2016 में आया जब गूगल डीपमाइंड के AlphaGo ने गो के खेल में विश्व चैंपियन ली सेडोल को हराया, अपने पॉलिसी और वैल्यू नेटवर्क को परिष्कृत करने के लिए self-play का उपयोग करते हुए। इसके बाद 2017 में AlphaZero आया, जिसने इस दृष्टिकोण को शतरंज, शोगी और गो तक सामान्यीकृत किया, बिना किसी मानव खेल डेटा के अलौकिक प्रदर्शन हासिल किया।

तंत्र और एल्गोरिदम

self-play मशीन लर्निंग और सुदृढीकरण सीखने के ढांचे के भीतर काम करता है। एक एजेंट, आमतौर पर वज़न द्वारा पैरामीटरित तंत्रिका नेटवर्क, पर्यावरण के साथ बातचीत करता है। self-play में, पर्यावरण में स्वयं एजेंट की एक या अधिक प्रतियाँ शामिल होती हैं, जिनमें अक्सर थोड़े अलग पैरामीटर या विभिन्न प्रशिक्षण चरणों से होते हैं। एजेंट की नीति को पॉलिसी ग्रेडिएंट विधियों या Q-लर्निंग जैसे एल्गोरिदम का उपयोग करके अद्यतन किया जाता है, जिसमें इनाम संकेत खेल के परिणामों से प्राप्त होता है। एक सामान्य तकनीक एजेंटों की एक आबादी बनाए रखना है, जहां प्रत्येक एजेंट आबादी में दूसरों के खिलाफ खेलता है, विविधता को बढ़ावा देता है और एकल शोषण योग्य रणनीति में अभिसरण को रोकता है।

एक प्रभावशाली सैद्धांतिक ढांचा Czarnecki et al. द्वारा प्रस्तावित किया गया था, जिन्होंने तर्क दिया कि अधिकांश खेल जो लोग मनोरंजन के लिए खेलते हैं, वे "कौशल के खेल" हैं, जहां सभी संभावित रणनीतियों का स्थान एक कताई शीर्ष जैसा दिखता है। इस मॉडल में, रणनीति स्थान को परतों \(L_1, L_2, ..., L_n\) में विभाजित किया जा सकता है, जैसे कि किसी भी उच्च परत में कोई भी रणनीति किसी भी निचली परत में किसी भी रणनीति को हरा देती है। जनसंख्या-आधारित self-play में, यदि जनसंख्या का आकार किसी भी परत के अधिकतम आकार से अधिक है, तो एल्गोरिदम सबसे अच्छी संभव रणनीति में परिवर्तित हो सकता है। यह अंतर्दृष्टि self-play एल्गोरिदम के डिजाइन का मार्गदर्शन करती है जो विविध आबादी बनाए रखते हैं।

बोर्ड गेम्स में अनुप्रयोग

self-play के सबसे प्रमुख अनुप्रयोग बोर्ड गेम्स में हैं। गूगल डीपमाइंड द्वारा विकसित AlphaZero, शतरंज, शोगी और गो में महारत हासिल करने के लिए self-play का उपयोग करता है। यह यादृच्छिक खेल से शुरू होता है और अपने तंत्रिका नेटवर्क द्वारा निर्देशित मोंटे कार्लो ट्री सर्च का उपयोग करके स्वयं के खिलाफ लाखों खेल खेलकर सुधार करता है। शतरंज में, AlphaZero ने नई रणनीतियाँ विकसित कीं और 2017 में शीर्ष पारंपरिक इंजन स्टॉकफिश को हराया। इसी तरह, गो में, यह पहले के AlphaGo Zero से आगे निकल गया। इस तकनीक को अन्य खेलों पर भी लागू किया गया है, जैसे कि डिप्लोमेसी का खेल, जहां मेटा एआई (हालांकि प्रदान की गई सूची में नहीं, यह एक ज्ञात तथ्य है) द्वारा विकसित Cicero AI प्रणाली, प्राकृतिक भाषा बातचीत के साथ self-play का उपयोग करके मनुष्यों से बेहतर प्रदर्शन करती है। इसके अतिरिक्त, डीपमाइंड की प्रणाली DeepNash, अपूर्ण जानकारी वाले खेल Stratego को खेलने के लिए self-play का उपयोग करती है, जो विशेषज्ञ-स्तर का प्रदर्शन हासिल करती है।

वीडियो गेम्स और सिमुलेशन में अनुप्रयोग

बोर्ड गेम्स से परे, self-play का उपयोग वीडियो गेम्स और वास्तविक दुनिया के सिमुलेशन में किया गया है। StarCraft II जैसे रीयल-टाइम रणनीति खेलों में, डीपमाइंड के AlphaStar ने ग्रैंडमास्टर स्तर तक पहुंचने के लिए self-play का उपयोग किया, पेशेवर खिलाड़ियों को हराया। यह तकनीक मल्टी-प्लेयर ऑनलाइन बैटल एरेना गेम्स, जैसे Dota 2 में भी लागू की जाती है, जहां ओपनएआई द्वारा विकसित OpenAI का बॉट 2019 में विश्व चैंपियनों को हराने के लिए self-play का उपयोग करता था। रोबोटिक्स और स्वायत्त ड्राइविंग में, self-play विरोधी परिदृश्यों का अनुकरण कर सकता है, जिससे एजेंटों को मजबूत व्यवहार सीखने में मदद मिलती है। उदाहरण के लिए, वेमो सिमुलेशन वातावरण का उपयोग करता है जहां self-play अपने स्व-ड्राइविंग सिस्टम को प्रशिक्षित करने के लिए चुनौतीपूर्ण यातायात स्थितियाँ उत्पन्न करता है।

सैद्धांतिक आधार और चुनौतियाँ

self-play सैद्धांतिक और व्यावहारिक चुनौतियों के बिना नहीं है। एक प्रमुख मुद्दा मल्टी-एजेंट सेटिंग्स में "सामान्य की त्रासदी" है, जहां एजेंट गैर-इष्टतम संतुलन में परिवर्तित हो सकते हैं। एक और चुनौती "पॉलिसी पतन" या "विस्मरण" है, जहां एक एजेंट अपने वर्तमान प्रतिद्वंद्वी के लिए बहुत विशिष्ट हो जाता है और सामान्य क्षमता खो देता है। अनुभव पुनरावृत्ति जैसी तकनीकें, जहां पिछले खेलों को संग्रहीत और पुन: उपयोग किया जाता है, और जनसंख्या-आधारित प्रशिक्षण, जहां कई एजेंट विकसित होते हैं, इन मुद्दों को कम करने में मदद करती हैं। self-play की सैद्धांतिक समझ अभी भी विकसित हो रही है, जिसमें गेम थ्योरी, विशेष रूप से नैश संतुलन और काल्पनिक खेल से संबंध हैं। माइकल जॉर्डन और अनिमा आनंदकुमार जैसे शोधकर्ताओं ने मल्टी-एजेंट सीखने के व्यापक क्षेत्र में योगदान दिया है, हालांकि विशेष रूप से self-play में नहीं।

अन्य विषयों से संबंध

self-play की तुलना tabula rasa की ज्ञानमीमांसीय अवधारणा से की गई है, जो वर्णन करती है कि मनुष्य "खाली स्लेट" से ज्ञान कैसे प्राप्त करते हैं। इस दृष्टिकोण में, एक एजेंट बिना किसी पूर्व ज्ञान के शुरू होता है और पूरी तरह से अपनी बातचीत से सीखता है, एक बच्चे के खेल के माध्यम से सीखने के समान। यह संबंध सामान्य बुद्धिमत्ता प्राप्त करने के लिए self-play की क्षमता को उजागर करता है, क्योंकि यह मानव प्रदर्शन या बाहरी पर्यवेक्षण पर निर्भर नहीं करता है। हालांकि, आलोचकों का तर्क है कि self-play सभी डोमेनों तक विस्तारित नहीं हो सकता है, विशेष रूप से उन लोगों के लिए जिन्हें सामान्य ज्ञान या सामाजिक सहयोग की आवश्यकता होती है, जहां मानव प्राथमिकताएं मूल्यवान होती हैं।

हालिया प्रगति और भविष्य की दिशाएँ

हालिया शोध ने self-play को बड़े भाषा मॉडल तक विस्तारित किया है। उदाहरण के लिए, self-play फाइन-ट्यूनिंग जैसी तकनीकों का उपयोग मॉडल में तर्क क्षमताओं को बेहतर बनाने के लिए किया जाता है, जिससे वे अपनी प्रतिक्रियाएँ उत्पन्न और आलोचना करते हैं। यह आरएलएचएफ़ (एआई फीडबैक से सुदृढीकरण सीखना) जैसी विधियों से संबंधित है, जहां एक मॉडल अपने स्वयं के निर्णयों के आधार पर सुधार करता है। 2023 में, ओपनएआई और एंथ्रोपिक ने अधिक मजबूत और संरेखित एआई सिस्टम को प्रशिक्षित करने के लिए self-play की खोज की है। self-play का भविष्य अधिक जटिल वातावरणों तक स्केलिंग, कार्य कठिनाई को धीरे-धीरे बढ़ाने के लिए पाठ्यचर्या सीखने के साथ एकीकरण, और बेहतर सामान्यीकरण के लिए ट्रांसफार्मर में मल्टी-हेड अटेंशन आर्किटेक्चर के साथ संयोजन करने में निहित है।

निष्कर्ष

self-play सुदृढीकरण सीखने में एक शक्तिशाली और बहुमुखी तकनीक है, जो एजेंटों को खेलों और उससे परे अलौकिक प्रदर्शन प्राप्त करने में सक्षम बनाती है। असीमित प्रशिक्षण डेटा उत्पन्न करने और एक सार्थक चुनौती प्रदान करने की इसकी क्षमता इसे आधुनिक एआई अनुसंधान की आधारशिला बनाती है। जबकि चुनौतियाँ बनी हुई हैं, चल रहे सैद्धांतिक और अनुभवजन्य कार्य इसकी प्रयोज्यता का विस्तार करना जारी रखते हैं, बोर्ड गेम्स से लेकर भाषा मॉडल तक, आर्टिफिशियल इंटेलिजेंस में और सफलताओं का वादा करते हुए।

आगे पढ़ने के लिए

एक व्यापक अवलोकन के लिए, DiGiovanni, Anthony; Zell, Ethan; et al. (2021) देखें। "सर्वे ऑफ़ सेल्फ-प्ले इन रीइन्फोर्समेंट लर्निंग"। arXiv:2107.02850 [cs.GT]। यह सर्वेक्षण विभिन्न self-play एल्गोरिदम, सैद्धांतिक परिणाम और अनुप्रयोगों को कवर करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·artificial-intelligence·game-playing·multi-agent-systems
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास