अंग्रेज़ी से अनुवादित

AlphaZero एक DeepMind कंप्यूटर प्रोग्राम है जिसने शतरंज, शोगी और गो में महारत हासिल की, जो स्व-खेल सुदृढीकरण सीखने के माध्यम से, न्यूरल नेटवर्क और नियमों से परे किसी भी डोमेन ज्ञान के बिना काम करता है।

AlphaZero एक कंप्यूटर प्रोग्राम है जिसे कृत्रिम बुद्धिमत्ता अनुसंधान कंपनी डीपमाइंड द्वारा बोर्ड गेम शतरंज, शोगी और गो में महारत हासिल करने के लिए विकसित किया गया था। पहले के गेम-प्लेइंग सिस्टम के विपरीत, इसने पूरी तरह से स्व-खेल के माध्यम से सीखा, गेम नियमों से परे कोई मानवीय ज्ञान नहीं होने के बावजूद शुरुआत की। यह प्रोग्राम मोंटे कार्लो ट्री सर्च के साथ संयुक्त एक तंत्रिका नेटवर्क का उपयोग करता है, यह दृष्टिकोण पहली बार इसके पूर्ववर्ती अल्फागो जीरो में प्रदर्शित किया गया था। कंपनी ने 5 दिसंबर, 2017 को अल्फाजीरो को पेश करने वाला एक प्रीप्रिंट पेपर जारी किया, इसके बाद 7 दिसंबर, 2018 को जर्नल साइंस में एक सहकर्मी-समीक्षित प्रकाशन जारी किया।

अल्फाजीरो की प्रशिक्षण विधि के लिए कोई ओपनिंग बुक, एंडगेम टेबल या मानव-निर्मित ह्यूरिस्टिक्स की आवश्यकता नहीं थी। इसके बजाय, इसने एक सुदृढीकरण सीखने के एल्गोरिदम द्वारा निर्देशित, लाखों बार खुद के खिलाफ खेलकर अपना अनुभव उत्पन्न किया। इस दृष्टिकोण ने इसे पारंपरिक इंजनों की तुलना में प्रति सेकंड बहुत कम स्थितियों की खोज करने के बावजूद, घंटों के भीतर तीनों खेलों में अलौकिक प्रदर्शन प्राप्त करने की अनुमति दी। डीपमाइंड ने परिणामी खेल शैली को असामान्य बताया, कुछ चालें मानव पर्यवेक्षकों को प्रति-सहज ज्ञान युक्त लगती हैं।

प्रशिक्षण विधि

प्रशिक्षण प्रक्रिया में स्व-खेल गेम उत्पन्न करने के लिए 5,000 पहली पीढ़ी के टेंसर प्रोसेसिंग यूनिट (TPU) और तंत्रिका नेटवर्क वजन को अपडेट करने के लिए 64 दूसरी पीढ़ी के TPU का उपयोग किया गया, ये सभी समानांतर में चल रहे थे। प्रगति का आकलन करने के लिए प्रशिक्षण के दौरान सिस्टम को समय-समय पर छोटे प्रदर्शनी खेलों में एक बेंचमार्क प्रोग्राम के खिलाफ खेला गया। शतरंज इंजन स्टॉकफिश के खिलाफ, अल्फाजीरो ने लगभग चार घंटे के प्रशिक्षण के बाद बेंचमार्क प्रदर्शन को पार कर लिया; शोगी इंजन एल्मो के खिलाफ, इसमें लगभग दो घंटे लगे; तीन दिन के अल्फागो जीरो संस्करण के खिलाफ, लगभग आठ घंटे।

प्रशिक्षण के दौरान तंत्रिका नेटवर्क को लगातार अपडेट किया गया था। अपने पूर्ववर्ती सिस्टम के विपरीत, अल्फाजीरो ने अपने प्रशिक्षण डेटा को बढ़ाने के लिए गेम समरूपता का उपयोग नहीं किया, और इसमें ड्रॉ की संभावना को शामिल किया गया, जो गो में अनुपस्थित हैं लेकिन शतरंज और शोगी में संभव हैं। एल्गोरिदम इन अतिरिक्त ड्रॉ को संभालने के लिए पहले के अल्फागो जीरो दृष्टिकोण को सामान्यीकृत करता है।

मैच परिणाम

शतरंज में, नौ घंटे के प्रशिक्षण के बाद, अल्फाजीरो ने स्टॉकफिश 8 (2016 TCEC विश्व चैंपियन) के खिलाफ 100 गेम का मैच खेला, प्रत्येक पक्ष को प्रति चाल एक मिनट मिला। स्टॉकफिश ने 64 थ्रेड और 1 जीबी का हैश आकार उपयोग किया, जबकि अल्फाजीरो चार TPU वाली एक मशीन पर चला। परिणाम 28 जीत, 0 हार और 72 ड्रॉ रहा। लोकप्रिय मानव ओपनिंग से शुरू होने वाले बारह 100-गेम मैचों की श्रृंखला में, अल्फाजीरो ने 290 जीते, 886 ड्रॉ किए और 24 हारे।

शोगी में, दो घंटे के प्रशिक्षण के बाद, अल्फाजीरो ने एल्मो इंजन (विश्व कंप्यूटर शोगी चैम्पियनशिप 27 ग्रीष्मकालीन 2017 संस्करण यानेउराओ 4.73 के साथ) को 100 खेलों में हराया, 90 जीते, 8 हारे और 2 ड्रॉ किए। गो में, 34 घंटे के स्व-शिक्षण के बाद, अल्फाजीरो ने तीन दिन के अल्फागो जीरो संस्करण के खिलाफ खेला, 60 गेम जीते और 40 हारे।

मूल्यांकन की गई स्थितियों की संख्या नाटकीय रूप से भिन्न थी। अल्फाजीरो ने शतरंज में लगभग 80 स्थितियों और शोगी में 40,000 की खोज की, जबकि स्टॉकफिश के लिए 70 मिलियन और एल्मो के लिए 35 मिलियन की तुलना में। इसने आशाजनक विविधताओं पर अपने गहरे तंत्रिका नेटवर्क के चयनात्मक ध्यान से इसकी भरपाई की।

प्रदर्शन का मूल्यांकन

डीपमाइंड शोधकर्ताओं ने कहा कि एल्गोरिदम ने प्रदर्शित किया कि एक सामान्य सुदृढीकरण सीखने दृष्टिकोण नियमों से परे डोमेन ज्ञान के बिना कई बोर्ड खेलों में अलौकिक स्तर तक पहुंच सकता है। उन्होंने कहा कि अत्याधुनिक शतरंज इंजन आम तौर पर हस्तनिर्मित विशेषज्ञता का उपयोग करके लाखों स्थितियों की खोज करते हैं, जबकि अल्फाजीरो घंटों के भीतर एक हजार गुना कम स्थितियों की खोज करता है। डीपमाइंड के डेमिस हसाबिस, जो खुद एक शतरंज शौकिया हैं, ने अल्फाजीरो की शैली को विदेशी बताया, जो स्थितिगत लाभ के लिए रानी और बिशप की पेशकश जैसे प्रति-सहज बलिदानों का संदर्भ देते हैं।

हालांकि, कुछ विशेषज्ञों ने सावधानी व्यक्त की। ग्रैंडमास्टर हिकारू नाकामुरा और कोमोडो डेवलपर लैरी कॉफमैन ने सुझाव दिया कि यदि स्टॉकफिश ने ओपनिंग डेटाबेस का उपयोग किया होता तो परिणाम अधिक विवादास्पद हो सकते थे, क्योंकि इंजन उस परिदृश्य के लिए अनुकूलित था। स्टॉकफिश डेवलपर डारियो रोमस्टैड ने कहा कि यह कठोर रूप से निश्चित समय के लिए अनुकूलित नहीं है, और उपयोग किया गया संस्करण मैच तक पहले से ही पुराना था। इसी तरह, कुछ शोगी पर्यवेक्षकों ने सोचा कि एल्मो का हैश आकार बहुत कम था, और त्याग या प्रवेश सेटिंग्स अनुचित हो सकती हैं।

विरासत

डीपमाइंड ने पूर्ण अल्फाजीरो कोड कभी जारी नहीं किया। हालांकि, साइंस पेपर में एल्गोरिदमिक विवरण ने जनता को समान सिस्टम को पुन: पेश करने में सक्षम बनाया। 2019 में, डीपमाइंड ने म्यूज़ीरो नामक एक अधिक शक्तिशाली सामान्यीकरण प्रकाशित किया, जिसने नियमों या गेम के प्रतिनिधित्व के बिना सिखाए बिना अटारी गेम और बोर्ड गेम पर मजबूत प्रदर्शन हासिल किया, यह दिखाते हुए कि मुख्य विचार मानव-परिभाषित गेम नियमों तक सीमित नहीं है।

पर्यवेक्षकों ने अल्फाजीरो की शुरुआत की तुलना शतरंज-कंप्यूटर विकास में ऐतिहासिक मील के पत्थर से की। 1997 में, डीप ब्लू विश्व चैंपियन गैरी कास्परोव को एक मैच में हराने वाला पहला कंप्यूटर बन गया। अल्फाजीरो ने एक अलग सीमा का प्रतिनिधित्व किया: लाखों स्थितियों पर केंद्रित विशेष, खोज-भारी ह्यूरिस्टिक्स का उपयोग करने के बजाय, इसने सीखा कि इसका अपना कोड और मशीन-सीखने द्वारा प्रतिस्पर्धा से बाहर निकलना, जहां स्व-खेल के माध्यम से प्रशिक्षित तंत्रिका नेटवर्क मानव-इंजीनियर सिस्टम के प्रदर्शन से अधिक थे।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·reinforcement-learning·game-playing·deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास