AlphaZero एक कंप्यूटर प्रोग्राम है जिसे कृत्रिम बुद्धिमत्ता अनुसंधान कंपनी डीपमाइंड द्वारा बोर्ड गेम शतरंज, शोगी और गो में महारत हासिल करने के लिए विकसित किया गया था। पहले के गेम-प्लेइंग सिस्टम के विपरीत, इसने पूरी तरह से स्व-खेल के माध्यम से सीखा, गेम नियमों से परे कोई मानवीय ज्ञान नहीं होने के बावजूद शुरुआत की। यह प्रोग्राम मोंटे कार्लो ट्री सर्च के साथ संयुक्त एक तंत्रिका नेटवर्क का उपयोग करता है, यह दृष्टिकोण पहली बार इसके पूर्ववर्ती अल्फागो जीरो में प्रदर्शित किया गया था। कंपनी ने 5 दिसंबर, 2017 को अल्फाजीरो को पेश करने वाला एक प्रीप्रिंट पेपर जारी किया, इसके बाद 7 दिसंबर, 2018 को जर्नल साइंस में एक सहकर्मी-समीक्षित प्रकाशन जारी किया।
अल्फाजीरो की प्रशिक्षण विधि के लिए कोई ओपनिंग बुक, एंडगेम टेबल या मानव-निर्मित ह्यूरिस्टिक्स की आवश्यकता नहीं थी। इसके बजाय, इसने एक सुदृढीकरण सीखने के एल्गोरिदम द्वारा निर्देशित, लाखों बार खुद के खिलाफ खेलकर अपना अनुभव उत्पन्न किया। इस दृष्टिकोण ने इसे पारंपरिक इंजनों की तुलना में प्रति सेकंड बहुत कम स्थितियों की खोज करने के बावजूद, घंटों के भीतर तीनों खेलों में अलौकिक प्रदर्शन प्राप्त करने की अनुमति दी। डीपमाइंड ने परिणामी खेल शैली को असामान्य बताया, कुछ चालें मानव पर्यवेक्षकों को प्रति-सहज ज्ञान युक्त लगती हैं।
प्रशिक्षण विधि
प्रशिक्षण प्रक्रिया में स्व-खेल गेम उत्पन्न करने के लिए 5,000 पहली पीढ़ी के टेंसर प्रोसेसिंग यूनिट (TPU) और तंत्रिका नेटवर्क वजन को अपडेट करने के लिए 64 दूसरी पीढ़ी के TPU का उपयोग किया गया, ये सभी समानांतर में चल रहे थे। प्रगति का आकलन करने के लिए प्रशिक्षण के दौरान सिस्टम को समय-समय पर छोटे प्रदर्शनी खेलों में एक बेंचमार्क प्रोग्राम के खिलाफ खेला गया। शतरंज इंजन स्टॉकफिश के खिलाफ, अल्फाजीरो ने लगभग चार घंटे के प्रशिक्षण के बाद बेंचमार्क प्रदर्शन को पार कर लिया; शोगी इंजन एल्मो के खिलाफ, इसमें लगभग दो घंटे लगे; तीन दिन के अल्फागो जीरो संस्करण के खिलाफ, लगभग आठ घंटे।
प्रशिक्षण के दौरान तंत्रिका नेटवर्क को लगातार अपडेट किया गया था। अपने पूर्ववर्ती सिस्टम के विपरीत, अल्फाजीरो ने अपने प्रशिक्षण डेटा को बढ़ाने के लिए गेम समरूपता का उपयोग नहीं किया, और इसमें ड्रॉ की संभावना को शामिल किया गया, जो गो में अनुपस्थित हैं लेकिन शतरंज और शोगी में संभव हैं। एल्गोरिदम इन अतिरिक्त ड्रॉ को संभालने के लिए पहले के अल्फागो जीरो दृष्टिकोण को सामान्यीकृत करता है।
मैच परिणाम
शतरंज में, नौ घंटे के प्रशिक्षण के बाद, अल्फाजीरो ने स्टॉकफिश 8 (2016 TCEC विश्व चैंपियन) के खिलाफ 100 गेम का मैच खेला, प्रत्येक पक्ष को प्रति चाल एक मिनट मिला। स्टॉकफिश ने 64 थ्रेड और 1 जीबी का हैश आकार उपयोग किया, जबकि अल्फाजीरो चार TPU वाली एक मशीन पर चला। परिणाम 28 जीत, 0 हार और 72 ड्रॉ रहा। लोकप्रिय मानव ओपनिंग से शुरू होने वाले बारह 100-गेम मैचों की श्रृंखला में, अल्फाजीरो ने 290 जीते, 886 ड्रॉ किए और 24 हारे।
शोगी में, दो घंटे के प्रशिक्षण के बाद, अल्फाजीरो ने एल्मो इंजन (विश्व कंप्यूटर शोगी चैम्पियनशिप 27 ग्रीष्मकालीन 2017 संस्करण यानेउराओ 4.73 के साथ) को 100 खेलों में हराया, 90 जीते, 8 हारे और 2 ड्रॉ किए। गो में, 34 घंटे के स्व-शिक्षण के बाद, अल्फाजीरो ने तीन दिन के अल्फागो जीरो संस्करण के खिलाफ खेला, 60 गेम जीते और 40 हारे।
मूल्यांकन की गई स्थितियों की संख्या नाटकीय रूप से भिन्न थी। अल्फाजीरो ने शतरंज में लगभग 80 स्थितियों और शोगी में 40,000 की खोज की, जबकि स्टॉकफिश के लिए 70 मिलियन और एल्मो के लिए 35 मिलियन की तुलना में। इसने आशाजनक विविधताओं पर अपने गहरे तंत्रिका नेटवर्क के चयनात्मक ध्यान से इसकी भरपाई की।
प्रदर्शन का मूल्यांकन
डीपमाइंड शोधकर्ताओं ने कहा कि एल्गोरिदम ने प्रदर्शित किया कि एक सामान्य सुदृढीकरण सीखने दृष्टिकोण नियमों से परे डोमेन ज्ञान के बिना कई बोर्ड खेलों में अलौकिक स्तर तक पहुंच सकता है। उन्होंने कहा कि अत्याधुनिक शतरंज इंजन आम तौर पर हस्तनिर्मित विशेषज्ञता का उपयोग करके लाखों स्थितियों की खोज करते हैं, जबकि अल्फाजीरो घंटों के भीतर एक हजार गुना कम स्थितियों की खोज करता है। डीपमाइंड के डेमिस हसाबिस, जो खुद एक शतरंज शौकिया हैं, ने अल्फाजीरो की शैली को विदेशी बताया, जो स्थितिगत लाभ के लिए रानी और बिशप की पेशकश जैसे प्रति-सहज बलिदानों का संदर्भ देते हैं।
हालांकि, कुछ विशेषज्ञों ने सावधानी व्यक्त की। ग्रैंडमास्टर हिकारू नाकामुरा और कोमोडो डेवलपर लैरी कॉफमैन ने सुझाव दिया कि यदि स्टॉकफिश ने ओपनिंग डेटाबेस का उपयोग किया होता तो परिणाम अधिक विवादास्पद हो सकते थे, क्योंकि इंजन उस परिदृश्य के लिए अनुकूलित था। स्टॉकफिश डेवलपर डारियो रोमस्टैड ने कहा कि यह कठोर रूप से निश्चित समय के लिए अनुकूलित नहीं है, और उपयोग किया गया संस्करण मैच तक पहले से ही पुराना था। इसी तरह, कुछ शोगी पर्यवेक्षकों ने सोचा कि एल्मो का हैश आकार बहुत कम था, और त्याग या प्रवेश सेटिंग्स अनुचित हो सकती हैं।
विरासत
डीपमाइंड ने पूर्ण अल्फाजीरो कोड कभी जारी नहीं किया। हालांकि, साइंस पेपर में एल्गोरिदमिक विवरण ने जनता को समान सिस्टम को पुन: पेश करने में सक्षम बनाया। 2019 में, डीपमाइंड ने म्यूज़ीरो नामक एक अधिक शक्तिशाली सामान्यीकरण प्रकाशित किया, जिसने नियमों या गेम के प्रतिनिधित्व के बिना सिखाए बिना अटारी गेम और बोर्ड गेम पर मजबूत प्रदर्शन हासिल किया, यह दिखाते हुए कि मुख्य विचार मानव-परिभाषित गेम नियमों तक सीमित नहीं है।
पर्यवेक्षकों ने अल्फाजीरो की शुरुआत की तुलना शतरंज-कंप्यूटर विकास में ऐतिहासिक मील के पत्थर से की। 1997 में, डीप ब्लू विश्व चैंपियन गैरी कास्परोव को एक मैच में हराने वाला पहला कंप्यूटर बन गया। अल्फाजीरो ने एक अलग सीमा का प्रतिनिधित्व किया: लाखों स्थितियों पर केंद्रित विशेष, खोज-भारी ह्यूरिस्टिक्स का उपयोग करने के बजाय, इसने सीखा कि इसका अपना कोड और मशीन-सीखने द्वारा प्रतिस्पर्धा से बाहर निकलना, जहां स्व-खेल के माध्यम से प्रशिक्षित तंत्रिका नेटवर्क मानव-इंजीनियर सिस्टम के प्रदर्शन से अधिक थे।