AlphaGo एक कंप्यूटर प्रोग्राम है जो बोर्ड गेम गो खेलता है, जिसे लंदन स्थित डीपमाइंड टेक्नोलॉजीज द्वारा विकसित किया गया है, जो गूगल की एक अधिग्रहीत सहायक कंपनी है। इस प्रोग्राम और इसके एल्गोरिदम का वर्णन 27 जनवरी 2016 को जर्नल नेचर में प्रकाशित एक पेपर में किया गया था, जो यूरोपीय चैंपियन फैन हुई पर इसकी जीत की घोषणा के साथ मेल खाता था। यह पेपर कृत्रिम बुद्धिमत्ता में एक मील का पत्थर साबित हुआ, क्योंकि AlphaGo पहला कंप्यूटर गो प्रोग्राम बन गया जिसने बिना किसी हैंडीकैप के पूर्ण आकार के 19×19 बोर्ड पर एक पेशेवर मानव खिलाड़ी को हराया। इस जीत को 22 दिसंबर 2016 को साइंस द्वारा वर्ष की सफलता के उपविजेताओं में से एक के रूप में मान्यता दी गई।
AlphaGo बोर्ड स्थितियों का मूल्यांकन करने और चालों का चयन करने के लिए Machine learning और कृत्रिम तंत्रिका नेटवर्क के संयोजन का उपयोग करता है। यह एक मोंटे कार्लो ट्री सर्च एल्गोरिदम का उपयोग करता है, जो एक गहन शिक्षण नीति नेटवर्क और एक मूल्य नेटवर्क द्वारा निर्देशित होता है, जिसे मानव खेलों से पर्यवेक्षित शिक्षण और स्व-खेल से सुदृढीकरण शिक्षण दोनों के माध्यम से प्रशिक्षित किया जाता है। इस दृष्टिकोण ने AlphaGo को गो के बड़े शाखा कारक की चुनौतियों को पार करने की अनुमति दी, जिसने पहले के Artificial intelligence तरीकों को विफल कर दिया था।
विकास और पृष्ठभूमि
गो को शतरंज जैसे अन्य खेलों की तुलना में कंप्यूटर के लिए जीतना कहीं अधिक कठिन माना जाता है, क्योंकि इसकी रणनीतिक और सौंदर्यपरक प्रकृति सीधे मूल्यांकन फ़ंक्शन का निर्माण करना कठिन बना देती है, और इसका बहुत बड़ा शाखा कारक पारंपरिक एआई विधियों जैसे अल्फा-बीटा प्रूनिंग, ट्री ट्रैवर्सल और ह्यूरिस्टिक सर्च का उपयोग करना निषेधात्मक रूप से कठिन बना देता है। आईबीएम के कंप्यूटर डीप ब्लू द्वारा 1997 के मैच में विश्व शतरंज चैंपियन गैरी कास्परोव को हराने के लगभग दो दशक बाद, कृत्रिम बुद्धिमत्ता तकनीकों का उपयोग करने वाले सबसे मजबूत गो प्रोग्राम केवल लगभग शौकिया 5-डैन स्तर तक ही पहुंच पाए थे, और फिर भी बिना हैंडीकैप के किसी पेशेवर गो खिलाड़ी को नहीं हरा सके। 2012 में, चार पीसी क्लस्टर पर चलने वाले सॉफ्टवेयर प्रोग्राम ज़ेन ने मासाकी ताकेमिया (9p) को पांच- और चार-पत्थर के हैंडीकैप पर दो बार हराया। 2013 में, क्रेज़ी स्टोन ने योशियो इशिदा (9p) को चार-पत्थर के हैंडीकैप पर हराया।
डीपमाइंड के डेविड सिल्वर के अनुसार, AlphaGo अनुसंधान परियोजना लगभग 2014 में यह परीक्षण करने के लिए बनाई गई थी कि Deep learning का उपयोग करने वाला तंत्रिका नेटवर्क गो में कितनी अच्छी प्रतिस्पर्धा कर सकता है। AlphaGo पिछले गो प्रोग्रामों की तुलना में एक महत्वपूर्ण सुधार का प्रतिनिधित्व करता है। क्रेज़ी स्टोन और ज़ेन सहित अन्य उपलब्ध गो प्रोग्रामों के खिलाफ 500 खेलों में, एक ही कंप्यूटर पर चलने वाले AlphaGo ने एक को छोड़कर सभी जीते। एक समान मुकाबले में, कई कंप्यूटरों पर चलने वाले AlphaGo ने अन्य गो प्रोग्रामों के खिलाफ खेले गए सभी 500 खेल जीते, और एक ही कंप्यूटर पर चलने वाले AlphaGo के खिलाफ खेले गए 77% खेल जीते। अक्टूबर 2015 में वितरित संस्करण 1,202 सीपीयू और 176 जीपीयू का उपयोग कर रहा था।
फैन हुई के खिलाफ मैच
अक्टूबर 2015 में, AlphaGo के वितरित संस्करण ने यूरोपीय गो चैंपियन फैन हुई, जो एक 2-डैन (संभावित 9 डैन में से) पेशेवर थे, को पांच से शून्य से हराया। यह पहली बार था जब किसी कंप्यूटर गो प्रोग्राम ने बिना हैंडीकैप के पूर्ण आकार के बोर्ड पर एक पेशेवर मानव खिलाड़ी को हराया था। समाचार की घोषणा 27 जनवरी 2016 तक विलंबित की गई थी ताकि यह जर्नल नेचर में उपयोग किए गए एल्गोरिदम का वर्णन करने वाले पेपर के प्रकाशन के साथ मेल खाए।
ली सेडोल के खिलाफ मैच
AlphaGo ने दक्षिण कोरियाई पेशेवर गो खिलाड़ी ली सेडोल, जो 9-डैन रैंक के थे और गो के सर्वश्रेष्ठ खिलाड़ियों में से एक थे, के खिलाफ खेला, जिसमें पांच खेल 9, 10, 12, 13 और 15 मार्च 2016 को सियोल, दक्षिण कोरिया के फोर सीजन्स होटल में हुए, जिन्हें लाइव वीडियो-स्ट्रीम किया गया। पांच खेलों में से, AlphaGo ने चार खेल जीते और ली ने चौथा खेल जीता, जिससे वह एकमात्र मानव खिलाड़ी बन गए जिन्होंने AlphaGo के सभी 74 आधिकारिक खेलों में उसे हराया। AlphaGo गूगल के क्लाउड कंप्यूटिंग पर चला, जिसके सर्वर संयुक्त राज्य अमेरिका में स्थित थे। मैच में 7.5-पॉइंट कोमी के साथ चीनी नियमों का उपयोग किया गया, और प्रत्येक पक्ष के पास दो घंटे का सोचने का समय और तीन 60-सेकंड के ब्योयोमी अवधि थे। ली के खिलाफ खेलने वाला AlphaGo संस्करण फैन हुई मैच में उपयोग किए गए समान कंप्यूटिंग शक्ति का उपयोग करता था। द इकोनॉमिस्ट ने बताया कि इसने 1,920 सीपीयू और 280 जीपीयू का उपयोग किया। खेल के समय, ली सेडोल के पास दक्षिण कोरियाई खिलाड़ी ली चांग-हो के बाद दुनिया में गो अंतर्राष्ट्रीय चैंपियनशिप जीत की दूसरी सबसे अधिक संख्या थी, जिन्होंने 16 वर्षों तक विश्व चैंपियनशिप खिताब अपने पास रखा। चूंकि अंतर्राष्ट्रीय गो में रैंकिंग का कोई एक आधिकारिक तरीका नहीं है, रैंकिंग स्रोतों के बीच भिन्न हो सकती है। जबकि उन्हें कभी-कभी शीर्ष स्थान दिया जाता था, कुछ स्रोतों ने ली सेडोल को उस समय दुनिया का चौथा सर्वश्रेष्ठ खिलाड़ी बताया। AlphaGo को विशेष रूप से ली का सामना करने के लिए प्रशिक्षित नहीं किया गया था और न ही इसे किसी विशिष्ट मानव खिलाड़ी के साथ प्रतिस्पर्धा करने के लिए डिज़ाइन किया गया था।
पहले तीन खेल AlphaGo ने ली के समर्पण के बाद जीते। हालांकि, ली ने चौथे खेल में AlphaGo को हराया, चाल 180 पर समर्पण द्वारा जीत हासिल की। AlphaGo ने फिर चौथी जीत हासिल की, पांचवां खेल समर्पण द्वारा जीतकर। पुरस्कार राशि US$1 मिलियन थी। चूंकि AlphaGo ने पांच में से चार जीते और इस प्रकार श्रृंखला जीती, पुरस्कार राशि यूनिसेफ सहित चैरिटी को दान की जाएगी। ली सेडोल को सभी पांच खेलों में भाग लेने के लिए $150,000 और खेल 4 में जीत के लिए अतिरिक्त $20,000 मिले।
जून 2016 में, नीदरलैंड के एक विश्वविद्यालय में आयोजित एक प्रस्तुति में, डीपमाइंड टीम के सदस्य अजा हुआंग ने खुलासा किया कि उन्होंने AlphaGo और ली के बीच मैच के चौथे खेल के दौरान हुई तार्किक कमजोरी को ठीक कर दिया था, और चाल 78 (जिसे कई पेशेवरों द्वारा "दिव्य चाल" कहा गया) के बाद, यह इच्छित रूप से खेलेगा और ब्लैक का लाभ बनाए रखेगा। चाल 78 से पहले, AlphaGo पूरे खेल में आगे था, लेकिन ली की चाल ने प्रोग्राम की कंप्यूटिंग शक्ति को विचलित और भ्रमित कर दिया। हुआंग ने समझाया कि AlphaGo की नीति नेटवर्क ने स्थिति का गलत आकलन किया, जिससे हार हुई।
परिणाम और विरासत
जीत की मान्यता में, AlphaGo को कोरिया बादुक एसोसिएशन द्वारा मानद 9-डैन से सम्मानित किया गया। ली सेडोल के साथ तैयारी और चुनौती मैच को ग्रेग कोह्स द्वारा निर्देशित AlphaGo नामक एक वृत्तचित्र फिल्म में दर्ज किया गया था। 2017 के फ्यूचर ऑफ गो समिट में, AlphaGo के मास्टर संस्करण ने उस समय दुनिया के नंबर एक रैंक वाले खिलाड़ी के जी को तीन-गेम मैच में हराया, जिसके बाद AlphaGo को चीनी वेइकी एसोसिएशन द्वारा पेशेवर 9-डैन से सम्मानित किया गया। AlphaGo और के जी के बीच मैच के बाद, डीपमाइंड ने AlphaGo को सेवानिवृत्त कर दिया, जबकि अन्य क्षेत्रों में एआई अनुसंधान जारी रखा। स्व-शिक्षित AlphaGo Zero ने AlphaGo के शुरुआती प्रतिस्पर्धी संस्करण के खिलाफ 100-0 की जीत हासिल की, और इसके उत्तराधिकारी AlphaZero को 2010 के दशक के अंत तक गो में दुनिया का शीर्ष खिलाड़ी माना गया। AlphaZero को बदले में MuZero नामक एक प्रोग्राम द्वारा सफल बनाया गया है जो नियम सिखाए बिना सीखता है। ये उत्तराधिकारी, मूल AlphaGo के समान सिद्धांतों पर निर्मित, डीपमाइंड और उससे आगे के अनुसंधान को प्रभावित किया है, जो Generative AI और अन्य क्षेत्रों में प्रगति में योगदान दे रहे हैं।