अंग्रेज़ी से अनुवादित

DeepMind का 2016 का Nature पेपर AlphaGo प्रस्तुत करता है, जो पहला कंप्यूटर प्रोग्राम है जिसने बिना किसी हैंडीकैप के एक पेशेवर Go खिलाड़ी को हराया, जिसमें गहरे तंत्रिका नेटवर्क और Monte Carlo ट्री सर्च का उपयोग किया गया। पेपर ने Fan Hui पर इसकी 5-0 जीत का दस्तावेजीकरण किया और Lee Sedol पर इसकी ऐतिहासिक 4-1 विजय से पहले आया।

AlphaGo एक कंप्यूटर प्रोग्राम है जो बोर्ड गेम गो खेलता है, जिसे लंदन स्थित डीपमाइंड टेक्नोलॉजीज द्वारा विकसित किया गया है, जो गूगल की एक अधिग्रहीत सहायक कंपनी है। इस प्रोग्राम और इसके एल्गोरिदम का वर्णन 27 जनवरी 2016 को जर्नल नेचर में प्रकाशित एक पेपर में किया गया था, जो यूरोपीय चैंपियन फैन हुई पर इसकी जीत की घोषणा के साथ मेल खाता था। यह पेपर कृत्रिम बुद्धिमत्ता में एक मील का पत्थर साबित हुआ, क्योंकि AlphaGo पहला कंप्यूटर गो प्रोग्राम बन गया जिसने बिना किसी हैंडीकैप के पूर्ण आकार के 19×19 बोर्ड पर एक पेशेवर मानव खिलाड़ी को हराया। इस जीत को 22 दिसंबर 2016 को साइंस द्वारा वर्ष की सफलता के उपविजेताओं में से एक के रूप में मान्यता दी गई।

AlphaGo बोर्ड स्थितियों का मूल्यांकन करने और चालों का चयन करने के लिए Machine learning और कृत्रिम तंत्रिका नेटवर्क के संयोजन का उपयोग करता है। यह एक मोंटे कार्लो ट्री सर्च एल्गोरिदम का उपयोग करता है, जो एक गहन शिक्षण नीति नेटवर्क और एक मूल्य नेटवर्क द्वारा निर्देशित होता है, जिसे मानव खेलों से पर्यवेक्षित शिक्षण और स्व-खेल से सुदृढीकरण शिक्षण दोनों के माध्यम से प्रशिक्षित किया जाता है। इस दृष्टिकोण ने AlphaGo को गो के बड़े शाखा कारक की चुनौतियों को पार करने की अनुमति दी, जिसने पहले के Artificial intelligence तरीकों को विफल कर दिया था।

विकास और पृष्ठभूमि

गो को शतरंज जैसे अन्य खेलों की तुलना में कंप्यूटर के लिए जीतना कहीं अधिक कठिन माना जाता है, क्योंकि इसकी रणनीतिक और सौंदर्यपरक प्रकृति सीधे मूल्यांकन फ़ंक्शन का निर्माण करना कठिन बना देती है, और इसका बहुत बड़ा शाखा कारक पारंपरिक एआई विधियों जैसे अल्फा-बीटा प्रूनिंग, ट्री ट्रैवर्सल और ह्यूरिस्टिक सर्च का उपयोग करना निषेधात्मक रूप से कठिन बना देता है। आईबीएम के कंप्यूटर डीप ब्लू द्वारा 1997 के मैच में विश्व शतरंज चैंपियन गैरी कास्परोव को हराने के लगभग दो दशक बाद, कृत्रिम बुद्धिमत्ता तकनीकों का उपयोग करने वाले सबसे मजबूत गो प्रोग्राम केवल लगभग शौकिया 5-डैन स्तर तक ही पहुंच पाए थे, और फिर भी बिना हैंडीकैप के किसी पेशेवर गो खिलाड़ी को नहीं हरा सके। 2012 में, चार पीसी क्लस्टर पर चलने वाले सॉफ्टवेयर प्रोग्राम ज़ेन ने मासाकी ताकेमिया (9p) को पांच- और चार-पत्थर के हैंडीकैप पर दो बार हराया। 2013 में, क्रेज़ी स्टोन ने योशियो इशिदा (9p) को चार-पत्थर के हैंडीकैप पर हराया।

डीपमाइंड के डेविड सिल्वर के अनुसार, AlphaGo अनुसंधान परियोजना लगभग 2014 में यह परीक्षण करने के लिए बनाई गई थी कि Deep learning का उपयोग करने वाला तंत्रिका नेटवर्क गो में कितनी अच्छी प्रतिस्पर्धा कर सकता है। AlphaGo पिछले गो प्रोग्रामों की तुलना में एक महत्वपूर्ण सुधार का प्रतिनिधित्व करता है। क्रेज़ी स्टोन और ज़ेन सहित अन्य उपलब्ध गो प्रोग्रामों के खिलाफ 500 खेलों में, एक ही कंप्यूटर पर चलने वाले AlphaGo ने एक को छोड़कर सभी जीते। एक समान मुकाबले में, कई कंप्यूटरों पर चलने वाले AlphaGo ने अन्य गो प्रोग्रामों के खिलाफ खेले गए सभी 500 खेल जीते, और एक ही कंप्यूटर पर चलने वाले AlphaGo के खिलाफ खेले गए 77% खेल जीते। अक्टूबर 2015 में वितरित संस्करण 1,202 सीपीयू और 176 जीपीयू का उपयोग कर रहा था।

फैन हुई के खिलाफ मैच

अक्टूबर 2015 में, AlphaGo के वितरित संस्करण ने यूरोपीय गो चैंपियन फैन हुई, जो एक 2-डैन (संभावित 9 डैन में से) पेशेवर थे, को पांच से शून्य से हराया। यह पहली बार था जब किसी कंप्यूटर गो प्रोग्राम ने बिना हैंडीकैप के पूर्ण आकार के बोर्ड पर एक पेशेवर मानव खिलाड़ी को हराया था। समाचार की घोषणा 27 जनवरी 2016 तक विलंबित की गई थी ताकि यह जर्नल नेचर में उपयोग किए गए एल्गोरिदम का वर्णन करने वाले पेपर के प्रकाशन के साथ मेल खाए।

ली सेडोल के खिलाफ मैच

AlphaGo ने दक्षिण कोरियाई पेशेवर गो खिलाड़ी ली सेडोल, जो 9-डैन रैंक के थे और गो के सर्वश्रेष्ठ खिलाड़ियों में से एक थे, के खिलाफ खेला, जिसमें पांच खेल 9, 10, 12, 13 और 15 मार्च 2016 को सियोल, दक्षिण कोरिया के फोर सीजन्स होटल में हुए, जिन्हें लाइव वीडियो-स्ट्रीम किया गया। पांच खेलों में से, AlphaGo ने चार खेल जीते और ली ने चौथा खेल जीता, जिससे वह एकमात्र मानव खिलाड़ी बन गए जिन्होंने AlphaGo के सभी 74 आधिकारिक खेलों में उसे हराया। AlphaGo गूगल के क्लाउड कंप्यूटिंग पर चला, जिसके सर्वर संयुक्त राज्य अमेरिका में स्थित थे। मैच में 7.5-पॉइंट कोमी के साथ चीनी नियमों का उपयोग किया गया, और प्रत्येक पक्ष के पास दो घंटे का सोचने का समय और तीन 60-सेकंड के ब्योयोमी अवधि थे। ली के खिलाफ खेलने वाला AlphaGo संस्करण फैन हुई मैच में उपयोग किए गए समान कंप्यूटिंग शक्ति का उपयोग करता था। द इकोनॉमिस्ट ने बताया कि इसने 1,920 सीपीयू और 280 जीपीयू का उपयोग किया। खेल के समय, ली सेडोल के पास दक्षिण कोरियाई खिलाड़ी ली चांग-हो के बाद दुनिया में गो अंतर्राष्ट्रीय चैंपियनशिप जीत की दूसरी सबसे अधिक संख्या थी, जिन्होंने 16 वर्षों तक विश्व चैंपियनशिप खिताब अपने पास रखा। चूंकि अंतर्राष्ट्रीय गो में रैंकिंग का कोई एक आधिकारिक तरीका नहीं है, रैंकिंग स्रोतों के बीच भिन्न हो सकती है। जबकि उन्हें कभी-कभी शीर्ष स्थान दिया जाता था, कुछ स्रोतों ने ली सेडोल को उस समय दुनिया का चौथा सर्वश्रेष्ठ खिलाड़ी बताया। AlphaGo को विशेष रूप से ली का सामना करने के लिए प्रशिक्षित नहीं किया गया था और न ही इसे किसी विशिष्ट मानव खिलाड़ी के साथ प्रतिस्पर्धा करने के लिए डिज़ाइन किया गया था।

पहले तीन खेल AlphaGo ने ली के समर्पण के बाद जीते। हालांकि, ली ने चौथे खेल में AlphaGo को हराया, चाल 180 पर समर्पण द्वारा जीत हासिल की। AlphaGo ने फिर चौथी जीत हासिल की, पांचवां खेल समर्पण द्वारा जीतकर। पुरस्कार राशि US$1 मिलियन थी। चूंकि AlphaGo ने पांच में से चार जीते और इस प्रकार श्रृंखला जीती, पुरस्कार राशि यूनिसेफ सहित चैरिटी को दान की जाएगी। ली सेडोल को सभी पांच खेलों में भाग लेने के लिए $150,000 और खेल 4 में जीत के लिए अतिरिक्त $20,000 मिले।

जून 2016 में, नीदरलैंड के एक विश्वविद्यालय में आयोजित एक प्रस्तुति में, डीपमाइंड टीम के सदस्य अजा हुआंग ने खुलासा किया कि उन्होंने AlphaGo और ली के बीच मैच के चौथे खेल के दौरान हुई तार्किक कमजोरी को ठीक कर दिया था, और चाल 78 (जिसे कई पेशेवरों द्वारा "दिव्य चाल" कहा गया) के बाद, यह इच्छित रूप से खेलेगा और ब्लैक का लाभ बनाए रखेगा। चाल 78 से पहले, AlphaGo पूरे खेल में आगे था, लेकिन ली की चाल ने प्रोग्राम की कंप्यूटिंग शक्ति को विचलित और भ्रमित कर दिया। हुआंग ने समझाया कि AlphaGo की नीति नेटवर्क ने स्थिति का गलत आकलन किया, जिससे हार हुई।

परिणाम और विरासत

जीत की मान्यता में, AlphaGo को कोरिया बादुक एसोसिएशन द्वारा मानद 9-डैन से सम्मानित किया गया। ली सेडोल के साथ तैयारी और चुनौती मैच को ग्रेग कोह्स द्वारा निर्देशित AlphaGo नामक एक वृत्तचित्र फिल्म में दर्ज किया गया था। 2017 के फ्यूचर ऑफ गो समिट में, AlphaGo के मास्टर संस्करण ने उस समय दुनिया के नंबर एक रैंक वाले खिलाड़ी के जी को तीन-गेम मैच में हराया, जिसके बाद AlphaGo को चीनी वेइकी एसोसिएशन द्वारा पेशेवर 9-डैन से सम्मानित किया गया। AlphaGo और के जी के बीच मैच के बाद, डीपमाइंड ने AlphaGo को सेवानिवृत्त कर दिया, जबकि अन्य क्षेत्रों में एआई अनुसंधान जारी रखा। स्व-शिक्षित AlphaGo Zero ने AlphaGo के शुरुआती प्रतिस्पर्धी संस्करण के खिलाफ 100-0 की जीत हासिल की, और इसके उत्तराधिकारी AlphaZero को 2010 के दशक के अंत तक गो में दुनिया का शीर्ष खिलाड़ी माना गया। AlphaZero को बदले में MuZero नामक एक प्रोग्राम द्वारा सफल बनाया गया है जो नियम सिखाए बिना सीखता है। ये उत्तराधिकारी, मूल AlphaGo के समान सिद्धांतों पर निर्मित, डीपमाइंड और उससे आगे के अनुसंधान को प्रभावित किया है, जो Generative AI और अन्य क्षेत्रों में प्रगति में योगदान दे रहे हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·deep-learning·go-game·deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास