AlphaGo Zero एक कंप्यूटर प्रोग्राम था जिसे 2017 में गूगल डीपमाइंड द्वारा विकसित किया गया था, जिसने आत्म-खेल सुदृढीकरण सीखने के माध्यम से बोर्ड गेम गो में अति-मानवीय प्रदर्शन हासिल किया। अपने पूर्ववर्ती AlphaGo के विपरीत, जिसे हजारों मानव शौकिया और पेशेवर खेलों पर प्रशिक्षित किया गया था, AlphaGo Zero ने पूरी तरह से शुरुआत से सीखा, यादृच्छिक चालों से शुरू करके और केवल अपने खिलाफ खेलकर सुधार किया। इस प्रोग्राम को अक्टूबर 2017 में Nature पत्रिका में प्रकाशित एक पेपर में पेश किया गया था, जिसका शीर्षक था "मानव ज्ञान के बिना गो के खेल में महारत हासिल करना।"
सिस्टम ने गहरे तंत्रिका नेटवर्क को मशीन लर्निंग एल्गोरिदम के साथ जोड़ा, जिसे मोंटे कार्लो ट्री सर्च के रूप में जाना जाता है। तंत्रिका नेटवर्क ने बोर्ड स्थितियों का मूल्यांकन किया और जीतने की संभावना की भविष्यवाणी की, जबकि ट्री सर्च ने चाल चयन का मार्गदर्शन किया। प्रशिक्षण में सुदृढीकरण सीखने का एक लूप शामिल था: नेटवर्क ने लाखों आत्म-खेल खेल खेले, और इसके मापदंडों को खेल के परिणामों की बेहतर भविष्यवाणी करने और चाल विकल्पों में सुधार करने के लिए अद्यतन किया गया। इस दृष्टिकोण ने मानव विशेषज्ञ डेटा की आवश्यकता को समाप्त कर दिया, यह प्रदर्शित करते हुए कि एक एआई स्वतंत्र रूप से जटिल रणनीतियों की खोज कर सकता है।
वास्तुकला और प्रशिक्षण
AlphaGo Zero की वास्तुकला पहले के संस्करणों की तुलना में सरल थी। इसने अवशिष्ट ब्लॉकों के साथ एक एकल तंत्रिका नेटवर्क का उपयोग किया, जो गहरे सीखने की संरचना का एक प्रकार है जो बहुत गहरे नेटवर्क को प्रशिक्षित करने में मदद करता है। नेटवर्क ने इनपुट के रूप में वर्तमान बोर्ड स्थिति ली और दो मान आउटपुट किए: एक नीति वेक्टर (प्रत्येक संभावित चाल के लिए संभावनाएं) और एक मान स्केलर (अनुमानित जीत संभावना)। प्रशिक्षण में एडम ऑप्टिमाइज़र और नीति और मान त्रुटियों को मिलाकर एक कस्टम हानि फ़ंक्शन का उपयोग किया गया।
आत्म-खेल खेल कई मशीनों पर समानांतर रूप से उत्पन्न किए गए थे। प्रत्येक खेल वर्तमान सर्वश्रेष्ठ नेटवर्क द्वारा खेला गया था, और परिणामों का उपयोग स्टोकेस्टिक ग्रेडिएंट डिसेंट के माध्यम से नेटवर्क को अद्यतन करने के लिए किया गया था। प्रशिक्षण प्रक्रिया 64 टेंसर प्रोसेसिंग यूनिट्स (TPUs) पर लगभग 72 घंटे तक चली, जो गूगल द्वारा डिज़ाइन किया गया एक कस्टम हार्डवेयर त्वरक है। इस दौरान, प्रोग्राम ने लगभग 4.9 मिलियन आत्म-खेल खेल खेले, जो कुछ अन्य एआई प्रशिक्षण प्रणालियों में उपयोग किए गए अरबों खेलों से काफी कम संख्या है।
प्रदर्शन और परिणाम
तीन दिनों के प्रशिक्षण के बाद, AlphaGo Zero ने खेल का एक स्तर हासिल किया जो पिछले AlphaGo संस्करण से आगे निकल गया, जिसने 2016 में विश्व चैंपियन ली सेडोल को हराया था। 21 दिनों के बाद, यह लगभग 5185 एलो की रेटिंग तक पहुंच गया, जो किसी भी मानव खिलाड़ी या पिछली एआई प्रणाली से अधिक था। मूल्यांकन खेलों की एक श्रृंखला में, AlphaGo Zero ने AlphaGo ली को 100 खेलों में 0 से हराया, और इसने AlphaGo मास्टर, एक पहले के बेहतर संस्करण, को 89 खेलों में 11 से भी हराया।
प्रोग्राम ने अपने दम पर कई ज्ञात गो रणनीतियों की खोज की, जिसमें "3-3 पॉइंट" आक्रमण जैसे उद्घाटन पैटर्न और जटिल मध्य-खेल रणनीति शामिल हैं। इसने नई रणनीतियां भी विकसित कीं जो मानव खेल में आम नहीं थीं, जैसे असामान्य प्रारंभिक चालें जिन्होंने पेशेवर खिलाड़ियों को आश्चर्यचकित किया। इससे पता चला कि आत्म-खेल सीखना मानव मार्गदर्शन के बिना रचनात्मक समाधान उत्पन्न कर सकता है।
महत्व और प्रभाव
AlphaGo Zero ने कृत्रिम बुद्धिमत्ता अनुसंधान में एक प्रमुख मील का पत्थर प्रस्तुत किया। इसने प्रदर्शित किया कि एक सामान्य-उद्देश्य सीखने वाला एल्गोरिदम, पर्याप्त कम्प्यूटेशनल शक्ति के साथ मिलकर, बिना किसी पूर्व ज्ञान के एक जटिल डोमेन में महारत हासिल कर सकता है। यह पहले के दृष्टिकोणों के विपरीत था जो मानव विशेषज्ञता या हाथ से तैयार की गई सुविधाओं पर बहुत अधिक निर्भर थे। AlphaGo Zero की सफलता ने सुदृढीकरण सीखने में बाद के काम को प्रभावित किया, जिसमें अन्य खेलों और प्रोटीन फोल्डिंग और चिप डिजाइन जैसी वास्तविक दुनिया की समस्याओं के अनुप्रयोग शामिल हैं।
विधि ने कम्प्यूटेशनल संसाधनों के महत्व को भी उजागर किया। जबकि एल्गोरिदम वैचारिक रूप से सरल था, लाखों आत्म-खेल खेल चलाने के लिए महत्वपूर्ण हार्डवेयर की आवश्यकता थी। इसने ऐसी तकनीकों की पहुंच के बारे में सवाल उठाए, क्योंकि केवल डीपमाइंड जैसे बड़े संगठन ही आवश्यक बुनियादी ढांचे का खर्च उठा सकते थे। हालांकि, मूल विचारों को बाद में छोटे पैमाने की समस्याओं और ओपन-सोर्स कार्यान्वयन के लिए अनुकूलित किया गया।
विरासत और अनुवर्ती कार्य
AlphaGo Zero के पीछे के सिद्धांतों को अन्य डोमेन तक बढ़ाया गया। 2019 में, डीपमाइंड ने AlphaZero जारी किया, एक अधिक सामान्य संस्करण जो उसी आत्म-खेल दृष्टिकोण का उपयोग करके गो, शतरंज और शोगी खेल सकता था। AlphaZero ने तीनों खेलों में अति-मानवीय प्रदर्शन हासिल किया, जिससे विधि की बहुमुखी प्रतिभा और प्रदर्शित हुई। इन प्रणालियों की सफलता ने गहरे सीखने के व्यापक क्षेत्र में योगदान दिया और एआई विकास में सुदृढीकरण सीखने की क्षमता को मजबूत किया।
AlphaGo Zero ने एआई में रचनात्मकता और अंतर्ज्ञान की प्रकृति के बारे में भी चर्चाएं शुरू कीं। मानव इनपुट के बिना नई रणनीतियों की खोज करने की इसकी क्षमता ने सुझाव दिया कि मशीनें जटिल वातावरण में मूल समाधान उत्पन्न कर सकती हैं। इसका खेलों से परे क्षेत्रों पर प्रभाव है, जिसमें वैज्ञानिक खोज और अनुकूलन समस्याएं शामिल हैं। यह प्रोग्राम एक ऐतिहासिक उदाहरण बना हुआ है कि कैसे सरल सीखने के नियम पर्याप्त गणना के साथ मिलकर परिष्कृत व्यवहार का नेतृत्व कर सकते हैं।
स्वागत और आलोचना
जबकि AlphaGo Zero को इसकी तकनीकी उपलब्धियों के लिए व्यापक रूप से सराहा गया था, कुछ शोधकर्ताओं ने सीमाओं पर ध्यान दिया। प्रशिक्षण प्रक्रिया के लिए विशाल कम्प्यूटेशनल संसाधनों की आवश्यकता थी, जिससे यह कई शैक्षणिक प्रयोगशालाओं के लिए अव्यावहारिक हो गया। इसके अतिरिक्त, प्रोग्राम गो के लिए विशेषीकृत था और महत्वपूर्ण संशोधन के बिना अन्य कार्यों के लिए सामान्यीकृत नहीं हुआ। आलोचकों ने यह भी बताया कि आत्म-खेल दृष्टिकोण स्पष्ट नियमों के साथ एक अच्छी तरह से परिभाषित वातावरण पर निर्भर करता है, जो अनिश्चितता और अपूर्ण जानकारी वाली वास्तविक दुनिया की समस्याओं पर लागू नहीं हो सकता है।
इन आपत्तियों के बावजूद, एआई अनुसंधान पर AlphaGo Zero का प्रभाव काफी था। इसने आत्म-खेल और पाठ्यक्रम सीखने पर नए काम को प्रेरित किया, और इसकी सफलता ने इस विचार को मान्य करने में मदद की कि बुद्धिमान व्यवहार सरल सीखने के तंत्र से उभर सकता है। प्रोग्राम को अक्सर आधुनिक मशीन लर्निंग तकनीकों की शक्ति के एक प्रमुख उदाहरण के रूप में उद्धृत किया जाता है और एआई पाठ्यक्रमों और शोध पत्रों में अध्ययन का विषय बना हुआ है।