अंग्रेज़ी से अनुवादित

2017年由Google DeepMind开发的AlphaGo Zero,通过强化学习和神经网络,在没有人类数据的情况下从零开始掌握了棋盘游戏围棋。它击败了之前的AlphaGo版本,并为AI自我对弈学习树立了新标准。

AlphaGo Zero एक कंप्यूटर प्रोग्राम था जिसे 2017 में गूगल डीपमाइंड द्वारा विकसित किया गया था, जिसने आत्म-खेल सुदृढीकरण सीखने के माध्यम से बोर्ड गेम गो में अति-मानवीय प्रदर्शन हासिल किया। अपने पूर्ववर्ती AlphaGo के विपरीत, जिसे हजारों मानव शौकिया और पेशेवर खेलों पर प्रशिक्षित किया गया था, AlphaGo Zero ने पूरी तरह से शुरुआत से सीखा, यादृच्छिक चालों से शुरू करके और केवल अपने खिलाफ खेलकर सुधार किया। इस प्रोग्राम को अक्टूबर 2017 में Nature पत्रिका में प्रकाशित एक पेपर में पेश किया गया था, जिसका शीर्षक था "मानव ज्ञान के बिना गो के खेल में महारत हासिल करना।"

सिस्टम ने गहरे तंत्रिका नेटवर्क को मशीन लर्निंग एल्गोरिदम के साथ जोड़ा, जिसे मोंटे कार्लो ट्री सर्च के रूप में जाना जाता है। तंत्रिका नेटवर्क ने बोर्ड स्थितियों का मूल्यांकन किया और जीतने की संभावना की भविष्यवाणी की, जबकि ट्री सर्च ने चाल चयन का मार्गदर्शन किया। प्रशिक्षण में सुदृढीकरण सीखने का एक लूप शामिल था: नेटवर्क ने लाखों आत्म-खेल खेल खेले, और इसके मापदंडों को खेल के परिणामों की बेहतर भविष्यवाणी करने और चाल विकल्पों में सुधार करने के लिए अद्यतन किया गया। इस दृष्टिकोण ने मानव विशेषज्ञ डेटा की आवश्यकता को समाप्त कर दिया, यह प्रदर्शित करते हुए कि एक एआई स्वतंत्र रूप से जटिल रणनीतियों की खोज कर सकता है।

वास्तुकला और प्रशिक्षण

AlphaGo Zero की वास्तुकला पहले के संस्करणों की तुलना में सरल थी। इसने अवशिष्ट ब्लॉकों के साथ एक एकल तंत्रिका नेटवर्क का उपयोग किया, जो गहरे सीखने की संरचना का एक प्रकार है जो बहुत गहरे नेटवर्क को प्रशिक्षित करने में मदद करता है। नेटवर्क ने इनपुट के रूप में वर्तमान बोर्ड स्थिति ली और दो मान आउटपुट किए: एक नीति वेक्टर (प्रत्येक संभावित चाल के लिए संभावनाएं) और एक मान स्केलर (अनुमानित जीत संभावना)। प्रशिक्षण में एडम ऑप्टिमाइज़र और नीति और मान त्रुटियों को मिलाकर एक कस्टम हानि फ़ंक्शन का उपयोग किया गया।

आत्म-खेल खेल कई मशीनों पर समानांतर रूप से उत्पन्न किए गए थे। प्रत्येक खेल वर्तमान सर्वश्रेष्ठ नेटवर्क द्वारा खेला गया था, और परिणामों का उपयोग स्टोकेस्टिक ग्रेडिएंट डिसेंट के माध्यम से नेटवर्क को अद्यतन करने के लिए किया गया था। प्रशिक्षण प्रक्रिया 64 टेंसर प्रोसेसिंग यूनिट्स (TPUs) पर लगभग 72 घंटे तक चली, जो गूगल द्वारा डिज़ाइन किया गया एक कस्टम हार्डवेयर त्वरक है। इस दौरान, प्रोग्राम ने लगभग 4.9 मिलियन आत्म-खेल खेल खेले, जो कुछ अन्य एआई प्रशिक्षण प्रणालियों में उपयोग किए गए अरबों खेलों से काफी कम संख्या है।

प्रदर्शन और परिणाम

तीन दिनों के प्रशिक्षण के बाद, AlphaGo Zero ने खेल का एक स्तर हासिल किया जो पिछले AlphaGo संस्करण से आगे निकल गया, जिसने 2016 में विश्व चैंपियन ली सेडोल को हराया था। 21 दिनों के बाद, यह लगभग 5185 एलो की रेटिंग तक पहुंच गया, जो किसी भी मानव खिलाड़ी या पिछली एआई प्रणाली से अधिक था। मूल्यांकन खेलों की एक श्रृंखला में, AlphaGo Zero ने AlphaGo ली को 100 खेलों में 0 से हराया, और इसने AlphaGo मास्टर, एक पहले के बेहतर संस्करण, को 89 खेलों में 11 से भी हराया।

प्रोग्राम ने अपने दम पर कई ज्ञात गो रणनीतियों की खोज की, जिसमें "3-3 पॉइंट" आक्रमण जैसे उद्घाटन पैटर्न और जटिल मध्य-खेल रणनीति शामिल हैं। इसने नई रणनीतियां भी विकसित कीं जो मानव खेल में आम नहीं थीं, जैसे असामान्य प्रारंभिक चालें जिन्होंने पेशेवर खिलाड़ियों को आश्चर्यचकित किया। इससे पता चला कि आत्म-खेल सीखना मानव मार्गदर्शन के बिना रचनात्मक समाधान उत्पन्न कर सकता है।

महत्व और प्रभाव

AlphaGo Zero ने कृत्रिम बुद्धिमत्ता अनुसंधान में एक प्रमुख मील का पत्थर प्रस्तुत किया। इसने प्रदर्शित किया कि एक सामान्य-उद्देश्य सीखने वाला एल्गोरिदम, पर्याप्त कम्प्यूटेशनल शक्ति के साथ मिलकर, बिना किसी पूर्व ज्ञान के एक जटिल डोमेन में महारत हासिल कर सकता है। यह पहले के दृष्टिकोणों के विपरीत था जो मानव विशेषज्ञता या हाथ से तैयार की गई सुविधाओं पर बहुत अधिक निर्भर थे। AlphaGo Zero की सफलता ने सुदृढीकरण सीखने में बाद के काम को प्रभावित किया, जिसमें अन्य खेलों और प्रोटीन फोल्डिंग और चिप डिजाइन जैसी वास्तविक दुनिया की समस्याओं के अनुप्रयोग शामिल हैं।

विधि ने कम्प्यूटेशनल संसाधनों के महत्व को भी उजागर किया। जबकि एल्गोरिदम वैचारिक रूप से सरल था, लाखों आत्म-खेल खेल चलाने के लिए महत्वपूर्ण हार्डवेयर की आवश्यकता थी। इसने ऐसी तकनीकों की पहुंच के बारे में सवाल उठाए, क्योंकि केवल डीपमाइंड जैसे बड़े संगठन ही आवश्यक बुनियादी ढांचे का खर्च उठा सकते थे। हालांकि, मूल विचारों को बाद में छोटे पैमाने की समस्याओं और ओपन-सोर्स कार्यान्वयन के लिए अनुकूलित किया गया।

विरासत और अनुवर्ती कार्य

AlphaGo Zero के पीछे के सिद्धांतों को अन्य डोमेन तक बढ़ाया गया। 2019 में, डीपमाइंड ने AlphaZero जारी किया, एक अधिक सामान्य संस्करण जो उसी आत्म-खेल दृष्टिकोण का उपयोग करके गो, शतरंज और शोगी खेल सकता था। AlphaZero ने तीनों खेलों में अति-मानवीय प्रदर्शन हासिल किया, जिससे विधि की बहुमुखी प्रतिभा और प्रदर्शित हुई। इन प्रणालियों की सफलता ने गहरे सीखने के व्यापक क्षेत्र में योगदान दिया और एआई विकास में सुदृढीकरण सीखने की क्षमता को मजबूत किया।

AlphaGo Zero ने एआई में रचनात्मकता और अंतर्ज्ञान की प्रकृति के बारे में भी चर्चाएं शुरू कीं। मानव इनपुट के बिना नई रणनीतियों की खोज करने की इसकी क्षमता ने सुझाव दिया कि मशीनें जटिल वातावरण में मूल समाधान उत्पन्न कर सकती हैं। इसका खेलों से परे क्षेत्रों पर प्रभाव है, जिसमें वैज्ञानिक खोज और अनुकूलन समस्याएं शामिल हैं। यह प्रोग्राम एक ऐतिहासिक उदाहरण बना हुआ है कि कैसे सरल सीखने के नियम पर्याप्त गणना के साथ मिलकर परिष्कृत व्यवहार का नेतृत्व कर सकते हैं।

स्वागत और आलोचना

जबकि AlphaGo Zero को इसकी तकनीकी उपलब्धियों के लिए व्यापक रूप से सराहा गया था, कुछ शोधकर्ताओं ने सीमाओं पर ध्यान दिया। प्रशिक्षण प्रक्रिया के लिए विशाल कम्प्यूटेशनल संसाधनों की आवश्यकता थी, जिससे यह कई शैक्षणिक प्रयोगशालाओं के लिए अव्यावहारिक हो गया। इसके अतिरिक्त, प्रोग्राम गो के लिए विशेषीकृत था और महत्वपूर्ण संशोधन के बिना अन्य कार्यों के लिए सामान्यीकृत नहीं हुआ। आलोचकों ने यह भी बताया कि आत्म-खेल दृष्टिकोण स्पष्ट नियमों के साथ एक अच्छी तरह से परिभाषित वातावरण पर निर्भर करता है, जो अनिश्चितता और अपूर्ण जानकारी वाली वास्तविक दुनिया की समस्याओं पर लागू नहीं हो सकता है।

इन आपत्तियों के बावजूद, एआई अनुसंधान पर AlphaGo Zero का प्रभाव काफी था। इसने आत्म-खेल और पाठ्यक्रम सीखने पर नए काम को प्रेरित किया, और इसकी सफलता ने इस विचार को मान्य करने में मदद की कि बुद्धिमान व्यवहार सरल सीखने के तंत्र से उभर सकता है। प्रोग्राम को अक्सर आधुनिक मशीन लर्निंग तकनीकों की शक्ति के एक प्रमुख उदाहरण के रूप में उद्धृत किया जाता है और एआई पाठ्यक्रमों और शोध पत्रों में अध्ययन का विषय बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·reinforcement-learning·go-game·google-deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास