अल्फागो ज़ीरो एक कंप्यूटर प्रोग्राम है जिसे गूगल डीपमाइंड द्वारा विकसित किया गया है और यह बोर्ड गेम गो खेलता है। यह एक तंत्रिका नेटवर्क-आधारित प्रणाली है जिसने गो खेलना पूरी तरह से स्व-खेल से सीखा, बिना किसी मानव खेल डेटा या खेल के बुनियादी नियमों से परे पूर्व ज्ञान के। अक्टूबर 2017 में जारी, इसने अपने पूर्ववर्ती अल्फागो के प्रदर्शन को पार कर लिया, जिसने शीर्ष मानव खिलाड़ियों को हराया था, और जटिल रणनीति खेलों में कृत्रिम बुद्धिमत्ता के लिए एक नया मानदंड स्थापित किया।
अल्फागो के पहले के संस्करणों के विपरीत, जिन्हें शुरू में हजारों मानव शौकिया और पेशेवर खेलों पर प्रशिक्षित किया गया था, अल्फागो ज़ीरो ने एक खाली स्लेट से शुरुआत की। इसने एक एकल तंत्रिका नेटवर्क का उपयोग किया जिसे सुदृढीकरण सीखने के माध्यम से प्रशिक्षित किया गया था, जो अपने खिलाफ लाखों खेल खेलता था। इस दृष्टिकोण ने प्रदर्शित किया कि एक प्रणाली मानव विशेषज्ञता पर भरोसा किए बिना किसी डोमेन में अलौकिक प्रदर्शन प्राप्त कर सकती है, जो गहन सीखने अनुसंधान में एक महत्वपूर्ण मील का पत्थर है।
वास्तुकला और प्रशिक्षण
अल्फागो ज़ीरो की वास्तुकला अपने पूर्ववर्तियों की तुलना में सरल और अधिक कुशल थी। इसने अवशिष्ट ब्लॉकों के साथ एक एकल गहन तंत्रिका नेटवर्क का उपयोग किया, जो ResNet से प्रेरित एक डिज़ाइन है, बोर्ड स्थितियों का मूल्यांकन करने और चालों का चयन करने के लिए। नेटवर्क को नीति और मूल्य आउटपुट के संयोजन का उपयोग करके प्रशिक्षित किया गया था, जहां नीति हेड ने प्रत्येक चाल की संभावना की भविष्यवाणी की और मूल्य हेड ने वर्तमान स्थिति से खेल के अपेक्षित परिणाम का अनुमान लगाया।
प्रशिक्षण स्व-खेल के माध्यम से आगे बढ़ा, जहां नेटवर्क का वर्तमान संस्करण खेल डेटा उत्पन्न करने के लिए अपने खिलाफ खेला। नेटवर्क को स्टोकेस्टिक ग्रेडिएंट डिसेंट ऑप्टिमाइज़र के एक प्रकार, विशेष रूप से एडम ऑप्टिमाइज़र, के साथ एक सीखने की दर अनुसूची का उपयोग करके अद्यतन किया गया था जो समय के साथ घटती गई। सिस्टम ने प्रशिक्षण उदाहरणों की विविधता बढ़ाने के लिए बोर्ड स्थितियों को घुमाकर और प्रतिबिंबित करके डेटा संवर्धन भी नियोजित किया। यह प्रक्रिया लाखों खेलों पर दोहराई गई, जिसमें नेटवर्क लगातार अपने खेल में सुधार करता रहा।
प्रदर्शन और परिणाम
प्रयोगों की एक श्रृंखला में, अल्फागो ज़ीरो ने उल्लेखनीय परिणाम प्राप्त किए। केवल 72 घंटे के स्व-खेल प्रशिक्षण के बाद, यह पहले जारी अल्फागो ली को हराने में सक्षम था, जो वह संस्करण था जिसने 2016 में विश्व चैंपियन ली सेडोल को हराया था, 100 खेलों से 0 के स्कोर के साथ। लगभग 40 दिनों के प्रशिक्षण के बाद, इसने अल्फागो मास्टर को पार कर लिया, जो एक मजबूत संस्करण था जिसने 2017 की शुरुआत में शीर्ष पेशेवरों को हराया था। अल्फागो ज़ीरो का अंतिम संस्करण, लगभग 40 दिनों के लिए प्रशिक्षित, सभी पिछले अल्फागो संस्करणों से अधिक मजबूत होने का मूल्यांकन किया गया था, जिसमें अल्फागो मास्टर के लगभग 4800 की तुलना में 5000 से अधिक का अनुमानित एलो रेटिंग थी।
इन परिणामों ने दिखाया कि मानव ज्ञान के बिना प्रशिक्षित एक प्रणाली न केवल मानव खेलों पर प्रशिक्षित प्रणालियों के प्रदर्शन से मेल खा सकती है बल्कि उससे अधिक भी हो सकती है। स्व-खेल दृष्टिकोण भी अधिक कम्प्यूटेशनल रूप से कुशल साबित हुआ, पहले के संस्करणों की तुलना में कम संसाधनों का उपयोग करते हुए।
महत्व और प्रभाव
अल्फागो ज़ीरो की सफलता के एआई के क्षेत्र के लिए गहरा निहितार्थ थे। इसने प्रदर्शित किया कि सुदृढीकरण सीखना, गहन तंत्रिका नेटवर्क के साथ संयुक्त, मानव-जनित प्रशिक्षण डेटा की आवश्यकता के बिना जटिल समस्याओं को हल कर सकता है। यह विशेष रूप से गो जैसे खेल में उल्लेखनीय था, जिसमें एक विशाल खोज स्थान है और लंबे समय से एआई के लिए एक बड़ी चुनौती माना जाता था।
अल्फागो ज़ीरो में उपयोग किया गया दृष्टिकोण मशीन सीखने में बाद के अनुसंधान को प्रभावित किया है, जिसमें खेलों से परे अनुप्रयोग शामिल हैं। इसने एजेंटों को प्रशिक्षित करने में स्व-खेल और पाठ्यक्रम सीखने की क्षमता पर प्रकाश डाला, और इसने अधिक सामान्य सुदृढीकरण सीखने एल्गोरिदम के विकास में योगदान दिया। सिद्धांतों को अन्य डोमेनों पर लागू किया गया है, जैसे जनरेटिव मॉडल और रोबोटिक्स, हालांकि सफलता की अलग-अलग डिग्री के साथ।
विरासत और भविष्य की दिशाएँ
अल्फागो ज़ीरो डीपमाइंड और एआई अनुसंधान के इतिहास में एक प्रमुख उपलब्धि थी। इसके बाद अल्फाज़ीरो आया, एक अधिक सामान्य संस्करण जो शतरंज और शोगी भी खेल सकता था, जो स्व-खेल दृष्टिकोण की बहुमुखी प्रतिभा को और प्रदर्शित करता है। अल्फागो ज़ीरो के विचारों को अन्य एआई प्रणालियों में शामिल किया गया है, और वे तंत्रिका नेटवर्क और सुदृढीकरण सीखने पर अनुसंधान को सूचित करना जारी रखते हैं।
कार्यक्रम ने मानव विशेषज्ञता की प्रकृति और एआई की नवीन रणनीतियों को खोजने की क्षमता के बारे में भी प्रश्न उठाए। अपने खेलों में, अल्फागो ज़ीरो ने कभी-कभी ऐसी चालें चलीं जो मानव मानकों से अपरंपरागत थीं, यह सुझाव देते हुए कि एआई ऐसे समाधान खोज सकता है जिन पर मनुष्यों ने विचार नहीं किया है। इसने वैज्ञानिक खोज और समस्या-समाधान में एआई की भूमिका के बारे में चर्चाओं को जन्म दिया है।
2020 के दशक की शुरुआत तक, अल्फागो ज़ीरो द्वारा अग्रणी तकनीकें प्रभावशाली बनी हुई हैं, और सिस्टम को अक्सर आधुनिक गहन सीखने और सुदृढीकरण सीखने के साथ संभव का एक ऐतिहासिक उदाहरण के रूप में उद्धृत किया जाता है। इसकी विरासत विभिन्न क्षेत्रों में अधिक सक्षम एआई प्रणालियों के चल रहे विकास में देखी जाती है।
यह भी देखें
संदर्भ
- सिल्वर, डी., एट अल. (2017). "मानव ज्ञान के बिना गो के खेल में महारत हासिल करना." नेचर, 550, 354-359.
- सिल्वर, डी., एट अल. (2018). "एक सामान्य सुदृढीकरण सीखने एल्गोरिदम जो स्व-खेल के माध्यम से शतरंज, शोगी और गो में महारत हासिल करता है." साइंस, 362, 1140-1144.