AlphaZero एक सुदृढीकरण-सीखने प्रणाली है जिसे DeepMind द्वारा विकसित किया गया था, जिसने एक सामान्य-उद्देश्य एल्गोरिदम और कोई मानव-निर्मित खेल डेटा के बिना शतरंज, शोगी और गो को अति-मानवीय स्तर पर खेलना सीखा। DeepMind ने दिसंबर 2017 में प्रकाशित एक पेपर में AlphaZero की घोषणा की, जिसमें एक ऐसी प्रणाली का वर्णन किया गया जो प्रत्येक खेल के केवल नियमों से शुरू होकर, पूरी तरह से स्व-खेल के माध्यम से सीखती है, स्थितियों का मूल्यांकन करने और चालों का चयन करने के लिए गहरे तंत्रिका नेटवर्क को मोंटे कार्लो ट्री खोज के साथ जोड़ती है, और फिर स्वयं के विरुद्ध खेले गए खेलों के परिणामों के माध्यम से उस नेटवर्क को सुधारती है।
AlphaGo से संबंध
AlphaZero ने पहले AlphaGo Zero द्वारा प्रदर्शित स्व-खेल दृष्टिकोण को सामान्यीकृत किया, जो AlphaGo का वह संस्करण था जिसने बिना मानव खेल डेटा के पूरी तरह से स्व-खेल के माध्यम से गो सीखा था, और इसे अतिरिक्त खेलों तक विस्तारित किया। जहाँ AlphaGo और AlphaGo Zero केवल गो के लिए विशेषीकृत थे, वहीं AlphaZero ने समान अंतर्निहित वास्तुकला और प्रशिक्षण प्रक्रिया का उपयोग किया, जिसमें नियमों के अलावा कोई खेल-विशिष्ट समायोजन नहीं था, और शतरंज और शोगी में भी अति-मानवीय प्रदर्शन हासिल किया, यह प्रदर्शित करते हुए कि स्व-खेल सुदृढीकरण सीखने का दृष्टिकोण गो-विशिष्ट चाल नहीं था, बल्कि पूर्ण जानकारी वाले खेलों में महारत हासिल करने के लिए एक वास्तविक सामान्य विधि थी।
शतरंज परिणाम
AlphaZero के शतरंज परिणाम ने AI और शतरंज समुदायों दोनों में विशेष ध्यान आकर्षित किया, क्योंकि शतरंज में गो की तुलना में कंप्यूटर इंजन विकास का अधिक लंबा इतिहास था, जिस पर दो दशकों तक गहरी, हाथ-से-ट्यून की गई ब्रूट-फोर्स खोज का उपयोग करने वाले पारंपरिक इंजनों का वर्चस्व था, जिनमें सबसे प्रसिद्ध Stockfish था। केवल चार घंटे के स्व-खेल प्रशिक्षण के बाद, बिना किसी उद्घाटन पुस्तक, अंतिम-खेल तालिका, या बुनियादी नियमों के अलावा अन्य शतरंज-विशिष्ट मानव ज्ञान के उपयोग के बिना, AlphaZero ने 100-खेल मैच में Stockfish को हराया। समीक्षकों, जिनमें खेलों की समीक्षा करने वाले ग्रैंडमास्टर शामिल थे, ने नोट किया कि AlphaZero की शतरंज खेल शैली विशिष्ट थी, जो पारंपरिक इंजनों में निहित सामग्री-गणना अनुमानों पर दीर्घकालिक मोहरा गतिशीलता और राजा सुरक्षा को प्राथमिकता देती थी, और अक्सर ऐसे बलिदान करती थी जो तत्काल सामग्री लाभ के बजाय स्थायी स्थितिगत लाभ उत्पन्न करते थे, एक ऐसी शैली जिसे कुछ लोगों ने पिछले इंजनों की तुलना में अधिक सहज या सौंदर्यपूर्ण रूप से प्रभावशाली बताया।
महत्व
AlphaZero का यह प्रदर्शन कि एक एकल स्व-खेल सुदृढीकरण सीखने एल्गोरिदम बिना डोमेन-विशिष्ट इंजीनियरिंग के पूर्ण जानकारी वाले कई अलग-अलग खेलों में महारत हासिल कर सकता है, अधिक सामान्य-उद्देश्य सीखने प्रणालियों की दिशा में एक महत्वपूर्ण कदम के रूप में देखा गया, हालाँकि AlphaZero पूरी तरह से देखने योग्य, नियतात्मक, दो-खिलाड़ी खेलों तक सीमित रहा और Artificial general intelligence से जुड़े खुले-अंत, वास्तविक-विश्व कार्यों तक विस्तारित नहीं हुआ। इसकी वास्तुकला और स्व-खेल प्रशिक्षण पद्धति ने बाद के DeepMind अनुसंधान को प्रभावित किया, जिसमें MuZero शामिल है, एक अनुवर्ती प्रणाली जिसने अज्ञात नियमों वाले खेलों सहित खेल खेलना सीखा, नियमों को सीधे दिए जाने के बजाय पर्यावरण का एक आंतरिक विश्व-मॉडल सीखकर। AlphaZero के शतरंज खेलों का बाद में पेशेवर शतरंज खिलाड़ियों और इंजन डेवलपर्स द्वारा व्यापक रूप से अध्ययन किया गया, और इसकी कुछ शैलीगत प्रवृत्तियों ने बाद के शतरंज इंजनों के डिजाइन और मूल्यांकन को प्रभावित किया, जिनमें ओपन-सोर्स तंत्रिका-नेटवर्क-आधारित इंजन शामिल हैं जिन्होंने समान स्व-खेल प्रशिक्षण विधियों को अपनाया।
स्वागत
AlphaZero को AI अनुसंधान में स्व-खेल सुदृढीकरण सीखने को गहरे तंत्रिका नेटवर्क और खोज के साथ जोड़ने की शक्ति के एक ऐतिहासिक प्रदर्शन के रूप में व्यापक रूप से उद्धृत किया जाता है, जो AlphaGo के पहले के परिणामों के महत्व को विस्तारित करता है, जिसमें 2016 में ली सेडोल पर जीत शामिल है, और DeepMind की व्यापक शोध कथा को सुदृढ़ करता है कि सामान्य सीखने एल्गोरिदम, पर्याप्त कंप्यूट शक्ति दिए जाने पर, अच्छी तरह से परिभाषित डोमेन में दशकों के संचित मानव और हाथ-से-इंजीनियर किए गए डोमेन ज्ञान को मिला सकते हैं या उससे अधिक कर सकते हैं।