MuZero एक कंप्यूटर प्रोग्राम है जिसे कृत्रिम बुद्धिमत्ता अनुसंधान कंपनी DeepMind द्वारा विकसित किया गया है, जो Google की एक सहायक कंपनी है, ताकि उनके नियमों और अंतर्निहित गतिशीलता को जाने बिना खेलों में महारत हासिल की जा सके। इसके 2019 में जारी होने में गो, शतरंज, शोगी और 57 विभिन्न Atari खेलों के एक सेट में इसके प्रदर्शन के बेंचमार्क शामिल थे। एल्गोरिथ्म AlphaZero के समान दृष्टिकोण का उपयोग करता है, जहाँ वृक्ष-आधारित खोज और एक सीखा हुआ मॉडल का संयोजन तैनात किया जाता है। इसने शतरंज और शोगी में AlphaZero के प्रदर्शन से मेल खाया, गो में इसके प्रदर्शन में सुधार किया, और 57 Atari खेलों (Arcade Learning Environment) के सेट में महारत हासिल करने में सर्वोत्तम स्थिति में सुधार किया, जो एक दृश्य-जटिल डोमेन है।
MuZero को स्व-खेल के माध्यम से प्रशिक्षित किया गया था, जिसमें नियमों, शुरुआती पुस्तकों या अंत-खेल तालिकाओं तक कोई पहुँच नहीं थी। प्रशिक्षित एल्गोरिथ्म ने AlphaZero के समान कनवल्शनल और अवशिष्ट वास्तुकला का उपयोग किया, लेकिन खोज वृक्ष में प्रति नोड 20 प्रतिशत कम गणना चरणों के साथ।
इतिहास
19 नवंबर, 2019 को, DeepMind टीम ने MuZero का परिचय देते हुए एक प्रीप्रिंट जारी किया। यह कार्य सीधे AlphaZero एल्गोरिथ्म पर आधारित था, जिसने मशीन लर्निंग को Monte Carlo वृक्ष खोज के साथ जोड़कर शतरंज, शोगी और गो में अलौकिक प्रदर्शन का प्रदर्शन किया था। MuZero ने खेल के नियमों के लिए एक प्रोग्राम किए गए सिम्युलेटर की आवश्यकता को हटाकर इस प्रतिमान का विस्तार किया।
AlphaZero से व्युत्पत्ति
MuZero (MZ) उच्च-प्रदर्शन योजना के AlphaZero (AZ) एल्गोरिथ्म का सुदृढीकरण लर्निंग के मॉडल-मुक्त दृष्टिकोणों के साथ एक संयोजन है। यह संयोजन शास्त्रीय योजना क्षेत्रों, जैसे गो, में अधिक कुशल प्रशिक्षण की अनुमति देता है, साथ ही प्रत्येक चरण में अधिक जटिल इनपुट वाले डोमेन, जैसे दृश्य वीडियो गेम, को भी संभालता है।
MuZero सीधे AZ कोड से व्युत्पन्न किया गया था, जो हाइपरपैरामीटर सेट करने के लिए इसके नियमों को साझा करता है। दृष्टिकोणों के बीच अंतर में शामिल हैं:
- AZ की योजना प्रक्रिया एक सिम्युलेटर का उपयोग करती है जो खेल के नियमों को जानता है और उसे स्पष्ट रूप से प्रोग्राम किया जाना चाहिए। एक तंत्रिका नेटवर्क फिर भविष्य की स्थिति की नीति और मूल्य की भविष्यवाणी करता है। खेल के नियमों का पूर्ण ज्ञान खोज वृक्ष में राज्य संक्रमण, प्रत्येक नोड पर उपलब्ध क्रियाओं और वृक्ष की एक शाखा की समाप्ति को मॉडल करने में उपयोग किया जाता है। MZ के पास नियमों तक पहुँच नहीं है, और इसके बजाय तंत्रिका नेटवर्क के साथ एक सीखता है।
- AZ में खेल के लिए एक एकल मॉडल है (बोर्ड स्थिति से भविष्यवाणियों तक); MZ में वर्तमान स्थिति के प्रतिनिधित्व के लिए अलग मॉडल हैं (बोर्ड स्थिति से उसके आंतरिक एम्बेडिंग में), राज्यों की गतिशीलता (क्रियाएँ बोर्ड स्थितियों के प्रतिनिधित्व को कैसे बदलती हैं), और भविष्य की स्थिति की नीति और मूल्य की भविष्यवाणी (किसी स्थिति के प्रतिनिधित्व को देखते हुए)।
- MZ का छिपा हुआ मॉडल जटिल हो सकता है, और यह पता चल सकता है कि यह गणना की मेजबानी कर सकता है; MZ के प्रशिक्षित उदाहरण में छिपे हुए मॉडल के विवरण की खोज करना भविष्य की खोज का विषय है।
- MZ दो-खिलाड़ी खेल की उम्मीद नहीं करता है जहाँ विजेता सब कुछ लेते हैं। यह मानक सुदृढीकरण-लर्निंग परिदृश्यों के साथ काम करता है, जिसमें निरंतर मध्यवर्ती पुरस्कारों वाले एकल-एजेंट वातावरण शामिल हैं, संभवतः मनमाने परिमाण के और समय छूट के साथ। AZ को दो-खिलाड़ी खेलों के लिए डिज़ाइन किया गया था जिन्हें जीता, ड्रॉ या हारा जा सकता था।
R2D2 के साथ तुलना
Atari खेलों के सेट को खेलना सीखने की पिछली सर्वोत्तम तकनीक R2D2, Recurrent Replay Distributed DQN थी। MuZero ने खेलों के सेट में R2D2 के औसत और माध्य प्रदर्शन दोनों को पार कर लिया, हालाँकि इसने हर खेल में बेहतर प्रदर्शन नहीं किया।
प्रशिक्षण और परिणाम
MuZero ने प्रशिक्षण के लिए 16 तीसरी पीढ़ी के टेंसर प्रोसेसिंग यूनिट (TPU) और बोर्ड खेलों के लिए स्व-खेल के लिए 1000 TPU का उपयोग किया, जिसमें प्रति चरण 800 सिमुलेशन थे, और Atari खेलों के लिए प्रशिक्षण के लिए 8 TPU और स्व-खेल के लिए 32 TPU, जिसमें प्रति चरण 50 सिमुलेशन थे। AlphaZero ने प्रशिक्षण के लिए 64 दूसरी पीढ़ी के TPU और स्व-खेल के लिए 5000 पहली पीढ़ी के TPU का उपयोग किया। जैसे-जैसे TPU डिज़ाइन में सुधार हुआ है (तीसरी पीढ़ी के चिप्स व्यक्तिगत रूप से दूसरी पीढ़ी के चिप्स से 2 गुना अधिक शक्तिशाली हैं, एक पॉड में चिप्स में बैंडविड्थ और नेटवर्किंग में आगे की प्रगति के साथ), ये तुलनीय प्रशिक्षण सेटअप हैं। R2D2 को 2M प्रशिक्षण चरणों के माध्यम से 5 दिनों के लिए प्रशिक्षित किया गया था।
प्रारंभिक परिणाम
MuZero ने लगभग 1 मिलियन प्रशिक्षण चरणों के बाद शतरंज और शोगी में AlphaZero के प्रदर्शन से मेल खाया। इसने 500,000 प्रशिक्षण चरणों के बाद गो में AZ के प्रदर्शन से मेल खाया और 1 मिलियन चरणों तक इसे पार कर लिया। इसने 500 हजार प्रशिक्षण चरणों के बाद Atari खेल सेट में R2D2 के औसत और माध्य प्रदर्शन से मेल खाया और 1 मिलियन चरणों तक इसे पार कर लिया, हालाँकि इसने सेट में 6 खेलों में कभी अच्छा प्रदर्शन नहीं किया।
प्रतिक्रियाएँ और संबंधित कार्य
MuZero को AlphaZero पर एक महत्वपूर्ण उन्नति और अनुपयोगी लर्निंग तकनीकों में एक सामान्यीकरणीय कदम के रूप में देखा गया। इस कार्य को छोटे घटकों से सिस्टम बनाने के तरीके की समझ को आगे बढ़ाने के रूप में देखा गया, जो शुद्ध मशीन-लर्निंग विकास से अधिक सिस्टम-स्तरीय विकास था।
जबकि विकास टीम द्वारा केवल स्यूडोकोड जारी किया गया था, Werner Duvaud ने उस पर आधारित एक ओपन सोर्स कार्यान्वयन तैयार किया। MuZero का उपयोग अन्य कार्यों में एक संदर्भ कार्यान्वयन के रूप में किया गया है, उदाहरण के लिए मॉडल-आधारित व्यवहार उत्पन्न करने के तरीके के रूप में।
2021 के अंत में, MuZero का एक अधिक कुशल संस्करण प्रस्तावित किया गया था, जिसे EfficientZero नाम दिया गया। यह केवल दो घंटे के वास्तविक समय के खेल अनुभव के साथ Atari 100k बेंचमार्क पर 194.3 प्रतिशत औसत मानव प्रदर्शन और 109.0 प्रतिशत माध्य प्रदर्शन प्राप्त करता है। 2022 की शुरुआत में, स्टोकेस्टिक खेलों (उदाहरण के लिए 2048, बैकगैमौन) को खेलने के लिए MuZero का एक संस्करण प्रस्तावित किया गया था, जिसे Stochastic MuZero कहा जाता है, जो गतिशीलता नेटवर्क को प्रशिक्षित करते समय पर्यावरण की स्टोकेस्टिक प्रकृति को ध्यान में रखने के लिए afterstate गतिशीलता और मौका कोड का उपयोग करता है।
फरवरी 2022 में, DeepMind ने MuZero का एक वास्तविक-विश्व कार्य में पहला अनुप्रयोग बताया, जो ओपन-सोर्स VP9 कोडेक में वीडियो संपीड़न में सुधार करने के लिए YouTube के साथ सहयोग कर रहा था। MuZero-RC नामक एक संस्करण ने VP9 के डिफ़ॉल्ट दर-नियंत्रण तंत्र को बदल दिया, प्रत्येक फ्रेम के लिए परिमाणीकरण पैरामीटर का चयन किया, और गुणवत्ता में गिरावट के बिना विविध वीडियो के सेट में औसतन 4% बिटरेट कमी हासिल की।
यह भी देखें
- सामान्य खेल खेलना
- अनुपयोगी लर्निंग