डबल क्यू-लर्निंग, सुदृढीकरण सीखने में क्यू-लर्निंग एल्गोरिदम का एक प्रकार है, जिसे मानक क्यू-लर्निंग में होने वाले क्रिया मूल्यों के अधिक अनुमान को कम करने के लिए डिज़ाइन किया गया है। इसे 2010 में हाडो वैन हासेल्ट द्वारा पेश किया गया था। यह विधि दो स्वतंत्र क्यू-फ़ंक्शन बनाए रखती है और अद्यतनों के दौरान उन्हें वैकल्पिक रूप से उपयोग करती है, जो बेलमैन समीकरण में अधिकतम अनुमानित मूल्य का उपयोग करने से उत्पन्न होने वाले सकारात्मक पूर्वाग्रह को कम करती है। यह इसे शोर या स्टोकेस्टिक पुरस्कारों वाले वातावरण में विशेष रूप से उपयोगी बनाता है, जहां मानक क्यू-लर्निंग बढ़े हुए मूल्य अनुमानों के कारण उप-इष्टतम नीतियों में परिवर्तित हो सकती है।
एल्गोरिदम मॉडल-मुक्त है, जिसका अर्थ है कि इसे पर्यावरण के मॉडल की आवश्यकता नहीं होती है, और यह अनुकूलन के बिना स्टोकेस्टिक संक्रमणों और पुरस्कारों वाली समस्याओं को संभाल सकता है। किसी भी परिमित मार्कोव निर्णय प्रक्रिया के लिए, डबल क्यू-लर्निंग, क्यू-लर्निंग की तरह, एक इष्टतम नीति खोजने का लक्ष्य रखता है जो अनंत अन्वेषण समय और आंशिक रूप से यादृच्छिक नीति दिए जाने पर क्रमिक चरणों में अपेक्षित कुल पुरस्कार को अधिकतम करता है। "क्यू" नाम गुणवत्ता फ़ंक्शन को संदर्भित करता है जो किसी दिए गए राज्य में लिए गए किसी क्रिया के अपेक्षित पुरस्कार की गणना करता है।
क्यू-लर्निंग में अधिक अनुमान
मानक क्यू-लर्निंग अपने मूल्य फ़ंक्शन को अगले राज्य में सभी संभावित क्रियाओं पर अधिकतम अनुमानित क्यू-मूल्य का उपयोग करके अद्यतन करता है। यह अधिकतम संचालन एक व्यवस्थित सकारात्मक पूर्वाग्रह पेश करता है क्योंकि शोर अनुमानों का अधिकतम सत्य अधिकतम से अधिक होता है। उच्च विचरण वाले पुरस्कारों या फ़ंक्शन अनुमान वाले वातावरण में, यह अधिक अनुमान खराब प्रदर्शन का कारण बन सकता है, क्योंकि एजेंट बार-बार उन क्रियाओं का चयन कर सकता है जो वास्तव में उनसे बेहतर दिखाई देती हैं। उदाहरण के लिए, एक ग्रिड भूलभुलैया में जहां एक एजेंट 10 अंकों के निकास तक पहुंचना सीखता है, क्यू-लर्निंग दाएं जाने को बाएं जाने की तुलना में अधिक मूल्य निर्धारित कर सकता है यदि दाएं जाने से निकास तेजी से मिलता है, लेकिन अधिक अनुमान के कारण यह कम कुशल मार्ग के मूल्य को बढ़ाने पर शोर के कारण एक उप-इष्टतम मार्ग का पक्ष ले सकता है।
डबल क्यू-लर्निंग क्रिया के चयन को उसके मूल्य के मूल्यांकन से अलग करके इसे संबोधित करता है। एकल क्यू-फ़ंक्शन का उपयोग करने के बजाय, यह दो अलग-अलग अनुमान, क्यू_ए और क्यू_बी बनाए रखता है। प्रत्येक अद्यतन के दौरान, एक फ़ंक्शन का उपयोग अगले राज्य में सर्वोत्तम क्रिया का चयन करने के लिए किया जाता है, और दूसरे का उपयोग उसके मूल्य का अनुमान लगाने के लिए किया जाता है। यह पूर्वाग्रह को कम करता है क्योंकि चयन और मूल्यांकन विभिन्न, स्वतंत्र अनुमानों पर आधारित होते हैं।
एल्गोरिदम की कार्यप्रणाली
डबल क्यू-लर्निंग में मुख्य अद्यतन नियम में दो क्यू-फ़ंक्शन शामिल होते हैं। प्रत्येक समय चरण टी पर, एजेंट एक क्रिया ए_टी का चयन करता है, एक पुरस्कार आर_{टी+1} देखता है, और एक नई स्थिति एस_{टी+1} में प्रवेश करता है। समान संभावना के साथ, एल्गोरिदम या तो क्यू_ए या क्यू_बी को अद्यतन करता है। उदाहरण के लिए, क्यू_ए को अद्यतन करते समय, यह अगले राज्य में सर्वोत्तम क्रिया निर्धारित करने के लिए क्यू_बी का उपयोग करता है, फिर उस क्रिया के मूल्य का मूल्यांकन करने के लिए क्यू_ए का उपयोग करता है। अद्यतन एक बेलमैन-शैली समीकरण का पालन करता है, जो सीखने की दर अल्फा (0 और 1 के बीच) और छूट कारक गामा (0 और 1 के बीच) द्वारा भारित होता है, जो भविष्य के पुरस्कारों की तुलना में तत्काल पुरस्कारों को अधिक महत्व देता है। यह वैकल्पिक अद्यतन सुनिश्चित करता है कि कोई भी फ़ंक्शन हावी न हो, और अधिक अनुमान कम हो जाता है क्योंकि अधिकतम संचालन एक फ़ंक्शन पर लागू होता है जबकि मूल्य दूसरे से पढ़ा जाता है।
अनुप्रयोग और विस्तार
डबल क्यू-लर्निंग को गहन सुदृढीकरण सीखने में व्यापक रूप से अपनाया गया है, जहां यह डबल डीप क्यू-नेटवर्क (डबल डीक्यूएन) एल्गोरिदम का आधार बनता है, जिसे 2015 में वैन हासेल्ट और सहयोगियों द्वारा पेश किया गया था। डबल डीक्यूएन इस विचार को Deep learning तकनीकों के साथ जोड़ता है, क्यू-फ़ंक्शनों का अनुमान लगाने के लिए तंत्रिका नेटवर्क का उपयोग करता है, और एटारी गेम खेलने जैसे कार्यों में बेहतर स्थिरता और प्रदर्शन दिखाया है। यह दृष्टिकोण Artificial intelligence और Machine learning जैसे व्यापक क्षेत्रों में भी प्रासंगिक है, जहां अनुक्रमिक निर्णय लेने के लिए मूल्य-आधारित विधियों का उपयोग किया जाता है। शोधकर्ताओं ने अवधारणा को बहु-एजेंट प्रणालियों और निरंतर क्रिया स्थानों जैसी अन्य सेटिंग्स में विस्तारित किया है, हालांकि इन विस्तारों के लिए अक्सर अतिरिक्त संशोधनों की आवश्यकता होती है।
अन्य विधियों से संबंध
डबल क्यू-लर्निंग मूल्य-आधारित सुदृढीकरण सीखने वाले एल्गोरिदम के परिवार का हिस्सा है जिसमें मानक क्यू-लर्निंग और सार्सा शामिल हैं। सार्सा के विपरीत, जो अनुसरण की जा रही नीति के मूल्य को सीखता है, डबल क्यू-लर्निंग एक ऑफ-पॉलिसी विधि है, जिसका अर्थ है कि यह एजेंट के कार्यों से स्वतंत्र रूप से एक इष्टतम नीति सीख सकता है। यह गुण इसे अन्वेषण रणनीतियों में अधिक लचीला बनाता है। मानक क्यू-लर्निंग की तुलना में, डबल क्यू-लर्निंग दो फ़ंक्शन बनाए रखने के कारण कम्प्यूटेशनल लागत में थोड़ी वृद्धि को पूर्वाग्रह में महत्वपूर्ण कमी के साथ व्यापार करता है, जो अक्सर व्यवहार में इष्टतम नीतियों में तेजी से अभिसरण की ओर ले जाता है। यह तकनीक एन्सेम्बल विधियों से भी संबंधित है, जो विचरण को कम करने के लिए कई अनुमानों का औसत करते हैं, हालांकि डबल क्यू-लर्निंग विशेष रूप से विचरण के बजाय पूर्वाग्रह को लक्षित करता है।
सीमाएं और विचार
जबकि डबल क्यू-लर्निंग अधिक अनुमान को कम करता है, यह इसे पूरी तरह से समाप्त नहीं करता है, खासकर जब दो क्यू-फ़ंक्शन समय के साथ सहसंबद्ध हो जाते हैं। कुछ मामलों में, यह अधो-अनुमान पेश कर सकता है, जो शुरुआती चरणों में सीखने को धीमा कर सकता है। एल्गोरिदम को सीखने की दर और छूट कारक जैसे हाइपरपैरामीटर के सावधानीपूर्वक ट्यूनिंग की भी आवश्यकता होती है। गहन सुदृढीकरण सीखने में, लक्ष्य नेटवर्क का उपयोग, जैसा कि डबल डीक्यूएन में होता है, अतिरिक्त जटिलता जोड़ता है लेकिन स्थिरता के लिए अक्सर आवश्यक होता है। इन चुनौतियों के बावजूद, डबल क्यू-लर्निंग क्षेत्र में एक मौलिक तकनीक बनी हुई है, और इसके सिद्धांतों ने कई बाद के एल्गोरिदम को प्रभावित किया है, जिनमें BAIR (Berkeley AI Research) और MIT CSAIL जैसे संस्थानों में विकसित उन्नत प्रणालियों में उपयोग किए जाने वाले शामिल हैं।
इन्फोबॉक्स
- प्रकार: अवधारणा
- पेश किया गया: 2010
- पेश करने वाले: हाडो वैन हासेल्ट
- संबंधित: क्यू-लर्निंग
श्रेणियाँ
- सुदृढीकरण-सीखना
- एल्गोरिदम
- मशीन-सीखना
- मूल्य-आधारित-विधियाँ