वितरणात्मक सॉफ्ट एक्टर क्रिटिक

अंग्रेज़ी से अनुवादित

वितरणात्मक सॉफ्ट एक्टर-क्रिटिक (DSAC) एक सुदृढीकरण सीखने का एल्गोरिदम है जो सॉफ्ट एक्टर-क्रिटिक का विस्तार करता है, जिसमें Q-मानों पर वितरण सीखकर निरंतर नियंत्रण कार्यों में नमूना दक्षता और स्थिरता में सुधार होता है।

Distributional Soft Actor Critic (DSAC) एक सुदृढीकरण अधिगम एल्गोरिदम है जिसे निरंतर नियंत्रण कार्यों के लिए विकसित किया गया है। यह सॉफ्ट एक्टर-क्रिटिक (SAC) ढांचे पर आधारित है और इसमें वितरणात्मक सुदृढीकरण अधिगम सिद्धांतों को शामिल किया गया है। अपेक्षित प्रतिफल को एकल अदिश मान के रूप में अनुमानित करने के बजाय, DSAC संभावित प्रतिफलों का एक पूर्ण वितरण सीखता है, जो अधिक समृद्ध प्रशिक्षण संकेत प्रदान करता है और स्टोकेस्टिक गतिशीलता या पुरस्कार शोर वाले वातावरण में प्रदर्शन में सुधार करता है। यह एल्गोरिदम 2020 में जिंगलियांग डुआन, यांग गुआन और शेंगबो एबेन ली सहित शोधकर्ताओं द्वारा प्रस्तुत किया गया था, और इसे स्वायत्त ड्राइविंग और रोबोट नियंत्रण बेंचमार्क पर लागू किया गया है।

DSAC अधिकतम एन्ट्रॉपी सुदृढीकरण अधिगम को वितरणात्मक मूल्य अनुमान के साथ एकीकृत करता है। मुख्य विचार प्रतिफल वितरण और लक्ष्य वितरण के बीच कुल्बैक-लेब्लर विचलन को न्यूनतम करना है, साथ ही अन्वेषण को प्रोत्साहित करने के लिए नीति एन्ट्रॉपी को अधिकतम करना है। यह संयोजन DSAC को MuJoCo और OpenAI Gym कार्यों जैसे मानक निरंतर नियंत्रण बेंचमार्क पर अत्याधुनिक नमूना दक्षता प्राप्त करने की अनुमति देता है, जो अक्सर SAC और Distributional DQN जैसे अन्य वितरणात्मक प्रकारों से बेहतर प्रदर्शन करता है।

एल्गोरिदम अवलोकन

DSAC तीन मुख्य घटकों को बनाए रखता है: एक नीति नेटवर्क, एक मूल्य वितरण नेटवर्क, और एक लक्ष्य मूल्य वितरण नेटवर्क। मूल्य वितरण नेटवर्क प्रतिफल मूल्यों पर एक श्रेणीबद्ध वितरण आउटपुट करता है, जो C51 और अन्य वितरणात्मक Q-अधिगम विधियों में उपयोग किए गए दृष्टिकोण के समान है। नीति को अपेक्षित प्रतिफल और एन्ट्रॉपी बोनस को अधिकतम करने के लिए प्रशिक्षित किया जाता है, जबकि मूल्य वितरण को एक वितरणात्मक बेलमैन बैकअप का उपयोग करके अद्यतन किया जाता है जो पूर्वानुमानित और लक्ष्य वितरणों के बीच क्रॉस-एन्ट्रॉपी को न्यूनतम करता है।

DSAC का एक प्रमुख नवाचार एक सॉफ्ट Q-फ़ंक्शन का उपयोग है जो प्रतिफल वितरण में एन्ट्रॉपी को शामिल करता है। यह मानक वितरणात्मक विधियों से भिन्न है, जो आमतौर पर मूल्य वितरण में एन्ट्रॉपी को अनदेखा करते हैं। एन्ट्रॉपी को शामिल करके, DSAC अधिकतम एन्ट्रॉपी सुदृढीकरण अधिगम के अन्वेषण लाभों को बनाए रखता है, साथ ही वितरणात्मक मूल्य अनुमान से लाभान्वित होता है।

प्रशिक्षण स्थिरता और नमूना दक्षता

DSAC अभिनेता-आलोचक विधियों में सामान्य कई स्थिरता समस्याओं का समाधान करता है। वितरणात्मक प्रतिनिधित्व लक्ष्य मूल्यों के विचरण को कम करता है, जिससे अधिक स्थिर ग्रेडिएंट अद्यतन होते हैं। एल्गोरिदम TD3 और SAC के समान, अति-अनुमान पूर्वाग्रह को कम करने के लिए एक जुड़वां मूल्य वितरण नेटवर्क भी नियोजित करता है। ये डिज़ाइन विकल्प DSAC को SAC की तुलना में कम पर्यावरण अंतःक्रियाओं से सीखने की अनुमति देते हैं, जिससे यह वास्तविक-विश्व अनुप्रयोगों के लिए विशेष रूप से उपयुक्त होता है जहां डेटा संग्रह महंगा होता है।

अनुभवजन्य परिणाम दिखाते हैं कि DSAC HalfCheetah, Walker2d और Ant जैसे कार्यों पर SAC की तुलना में उच्च संचयी पुरस्कार प्राप्त करता है, विशेष रूप से प्रशिक्षण के प्रारंभिक चरणों में। एल्गोरिदम हाइपरपैरामीटर विविधताओं के प्रति मजबूती भी प्रदर्शित करता है, जिससे व्यापक ट्यूनिंग की आवश्यकता कम हो जाती है।

अनुप्रयोग

DSAC को स्वायत्त ड्राइविंग सिमुलेशन में सफलतापूर्वक लागू किया गया है, जहां यह जटिल यातायात परिदृश्यों में वाहन त्वरण और स्टीयरिंग को नियंत्रित करता है। मूल्य फ़ंक्शन की वितरणात्मक प्रकृति यातायात गतिशीलता में निहित अनिश्चितता को संभालने में मदद करती है। रोबोटिक्स में, DSAC का उपयोग हेरफेर कार्यों के लिए किया गया है, जिससे एजेंट उच्च-आयामी सेंसर इनपुट से निपुण नीतियां सीख सकते हैं। एल्गोरिदम की नमूना दक्षता इसे वास्तविक-विश्व रोबोटिक अधिगम के लिए व्यवहार्य बनाती है, जहां भौतिक परीक्षण सीमित होते हैं।

विस्तार और प्रकार

DSAC के कई विस्तार प्रस्तावित किए गए हैं। स्वचालित तापमान समायोजन के साथ DSAC (DSAC-T) एक सीखने योग्य एन्ट्रॉपी गुणांक प्रस्तुत करता है, जो मैनुअल ट्यूनिंग की आवश्यकता को समाप्त करता है। एक अन्य प्रकार, एन्सेम्बल वितरणों के साथ DSAC, विचरण को और कम करने के लिए कई मूल्य वितरणों को जोड़ता है। शोधकर्ताओं ने DSAC को मॉडल-आधारित योजना के साथ भी एकीकृत किया है, जिसमें अतिरिक्त प्रशिक्षण के लिए सिंथेटिक अनुभव उत्पन्न करने के लिए सीखे गए गतिशीलता मॉडल का उपयोग किया जाता है।

संबंधित विधियों के साथ तुलना

DSAC मुख्य रूप से अपने मूल्य अनुमान दृष्टिकोण में SAC से भिन्न है। जबकि SAC Q-फ़ंक्शन का एक बिंदु अनुमान सीखता है, DSAC एक वितरण सीखता है, जो प्रतिफल की अनिश्चितता के बारे में अधिक जानकारी प्रदान करता है। Distributional DQN की तुलना में, DSAC निरंतर क्रिया स्थानों में संचालित होता है और अधिकतम एन्ट्रॉपी अन्वेषण को शामिल करता है। एल्गोरिदम गहन अधिगम और तंत्रिका नेटवर्क तकनीकों से भी संबंधित है, क्योंकि यह नीति और मूल्य नेटवर्क दोनों के लिए गहन फ़ंक्शन अनुमानकों पर निर्भर करता है।

सीमाएं और भविष्य की दिशाएं

DSAC को वितरणात्मक सुदृढीकरण अधिगम से कुछ सीमाएं विरासत में मिलती हैं, जिसमें प्रतिफल वितरण बनाए रखने के कारण बढ़ी हुई कम्प्यूटेशनल लागत शामिल है। वितरण प्रतिनिधित्व (श्रेणीबद्ध, गाऊसी, या क्वांटाइल) का चुनाव प्रदर्शन को प्रभावित करता है और सावधानीपूर्वक चयन की आवश्यकता होती है। भविष्य के शोध दिशाओं में DSAC को मल्टी-एजेंट सेटिंग्स तक विस्तारित करना और अनुक्रम-आधारित निर्णय लेने के लिए ट्रांसफॉर्मर आर्किटेक्चर को शामिल करना शामिल है, हालांकि ऐसे विस्तार 2025 तक प्रयोगात्मक बने हुए हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·continuous-control·distributional-rl·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास