अंग्रेज़ी से अनुवादित

डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (DDPG) एक मॉडल-फ्री ऑफ-पॉलिसी एक्टर-क्रिटिक रीइन्फोर्समेंट लर्निंग एल्गोरिदम है, जो निरंतर एक्शन स्पेस के लिए डिज़ाइन किया गया है, और यह DQN के अनुभव रीप्ले और टारगेट नेटवर्क को डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट्स के साथ जोड़ता है।

डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (DDPG) एक सुदृढीकरण सीखने का एल्गोरिदम है जो अभिनेता-आलोचक वास्तुकला को गहरे तंत्रिका नेटवर्क के साथ जोड़ता है ताकि निरंतर क्रिया स्थानों को संभाला जा सके। इसे 2016 में Google DeepMind के शोधकर्ताओं द्वारा पेश किया गया था, यह नियतिवादी नीति ग्रेडिएंट प्रमेय पर आधारित है, और गहरे क्यू-लर्निंग से तकनीकों जैसे अनुभव पुनर्प्ले और लक्ष्य नेटवर्क को प्रशिक्षण स्थिरता में सुधार के लिए अनुकूलित करता है। DDPG उन वातावरणों के लिए डिज़ाइन किया गया है जहां क्रियाएं असतत विकल्पों के बजाय निरंतर मान हैं, जो इसे रोबोटिक्स और सिमुलेशन में नियंत्रण कार्यों के लिए उपयुक्त बनाता है।

एल्गोरिदम मानक सुदृढीकरण सीखने के ढांचे के भीतर काम करता है, जहां एक एजेंट मार्कोव निर्णय प्रक्रिया के रूप में मॉडल किए गए वातावरण के साथ बातचीत करता है। प्रत्येक समय चरण पर, एजेंट एक स्थिति का अवलोकन करता है, एक क्रिया का चयन करता है, एक पुरस्कार प्राप्त करता है, और एक नई स्थिति में संक्रमण करता है। DDPG एक नीति सीखता है जो दो तंत्रिका नेटवर्क का उपयोग करके संचयी पुरस्कार संकेत को अधिकतम करता है: एक अभिनेता जो स्थितियों को क्रियाओं में मैप करता है और एक आलोचक जो दिए गए स्थिति-क्रिया जोड़े के लिए अपेक्षित रिटर्न का अनुमान लगाता है।

एल्गोरिदम वास्तुकला

DDPG एक अभिनेता-आलोचक वास्तुकला का उपयोग करता है, जो नीति और मूल्य फ़ंक्शन सीखने को अलग करता है। अभिनेता नेटवर्क एक दी गई स्थिति के लिए एक नियतिवादी क्रिया आउटपुट करता है, जबकि आलोचक नेटवर्क क्रिया-मूल्य फ़ंक्शन का अनुमान लगाकर उस क्रिया की गुणवत्ता का मूल्यांकन करता है, जिसे अक्सर Q(s,a) के रूप में दर्शाया जाता है। प्रशिक्षण आलोचक को सही रिटर्न का बेहतर अनुमान लगाने के लिए अद्यतन करने और अभिनेता को आलोचक के अनुमान को अधिकतम करने वाली क्रियाओं का चयन करने के लिए अद्यतन करने के बीच वैकल्पिक होता है।

स्थिरता में सुधार के लिए, DDPG नरम अद्यतनों के साथ लक्ष्य नेटवर्क का उपयोग करता है। लक्ष्य नेटवर्क अभिनेता और आलोचक की प्रतियां हैं जो एक मिश्रण पैरामीटर, आमतौर पर 0.001, का उपयोग करके सीखे गए नेटवर्क को धीरे-धीरे ट्रैक करते हैं। यह तकनीक प्रशिक्षण के दौरान विचलन के जोखिम को कम करती है और गहरे क्यू-लर्निंग विधियों से उधार ली गई है।

अन्वेषण और अनुभव पुनर्प्ले

क्योंकि DDPG एक नियतिवादी नीति सीखता है, यह प्रशिक्षण के दौरान क्रिया चयन में शोर जोड़कर अन्वेषण-दोहन दुविधा को संबोधित करता है, आमतौर पर एक ओर्नस्टीन-उहलेनबेक प्रक्रिया का उपयोग करके। यह एजेंट को इष्टतम व्यवहार की ओर बढ़ते हुए अपने वातावरण का पता लगाने की अनुमति देता है। एल्गोरिदम एक पुनर्प्ले बफर भी उपयोग करता है जो पिछले संक्रमणों को संग्रहीत करता है; सीखने के दौरान, अनुभवों के मिनी-बैच इस बफर से समान रूप से नमूने लिए जाते हैं ताकि अस्थायी सहसंबंधों को तोड़ा जा सके और नमूना दक्षता में सुधार हो सके। ये डिज़ाइन विकल्प DDPG को निरंतर क्रिया स्थानों को संभालने की अनुमति देते हैं, जो रोबोटिक्स और नियंत्रण अनुप्रयोगों में आम हैं।

एल्गोरिदम विवरण

DDPG का मूल अभिनेता-आलोचक वास्तुकला है। आलोचक को बेलमैन समीकरण का उपयोग करके क्रिया-मूल्य फ़ंक्शन का अनुमान लगाने के लिए प्रशिक्षित किया जाता है, जो भविष्यवाणी और लक्ष्य क्यू-मानों के बीच माध्य वर्ग त्रुटि को कम करता है। अभिनेता को नियतिवादी नीति ग्रेडिएंट प्रमेय का उपयोग करके अद्यतन किया जाता है, जो आलोचक के आउटपुट पर लागू श्रृंखला नियम के माध्यम से अभिनेता के मापदंडों के संबंध में अपेक्षित रिटर्न के ग्रेडिएंट की गणना करता है। नरम प्रतिस्थापन (पॉल्याक औसत) के माध्यम से अद्यतन किए गए लक्ष्य नेटवर्क, प्रशिक्षण को स्थिर करते हैं।

निरंतर क्रिया स्थान

DQN जैसे मूल्य-आधारित विधियों के विपरीत जो असतत क्रियाओं को संभालते हैं, DDPG सीधे एक नीति नेटवर्क से निरंतर क्रियाएं आउटपुट करता है। यह अभिनेता को असतत सेट पर संभावनाओं के बजाय नियतिवादी क्रिया मान उत्पन्न करके प्राप्त किया जाता है। यह DDPG को रोबोटिक नियंत्रण, स्वायत्त ड्राइविंग, और उच्च-आयामी निरंतर क्रिया स्थानों वाले अन्य नियंत्रण कार्यों के लिए उपयुक्त बनाता है।

अनुप्रयोग और विविधताएं

DDPG को रोबोटिक्स, सिम्युलेटेड नियंत्रण बेंचमार्क (जैसे, MuJoCo), और स्व-ड्राइविंग वाहन अनुसंधान में लागू किया गया है। यह बाद के तरीकों जैसे ट्विन डिलेड DDPG (TD3) और सॉफ्ट एक्टर-क्रिटिक (SAC) के लिए एक आधारभूत एल्गोरिदम है, जो नमूना दक्षता और स्थिरता में सुधार करते हैं। DDPG नियतिवादी नीति ग्रेडिएंट विधियों और Deep learning में अभिनेता-आलोचक वास्तुकला से भी निकटता से संबंधित है।

अन्य आरएल विधियों से संबंध

DDPG Machine learning और विशेष रूप से Reinforcement learning के व्यापक क्षेत्र के भीतर काम करता है, जहां एजेंट बातचीत से नीतियां सीखते हैं। Supervised learning के विपरीत, DDPG को लेबल किए गए डेटा की आवश्यकता नहीं होती है; यह पुरस्कार संकेतों से सीखता है। इसकी ऑफ-पॉलिसी प्रकृति इसे पुनर्प्ले बफर में संग्रहीत पिछले अनुभवों को पुन: उपयोग करने की अनुमति देती है, जो पॉलिसी ग्रेडिएंट विधियों जैसे ऑन-पॉलिसी एल्गोरिदम की तुलना में नमूना-कुशल सीखने को सक्षम बनाती है। निरंतर नियंत्रण के लिए प्रारंभिक गहरे आरएल एल्गोरिदम में से एक के रूप में, इसने Artificial intelligence और स्वायत्त प्रणालियों में बाद के शोध को प्रभावित किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·deep-learning·actor-critic·continuous-control
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास