अंग्रेज़ी से अनुवादित

पॉलिसी ग्रेडिएंट विधियाँ रीइन्फोर्समेंट लर्निंग एल्गोरिदम का एक वर्ग हैं जो मूल्य फ़ंक्शन पर निर्भर किए बिना, ग्रेडिएंट असेंट के माध्यम से एक पैरामीट्रीकृत पॉलिसी फ़ंक्शन को सीधे अनुकूलित करती हैं। ये मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में उपयोग की जाने वाली पॉलिसी अनुकूलन विधियों का एक उप-वर्ग हैं।

पॉलिसी ग्रेडिएंट विधियाँ सुदृढीकरण सीखने के एल्गोरिदम का एक वर्ग और पॉलिसी अनुकूलन विधियों का एक उप-वर्ग हैं। मूल्य-आधारित विधियों के विपरीत, जो एक पॉलिसी प्राप्त करने के लिए एक मूल्य फलन सीखती हैं, पॉलिसी अनुकूलन विधियाँ सीधे एक पॉलिसी फलन सीखती हैं जो मूल्य फलन से परामर्श किए बिना क्रियाओं का चयन करती है। पॉलिसी ग्रेडिएंट लागू करने के लिए, पॉलिसी फलन को एक अवकलनीय पैरामीटर द्वारा पैरामीटरित किया जाता है, जिसे आम तौर पर थीटा के रूप में दर्शाया जाता है, और लक्ष्य पॉलिसी पैरामीटर पर ग्रेडिएंट आरोहण के माध्यम से अपेक्षित संचयी पुरस्कार को अधिकतम करना होता है।

ये विधियाँ आधुनिक सुदृढीकरण सीखने के केंद्र में हैं और रोबोटिक्स, गेम खेलने और स्वायत्त प्रणालियों जैसे क्षेत्रों में लागू की गई हैं। वे निरंतर क्रिया स्थानों वाले वातावरण में विशेष रूप से उपयोगी हैं, जहाँ मूल्य-आधारित विधियाँ अक्सर संघर्ष करती हैं। पॉलिसी ग्रेडिएंट विधियों का अध्ययन "मोंटे कार्लो ग्रेडिएंट अनुमान" शीर्षक के तहत भी किया जाता है क्योंकि वे ग्रेडिएंट का अनुमान लगाने के लिए स्टोकेस्टिक नमूनाकरण पर निर्भर करती हैं।

अवलोकन

पॉलिसी-आधारित सुदृढीकरण सीखने में, अभिनेता एक पैरामीटरित पॉलिसी फलन होता है जो अवस्थाओं को क्रियाओं पर एक प्रायिकता वितरण में मैप करता है। किसी दी गई अवस्था के लिए, पॉलिसी प्रत्येक संभावित क्रिया के लिए प्रायिकताएँ आउटपुट करती है, जिसमें सभी क्रियाओं पर योग या समाकलन 1 के बराबर होता है, यह इस पर निर्भर करता है कि क्रिया स्थान असतत है या निरंतर। लक्ष्य ऐसे पैरामीटर खोजना है जो अपेक्षित एपिसोडिक पुरस्कार को अधिकतम करते हैं, जिसे प्रारंभिक अवस्था से शुरू करते हुए, समय क्षितिज पर पुरस्कारों के छूट वाले योग के रूप में परिभाषित किया जाता है।

पॉलिसी ग्रेडिएंट, पॉलिसी पैरामीटर के संबंध में इस अपेक्षित पुरस्कार का ग्रेडिएंट है। विभिन्न पॉलिसी ग्रेडिएंट विधियाँ इस ग्रेडिएंट का विभिन्न तरीकों से स्टोकेस्टिक अनुमान लगाती हैं, लेकिन सभी का उद्देश्य ग्रेडिएंट पर चढ़कर पॉलिसी को पुनरावृत्त रूप से सुधारना होता है। मुख्य चुनौती ग्रेडिएंट का एक निष्पक्ष और कम-विचरण वाला अनुमान प्राप्त करना है, जिसके कारण बेसलाइन और अभिनेता-आलोचक आर्किटेक्चर जैसी विभिन्न तकनीकें विकसित हुई हैं।

REINFORCE

REINFORCE एल्गोरिदम, जिसे रोनाल्ड जे. विलियम्स ने 1992 में प्रस्तुत किया था, पहली पॉलिसी ग्रेडिएंट विधि थी। यह एक मौलिक पहचान पर आधारित है जो पॉलिसी ग्रेडिएंट को लॉग-पॉलिसी के ग्रेडिएंट और कुल पुरस्कार के गुणनफल के प्रक्षेप पथों पर एक अपेक्षा के रूप में व्यक्त करती है। एक प्रमुख सुधार "कार्य-कारण चाल" है, जो प्रत्येक क्रिया को केवल उस समय-चरण से आगे के पुरस्कारों द्वारा भारित करता है, जिससे पूर्वाग्रह उत्पन्न किए बिना विचरण कम होता है। REINFORCE एक मोंटे कार्लो विधि है, जिसका अर्थ है कि यह ग्रेडिएंट का अनुमान लगाने के लिए पूर्ण एपिसोड का उपयोग करती है, जिससे उच्च विचरण हो सकता है लेकिन इसे लागू करना सरल है।

अभिनेता-आलोचक विधियाँ

अभिनेता-आलोचक विधियाँ विचरण कम करने के लिए पॉलिसी ग्रेडिएंट को मूल्य फलन सन्निकटन के साथ जोड़ती हैं। अभिनेता पॉलिसी नेटवर्क है, जबकि आलोचक मूल्य फलन का अनुमान लगाता है, जिसका उपयोग बेसलाइन या लाभ फलन की गणना करने के लिए किया जाता है। यह शुद्ध REINFORCE की तुलना में अधिक स्थिर और नमूना-कुशल सीखने की अनुमति देता है। उल्लेखनीय उदाहरणों में A2C (लाभ अभिनेता-आलोचक) और A3C (अतुल्यकालिक लाभ अभिनेता-आलोचक) शामिल हैं, जिनका गहन सुदृढीकरण सीखने में व्यापक रूप से उपयोग किया गया है।

आधुनिक प्रकार

आधुनिक पॉलिसी ग्रेडिएंट विधियों में प्रॉक्सिमल पॉलिसी अनुकूलन (PPO) और ट्रस्ट क्षेत्र पॉलिसी अनुकूलन (TRPO) शामिल हैं, जो विनाशकारी बड़े कदमों से बचने के लिए पॉलिसी अद्यतन को प्रतिबंधित करती हैं। ये विधियाँ अपनी विश्वसनीयता और प्रदर्शन के कारण गहन सुदृढीकरण सीखने में मानक बन गई हैं। इनका उपयोग Dota 2 और StarCraft II जैसे खेलों के लिए एजेंटों को प्रशिक्षित करने के साथ-साथ रोबोटिक्स और स्वायत्त ड्राइविंग अनुसंधान में किया जाता है।

अनुप्रयोग और चुनौतियाँ

पॉलिसी ग्रेडिएंट विधियाँ विभिन्न डोमेन में लागू की गई हैं, जिनमें कृत्रिम बुद्धिमत्ता अनुसंधान, मशीन सीखने प्रणालियाँ और गहन सीखने ढाँचे शामिल हैं। वे निरंतर नियंत्रण कार्यों, जैसे रोबोटिक हेरफेर और गति के लिए विशेष रूप से प्रभावी हैं। हालाँकि, उन्हें उच्च नमूना जटिलता और हाइपरपैरामीटर के प्रति संवेदनशीलता जैसी चुनौतियों का सामना करना पड़ता है। अनुसंधान इन मुद्दों को संबोधित करना जारी रखता है, जिसमें तंत्रिका-नेटवर्क आर्किटेक्चर और अनुकूलन तकनीकों में प्रगति शामिल है।

पॉलिसी ग्रेडिएंट विधियाँ बड़े-भाषा-मॉडल प्रशिक्षण के लिए भी प्रासंगिक हैं, जहाँ मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) मानव प्राथमिकताओं के साथ मॉडलों को संरेखित करने के लिए पॉलिसी ग्रेडिएंट जैसे अद्यतनों का उपयोग करता है। यह संबंध पारंपरिक सुदृढीकरण सीखने की सेटिंग्स से परे इन एल्गोरिदम की व्यापक प्रयोज्यता को उजागर करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·policy-optimization·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास