पॉलिसी ग्रेडिएंट विधियाँ सुदृढीकरण सीखने के एल्गोरिदम का एक वर्ग और पॉलिसी अनुकूलन विधियों का एक उप-वर्ग हैं। मूल्य-आधारित विधियों के विपरीत, जो एक पॉलिसी प्राप्त करने के लिए एक मूल्य फलन सीखती हैं, पॉलिसी अनुकूलन विधियाँ सीधे एक पॉलिसी फलन सीखती हैं जो मूल्य फलन से परामर्श किए बिना क्रियाओं का चयन करती है। पॉलिसी ग्रेडिएंट लागू करने के लिए, पॉलिसी फलन को एक अवकलनीय पैरामीटर द्वारा पैरामीटरित किया जाता है, जिसे आम तौर पर थीटा के रूप में दर्शाया जाता है, और लक्ष्य पॉलिसी पैरामीटर पर ग्रेडिएंट आरोहण के माध्यम से अपेक्षित संचयी पुरस्कार को अधिकतम करना होता है।
ये विधियाँ आधुनिक सुदृढीकरण सीखने के केंद्र में हैं और रोबोटिक्स, गेम खेलने और स्वायत्त प्रणालियों जैसे क्षेत्रों में लागू की गई हैं। वे निरंतर क्रिया स्थानों वाले वातावरण में विशेष रूप से उपयोगी हैं, जहाँ मूल्य-आधारित विधियाँ अक्सर संघर्ष करती हैं। पॉलिसी ग्रेडिएंट विधियों का अध्ययन "मोंटे कार्लो ग्रेडिएंट अनुमान" शीर्षक के तहत भी किया जाता है क्योंकि वे ग्रेडिएंट का अनुमान लगाने के लिए स्टोकेस्टिक नमूनाकरण पर निर्भर करती हैं।
अवलोकन
पॉलिसी-आधारित सुदृढीकरण सीखने में, अभिनेता एक पैरामीटरित पॉलिसी फलन होता है जो अवस्थाओं को क्रियाओं पर एक प्रायिकता वितरण में मैप करता है। किसी दी गई अवस्था के लिए, पॉलिसी प्रत्येक संभावित क्रिया के लिए प्रायिकताएँ आउटपुट करती है, जिसमें सभी क्रियाओं पर योग या समाकलन 1 के बराबर होता है, यह इस पर निर्भर करता है कि क्रिया स्थान असतत है या निरंतर। लक्ष्य ऐसे पैरामीटर खोजना है जो अपेक्षित एपिसोडिक पुरस्कार को अधिकतम करते हैं, जिसे प्रारंभिक अवस्था से शुरू करते हुए, समय क्षितिज पर पुरस्कारों के छूट वाले योग के रूप में परिभाषित किया जाता है।
पॉलिसी ग्रेडिएंट, पॉलिसी पैरामीटर के संबंध में इस अपेक्षित पुरस्कार का ग्रेडिएंट है। विभिन्न पॉलिसी ग्रेडिएंट विधियाँ इस ग्रेडिएंट का विभिन्न तरीकों से स्टोकेस्टिक अनुमान लगाती हैं, लेकिन सभी का उद्देश्य ग्रेडिएंट पर चढ़कर पॉलिसी को पुनरावृत्त रूप से सुधारना होता है। मुख्य चुनौती ग्रेडिएंट का एक निष्पक्ष और कम-विचरण वाला अनुमान प्राप्त करना है, जिसके कारण बेसलाइन और अभिनेता-आलोचक आर्किटेक्चर जैसी विभिन्न तकनीकें विकसित हुई हैं।
REINFORCE
REINFORCE एल्गोरिदम, जिसे रोनाल्ड जे. विलियम्स ने 1992 में प्रस्तुत किया था, पहली पॉलिसी ग्रेडिएंट विधि थी। यह एक मौलिक पहचान पर आधारित है जो पॉलिसी ग्रेडिएंट को लॉग-पॉलिसी के ग्रेडिएंट और कुल पुरस्कार के गुणनफल के प्रक्षेप पथों पर एक अपेक्षा के रूप में व्यक्त करती है। एक प्रमुख सुधार "कार्य-कारण चाल" है, जो प्रत्येक क्रिया को केवल उस समय-चरण से आगे के पुरस्कारों द्वारा भारित करता है, जिससे पूर्वाग्रह उत्पन्न किए बिना विचरण कम होता है। REINFORCE एक मोंटे कार्लो विधि है, जिसका अर्थ है कि यह ग्रेडिएंट का अनुमान लगाने के लिए पूर्ण एपिसोड का उपयोग करती है, जिससे उच्च विचरण हो सकता है लेकिन इसे लागू करना सरल है।
अभिनेता-आलोचक विधियाँ
अभिनेता-आलोचक विधियाँ विचरण कम करने के लिए पॉलिसी ग्रेडिएंट को मूल्य फलन सन्निकटन के साथ जोड़ती हैं। अभिनेता पॉलिसी नेटवर्क है, जबकि आलोचक मूल्य फलन का अनुमान लगाता है, जिसका उपयोग बेसलाइन या लाभ फलन की गणना करने के लिए किया जाता है। यह शुद्ध REINFORCE की तुलना में अधिक स्थिर और नमूना-कुशल सीखने की अनुमति देता है। उल्लेखनीय उदाहरणों में A2C (लाभ अभिनेता-आलोचक) और A3C (अतुल्यकालिक लाभ अभिनेता-आलोचक) शामिल हैं, जिनका गहन सुदृढीकरण सीखने में व्यापक रूप से उपयोग किया गया है।
आधुनिक प्रकार
आधुनिक पॉलिसी ग्रेडिएंट विधियों में प्रॉक्सिमल पॉलिसी अनुकूलन (PPO) और ट्रस्ट क्षेत्र पॉलिसी अनुकूलन (TRPO) शामिल हैं, जो विनाशकारी बड़े कदमों से बचने के लिए पॉलिसी अद्यतन को प्रतिबंधित करती हैं। ये विधियाँ अपनी विश्वसनीयता और प्रदर्शन के कारण गहन सुदृढीकरण सीखने में मानक बन गई हैं। इनका उपयोग Dota 2 और StarCraft II जैसे खेलों के लिए एजेंटों को प्रशिक्षित करने के साथ-साथ रोबोटिक्स और स्वायत्त ड्राइविंग अनुसंधान में किया जाता है।
अनुप्रयोग और चुनौतियाँ
पॉलिसी ग्रेडिएंट विधियाँ विभिन्न डोमेन में लागू की गई हैं, जिनमें कृत्रिम बुद्धिमत्ता अनुसंधान, मशीन सीखने प्रणालियाँ और गहन सीखने ढाँचे शामिल हैं। वे निरंतर नियंत्रण कार्यों, जैसे रोबोटिक हेरफेर और गति के लिए विशेष रूप से प्रभावी हैं। हालाँकि, उन्हें उच्च नमूना जटिलता और हाइपरपैरामीटर के प्रति संवेदनशीलता जैसी चुनौतियों का सामना करना पड़ता है। अनुसंधान इन मुद्दों को संबोधित करना जारी रखता है, जिसमें तंत्रिका-नेटवर्क आर्किटेक्चर और अनुकूलन तकनीकों में प्रगति शामिल है।
पॉलिसी ग्रेडिएंट विधियाँ बड़े-भाषा-मॉडल प्रशिक्षण के लिए भी प्रासंगिक हैं, जहाँ मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) मानव प्राथमिकताओं के साथ मॉडलों को संरेखित करने के लिए पॉलिसी ग्रेडिएंट जैसे अद्यतनों का उपयोग करता है। यह संबंध पारंपरिक सुदृढीकरण सीखने की सेटिंग्स से परे इन एल्गोरिदम की व्यापक प्रयोज्यता को उजागर करता है।