अंग्रेज़ी से अनुवादित

Trust Region Policy Optimization (TRPO) एक सुदृढ़ीकरण सीखने का एल्गोरिथ्म है जो एजेंटों को प्रशिक्षित करने के लिए है, जिसे 2015 में PPO के पूर्ववर्ती के रूप में प्रकाशित किया गया था। यह नीति अद्यतनों पर एक ट्रस्ट क्षेत्र बाधा का उपयोग करता है ताकि स्थिरता में सुधार हो सके।

Trust Region Policy Optimization (TRPO) एक सुदृढीकरण अधिगम (reinforcement learning, RL) एल्गोरिदम है जो एक बुद्धिमान एजेंट को अनुक्रमिक निर्णय लेने के लिए प्रशिक्षित करता है। यह एक पॉलिसी ग्रेडिएंट विधि है, जिसे अक्सर गहन RL में उपयोग किया जाता है जब पॉलिसी नेटवर्क बड़ा होता है, और इसे 2015 में पहले के एल्गोरिदम में अस्थिरता की समस्याओं के जवाब में पेश किया गया था। TRPO प्रत्येक अद्यतन में पॉलिसी में परिवर्तन को एक ट्रस्ट क्षेत्र (trust region) का उपयोग करके सीमित करता है, जो पुरानी और नई पॉलिसियों के बीच कुलबैक-लीब्लर (KL) विचलन को सीमित करता है, जिससे अधिक विश्वसनीय सुधार सुनिश्चित होते हैं।

TRPO एक ऑन-पॉलिसी एल्गोरिदम है, जिसका अर्थ है कि यह वर्तमान पॉलिसी से एकत्रित डेटा का उपयोग करके पॉलिसी को अद्यतन करता है। यह असतत या सतत क्रिया स्थानों वाले वातावरण पर लागू होता है। एल्गोरिदम पुनरावृत्त रूप से प्रक्षेपवक्र एकत्र करता है, लाभों का अनुमान लगाता है, एक पॉलिसी ग्रेडिएंट की गणना करता है, और फिर पॉलिसी मापदंडों को अद्यतन करने के लिए एक प्रतिबंधित अनुकूलन चरण लागू करता है।

पृष्ठभूमि और प्रेरणा

सुदृढीकरण अधिगम का उद्देश्य परीक्षण और त्रुटि के माध्यम से संचयी पुरस्कार को अधिकतम करके एजेंटों को प्रशिक्षित करना है। प्रारंभिक गहन RL विधियाँ, जैसे कि डीप क्यू-नेटवर्क (DQN), ने उल्लेखनीय सफलताएँ प्राप्त कीं लेकिन प्रशिक्षण के दौरान अस्थिरता से ग्रस्त रहीं। DQN, जिसे 2013 में Google DeepMind के शोधकर्ताओं द्वारा पेश किया गया था, ने Q-मान फ़ंक्शन का अनुमान लगाने के लिए एक तंत्रिका नेटवर्क का उपयोग किया लेकिन अनियमित अद्यतन प्रदर्शित कर सकता था। TRPO को इन मुद्दों को संबोधित करने के लिए एक अधिक स्थिर पॉलिसी अद्यतन तंत्र प्रदान करके विकसित किया गया था।

TRPO के पीछे मूल विचार यह सीमित करना है कि एक एकल अद्यतन में पॉलिसी कितनी बदल सकती है। यह पुरानी और नई पॉलिसियों के बीच KL विचलन पर एक प्रतिबंध लगाकर प्राप्त किया जाता है। पॉलिसी को एक ट्रस्ट क्षेत्र के भीतर रखकर, TRPO बड़े, विनाशकारी अद्यतनों से बचता है जो भोले पॉलिसी ग्रेडिएंट विधियों में हो सकते हैं।

एल्गोरिदम विवरण

TRPO वातावरण में वर्तमान पॉलिसी को चलाकर पुनरावृत्त रूप से प्रक्षेपवक्रों का एक सेट एकत्र करके संचालित होता है। प्रत्येक प्रक्षेपवक्र के लिए, यह पुरस्कार-से-लक्ष्य और लाभ अनुमानों की गणना करता है, जो मापते हैं कि एक क्रिया औसत की तुलना में कितनी बेहतर है। पॉलिसी ग्रेडिएंट तब इन लाभों द्वारा भारित क्रियाओं की लॉग-प्रायिकता के अपेक्षित ग्रेडिएंट के रूप में अनुमानित किया जाता है।

एक प्रमुख कम्प्यूटेशनल चुनौती KL विचलन प्रतिबंध को लागू करना है। TRPO KL विचलन के हेसियन मैट्रिक्स - द्वितीय व्युत्पन्नों का एक मैट्रिक्स - का उपयोग करके प्रतिबंध का अनुमान लगाता है। हालाँकि, बड़े पैमाने की समस्याओं के लिए हेसियन की सीधे गणना करना कम्प्यूटेशनल रूप से महंगा है। इसे कम करने के लिए, TRPO परिणामी रैखिक प्रणाली को लगभग हल करने के लिए संयुग्म ग्रेडिएंट एल्गोरिदम का उपयोग करता है, जिससे पूर्ण हेसियन को स्पष्ट रूप से बनाने की आवश्यकता से बचा जाता है। इसके अतिरिक्त, एक बैकट्रैकिंग लाइन खोज यह सुनिश्चित करती है कि अद्यतित पॉलिसी प्रतिबंध को संतुष्ट करती है।

PPO से संबंध

TRPO प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) का प्रत्यक्ष पूर्ववर्ती है, जो 2017 में प्रकाशित हुआ था। PPO एक क्लिप्ड उद्देश्य फ़ंक्शन के साथ KL विचलन प्रतिबंध का अनुमान लगाकर TRPO को सरल बनाता है, जिससे हेसियन की गणना करने की आवश्यकता समाप्त हो जाती है। यह PPO को कम्प्यूटेशनल रूप से अधिक कुशल और लागू करने में आसान बनाता है, जबकि समान स्थिरता लाभ बनाए रखता है। 2018 के बाद से, PPO OpenAI में डिफ़ॉल्ट RL एल्गोरिदम रहा है, और इसे कार्यों की एक विस्तृत श्रृंखला पर लागू किया गया है, जिसमें रोबोटिक भुजाओं को नियंत्रित करना, Atari गेम खेलना, और OpenAI Five परियोजना के भाग के रूप में Dota 2 में पेशेवर खिलाड़ियों को हराना शामिल है।

PPO की लोकप्रियता के बावजूद, TRPO RL में एक महत्वपूर्ण मौलिक एल्गोरिदम बना हुआ है। इसका ट्रस्ट क्षेत्र दृष्टिकोण ने कई बाद की विधियों को प्रभावित किया है, और यह अभी भी उन परिदृश्यों में उपयोग किया जाता है जहाँ अतिरिक्त कम्प्यूटेशनल लागत स्वीकार्य है।

अनुप्रयोग और प्रभाव

TRPO को विभिन्न निरंतर नियंत्रण कार्यों पर लागू किया गया है, जैसे कि गति और हेरफेर, जहाँ स्थिर पॉलिसी अद्यतन महत्वपूर्ण हैं। इसका उपयोग जटिल वातावरण में पॉलिसी अनुकूलन का अध्ययन करने के लिए अनुसंधान सेटिंग्स में भी किया गया है। एकरस सुधार पर एल्गोरिदम का जोर इसे नए RL विधियों की तुलना करने के लिए एक बेंचमार्क बनाता है।

मशीन लर्निंग और कृत्रिम बुद्धिमत्ता के व्यापक संदर्भ में, TRPO ने RL में तंत्रिका नेटवर्क के लिए अधिक मजबूत प्रशिक्षण तकनीकों के विकास में योगदान दिया। इसके विचारों को कई अनुवर्ती कार्यों में विस्तारित और अनुकूलित किया गया है, जिससे गहन RL के इतिहास में इसका स्थान मजबूत हुआ है।

सीमाएँ

TRPO की मुख्य सीमा हेसियन गणना और संयुग्म ग्रेडिएंट पुनरावृत्तियों के कारण इसका कम्प्यूटेशनल ओवरहेड है। यह इसे PPO जैसी सरल विधियों की तुलना में धीमा बनाता है, विशेष रूप से जब पॉलिसी नेटवर्क बहुत बड़ा होता है। इसके अतिरिक्त, TRPO को हाइपरपैरामीटरों के सावधानीपूर्वक समायोजन की आवश्यकता होती है, जैसे कि KL विचलन सीमा और बैकट्रैकिंग गुणांक, जो प्रदर्शन को प्रभावित कर सकते हैं।

इन कमियों के बावजूद, TRPO के सैद्धांतिक आश्वासन और स्थिरता गुण इसे पॉलिसी अनुकूलन को समझने के लिए एक मूल्यवान उपकरण बनाते हैं। यह क्षेत्र में नए एल्गोरिदम का मूल्यांकन करने के लिए एक संदर्भ बिंदु बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·machine-learning·optimization·policy-gradient
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास