प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन

अंग्रेज़ी से अनुवादित

प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) एक सुदृढ़ीकरण सीखने का एल्गोरिदम है जो बुद्धिमान एजेंटों को प्रशिक्षित करने के लिए उपयोग किया जाता है, विशेष रूप से एक पॉलिसी ग्रेडिएंट विधि जो स्थिरता और दक्षता में सुधार के लिए एक क्लिप किए गए उद्देश्य का उपयोग करती है।

प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) एक सुदृढ़ीकरण अधिगम (RL) एल्गोरिथ्म है जिसका उपयोग किसी बुद्धिमान एजेंट को वातावरण में निर्णय लेने के लिए प्रशिक्षित करने हेतु किया जाता है। यह पॉलिसी ग्रेडिएंट विधियों के परिवार से संबंधित है, जो अपेक्षित पुरस्कार के ग्रेडिएंट का अनुमान लगाकर सीधे पॉलिसी को अनुकूलित करते हैं। PPO विशेष रूप से गहन सुदृढ़ीकरण अधिगम (deep RL) के लिए उपयुक्त है, जहाँ पॉलिसी को एक बड़े तंत्रिका नेटवर्क द्वारा दर्शाया जाता है, और यह सरलता, स्थिरता और नमूना दक्षता के संतुलन के कारण कई अनुप्रयोगों के लिए एक मानक विकल्प बन गया है।

यह एल्गोरिथ्म 2017 में ट्रस्ट रीजन पॉलिसी ऑप्टिमाइज़ेशन (TRPO) के सन्निकटन के रूप में प्रस्तुत किया गया था, जो एक पहले की विधि थी जिसका उद्देश्य प्रत्येक अद्यतन में पॉलिसी में होने वाले परिवर्तन को सीमित करके प्रशिक्षण को स्थिर करना था। PPO इसे एक क्लिप किए गए उद्देश्य फलन का उपयोग करके सरल बनाता है, जिससे TRPO के द्वितीय-क्रम विधियों की कम्प्यूटेशनल लागत से बचा जा सकता है। 2018 से, PPO OpenAI में डिफ़ॉल्ट RL एल्गोरिथ्म रहा है, और इसे रोबोटिक्स से लेकर खेल खेलने तक के क्षेत्रों में लागू किया गया है।

मुख्य तंत्र

PPO एक ऑन-पॉलिसी एल्गोरिथ्म है, जिसका अर्थ है कि यह पॉलिसी को वर्तमान संस्करण से एकत्रित डेटा का उपयोग करके अद्यतन करता है। मुख्य विचार पॉलिसी पर ग्रेडिएंट आरोहण के कई चरण लेना है, जबकि यह सुनिश्चित करना है कि नई पॉलिसी पुरानी से बहुत अधिक विचलित न हो। यह एक क्लिप किए गए सरोगेट उद्देश्य के माध्यम से प्राप्त किया जाता है, जो उन परिवर्तनों को दंडित करता है जो नई और पुरानी पॉलिसी के बीच संभाव्यता अनुपात को बहुत बड़ा या बहुत छोटा बना दें।

उद्देश्य फलन को पॉलिसी सुधार का एक रूढ़िवादी अनुमान प्रदान करने के लिए डिज़ाइन किया गया है। अनुपात को क्लिप करके, PPO अत्यधिक बड़े अद्यतनों को रोकता है जो प्रशिक्षण को अस्थिर कर सकते हैं, जो पॉलिसी ग्रेडिएंट विधियों में एक सामान्य समस्या है। यह तंत्र कम्प्यूटेशनल रूप से कुशल है, क्योंकि इसमें केवल प्रथम-क्रम अनुकूलन की आवश्यकता होती है, TRPO के विपरीत जो हेसियन मैट्रिक्स का उपयोग करता है।

TRPO से संबंध

TRPO, जो 2015 में प्रकाशित हुआ था, ने डीप क्यू-नेटवर्क (DQN) जैसे पहले के एल्गोरिथ्मों में अस्थिरता के मुद्दों को एक ट्रस्ट रीजन विधि का उपयोग करके संबोधित किया, जो पुरानी और नई पॉलिसी के बीच KL विचलन को सीमित करता था। हालाँकि, इस बाधा को लागू करने के लिए द्वितीय व्युत्पन्नों के हेसियन मैट्रिक्स की गणना की आवश्यकता होती थी, जो बड़े पैमाने की समस्याओं के लिए अक्षम है। PPO को एक सन्निकटन के रूप में विकसित किया गया था जो पॉलिसी ग्रेडिएंट को क्लिप करके हेसियन गणना से बचता है। यह PPO को लागू करने और ट्यून करने में सरल बनाता है, जबकि कई कार्यों में तुलनीय या बेहतर प्रदर्शन प्राप्त करता है।

अनुप्रयोग

PPO को अनुसंधान और उद्योग दोनों में व्यापक रूप से अपनाया गया है। OpenAI में, इसका उपयोग विभिन्न वातावरणों में एजेंटों को प्रशिक्षित करने के लिए डिफ़ॉल्ट RL एल्गोरिथ्म के रूप में किया गया था। एक उल्लेखनीय अनुप्रयोग OpenAI Five था, एक प्रणाली जिसने 2019 में वीडियो गेम Dota 2 में पेशेवर खिलाड़ियों को हराया। PPO का उपयोग रोबोटिक भुजाओं को नियंत्रित करने, Atari गेम खेलने और अन्य क्षेत्रों में क्रमिक निर्णय लेने की आवश्यकता वाले कार्यों के लिए भी किया गया है। इसकी मजबूती और उपयोग में आसानी ने इसे मशीन अधिगम चिकित्सकों के लिए सुदृढ़ीकरण अधिगम समस्याओं पर काम करने वालों के बीच एक लोकप्रिय विकल्प बना दिया है।

विविधताएँ और विस्तार

PPO के कई रूप विशिष्ट चुनौतियों को संबोधित करने के लिए प्रस्तावित किए गए हैं। उदाहरण के लिए, कुछ संस्करण अनुकूली क्लिपिंग या विभिन्न लाभ अनुमान तकनीकों को शामिल करते हैं। PPO को अक्सर उच्च-आयामी अवलोकनों को संभालने के लिए गहन अधिगम आर्किटेक्चर जैसी अन्य विधियों के साथ भी जोड़ा जाता है। एल्गोरिथ्म के डिज़ाइन ने बाद के RL अनुसंधान को प्रभावित किया है, और यह एक बेंचमार्क बना हुआ है जिसके विरुद्ध नए एल्गोरिथ्मों की तुलना की जाती है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·machine-learning·algorithms
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास