प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) एक सुदृढ़ीकरण अधिगम (RL) एल्गोरिथ्म है जिसका उपयोग किसी बुद्धिमान एजेंट को वातावरण में निर्णय लेने के लिए प्रशिक्षित करने हेतु किया जाता है। यह पॉलिसी ग्रेडिएंट विधियों के परिवार से संबंधित है, जो अपेक्षित पुरस्कार के ग्रेडिएंट का अनुमान लगाकर सीधे पॉलिसी को अनुकूलित करते हैं। PPO विशेष रूप से गहन सुदृढ़ीकरण अधिगम (deep RL) के लिए उपयुक्त है, जहाँ पॉलिसी को एक बड़े तंत्रिका नेटवर्क द्वारा दर्शाया जाता है, और यह सरलता, स्थिरता और नमूना दक्षता के संतुलन के कारण कई अनुप्रयोगों के लिए एक मानक विकल्प बन गया है।
यह एल्गोरिथ्म 2017 में ट्रस्ट रीजन पॉलिसी ऑप्टिमाइज़ेशन (TRPO) के सन्निकटन के रूप में प्रस्तुत किया गया था, जो एक पहले की विधि थी जिसका उद्देश्य प्रत्येक अद्यतन में पॉलिसी में होने वाले परिवर्तन को सीमित करके प्रशिक्षण को स्थिर करना था। PPO इसे एक क्लिप किए गए उद्देश्य फलन का उपयोग करके सरल बनाता है, जिससे TRPO के द्वितीय-क्रम विधियों की कम्प्यूटेशनल लागत से बचा जा सकता है। 2018 से, PPO OpenAI में डिफ़ॉल्ट RL एल्गोरिथ्म रहा है, और इसे रोबोटिक्स से लेकर खेल खेलने तक के क्षेत्रों में लागू किया गया है।
मुख्य तंत्र
PPO एक ऑन-पॉलिसी एल्गोरिथ्म है, जिसका अर्थ है कि यह पॉलिसी को वर्तमान संस्करण से एकत्रित डेटा का उपयोग करके अद्यतन करता है। मुख्य विचार पॉलिसी पर ग्रेडिएंट आरोहण के कई चरण लेना है, जबकि यह सुनिश्चित करना है कि नई पॉलिसी पुरानी से बहुत अधिक विचलित न हो। यह एक क्लिप किए गए सरोगेट उद्देश्य के माध्यम से प्राप्त किया जाता है, जो उन परिवर्तनों को दंडित करता है जो नई और पुरानी पॉलिसी के बीच संभाव्यता अनुपात को बहुत बड़ा या बहुत छोटा बना दें।
उद्देश्य फलन को पॉलिसी सुधार का एक रूढ़िवादी अनुमान प्रदान करने के लिए डिज़ाइन किया गया है। अनुपात को क्लिप करके, PPO अत्यधिक बड़े अद्यतनों को रोकता है जो प्रशिक्षण को अस्थिर कर सकते हैं, जो पॉलिसी ग्रेडिएंट विधियों में एक सामान्य समस्या है। यह तंत्र कम्प्यूटेशनल रूप से कुशल है, क्योंकि इसमें केवल प्रथम-क्रम अनुकूलन की आवश्यकता होती है, TRPO के विपरीत जो हेसियन मैट्रिक्स का उपयोग करता है।
TRPO से संबंध
TRPO, जो 2015 में प्रकाशित हुआ था, ने डीप क्यू-नेटवर्क (DQN) जैसे पहले के एल्गोरिथ्मों में अस्थिरता के मुद्दों को एक ट्रस्ट रीजन विधि का उपयोग करके संबोधित किया, जो पुरानी और नई पॉलिसी के बीच KL विचलन को सीमित करता था। हालाँकि, इस बाधा को लागू करने के लिए द्वितीय व्युत्पन्नों के हेसियन मैट्रिक्स की गणना की आवश्यकता होती थी, जो बड़े पैमाने की समस्याओं के लिए अक्षम है। PPO को एक सन्निकटन के रूप में विकसित किया गया था जो पॉलिसी ग्रेडिएंट को क्लिप करके हेसियन गणना से बचता है। यह PPO को लागू करने और ट्यून करने में सरल बनाता है, जबकि कई कार्यों में तुलनीय या बेहतर प्रदर्शन प्राप्त करता है।
अनुप्रयोग
PPO को अनुसंधान और उद्योग दोनों में व्यापक रूप से अपनाया गया है। OpenAI में, इसका उपयोग विभिन्न वातावरणों में एजेंटों को प्रशिक्षित करने के लिए डिफ़ॉल्ट RL एल्गोरिथ्म के रूप में किया गया था। एक उल्लेखनीय अनुप्रयोग OpenAI Five था, एक प्रणाली जिसने 2019 में वीडियो गेम Dota 2 में पेशेवर खिलाड़ियों को हराया। PPO का उपयोग रोबोटिक भुजाओं को नियंत्रित करने, Atari गेम खेलने और अन्य क्षेत्रों में क्रमिक निर्णय लेने की आवश्यकता वाले कार्यों के लिए भी किया गया है। इसकी मजबूती और उपयोग में आसानी ने इसे मशीन अधिगम चिकित्सकों के लिए सुदृढ़ीकरण अधिगम समस्याओं पर काम करने वालों के बीच एक लोकप्रिय विकल्प बना दिया है।
विविधताएँ और विस्तार
PPO के कई रूप विशिष्ट चुनौतियों को संबोधित करने के लिए प्रस्तावित किए गए हैं। उदाहरण के लिए, कुछ संस्करण अनुकूली क्लिपिंग या विभिन्न लाभ अनुमान तकनीकों को शामिल करते हैं। PPO को अक्सर उच्च-आयामी अवलोकनों को संभालने के लिए गहन अधिगम आर्किटेक्चर जैसी अन्य विधियों के साथ भी जोड़ा जाता है। एल्गोरिथ्म के डिज़ाइन ने बाद के RL अनुसंधान को प्रभावित किया है, और यह एक बेंचमार्क बना हुआ है जिसके विरुद्ध नए एल्गोरिथ्मों की तुलना की जाती है।