प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) एक सुदृढीकरण सीखने (RL) एल्गोरिथ्म है जो एक बुद्धिमान एजेंट को प्रशिक्षित करने के लिए उपयोग किया जाता है। विशेष रूप से, यह एक पॉलिसी ग्रेडिएंट विधि है, जिसका उपयोग अक्सर गहन RL के लिए किया जाता है जब पॉलिसी नेटवर्क बहुत बड़ा होता है। PPO को 2017 में ट्रस्ट रीजन पॉलिसी ऑप्टिमाइज़ेशन (TRPO) के सन्निकटन के रूप में पेश किया गया था, जिसे दूसरे क्रम के डेरिवेटिव की गणना की कम्प्यूटेशनल लागत के बिना प्रशिक्षण स्थिरता में सुधार करने के लिए डिज़ाइन किया गया था। 2018 से, PPO OpenAI में डिफ़ॉल्ट RL एल्गोरिथ्म रहा है और इसे रोबोटिक आर्म नियंत्रण, अटारी गेम खेलने और OpenAI फाइव प्रोजेक्ट के माध्यम से Dota 2 में पेशेवर खिलाड़ियों को हराने जैसे क्षेत्रों में लागू किया गया है।
PPO पॉलिसी ग्रेडिएंट विधियों के परिवार से संबंधित है, जो अपेक्षित इनाम के ग्रेडिएंट का अनुमान लगाकर सीधे पॉलिसी को अनुकूलित करते हैं। डीप क्यू-नेटवर्क (DQN) जैसे मूल्य-आधारित तरीकों के विपरीत, PPO एक ऑन-पॉलिसी एल्गोरिथ्म है, जिसका अर्थ है कि यह वर्तमान पॉलिसी से एकत्र किए गए डेटा का उपयोग करके पॉलिसी को अपडेट करता है। यह असतत और निरंतर दोनों एक्शन स्पेस का समर्थन करता है, जो इसे विभिन्न प्रकार के वातावरणों के लिए बहुमुखी बनाता है।
पृष्ठभूमि: ट्रस्ट रीजन पॉलिसी ऑप्टिमाइज़ेशन
PPO के पूर्ववर्ती, ट्रस्ट रीजन पॉलिसी ऑप्टिमाइज़ेशन (TRPO) को 2015 में प्रकाशित किया गया था। TRPO ने पुरानी और नई नीतियों के बीच KL विचलन को सीमित करने के लिए ट्रस्ट रीजन विधि का उपयोग करके DQN की अस्थिरता समस्याओं को संबोधित किया। यह बाधा सुनिश्चित करती है कि अपडेट के दौरान पॉलिसी बहुत अधिक नहीं बदलती है, जो स्थिर सीखने को बनाए रखने में मदद करती है। हालाँकि, TRPO इस बाधा को हेसियन मैट्रिक्स की गणना करके लागू करता है, जो दूसरे क्रम के डेरिवेटिव का एक मैट्रिक्स है, जो बड़े पैमाने की समस्याओं के लिए कम्प्यूटेशनल रूप से महंगा और अक्षम है। इस सीमा ने PPO के विकास को प्रेरित किया, जो हेसियन की आवश्यकता के बिना TRPO की बाधा का अनुमान लगाता है।
PPO एल्गोरिथ्म
PPO KL विचलन बाधा को एक क्लिप किए गए उद्देश्य फ़ंक्शन के साथ बदलकर TRPO को सरल बनाता है। मुख्य विचार नई और पुरानी नीतियों के बीच संभावना अनुपात को क्लिप करके पॉलिसी अपडेट को सीमित करना है। यह क्लिपिंग तंत्र अत्यधिक बड़े अपडेट को रोकता है, जो प्रशिक्षण को अस्थिर कर सकता है। उद्देश्य फ़ंक्शन को पॉलिसी सुधार पर निचली सीमा प्रदान करने के लिए डिज़ाइन किया गया है, यह सुनिश्चित करते हुए कि अपडेट रूढ़िवादी लेकिन प्रभावी हैं।
एल्गोरिथ्म आम तौर पर इन चरणों का पालन करता है:
- वर्तमान पॉलिसी को वातावरण में चलाकर प्रक्षेपवक्र एकत्र करें।
- रिवॉर्ड्स-टू-गो और लाभ अनुमानों की गणना करें (उदाहरण के लिए, सामान्यीकृत लाभ अनुमान का उपयोग करके)।
- क्लिप किए गए सरोगेट उद्देश्य को अधिकतम करके पॉलिसी को अपडेट करें, अक्सर स्टोकेस्टिक ग्रेडिएंट असेंट का उपयोग करके।
- वैकल्पिक रूप से, लाभ अनुमान में सुधार के लिए एक मूल्य फ़ंक्शन को अपडेट करें।
PPO अपनी सरलता और TRPO की तुलना में कार्यान्वयन में आसानी के लिए जाना जाता है, साथ ही कई कार्यों में तुलनीय या बेहतर प्रदर्शन प्राप्त करता है। यह सुदृढीकरण सीखने के अनुसंधान में एक मानक आधार रेखा बन गया है।
अनुप्रयोग और प्रभाव
PPO को अनुसंधान और उद्योग दोनों में व्यापक रूप से अपनाया गया है। OpenAI में, यह 2018 में डिफ़ॉल्ट RL एल्गोरिथ्म बन गया, जिसका उपयोग OpenAI फाइव जैसी परियोजनाओं में किया गया, जिसने 2019 में Dota 2 में मौजूदा विश्व चैंपियन को हराया। PPO का उपयोग रोबोटिक नियंत्रण के लिए भी किया गया है, जिसमें हेरफेर कार्य करने के लिए एक रोबोटिक आर्म को प्रशिक्षित करना और अटारी गेम खेलना शामिल है, जहां इसने कई खिताबों पर मानव-स्तर से बेहतर प्रदर्शन हासिल किया।
एल्गोरिथ्म की स्थिरता और नमूना दक्षता ने इसे बड़े भाषा मॉडल को ठीक करने के लिए एक लोकप्रिय विकल्प बना दिया है, विशेष रूप से मानव प्रतिक्रिया से सुदृढीकरण सीखने (RLHF) के संदर्भ में। कई आधुनिक बड़े भाषा मॉडल को PPO या इसके प्रकारों का उपयोग करके संरेखित किया गया है, जो जनरेटिव AI प्रणालियों के विकास में योगदान देता है।
अन्य विधियों के साथ तुलना
PPO की तुलना अक्सर A2C (एडवांटेज एक्टर-क्रिटिक) और DDPG (डीप डेटर्मिनिस्टिक पॉलिसी ग्रेडिएंट) जैसे अन्य पॉलिसी ग्रेडिएंट एल्गोरिदम के साथ की जाती है। A2C के विपरीत, जो कई समानांतर वातावरणों का उपयोग करता है, PPO एकल वातावरण के साथ काम कर सकता है और डेटा का पुन: उपयोग करने के लिए महत्वपूर्ण नमूनाकरण का उपयोग करता है। DDPG की तुलना में, जो ऑफ-पॉलिसी और नियतात्मक है, PPO ऑन-पॉलिसी और स्टोकेस्टिक है, जो इसे हाइपरपैरामीटर विविधताओं के प्रति अधिक मजबूत बनाता है। PPO का क्लिप किया गया उद्देश्य TRPO के ट्रस्ट रीजन के लिए एक सरल विकल्प भी प्रदान करता है, जो स्थिरता बनाए रखते हुए कम्प्यूटेशनल ओवरहेड को कम करता है।
सीमाएँ और विस्तार
अपनी सफलता के बावजूद, PPO की सीमाएँ हैं। यह क्लिपिंग पैरामीटर और लाभ अनुमान विधि की पसंद के प्रति संवेदनशील हो सकता है। इसके लिए सीखने की दर और मिनी-बैच आकार जैसे हाइपरपैरामीटर के सावधानीपूर्वक ट्यूनिंग की भी आवश्यकता होती है। शोधकर्ताओं ने PPO-λ जैसे विस्तार प्रस्तावित किए हैं, जो सामान्यीकृत लाभ अनुमान को शामिल करता है, और ऐसे प्रकार जो क्लिपिंग रेंज को अनुकूल रूप से समायोजित करते हैं। इसके अतिरिक्त, PPO की ऑन-पॉलिसी प्रकृति ऑफ-पॉलिसी तरीकों की तुलना में नमूना-अक्षम हो सकती है, हालांकि इसकी भरपाई अक्सर इसकी स्थिरता से की जाती है।