अंग्रेज़ी से अनुवादित

SAC (Soft Actor-Critic) निरंतर क्रिया स्थानों के लिए एक सुदृढीकरण सीखने का एल्गोरिदम है, जो अपनी स्थिरता और नमूना दक्षता के लिए जाना जाता है। यह ऑफ-पॉलिसी सीखने को एन्ट्रॉपी अधिकतमकरण के साथ जोड़ता है ताकि अन्वेषण और दोहन के बीच संतुलन बनाया जा सके।

SAC (सॉफ्ट एक्टर-क्रिटिक) एक सुदृढीकरण सीखने एल्गोरिदम है जो निरंतर क्रिया स्थानों के लिए विकसित किया गया है, जिसे 2018 में टुओमास हार्नोजा और उनके सहयोगियों द्वारा बर्कले एआई रिसर्च प्रयोगशाला में पेश किया गया था। यह अपनी स्थिरता और नमूना दक्षता के लिए उल्लेखनीय है, जो इसे रोबोटिक नियंत्रण कार्यों और अन्य निरंतर नियंत्रण समस्याओं के लिए एक लोकप्रिय विकल्प बनाता है। यह एल्गोरिदम एक ऑफ-पॉलिसी विधि है जो अधिकतम एन्ट्रॉपी सुदृढीकरण सीखने को एकीकृत करती है, जो अपेक्षित रिटर्न और नीति की एन्ट्रॉपी दोनों को अधिकतम करके अन्वेषण को प्रोत्साहित करती है।

SAC का मूल विचार एक स्टोकेस्टिक नीति को प्रशिक्षित करना है जो अपेक्षित संचयी पुरस्कार और एन्ट्रॉपी के बीच एक समझौते को अधिकतम करने का लक्ष्य रखती है, जो क्रिया चयन में यादृच्छिकता का एक माप है। यह एन्ट्रॉपी शब्द विविध व्यवहार को बढ़ावा देता है, जो उप-इष्टतम नीतियों में समय से पहले अभिसरण को रोकता है। SAC तीन मुख्य घटकों का उपयोग करता है: एक एक्टर नेटवर्क जो क्रियाओं पर एक संभाव्यता वितरण आउटपुट करता है, दो क्रिटिक नेटवर्क जो राज्य-क्रिया मूल्य (क्यू-मूल्य) का अनुमान लगाते हैं, और एक तापमान पैरामीटर जो पुरस्कार और एन्ट्रॉपी के बीच संतुलन को नियंत्रित करता है। दो क्रिटिक्स का उपयोग अति-अनुमान पूर्वाग्रह को कम करने में मदद करता है, जो क्यू-लर्निंग-आधारित विधियों में एक सामान्य समस्या है।

एल्गोरिदमिक ढांचा

SAC एक्टर-क्रिटिक प्रतिमान के भीतर काम करता है, जहां एक्टर (नीति) को अपेक्षित क्यू-मूल्य और एन्ट्रॉपी बोनस को अधिकतम करने के लिए अद्यतन किया जाता है, जबकि क्रिटिक्स को अस्थायी अंतर त्रुटि को कम करने के लिए अद्यतन किया जाता है। एल्गोरिदम पिछले अनुभवों को संग्रहीत करने के लिए एक रीप्ले बफर का उपयोग करता है, जो ऑफ-पॉलिसी सीखने और बेहतर डेटा दक्षता की अनुमति देता है। एक प्रमुख नवाचार एक सॉफ्ट क्यू-फ़ंक्शन का उपयोग है, जो मूल्य अनुमान में एन्ट्रॉपी शब्द को शामिल करता है। तापमान पैरामीटर को प्रशिक्षण के दौरान स्वचालित रूप से समायोजित किया जाता है ताकि लक्ष्य एन्ट्रॉपी स्तर बनाए रखा जा सके, जो अनुकूली अन्वेषण को सक्षम बनाता है।

नीति को आमतौर पर एक गाऊसी वितरण के रूप में मॉडल किया जाता है, जिसमें माध्य और विचरण एक तंत्रिका नेटवर्क द्वारा आउटपुट किया जाता है। क्रियाएं इस वितरण से नमूना की जाती हैं, और पुनः-पैरामीटरीकरण चाल का उपयोग नमूनाकरण प्रक्रिया के माध्यम से ग्रेडिएंट की गणना करने के लिए किया जाता है। यह स्थिर और कुशल नीति अद्यतन की अनुमति देता है। क्रिटिक्स भी तंत्रिका नेटवर्क हैं, और उनके लक्ष्यों की गणना वर्तमान नीति के एन्ट्रॉपी-वर्धित मूल्य का उपयोग करके की जाती है, जो एक आत्म-संगत अद्यतन योजना की ओर ले जाता है।

प्रशिक्षण गतिशीलता और स्थिरता

SAC को हाइपरपैरामीटर सेटिंग्स के प्रति मजबूत होने के लिए डिज़ाइन किया गया है, जिसमें DDPG या PPO जैसे पहले के एल्गोरिदम की तुलना में न्यूनतम ट्यूनिंग की आवश्यकता होती है। इसकी ऑफ-पॉलिसी प्रकृति इसे रीप्ले बफर से डेटा का पुन: उपयोग करने की अनुमति देती है, जो सीखने को तेज करता है। एन्ट्रॉपी नियमितीकरण नीति को अभिसरण के दौरान भी अन्वेषण बनाए रखने में मदद करता है, जिससे स्थानीय ऑप्टिमा में फंसने का जोखिम कम होता है। व्यवहार में, SAC ने OpenAI Gym MuJoCo कार्यों जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्रदर्शित किया है, जो अक्सर प्रतिस्पर्धी विधियों की तुलना में कम नमूनों के साथ उच्च रिटर्न प्राप्त करता है।

एल्गोरिदम की स्थिरता क्रिटिक्स के लिए लक्ष्य नेटवर्क के उपयोग से और बढ़ाई जाती है, जिन्हें सॉफ्ट अपडेट (पॉल्याक औसत) के माध्यम से अद्यतन किया जाता है। यह लक्ष्य मूल्यों में भिन्नता को कम करता है और प्रशिक्षण को स्थिर करता है। इसके अतिरिक्त, स्वचालित तापमान ट्यूनिंग सुनिश्चित करती है कि एन्ट्रॉपी गुणांक कार्य की कठिनाई के अनुकूल हो, जो जटिल वातावरण में अधिक अन्वेषण और सरल वातावरण में कम अन्वेषण की अनुमति देता है।

अनुप्रयोग और विविधताएं

SAC को रोबोटिक्स और नियंत्रण में व्यापक रूप से अपनाया गया है, जिसमें लोकोमोशन, हेरफेर और स्वायत्त नेविगेशन जैसे कार्य शामिल हैं। इसकी नमूना दक्षता इसे वास्तविक दुनिया के अनुप्रयोगों के लिए उपयुक्त बनाती है जहां डेटा संग्रह महंगा है, जैसे सर्जिकल रोबोटिक्स और स्वायत्त वाहनों में। विशिष्ट चुनौतियों को संबोधित करने के लिए कई विविधताएं प्रस्तावित की गई हैं, जिनमें स्वचालित हाइपरपैरामीटर ट्यूनिंग के साथ SAC, असतत क्रिया स्थान अनुकूलन और मल्टी-एजेंट सेटिंग्स के लिए विस्तार शामिल हैं। शोधकर्ताओं ने उच्च-आयामी अवलोकनों, जैसे छवियों, को संभालने के लिए कन्वोल्यूशनल नेटवर्क को शामिल करके SAC को गहन सीखने तकनीकों के साथ भी जोड़ा है।

कृत्रिम बुद्धिमत्ता के क्षेत्र में, SAC ने बाद के एल्गोरिदम, जैसे TD3 और REDQ, को प्रभावित किया है, जो इसके सिद्धांतों पर निर्माण करते हैं। अधिकतम एन्ट्रॉपी सुदृढीकरण सीखने में इसकी सैद्धांतिक नींव ने मशीन सीखने में नियंत्रण से परे काम को भी प्रेरित किया है, जिसमें जनरेटिव मॉडल में अन्वेषण रणनीतियां शामिल हैं।

अन्य एल्गोरिदम के साथ तुलना

SAC PPO जैसी ऑन-पॉलिसी विधियों से भिन्न है, क्योंकि यह पिछले डेटा का पुन: उपयोग कर सकता है, जिससे उच्च नमूना दक्षता होती है। DDPG की तुलना में, जो नियतात्मक है, SAC की स्टोकेस्टिक नीति बेहतर अन्वेषण और मजबूती प्रदान करती है। हालांकि, SAC की कम्प्यूटेशनल लागत दो क्रिटिक्स और एक स्टोकेस्टिक एक्टर को प्रशिक्षित करने की आवश्यकता के कारण अधिक है। व्यवहार में, SAC अक्सर निरंतर नियंत्रण बेंचमार्क पर DDPG और PPO दोनों से बेहतर प्रदर्शन करता है, विशेष रूप से अंतिम प्रदर्शन और सीखने की गति के संदर्भ में। इसकी एन्ट्रॉपी-आधारित अन्वेषण इसे पुरस्कार विरलता के प्रति अधिक लचीला बनाती है, जो सुदृढीकरण सीखने में एक सामान्य चुनौती है।

सीमाएं और भविष्य की दिशाएं

अपनी ताकत के बावजूद, SAC की सीमाएं हैं। यह बहुत उच्च-आयामी क्रिया स्थानों के साथ संघर्ष कर सकता है, और विरल पुरस्कार या लंबे क्षितिज वाले वातावरण में इसका प्रदर्शन खराब हो सकता है। एल्गोरिदम पूरी तरह से अवलोकनीय स्थिति मानता है, जो आंशिक रूप से अवलोकनीय सेटिंग्स में इसके प्रत्यक्ष अनुप्रयोग को सीमित करता है, हालांकि आवर्तक SAC जैसे विस्तारों का पता लगाया गया है। भविष्य का शोध स्केलेबिलिटी में सुधार, मॉडल-आधारित विचारों को शामिल करने और सुरक्षा बाधाओं के साथ वास्तविक दुनिया की रोबोटिक प्रणालियों तक SAC का विस्तार करने पर केंद्रित है। 2025 तक, SAC सुदृढीकरण सीखने में एक मौलिक एल्गोरिदम बना हुआ है, जो शिक्षा और उद्योग दोनों में व्यापक रूप से उपयोग किया जाता है।

संदर्भ और प्रभाव

मूल SAC पेपर, "सॉफ्ट एक्टर-क्रिटिक: ऑफ-पॉलिसी मैक्सिमम एन्ट्रॉपी डीप रीइन्फोर्समेंट लर्निंग विद ए स्टोकेस्टिक एक्टर," 2018 में 35वें इंटरनेशनल कॉन्फ्रेंस ऑन मशीन लर्निंग (ICML) में प्रस्तुत किया गया था। तब से, इसने हजारों उद्धरण जमा किए हैं, जो अपने युग के सबसे प्रभावशाली सुदृढीकरण सीखने वाले एल्गोरिदम में से एक बन गया है। Stable Baselines3 और RLlib जैसी लाइब्रेरी में इसके ओपन-सोर्स कार्यान्वयन ने क्लाउड-आधारित सिमुलेशन से लेकर क्लाउड रोबोटिक्स अनुसंधान तक विभिन्न डोमेन में इसके अपनाने की सुविधा प्रदान की है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·machine-learning·deep-learning·control-theory
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास