असिंक्रोनस एडवांटेज एक्टर-क्रिटिक (A3C)

अंग्रेज़ी से अनुवादित

असिंक्रोनस एडवांटेज एक्टर-क्रिटिक (A3C) एक समानांतर सुदृढीकरण सीखने का एल्गोरिदम है जो एक साझा मॉडल को असिंक्रोनस रूप से अपडेट करके प्रशिक्षण को स्थिर करने के लिए कई कार्यकर्ताओं का उपयोग करता है, जिसे 2016 में DeepMind द्वारा पेश किया गया था।

Asynchronous Advantage Actor-Critic (A3C) एक सुदृढीकरण अधिगम एल्गोरिदम है जो अभिनेता-आलोचक (actor-critic) वास्तुकला को अतुल्यकालिक समानांतर प्रशिक्षण के साथ जोड़ता है। इसे 2016 में गूगल डीपमाइंड के शोधकर्ताओं द्वारा गहरे तंत्रिका नेटवर्क नीतियों के प्रशिक्षण को स्थिर और तेज करने के तरीके के रूप में पेश किया गया था। मूल विचार कई स्वतंत्र एजेंटों, या कार्यकर्ताओं (workers), को समानांतर वातावरण में चलाना है, जिनमें से प्रत्येक अनुभव एकत्र करता है और ग्रेडिएंट की गणना करता है, जिन्हें फिर एक साझा मॉडल पर अतुल्यकालिक रूप से लागू किया जाता है। यह समानांतरता प्रशिक्षण डेटा को असंबद्ध (decorrelate) करती है, जिससे अनुभव पुनर्प्ले (experience replay) की आवश्यकता कम होती है और एकल मल्टी-कोर CPU पर तेज़ और अधिक मजबूत अधिगम सक्षम होता है।

यह एल्गोरिदम मशीन अधिगम विधियों के व्यापक परिवार से संबंधित है जो नीतियों और मूल्य फलनों का अनुमान लगाने के लिए तंत्रिका नेटवर्क का उपयोग करते हैं। A3C एक महत्वपूर्ण प्रगति थी क्योंकि इसने प्रदर्शित किया कि सरल अतुल्यकालिक अद्यतन अधिक जटिल तुल्यकालिक विधियों, जैसे डीप क्यू-नेटवर्क (DQN), के प्रदर्शन को चुनौतीपूर्ण कार्यों जैसे Atari 2600 गेम्स पर मिला सकते हैं या उससे अधिक कर सकते हैं। इसके डिज़ाइन ने बाद के एल्गोरिदम को प्रभावित किया, जिनमें A2C (तुल्यकालिक प्रकार) और बाद के अभिनेता-आलोचक विधियाँ जैसे PPO शामिल हैं।

Architecture and Components

A3C अभिनेता-आलोचक ढांचे पर आधारित है, जिसमें दो मुख्य घटक होते हैं: एक अभिनेता (actor) और एक आलोचक (critic)। अभिनेता एक नीति नेटवर्क है जो किसी अवस्था (state) को देखते हुए क्रियाओं पर संभाव्यता वितरण आउटपुट करता है, जबकि आलोचक एक मूल्य नेटवर्क है जो उस अवस्था से अपेक्षित प्रतिफल (expected return) का अनुमान लगाता है। A3C में, दोनों नेटवर्क सामान्य परतों का एक सेट साझा करते हैं, आमतौर पर छवि इनपुट के लिए कन्वोल्यूशनल परतें, जिनमें नीति और मूल्य के लिए अलग-अलग आउटपुट हेड होते हैं।

एल्गोरिदम लाभ फलन (advantage function) का उपयोग करता है, जो मापता है कि किसी अवस्था में औसत क्रिया की तुलना में एक क्रिया कितनी बेहतर है। लाभ की गणना छूटे हुए प्रतिफल (discounted return) और अनुमानित मूल्य के बीच अंतर के रूप में की जाती है, अक्सर विचरण को कम करने के लिए सामान्यीकृत लाभ अनुमान (Generalized Advantage Estimation, GAE) नामक तकनीक का उपयोग करके। अभिनेता को सकारात्मक लाभ वाली क्रियाओं की संभावना बढ़ाने के लिए अद्यतन किया जाता है, जबकि आलोचक को उसकी भविष्यवाणियों और वास्तविक प्रतिफलों के बीच माध्य वर्ग त्रुटि को कम करने के लिए अद्यतन किया जाता है।

Asynchronous Training Mechanism

A3C में, कई कार्यकर्ता थ्रेड समवर्ती रूप से चलते हैं, प्रत्येक के पास पर्यावरण की अपनी प्रति और नेटवर्क मापदंडों की अपनी स्थानीय प्रति होती है। प्रत्येक कार्यकर्ता अपने पर्यावरण के साथ निश्चित संख्या में चरणों के लिए बातचीत करता है, आमतौर पर 20 से 40, ग्रेडिएंट जमा करते हुए। इस रोलआउट के बाद, कार्यकर्ता ग्रेडिएंट की गणना करता है और उन्हें एक वैश्विक साझा मॉडल पर भेजता है, जहाँ उन्हें एक साझा अनुकूलक, आमतौर पर RMSProp या Adam, का उपयोग करके अतुल्यकालिक रूप से लागू किया जाता है। फिर कार्यकर्ता अद्यतन वैश्विक मापदंडों को खींचता है और अपना अगला रोलआउट जारी रखता है।

यह अतुल्यकालिक डिज़ाइन कई लाभ प्रदान करता है। पहला, यह लगातार प्रशिक्षण नमूनों के बीच सहसंबंध को तोड़ता है क्योंकि विभिन्न कार्यकर्ता एक साथ अवस्था स्थान के विभिन्न हिस्सों की खोज करते हैं। दूसरा, यह एक बड़े अनुभव पुनर्प्ले बफर की आवश्यकता को समाप्त करता है, जो DQN में प्रशिक्षण को स्थिर करने के लिए आवश्यक था। तीसरा, यह एल्गोरिदम को CPU कोर की संख्या के साथ रैखिक रूप से स्केल करने की अनुमति देता है, जिससे यह GPU जैसे विशेष त्वरक की आवश्यकता के बिना मानक हार्डवेयर पर कुशल बनता है।

Historical Context and Impact

A3C का विकास गहरे सुदृढीकरण अधिगम एजेंटों के प्रशिक्षण की चुनौतियों से प्रेरित था, विशेष रूप से सहसंबद्ध डेटा के कारण अस्थिरता और तुल्यकालिक विधियों की उच्च कम्प्यूटेशनल लागत। "Asynchronous Methods for Deep Reinforcement Learning" शीर्षक वाला पेपर 2016 में वोलोडिमिर मनिह, एड्रिया पुइगडोमेनेच बादिया, मेहदी मिर्ज़ा, एलेक्स ग्रेव्स, टिमोथी लिलिक्रैप, टिम हार्ले, डेविड सिल्वर और कोरय कावुकुकुओग्लू द्वारा प्रकाशित किया गया था। इसमें A3C को अन्य अतुल्यकालिक प्रकारों के साथ प्रस्तुत किया गया, जिनमें अतुल्यकालिक एक-चरण Q-अधिगम और अतुल्यकालिक n-चरण Q-अधिगम शामिल हैं।

A3C ने Atari 2600 बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए, कई गेम्स पर DQN से बेहतर प्रदर्शन किया जबकि काफी कम कम्प्यूटेशनल संसाधनों का उपयोग किया। इसने MuJoCo भौतिकी सिम्युलेटर में निरंतर नियंत्रण कार्यों पर भी मजबूत प्रदर्शन दिखाया। एल्गोरिदम की सरलता और प्रभावशीलता ने इसे अनुसंधान और अनुप्रयोगों के लिए एक लोकप्रिय विकल्प बनाया, और इसे सुदृढीकरण अधिगम समुदाय में व्यापक रूप से अपनाया गया।

A3C की तुलना अक्सर इसके तुल्यकालिक समकक्ष, A2C (Advantage Actor-Critic), से की जाती है, जो समान वास्तुकला का उपयोग करता है लेकिन वैश्विक मॉडल को तुल्यकालिक तरीके से अद्यतन करता है, ग्रेडिएंट लागू करने से पहले सभी कार्यकर्ताओं के अपने रोलआउट पूरा करने की प्रतीक्षा करता है। A2C लागू करने में सरल है और कुछ सेटिंग्स में अधिक स्थिर हो सकता है, लेकिन A3C के अतुल्यकालिक अद्यतन बेहतर अन्वेषण और तेज़ दीवार-घड़ी प्रशिक्षण समय प्रदान कर सकते हैं।

एक अन्य संबंधित विधि प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) है, जिसे 2017 में ओपनएआई द्वारा पेश किया गया था, जो अभिनेता-आलोचक ढांचे पर आधारित है लेकिन नीति अद्यतनों को सीमित करने के लिए एक क्लिप्ड सरोगेट उद्देश्य का उपयोग करता है। PPO को अक्सर इसकी मजबूती और ट्यूनिंग में आसानी के कारण व्यवहार में पसंद किया जाता है, लेकिन A3C ऐतिहासिक रूप से एक मौलिक एल्गोरिदम के रूप में महत्वपूर्ण बना हुआ है जिसने गहरे सुदृढीकरण अधिगम में समानांतरता की शक्ति का प्रदर्शन किया।

Legacy and Modern Relevance

जबकि A3C अब अधिकांश बेंचमार्क में अत्याधुनिक नहीं है, इसके सिद्धांतों ने कई आधुनिक एल्गोरिदम को प्रभावित किया है। प्रशिक्षण को स्थिर करने के लिए कई समानांतर कार्यकर्ताओं का उपयोग करने का विचार अब वितरित सुदृढीकरण अधिगम प्रणालियों, जैसे IMPALA (Importance Weighted Actor-Learner Architecture) और Ape-X, में मानक है। अभिनेता-आलोचक वास्तुकला स्वयं सुदृढीकरण अधिगम की आधारशिला बनी हुई है, जिसका उपयोग रोबोटिक्स से लेकर गेम खेलने तक के अनुप्रयोगों में किया जाता है।

A3C ने एल्गोरिदमिक सरलता और कम्प्यूटेशनल दक्षता के महत्व को उजागर करके कृत्रिम बुद्धिमत्ता के व्यापक क्षेत्र में भी योगदान दिया। CPU-केवल हार्डवेयर पर इसकी सफलता ने गहरे सुदृढीकरण अधिगम को बड़े GPU क्लस्टरों तक पहुँच के बिना शोधकर्ताओं और चिकित्सकों के लिए अधिक सुलभ बना दिया। 2020 के दशक के मध्य तक, A3C मुख्य रूप से एक शैक्षणिक उदाहरण और बेसलाइन के रूप में अध्ययन किया जाता है, लेकिन स्केलेबल सुदृढीकरण अधिगम एल्गोरिदम के डिज़ाइन पर इसका प्रभाव स्थायी है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·deep-learning·algorithm·google-deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास