प्राथमिकता अनुभव पुनर्प्ले

अंग्रेज़ी से अनुवादित

प्राथमिकता अनुभव पुनर्प्ले एक गहन सुदृढीकरण सीखने की तकनीक है जो पिछले संक्रमणों को उनके महत्व के आधार पर नमूना करती है, जिसे अस्थायी-अंतर त्रुटि द्वारा मापा जाता है, ताकि समान नमूने की तुलना में सीखने की दक्षता और स्थिरता में सुधार हो सके।

प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले एक तकनीक है जिसका उपयोग रिइन्फोर्समेंट लर्निंग में किया जाता है, जो पिछले अनुभवों से सीखने वाले एजेंटों के प्रशिक्षण की दक्षता और स्थिरता में सुधार करती है। मानक एक्सपीरियंस रिप्ले में, एक एजेंट पिछले ट्रांज़िशन (अवस्था, क्रिया, पुरस्कार, अगली अवस्था) को एक मेमोरी बफर में संग्रहीत करता है और प्रशिक्षण के दौरान उन्हें यादृच्छिक रूप से समान रूप से नमूना करता है। प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले इसके बजाय इन ट्रांज़िशनों को उनके "महत्व" के अनुपात में नमूना करता है, जिसे आमतौर पर टेम्पोरल-डिफरेंस (TD) त्रुटि के परिमाण द्वारा मापा जाता है, जो इंगित करता है कि एक ट्रांज़िशन कितना आश्चर्यजनक या सूचनाप्रद है। बड़ी TD त्रुटियों वाले ट्रांज़िशनों पर ध्यान केंद्रित करके, एजेंट दुर्लभ या महत्वपूर्ण अनुभवों से अधिक सीखता है, जिससे अभिसरण में तेजी आती है और अक्सर बेहतर अंतिम प्रदर्शन होता है।

इस विधि को 2015 में टॉम शॉल, जॉन क्वान, आयोनिस एंटोनोग्लू और डेविड सिल्वर द्वारा गूगल डीपमाइंड (तब डीपमाइंड टेक्नोलॉजीज) में पेश किया गया था। इसे "प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले" नामक पेपर में प्रस्तुत किया गया था और यह कई गहन रिइन्फोर्समेंट लर्निंग एल्गोरिदम में एक मानक घटक बन गया, जिसमें मूल डीप क्यू-नेटवर्क (DQN) में सुधार शामिल हैं। मुख्य विचार समान नमूनाकरण की एक सीमा को संबोधित करता है: रिप्ले बफर में कई ट्रांज़िशन अनावश्यक होते हैं या उनमें छोटी त्रुटियाँ होती हैं, और उन्हें समान रूप से नमूना करना कम्प्यूटेशनल संसाधनों को बर्बाद करता है। प्राथमिकता देकर, एल्गोरिदम उन ट्रांज़िशनों पर अधिक अपडेट आवंटित करता है जिनसे सबसे बड़ा सीखने का संकेत मिलने की संभावना होती है।

तंत्र

एल्गोरिदम प्रत्येक ट्रांज़िशन को एक प्राथमिकता प्रदान करता है, जिसे आमतौर पर पूर्ण TD त्रुटि के रूप में परिभाषित किया जाता है, जिसे |δ| के रूप में दर्शाया जाता है, जहाँ Q-लर्निंग के लिए δ = r + γ·max_a' Q(s', a') - Q(s, a) है। उच्च |δ| का अर्थ है कि वर्तमान मूल्य अनुमान लक्ष्य से दूर है, जो इंगित करता है कि ट्रांज़िशन अधूरा सीखा गया है या नया है। हमेशा समान कुछ उच्च-त्रुटि ट्रांज़िशनों को नमूना करने से बचने के लिए, प्राथमिकताओं को एक स्टोकेस्टिक नियम का उपयोग करके नमूनाकरण संभावनाओं में परिवर्तित किया जाता है: P(i) = p_i^α / Σ_k p_k^α, जहाँ p_i प्राथमिकता है (अक्सर |δ| + ε, जिसमें ε एक छोटा स्थिरांक है जो गैर-शून्य संभावना सुनिश्चित करता है) और α प्राथमिकता की डिग्री को नियंत्रित करता है (α=0 समान नमूनाकरण देता है, α=1 पूर्ण प्राथमिकता देता है)।

क्योंकि प्राथमिकता अपेक्षित अपडेट में पूर्वाग्रह पेश करती है, विधि महत्व नमूनाकरण भार का उपयोग करके इसे ठीक करती है: w_i = (1/N · 1/P(i))^β, जहाँ N बफर आकार है और β एक हाइपरपैरामीटर है जो प्रशिक्षण के दौरान कम मान (जैसे, 0.4) से 1 तक एनील करता है। ये भार प्रत्येक नमूना किए गए ट्रांज़िशन के लिए हानि फ़ंक्शन में गुणा किए जाते हैं, यह सुनिश्चित करते हुए कि अपेक्षित अपडेट निष्पक्ष रहता है। व्यवहार में, प्राथमिकताएँ एक डेटा संरचना में संग्रहीत की जाती हैं जिसे सम ट्री कहा जाता है (एक बाइनरी ट्री जहाँ प्रत्येक नोड अपने बच्चों की प्राथमिकताओं का योग संग्रहीत करता है), जो O(log N) समय में कुशल नमूनाकरण और अद्यतन की अनुमति देता है।

वेरिएंट और कार्यान्वयन

दो सामान्य वेरिएंट मौजूद हैं: आनुपातिक प्राथमिकता और रैंक-आधारित प्राथमिकता। आनुपातिक प्राथमिकता में, प्राथमिकता सीधे |δ| + ε के अनुपात में होती है, जैसा कि ऊपर वर्णित है। रैंक-आधारित प्राथमिकता में, ट्रांज़िशनों को |δ| द्वारा क्रमबद्ध किया जाता है, और प्राथमिकता को 1/रैंक(i) के रूप में परिभाषित किया जाता है, जहाँ रैंक(i) क्रमबद्ध सूची में स्थिति है। रैंक-आधारित प्राथमिकता आउटलायरों के प्रति अधिक मजबूत होती है और सटीक त्रुटि परिमाणों को संग्रहीत करने की आवश्यकता नहीं होती है, लेकिन इसे क्रमबद्ध क्रम बनाए रखने की आवश्यकता होती है, जो कम्प्यूटेशनल रूप से अधिक महंगा हो सकता है। दोनों वेरिएंट व्यवहार में उपयोग किए जाते हैं, जिसमें सरलता के कारण आनुपातिक अधिक सामान्य है।

प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले को कई रिइन्फोर्समेंट लर्निंग फ्रेमवर्क और एल्गोरिदम में एकीकृत किया गया है। उदाहरण के लिए, यह रेनबो DQN एजेंट में एक प्रमुख घटक था, जिसने DQN में छह सुधारों को संयोजित किया, जिसमें प्रायोरिटाइज़्ड रिप्ले शामिल था। इसका उपयोग अभिनेता-आलोचक विधियों जैसे SAC (सॉफ्ट एक्टर-क्रिटिक) और TD3 (ट्विन डिलेड DDPG) में भी किया जाता है, जहाँ रिप्ले बफर ट्रांज़िशनों को संग्रहीत करता है और प्राथमिकता समान रूप से लागू की जाती है। OpenAI बेसलाइन्स और स्टेबल बेसलाइन्स3 जैसी लाइब्रेरीज़ कार्यान्वयन प्रदान करती हैं, जिससे यह अनुसंधान और अनुप्रयोगों के लिए सुलभ हो जाता है।

लाभ और सीमाएँ

प्राथमिक लाभ बेहतर नमूना दक्षता है: एजेंट पर्यावरण के साथ कम इंटरैक्शन से सीखते हैं क्योंकि वे सबसे सूचनाप्रद अनुभवों पर ध्यान केंद्रित करते हैं। यह विशेष रूप से उन डोमेन में मूल्यवान है जहाँ पर्यावरण इंटरैक्शन महंगा है, जैसे रोबोटिक्स या वास्तविक-विश्व नियंत्रण। इसके अतिरिक्त, प्राथमिकता अपडेट के विचरण को कम करके प्रशिक्षण को स्थिर कर सकती है, क्योंकि उच्च-त्रुटि ट्रांज़िशनों को अधिक बार दोबारा देखा जाता है, जिससे सीखने का संकेत सुचारू होता है।

हालाँकि, सीमाएँ हैं। विधि अतिरिक्त हाइपरपैरामीटर (α, β, और ε स्थिरांक) पेश करती है जिन्हें ट्यूनिंग की आवश्यकता होती है। यदि α बहुत अधिक है, तो एजेंट ट्रांज़िशनों के एक छोटे सेट पर ओवरफिट हो सकता है, जिससे अस्थिरता हो सकती है। महत्व नमूनाकरण सुधार महत्वपूर्ण है; इसके बिना, पूर्वाग्रह विचलन का कारण बन सकता है। साथ ही, TD त्रुटि महत्व के लिए एक प्रॉक्सी है, लेकिन यह शोरगुल वाली हो सकती है, विशेष रूप से प्रशिक्षण की शुरुआत में, और हमेशा उन ट्रांज़िशनों को पकड़ नहीं सकती है जो दीर्घकालिक क्रेडिट असाइनमेंट के लिए महत्वपूर्ण हैं। कुछ एक्सटेंशन वैकल्पिक प्राथमिकता मापों का उपयोग करते हैं, जैसे हानि ग्रेडिएंट का परिमाण या मूल्य अनुमान की अनिश्चितता, लेकिन ये कम सामान्य हैं।

अनुप्रयोग और प्रभाव

प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले को रिइन्फोर्समेंट लर्निंग कार्यों की एक विस्तृत श्रृंखला में लागू किया गया है, एटारी गेम खेलने से लेकर रोबोटिक हेरफेर और स्वायत्त ड्राइविंग तक। मूल पेपर में, लेखकों ने प्रदर्शित किया कि प्रायोरिटाइज़्ड रिप्ले वाले DQN ने कई एटारी 2600 गेमों में समान रिप्ले की तुलना में उच्च स्कोर प्राप्त किए, तेजी से सीखने के साथ। इसका उपयोग मल्टी-एजेंट सेटिंग्स में और अन्य तकनीकों जैसे करिकुलम लर्निंग और डेटा ऑगमेंटेशन के संयोजन में भी किया गया है।

इस तकनीक ने एक्सपीरियंस रिप्ले पर बाद के शोध को प्रभावित किया, जिससे लक्ष्य-आधारित कार्यों के लिए हिंडसाइट एक्सपीरियंस रिप्ले (HER) और वितरणात्मक प्रायोरिटाइज़्ड रिप्ले जैसे विचार सामने आए। यह रिइन्फोर्समेंट लर्निंग चिकित्सक के टूलकिट में एक मानक उपकरण बना हुआ है, और इसके सिद्धांतों को अन्य क्षेत्रों जैसे लार्ज लैंग्वेज मॉडल प्रशिक्षण में अनुकूलित किया गया है, जहाँ उच्च-हानि उदाहरणों की प्राथमिकता फाइन-ट्यूनिंग दक्षता में सुधार कर सकती है, हालाँकि संबंध कम प्रत्यक्ष है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·deep-learning·experience-replay·sample-efficiency
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास