प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले एक तकनीक है जिसका उपयोग रिइन्फोर्समेंट लर्निंग में किया जाता है, जो पिछले अनुभवों से सीखने वाले एजेंटों के प्रशिक्षण की दक्षता और स्थिरता में सुधार करती है। मानक एक्सपीरियंस रिप्ले में, एक एजेंट पिछले ट्रांज़िशन (अवस्था, क्रिया, पुरस्कार, अगली अवस्था) को एक मेमोरी बफर में संग्रहीत करता है और प्रशिक्षण के दौरान उन्हें यादृच्छिक रूप से समान रूप से नमूना करता है। प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले इसके बजाय इन ट्रांज़िशनों को उनके "महत्व" के अनुपात में नमूना करता है, जिसे आमतौर पर टेम्पोरल-डिफरेंस (TD) त्रुटि के परिमाण द्वारा मापा जाता है, जो इंगित करता है कि एक ट्रांज़िशन कितना आश्चर्यजनक या सूचनाप्रद है। बड़ी TD त्रुटियों वाले ट्रांज़िशनों पर ध्यान केंद्रित करके, एजेंट दुर्लभ या महत्वपूर्ण अनुभवों से अधिक सीखता है, जिससे अभिसरण में तेजी आती है और अक्सर बेहतर अंतिम प्रदर्शन होता है।
इस विधि को 2015 में टॉम शॉल, जॉन क्वान, आयोनिस एंटोनोग्लू और डेविड सिल्वर द्वारा गूगल डीपमाइंड (तब डीपमाइंड टेक्नोलॉजीज) में पेश किया गया था। इसे "प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले" नामक पेपर में प्रस्तुत किया गया था और यह कई गहन रिइन्फोर्समेंट लर्निंग एल्गोरिदम में एक मानक घटक बन गया, जिसमें मूल डीप क्यू-नेटवर्क (DQN) में सुधार शामिल हैं। मुख्य विचार समान नमूनाकरण की एक सीमा को संबोधित करता है: रिप्ले बफर में कई ट्रांज़िशन अनावश्यक होते हैं या उनमें छोटी त्रुटियाँ होती हैं, और उन्हें समान रूप से नमूना करना कम्प्यूटेशनल संसाधनों को बर्बाद करता है। प्राथमिकता देकर, एल्गोरिदम उन ट्रांज़िशनों पर अधिक अपडेट आवंटित करता है जिनसे सबसे बड़ा सीखने का संकेत मिलने की संभावना होती है।
तंत्र
एल्गोरिदम प्रत्येक ट्रांज़िशन को एक प्राथमिकता प्रदान करता है, जिसे आमतौर पर पूर्ण TD त्रुटि के रूप में परिभाषित किया जाता है, जिसे |δ| के रूप में दर्शाया जाता है, जहाँ Q-लर्निंग के लिए δ = r + γ·max_a' Q(s', a') - Q(s, a) है। उच्च |δ| का अर्थ है कि वर्तमान मूल्य अनुमान लक्ष्य से दूर है, जो इंगित करता है कि ट्रांज़िशन अधूरा सीखा गया है या नया है। हमेशा समान कुछ उच्च-त्रुटि ट्रांज़िशनों को नमूना करने से बचने के लिए, प्राथमिकताओं को एक स्टोकेस्टिक नियम का उपयोग करके नमूनाकरण संभावनाओं में परिवर्तित किया जाता है: P(i) = p_i^α / Σ_k p_k^α, जहाँ p_i प्राथमिकता है (अक्सर |δ| + ε, जिसमें ε एक छोटा स्थिरांक है जो गैर-शून्य संभावना सुनिश्चित करता है) और α प्राथमिकता की डिग्री को नियंत्रित करता है (α=0 समान नमूनाकरण देता है, α=1 पूर्ण प्राथमिकता देता है)।
क्योंकि प्राथमिकता अपेक्षित अपडेट में पूर्वाग्रह पेश करती है, विधि महत्व नमूनाकरण भार का उपयोग करके इसे ठीक करती है: w_i = (1/N · 1/P(i))^β, जहाँ N बफर आकार है और β एक हाइपरपैरामीटर है जो प्रशिक्षण के दौरान कम मान (जैसे, 0.4) से 1 तक एनील करता है। ये भार प्रत्येक नमूना किए गए ट्रांज़िशन के लिए हानि फ़ंक्शन में गुणा किए जाते हैं, यह सुनिश्चित करते हुए कि अपेक्षित अपडेट निष्पक्ष रहता है। व्यवहार में, प्राथमिकताएँ एक डेटा संरचना में संग्रहीत की जाती हैं जिसे सम ट्री कहा जाता है (एक बाइनरी ट्री जहाँ प्रत्येक नोड अपने बच्चों की प्राथमिकताओं का योग संग्रहीत करता है), जो O(log N) समय में कुशल नमूनाकरण और अद्यतन की अनुमति देता है।
वेरिएंट और कार्यान्वयन
दो सामान्य वेरिएंट मौजूद हैं: आनुपातिक प्राथमिकता और रैंक-आधारित प्राथमिकता। आनुपातिक प्राथमिकता में, प्राथमिकता सीधे |δ| + ε के अनुपात में होती है, जैसा कि ऊपर वर्णित है। रैंक-आधारित प्राथमिकता में, ट्रांज़िशनों को |δ| द्वारा क्रमबद्ध किया जाता है, और प्राथमिकता को 1/रैंक(i) के रूप में परिभाषित किया जाता है, जहाँ रैंक(i) क्रमबद्ध सूची में स्थिति है। रैंक-आधारित प्राथमिकता आउटलायरों के प्रति अधिक मजबूत होती है और सटीक त्रुटि परिमाणों को संग्रहीत करने की आवश्यकता नहीं होती है, लेकिन इसे क्रमबद्ध क्रम बनाए रखने की आवश्यकता होती है, जो कम्प्यूटेशनल रूप से अधिक महंगा हो सकता है। दोनों वेरिएंट व्यवहार में उपयोग किए जाते हैं, जिसमें सरलता के कारण आनुपातिक अधिक सामान्य है।
प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले को कई रिइन्फोर्समेंट लर्निंग फ्रेमवर्क और एल्गोरिदम में एकीकृत किया गया है। उदाहरण के लिए, यह रेनबो DQN एजेंट में एक प्रमुख घटक था, जिसने DQN में छह सुधारों को संयोजित किया, जिसमें प्रायोरिटाइज़्ड रिप्ले शामिल था। इसका उपयोग अभिनेता-आलोचक विधियों जैसे SAC (सॉफ्ट एक्टर-क्रिटिक) और TD3 (ट्विन डिलेड DDPG) में भी किया जाता है, जहाँ रिप्ले बफर ट्रांज़िशनों को संग्रहीत करता है और प्राथमिकता समान रूप से लागू की जाती है। OpenAI बेसलाइन्स और स्टेबल बेसलाइन्स3 जैसी लाइब्रेरीज़ कार्यान्वयन प्रदान करती हैं, जिससे यह अनुसंधान और अनुप्रयोगों के लिए सुलभ हो जाता है।
लाभ और सीमाएँ
प्राथमिक लाभ बेहतर नमूना दक्षता है: एजेंट पर्यावरण के साथ कम इंटरैक्शन से सीखते हैं क्योंकि वे सबसे सूचनाप्रद अनुभवों पर ध्यान केंद्रित करते हैं। यह विशेष रूप से उन डोमेन में मूल्यवान है जहाँ पर्यावरण इंटरैक्शन महंगा है, जैसे रोबोटिक्स या वास्तविक-विश्व नियंत्रण। इसके अतिरिक्त, प्राथमिकता अपडेट के विचरण को कम करके प्रशिक्षण को स्थिर कर सकती है, क्योंकि उच्च-त्रुटि ट्रांज़िशनों को अधिक बार दोबारा देखा जाता है, जिससे सीखने का संकेत सुचारू होता है।
हालाँकि, सीमाएँ हैं। विधि अतिरिक्त हाइपरपैरामीटर (α, β, और ε स्थिरांक) पेश करती है जिन्हें ट्यूनिंग की आवश्यकता होती है। यदि α बहुत अधिक है, तो एजेंट ट्रांज़िशनों के एक छोटे सेट पर ओवरफिट हो सकता है, जिससे अस्थिरता हो सकती है। महत्व नमूनाकरण सुधार महत्वपूर्ण है; इसके बिना, पूर्वाग्रह विचलन का कारण बन सकता है। साथ ही, TD त्रुटि महत्व के लिए एक प्रॉक्सी है, लेकिन यह शोरगुल वाली हो सकती है, विशेष रूप से प्रशिक्षण की शुरुआत में, और हमेशा उन ट्रांज़िशनों को पकड़ नहीं सकती है जो दीर्घकालिक क्रेडिट असाइनमेंट के लिए महत्वपूर्ण हैं। कुछ एक्सटेंशन वैकल्पिक प्राथमिकता मापों का उपयोग करते हैं, जैसे हानि ग्रेडिएंट का परिमाण या मूल्य अनुमान की अनिश्चितता, लेकिन ये कम सामान्य हैं।
अनुप्रयोग और प्रभाव
प्रायोरिटाइज़्ड एक्सपीरियंस रिप्ले को रिइन्फोर्समेंट लर्निंग कार्यों की एक विस्तृत श्रृंखला में लागू किया गया है, एटारी गेम खेलने से लेकर रोबोटिक हेरफेर और स्वायत्त ड्राइविंग तक। मूल पेपर में, लेखकों ने प्रदर्शित किया कि प्रायोरिटाइज़्ड रिप्ले वाले DQN ने कई एटारी 2600 गेमों में समान रिप्ले की तुलना में उच्च स्कोर प्राप्त किए, तेजी से सीखने के साथ। इसका उपयोग मल्टी-एजेंट सेटिंग्स में और अन्य तकनीकों जैसे करिकुलम लर्निंग और डेटा ऑगमेंटेशन के संयोजन में भी किया गया है।
इस तकनीक ने एक्सपीरियंस रिप्ले पर बाद के शोध को प्रभावित किया, जिससे लक्ष्य-आधारित कार्यों के लिए हिंडसाइट एक्सपीरियंस रिप्ले (HER) और वितरणात्मक प्रायोरिटाइज़्ड रिप्ले जैसे विचार सामने आए। यह रिइन्फोर्समेंट लर्निंग चिकित्सक के टूलकिट में एक मानक उपकरण बना हुआ है, और इसके सिद्धांतों को अन्य क्षेत्रों जैसे लार्ज लैंग्वेज मॉडल प्रशिक्षण में अनुकूलित किया गया है, जहाँ उच्च-हानि उदाहरणों की प्राथमिकता फाइन-ट्यूनिंग दक्षता में सुधार कर सकती है, हालाँकि संबंध कम प्रत्यक्ष है।