R2D2 (Recurrent Replay Distributed Deep DQN) एक गहन सुदृढीकरण सीखने एल्गोरिदम है जिसे DeepMind के शोधकर्ताओं द्वारा विकसित किया गया था। इसे 2019 के एक पेपर, "Recurrent Experience Replay in Distributed Reinforcement Learning," में पेश किया गया था, और यह आवर्तक तंत्रिका नेटवर्क को गहन Q-नेटवर्क (DQN) ढांचे के भीतर लागू करने में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है। R2D2 को आंशिक अवलोकन और दीर्घकालिक निर्भरताओं के साथ सुदृढीकरण सीखने में चुनौतियों का समाधान करने के लिए डिज़ाइन किया गया है, और प्रकाशन के समय 3D और 2D Atari खेलों के एक सूट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
R2D2 वितरित सुदृढीकरण सीखने में पिछले काम पर आधारित है, विशेष रूप से Ape-X DQN वास्तुकला, जो विविध अनुभव एकत्र करने के लिए एक साझा रीप्ले बफर और कई अभिनेताओं का उपयोग करती है। इसकी प्रमुख नवीनता आवर्तक तंत्रिका नेटवर्क, विशेष रूप से लंबी अल्पकालिक स्मृति (LSTM) इकाइयों, को अभिनय और सीखने दोनों प्रक्रियाओं में शामिल करना है। यह एजेंट को एक आंतरिक स्थिति बनाए रखने की अनुमति देता है जो अस्थायी संदर्भ को पकड़ सकती है, जो उन वातावरणों के लिए महत्वपूर्ण है जहां इतिहास के बिना अवलोकन अस्पष्ट होते हैं।
मुख्य वास्तुकला और आवर्तक अनुभव रीप्ले
R2D2 का केंद्रीय घटक एक आवर्तक रीप्ले बफर का उपयोग है, जो व्यक्तिगत संक्रमणों के बजाय अनुभव के अनुक्रमों को संग्रहीत करता है। मानक DQN में, अनुभव रीप्ले आमतौर पर एकल (स्थिति, क्रिया, पुरस्कार, अगली स्थिति) टुपल्स संग्रहीत करता है। R2D2 लंबाई 80 के छोटे अनुक्रमों को संग्रहीत करता है, और प्रत्येक संग्रहीत अनुक्रम में रिकॉर्डिंग के समय LSTM की प्रारंभिक आंतरिक स्थिति शामिल होती है। यह डिज़ाइन सुनिश्चित करता है कि जब नेटवर्क रीप्ले किए गए डेटा से सीखता है, तो यह अपनी छिपी स्थिति को अस्थायी संदर्भ से मेल खाने के लिए सही ढंग से प्रारंभ कर सकता है, जिससे छोटे या अव्यवस्थित अनुक्रमों पर प्रशिक्षण से उत्पन्न होने वाली समस्याओं से बचा जा सकता है।
एल्गोरिदम एक प्राथमिकता वाले रीप्ले तंत्र का उपयोग करता है, जहां अनुक्रमों को उनकी अस्थायी-अंतर त्रुटि के आधार पर नमूना किया जाता है, जैसा कि प्राथमिकता वाले अनुभव रीप्ले में पेश किया गया था। आवर्तक छिपी स्थितियों की स्टोकेस्टिकता को संभालने के लिए, R2D2 "बर्न-इन" नामक एक तकनीक का उपयोग करता है, जहां अनुक्रम का एक हिस्सा (आमतौर पर 40 समय चरण) केवल शेष चरणों पर वास्तविक प्रशिक्षण हानि की गणना करने से पहले छिपी स्थिति को गर्म करने के लिए उपयोग किया जाता है। यह प्रशिक्षण स्थिरता और प्रदर्शन में सुधार करता है।
प्रशिक्षण और वितरित सेटअप
R2D2 को वितरित तरीके से प्रशिक्षित किया जाता है, जो Ape-X की वास्तुकला से लिया गया है। यह 256 समानांतर अभिनेताओं का उपयोग करता है जो पर्यावरण की अलग-अलग प्रतियों के साथ बातचीत करते हैं, प्रत्येक अपनी स्वयं की LSTM आवर्तक स्थिति से सुसज्जित होता है। ये अभिनेता अनुभव उत्पन्न करते हैं, जो एक केंद्रीय रीप्ले बफर को भेजा जाता है। एक अलग शिक्षार्थी प्रक्रिया इस बफर से बैचों का नमूना लेती है और नेटवर्क वजन को अद्यतन करती है। यह अलगाव उच्च थ्रूपुट और विविध डेटा संग्रह की अनुमति देता है, जो आवर्तक नेटवर्क को प्रभावी ढंग से प्रशिक्षित करने के लिए आवश्यक है।
मूल प्रयोगों में, R2D2 को आर्केड लर्निंग एनवायरनमेंट से 57 Atari 2600 खेलों पर प्रशिक्षित किया गया था, साथ ही DeepMind Lab, एक 3D भूलभुलैया-नेविगेशन वातावरण पर भी। एल्गोरिदम ने पिछले तरीकों पर महत्वपूर्ण नमूना दक्षता लाभ प्रदर्शित किया, और अधिकांश खेलों पर मानव-स्तरीय प्रदर्शन या बेहतर तक पहुंच गया। विशेष रूप से, R2D2 ने लगभग सभी खेलों में पहले के Ape-X DQN से बेहतर प्रदर्शन किया और कई में नए रिकॉर्ड स्थापित किए, जिनमें Montezuma's Revenge शामिल है, एक खेल जो अपनी कठिन अन्वेषण आवश्यकताओं के लिए जाना जाता है।
अन्य तरीकों के साथ तुलना
R2D2 2010 के दशक के अंत में आवर्तक वास्तुकला को वितरित प्रशिक्षण के साथ संयोजित करने की व्यापक प्रवृत्ति का हिस्सा था। यह अन्य एल्गोरिदम के साथ समानताएं साझा करता था, जैसे कि आवर्तक रीप्ले वितरित DQN के पूर्ववर्ती, N-चरण डबल DQN, और बाद के R2D3 (प्राथमिकता वाले अनुभव रीप्ले और 3D वातावरण के साथ आवर्तक रीप्ले वितरित DQN), जिसने अन्वेषण को और बेहतर बनाने के लिए मानव प्रदर्शनों को शामिल किया। इनमें से, R2D2 को अक्सर एक मौलिक कार्य के रूप में उद्धृत किया जाता है जिसने बाद के डिज़ाइनों को प्रभावित किया, जिसमें Rainbow DQN एक्सटेंशन और MuZero जैसे अधिक उन्नत एजेंटों का विकास शामिल है।
एल्गोरिदम की सफलता ने सुदृढीकरण सीखने में स्मृति के महत्व को उजागर किया, विशेष रूप से आंशिक रूप से अवलोकन योग्य कार्यों के लिए। फीडफॉरवर्ड नेटवर्क के विपरीत, जो केवल वर्तमान फ्रेम देखते हैं, R2D2 की आवर्तक परतें अस्थायी पैटर्न से छिपी गतिशीलता, जैसे वस्तु वेग या ऑफ-स्क्रीन उत्तेजनाओं की उपस्थिति, का अनुमान लगा सकती हैं।
कार्यान्वयन और प्रभाव
R2D2 पेपर, जिसे स्टीवन कैप्टुरोव्स्की, जॉर्ज ओस्ट्रोव्स्की, जॉन क्वान, रेमी मुनोस और विल डैबनी द्वारा लिखा गया था, 2019 में इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन (ICLR) में प्रस्तुत किया गया था। कोडबेस शुरू में ओपन-सोर्स नहीं था, लेकिन विचारों को शैक्षणिक और औद्योगिक सेटिंग्स में व्यापक रूप से अपनाया गया। बाद में, आवर्तक अनुभव रीप्ले की अवधारणा गहन सुदृढीकरण सीखने में एक मानक उपकरण बन गई, जो विभिन्न उत्तराधिकारी एल्गोरिदम और ढांचे में दिखाई दी।
R2D2 का प्रभाव सुदृढीकरण सीखने अनुसंधान के व्यापक क्षेत्र तक भी फैला हुआ है, जहां इसे आमतौर पर एक आधार रेखा के रूप में उपयोग किया जाता है। वितरित अभिनेताओं, प्राथमिकता वाले अनुक्रमों और आवर्तक गतिशीलता का इसका संयोजन कई आधुनिक एजेंटों में दोहराया गया है, जिनमें रोबोटिक्स और स्वायत्त प्रणालियों के लिए शामिल हैं। एल्गोरिदम के डिज़ाइन सिद्धांतों ने ट्रांसफार्मर-आधारित स्मृति मॉडल पर काम को भी सूचित किया है, हालांकि LSTM जैसे आवर्तक दृष्टिकोण कई वास्तविक समय अनुप्रयोगों के लिए कम्प्यूटेशनल रूप से कुशल बने हुए हैं।
सीमाएं और भविष्य की दिशाएं
अपनी ताकत के बावजूद, R2D2 में अंतर्निहित सीमाएं हैं। LSTM इकाइयों का उपयोग अतिरिक्त पैरामीटर और प्रशिक्षण जटिलता पेश करता है, जो सरल कार्यों पर फीडफॉरवर्ड विकल्पों की तुलना में सीखने को धीमा कर सकता है। वितरित सेटअप भी पर्याप्त कम्प्यूटेशनल संसाधनों की मांग करता है, जिसने ऐतिहासिक रूप से इसके अनुप्रयोग को अच्छी तरह से वित्त पोषित अनुसंधान वातावरण तक सीमित कर दिया। हालांकि, जैसे-जैसे हार्डवेयर क्षमताएं बढ़ी हैं, ये बाधाएं कम प्रतिबंधात्मक हो गई हैं।
बाद के शोध ने मूल्य-आधारित क्रिया चयन, बेहतर अन्वेषण रणनीतियों और जनरेटिव मॉडल के साथ एकीकरण जैसे संशोधनों के साथ R2D2 पर निर्माण किया है। R2D2 की विरासत इसका प्रदर्शन है कि स्मृति और आवर्तकता जटिल वातावरण में मजबूत प्रदर्शन प्राप्त करने के लिए महत्वपूर्ण हैं, एक सिद्धांत जो आधुनिक सुदृढीकरण सीखने की प्रणालियों को खेल खेलने से लेकर बड़े पैमाने पर अनुप्रयोगों में अनुक्रमिक निर्णय लेने तक के क्षेत्रों में आकार देना जारी रखता है।
संक्षेप में, R2D2 गहन सुदृढीकरण सीखने में एक ऐतिहासिक एल्गोरिदम है, जो अपने आवर्तक रीप्ले डिज़ाइन, वितरित प्रशिक्षण दक्षता और मजबूत अनुभवजन्य परिणामों के लिए जाना जाता है। आंशिक अवलोकन को संभालने में इसके योगदान ने इसे क्षेत्र में बाद के काम के लिए एक संदर्भ बिंदु बना दिया है।