एक डीप क्यू-नेटवर्क (DQN) एक सुदृढीकरण सीखने का एल्गोरिदम है जो एजेंटों को बड़े या निरंतर अवस्था स्थानों वाले वातावरण में निर्णय लेने में सक्षम बनाने के लिए Deep learning को क्यू-लर्निंग के साथ एकीकृत करता है। इसे Google DeepMind के शोधकर्ताओं द्वारा नेचर में प्रकाशित 2015 के एक पेपर में पेश किया गया था, जिसमें केवल कच्चे पिक्सेल इनपुट और गेम स्कोर का उपयोग करके 49 एटारी 2600 गेम्स के एक सेट पर मानव-स्तरीय प्रदर्शन का प्रदर्शन किया गया था। यह एल्गोरिदम शास्त्रीय क्यू-लर्निंग का विस्तार करता है, जो पारंपरिक रूप से राज्य-क्रिया मूल्यों के सारणीबद्ध प्रतिनिधित्व पर निर्भर करता है, क्यू-फ़ंक्शन का अनुमान लगाने के लिए Neural network का उपयोग करके, जिससे यह समान अवस्थाओं में सामान्यीकरण कर सके और छवियों जैसे इनपुट को संभाल सके।
क्यू-लर्निंग में, क्यू-फ़ंक्शन किसी दिए गए राज्य में एक क्रिया करने के अपेक्षित संचयी इनाम का अनुमान लगाता है, उसके बाद एक इष्टतम नीति का पालन करता है। परिमित मार्कोव निर्णय प्रक्रियाओं के लिए, क्यू-लर्निंग अनंत अन्वेषण और उपयुक्त सीखने की दर को देखते हुए एक इष्टतम नीति में परिवर्तित होने के लिए सिद्ध है। हालाँकि, सारणीबद्ध क्यू-लर्निंग तब अव्यावहारिक हो जाती है जब राज्य स्थान विशाल होता है, जैसे कि दृश्य कार्यों में जहाँ प्रत्येक पिक्सेल कॉन्फ़िगरेशन एक अद्वितीय राज्य का गठन करता है। DQN राज्यों को क्रिया मूल्यों पर मैप करने के लिए एक गहरे तंत्रिका नेटवर्क को प्रशिक्षित करके इसे संबोधित करता है, प्रभावी रूप से राज्य स्थान को एक सीखी हुई सुविधा प्रतिनिधित्व में संपीड़ित करता है।
DQN का मुख्य नवाचार दो स्थिरीकरण तकनीकों में निहित है: अनुभव रीप्ले और एक लक्ष्य नेटवर्क। अनुभव रीप्ले पिछले संक्रमणों (राज्य, क्रिया, इनाम, अगली स्थिति) को एक मेमोरी बफर में संग्रहीत करता है और प्रशिक्षण के दौरान यादृच्छिक रूप से मिनी-बैचों का नमूना लेता है, क्रमिक नमूनों के बीच सहसंबंधों को तोड़ता है और डेटा दक्षता में सुधार करता है। लक्ष्य नेटवर्क मुख्य नेटवर्क की एक आवधिक रूप से अद्यतन प्रति है जिसका उपयोग लक्ष्य क्यू-मानों की गणना करने के लिए किया जाता है, जो एक गतिशील लक्ष्य का पीछा करने के कारण विचलन के जोखिम को कम करता है। जटिल वातावरण में एल्गोरिदम की सफलता के लिए ये तंत्र महत्वपूर्ण थे।
DQN असतत क्रिया स्थानों के लिए डिज़ाइन किया गया है, जहाँ नेटवर्क प्रत्येक संभावित क्रिया के लिए एक क्यू-मान आउटपुट करता है। एजेंट एप्सिलॉन-लालची नीति का उपयोग करके क्रियाओं का चयन करता है, अन्वेषण (यादृच्छिक क्रियाएं) को दोहन (उच्चतम क्यू-मान चुनना) के साथ संतुलित करता है। समय के साथ, एप्सिलॉन क्षय होता है, एजेंट को सीखे गए ज्ञान का दोहन करने की ओर स्थानांतरित करता है। एल्गोरिदम भविष्य के पुरस्कारों को भारित करने वाले डिस्काउंट कारक गामा के साथ, बेलमैन समीकरण के माध्यम से गणना किए गए भविष्यवाणी किए गए क्यू-मानों और लक्ष्य मूल्यों के बीच माध्य वर्ग त्रुटि को कम करके नेटवर्क को अनुकूलित करता है।
ऐतिहासिक संदर्भ और प्रभाव
2015 का DQN पेपर Artificial intelligence में एक मील का पत्थर था, जो दर्शाता है कि एक एकल एल्गोरिदम शुरू से कई एटारी गेम खेलना सीख सकता है, पिछले बेंचमार्क को पार कर सकता है और कुछ खेलों में मानव प्रदर्शन से अधिक हो सकता है। यह कार्य Reinforcement learning और Neural network फ़ंक्शन सन्निकटन में पहले के शोध पर आधारित था, जिसमें दृश्य इनपुट के लिए कन्वोल्यूशनल नेटवर्क का उपयोग शामिल था। DQN की सफलता ने गहन सुदृढीकरण सीखने के अनुसंधान की एक लहर को प्रेरित किया, जिससे डबल DQN, ड्यूएलिंग DQN, और प्राथमिकता वाले अनुभव रीप्ले जैसे वेरिएंट सामने आए, जिनमें से प्रत्येक अति-अनुमान पूर्वाग्रह या नमूना दक्षता जैसी विशिष्ट सीमाओं को संबोधित करता है।
एल्गोरिथमिक विवरण
DQN अद्यतन नियम क्यू-लर्निंग बेलमैन समीकरण का पालन करता है। प्रत्येक समय चरण पर, एजेंट राज्य \(S_t\) का निरीक्षण करता है, क्रिया \(A_t\) का चयन करता है, इनाम \(R_{t+1}\) प्राप्त करता है, और \(S_{t+1}\) पर संक्रमण करता है। लक्ष्य मान की गणना \(R_{t+1} + \gamma \max_a Q(S_{t+1}, a; \theta^-)\) के रूप में की जाती है, जहाँ \(\theta^-\) लक्ष्य नेटवर्क पैरामीटर हैं। मुख्य नेटवर्क पैरामीटर \(\theta\) को हानि \(\mathbb{E}[(\text{target} - Q(S_t, A_t; \theta))^2]\) पर ग्रेडिएंट डिसेंट के माध्यम से अद्यतन किया जाता है। डिस्काउंट कारक \(\gamma\) आमतौर पर 0.9 और 0.99 के बीच सेट किया जाता है, जो दीर्घकालिक लाभों पर विचार करते हुए अल्पकालिक पुरस्कारों पर जोर देता है।
अनुप्रयोग और सीमाएँ
DQN को खेलों से परे भी लागू किया गया है, जिसमें रोबोटिक्स नियंत्रण, संसाधन प्रबंधन और स्वायत्त नेविगेशन शामिल हैं। हालाँकि, असतत क्रियाओं पर इसकी निर्भरता निरंतर नियंत्रण कार्यों में इसके उपयोग को सीमित करती है, जहाँ DDPG या PPO जैसे एल्गोरिदम को प्राथमिकता दी जाती है। इसके अतिरिक्त, DQN नमूना-अक्षम हो सकता है और हाइपरपैरामीटर ट्यूनिंग के प्रति संवेदनशील हो सकता है, जिसके लिए सीखने की दर, रीप्ले बफर आकार और नेटवर्क आर्किटेक्चर के सावधानीपूर्वक समायोजन की आवश्यकता होती है। 2020 के दशक के मध्य तक, अधिक उन्नत तरीकों ने अनुसंधान में DQN को काफी हद तक बदल दिया है, लेकिन यह गहन सुदृढीकरण सीखने को समझने के लिए एक मौलिक शैक्षिक उपकरण और बेंचमार्क बना हुआ है।
विरासत और आगे के विकास
DQN द्वारा पेश किए गए सिद्धांत - अनुभव रीप्ले और लक्ष्य नेटवर्क - कई बाद के सुदृढीकरण सीखने के एल्गोरिदम में मानक घटक बन गए हैं। इसकी सफलता ने गहन शिक्षा को सुदृढीकरण सीखने के साथ संयोजित करने की व्यवहार्यता का प्रदर्शन किया, जिसने BAIR (Berkeley AI Research) और Stanford AI Lab जैसे संस्थानों में काम को प्रभावित किया। एल्गोरिदम ने स्थिर प्रशिक्षण गतिशीलता के महत्व पर भी प्रकाश डाला, एक चुनौती जो क्षेत्र में अनुसंधान को आगे बढ़ाती रहती है। DQN की विरासत आधुनिक AI प्रणालियों में बनी हुई है, विशेष रूप से उन क्षेत्रों में जहाँ एजेंटों को उच्च-आयामी संवेदी इनपुट से सीखना चाहिए और असतत निर्णय लेने चाहिए।