DQN (डीप क्यू-नेटवर्क) एक गहन सुदृढीकरण सीखने का एल्गोरिदम है जिसे डीपमाइंड (अब गूगल डीपमाइंड का हिस्सा) के शोधकर्ताओं द्वारा विकसित किया गया था और पहली बार 2015 में पत्रिका नेचर में प्रस्तुत किया गया था। यह क्लासिक क्यू-लर्निंग एल्गोरिदम को गहन तंत्रिका नेटवर्क के साथ जोड़ता है ताकि क्रिया-मूल्य फ़ंक्शन का अनुमान लगाया जा सके, जिससे एक एजेंट उच्च-आयामी संवेदी इनपुट, जैसे वीडियो गेम के कच्चे पिक्सेल फ्रेम, से सीधे सीख सके। एल्गोरिदम ने कई Atari 2600 गेम्स पर मानव-श्रेष्ठ प्रदर्शन हासिल किया, जो कृत्रिम बुद्धिमत्ता के क्षेत्र में एक ऐतिहासिक परिणाम दर्शाता है।
DQN का मुख्य नवाचार सुदृढीकरण सीखने के लिए तंत्रिका नेटवर्क के प्रशिक्षण को स्थिर करने की इसकी क्षमता में निहित है। पारंपरिक क्यू-लर्निंग फ़ंक्शन अनुमान के साथ अक्सर अनुक्रमिक डेटा में सहसंबंधों और गैर-स्थिर लक्ष्यों के कारण विचलन करता है। DQN इन मुद्दों को दो प्रमुख तंत्रों के माध्यम से संबोधित करता है: अनुभव पुनर्प्ले और एक लक्ष्य नेटवर्क। अनुभव पुनर्प्ले पिछले संक्रमणों को एक मेमोरी बफर में संग्रहीत करता है और मिनी-बैच को यादृच्छिक रूप से समान रूप से नमूना करता है, जिससे अस्थायी सहसंबंध टूट जाते हैं। लक्ष्य नेटवर्क, मुख्य नेटवर्क की एक आवधिक रूप से अद्यतन प्रति, सुसंगत लक्ष्य मान प्रदान करता है, जिससे फीडबैक लूप का जोखिम कम होता है।
आर्किटेक्चर और प्रशिक्षण
DQN कच्चे गेम फ्रेम को संसाधित करने के लिए एक कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN) का उपयोग करता है। इनपुट चार सबसे हाल के ग्रेस्केल फ्रेम का एक स्टैक है, जिसे 84x84 पिक्सेल में आकार दिया गया है। नेटवर्क आर्किटेक्चर में आमतौर पर तीन कन्वोल्यूशनल परतें होती हैं जिसके बाद दो पूरी तरह से जुड़ी परतें होती हैं, जिसमें अंतिम आउटपुट परत में प्रति संभावित क्रिया एक न्यूरॉन होता है। नेटवर्क को भविष्यवाणी किए गए Q-मानों और लक्ष्य मानों के बीच माध्य वर्ग त्रुटि को कम करने के लिए प्रशिक्षित किया जाता है, जिसकी गणना बेलमैन समीकरण का उपयोग करके की जाती है।
प्रशिक्षण एप्सिलॉन-लालची तरीके से आगे बढ़ता है, जहां एजेंट संभावना एप्सिलॉन के साथ पर्यावरण का अन्वेषण करता है और अन्यथा वर्तमान नीति का दोहन करता है। एप्सिलॉन मान समय के साथ घटाया जाता है, 1.0 से शुरू होकर 0.1 तक घटता है। एल्गोरिदम Adam या RMSProp ऑप्टिमाइज़र का उपयोग करता है, जिसमें सीखने की दर 0.00025 होती है। अनुभव पुनर्प्ले बफर दस लाख संक्रमणों तक रखता है, और लक्ष्य नेटवर्क हर 10,000 चरणों में अद्यतन किया जाता है।
Atari गेम्स पर प्रदर्शन
मूल 2015 पेपर में, DQN का मूल्यांकन आर्केड लर्निंग एनवायरनमेंट से 49 Atari 2600 गेम्स पर किया गया था। एजेंट को केवल कच्चा पिक्सेल इनपुट और गेम स्कोर को पुरस्कार के रूप में प्राप्त हुआ, बिना किसी कार्य-विशिष्ट जानकारी के। DQN ने सभी पिछले एल्गोरिदम को पीछे छोड़ दिया और 29 गेम्स पर एक पेशेवर मानव गेम परीक्षक से अधिक स्कोर हासिल किया। Breakout, Enduro, और Pong जैसे गेम्स पर, एजेंट ने ऐसी रणनीतियाँ सीखीं जो मानव खिलाड़ियों को पहले से ज्ञात नहीं थीं, जैसे Breakout में सुरंग के माध्यम से खेलना ताकि ईंटों को अधिक कुशलता से साफ किया जा सके।
विस्तार और प्रभाव
DQN की सफलता ने गहन सुदृढीकरण सीखने में अनुसंधान की एक लहर शुरू की। बाद के विस्तारों में डबल DQN शामिल है, जो अति-अनुमान पूर्वाग्रह को कम करता है; ड्यूएलिंग DQN, जो मूल्य और लाभ धाराओं को अलग करता है; और प्राथमिकता अनुभव पुनर्प्ले, जो महत्वपूर्ण संक्रमणों को अधिक बार नमूना करता है। इन सुधारों ने रेनबो एल्गोरिदम को जन्म दिया, जो इनमें से कई संवर्द्धन को एक ही एजेंट में जोड़ता है। DQN ने A3C और DDPG जैसे अन्य एल्गोरिदम के विकास को भी प्रभावित किया, और इसे गेम्स से परे रोबोटिक्स, स्वायत्त ड्राइविंग, और संसाधन प्रबंधन में लागू किया गया है।
सीमाएँ
अपनी सफलताओं के बावजूद, DQN में उल्लेखनीय सीमाएँ हैं। यह नमूना-अक्षम है, एक गेम सीखने के लिए लाखों फ्रेम की आवश्यकता होती है। यह उन कार्यों के साथ भी संघर्ष करता है जिनमें दीर्घकालिक स्मृति या विरल पुरस्कार की आवश्यकता होती है, क्योंकि अनुभव पुनर्प्ले बफर महत्वपूर्ण दुर्लभ घटनाओं को बनाए नहीं रख सकता है। एल्गोरिदम हाइपरपैरामीटर के प्रति संवेदनशील है, और इसका प्रदर्शन विभिन्न यादृच्छिक बीजों में काफी भिन्न हो सकता है। इसके अतिरिक्त, DQN की असतत क्रिया स्थानों पर निर्भरता निरंतर नियंत्रण समस्याओं पर इसके सीधे अनुप्रयोग को सीमित करती है, जो वास्तविक दुनिया के रोबोटिक्स में आम हैं।
विरासत
DQN को आधुनिक कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में एक मौलिक योगदान के रूप में व्यापक रूप से मान्यता प्राप्त है। इसने प्रदर्शित किया कि गहन शिक्षण को जटिल अनुक्रमिक निर्णय लेने की समस्याओं को हल करने के लिए सुदृढीकरण सीखने के साथ प्रभावी ढंग से जोड़ा जा सकता है। DQN में पेश की गई तकनीकें, जैसे अनुभव पुनर्प्ले और लक्ष्य नेटवर्क, अब कई सुदृढीकरण सीखने प्रणालियों में मानक घटक हैं। Atari गेम्स पर एल्गोरिदम की सफलता ने आर्केड लर्निंग एनवायरनमेंट को सुदृढीकरण सीखने वाले एजेंटों के मूल्यांकन के लिए एक बेंचमार्क के रूप में भी स्थापित किया, एक प्रथा जो बाद के शोध में जारी है। DQN का प्रभाव जनरेटिव एआई और बड़े पैमाने के मॉडल के विकास तक फैला हुआ है, क्योंकि स्थिर प्रशिक्षण और फ़ंक्शन अनुमान के सिद्धांत इन डोमेन में साझा हैं। इसकी विरासत गूगल डीपमाइंड, ओपनएआई, और एंथ्रोपिक जैसे संस्थानों में चल रहे कार्यों में स्पष्ट है, जहां सुदृढीकरण सीखना अन्वेषण का एक प्रमुख क्षेत्र बना हुआ है।
यह भी देखें
- तंत्रिका नेटवर्क
- सुदृढीकरण सीखना
- atari
- deepmind