अंग्रेज़ी से अनुवादित

DeepMind Atari गूगल डीपमाइंड द्वारा 2013 में बनाई गई एक ऐतिहासिक डीप रीइन्फोर्समेंट लर्निंग प्रणाली है, जिसने कच्चे पिक्सल से सीधे Atari 2600 गेम खेलने के लिए तंत्रिका नेटवर्क को प्रशिक्षित किया, और कई शीर्षकों पर मानव-स्तर से बेहतर प्रदर्शन हासिल किया। इसने डीप क्यू-नेटवर्क (DQN) एल्गोरिदम पेश किया, जो एआई में एक मौलिक प्रगति है।

DeepMind Atari उन शोध प्रणालियों और परिणामों की एक श्रृंखला को संदर्भित करता है जो Google DeepMind द्वारा 2013 और 2015 के बीच प्रकाशित की गई थीं, जो यह प्रदर्शित करती हैं कि एक एकल गहन शिक्षण वास्तुकला विभिन्न प्रकार के Atari 2600 वीडियो गेम को मानव विशेषज्ञों के बराबर या उससे बेहतर स्तर पर खेलना सीख सकती है। Koray Kavukcuoglu और David Ha (बाद वाला मूल पत्रों में शामिल नहीं था) सहित शोधकर्ताओं द्वारा किया गया यह कार्य, उच्च-आयामी संवेदी इनपुट वाले नियंत्रण कार्यों के लिए गहन सुदृढीकरण शिक्षण को एक व्यावहारिक दृष्टिकोण के रूप में स्थापित करता है। प्राथमिक एल्गोरिदम जो पेश किया गया था वह Deep Q-Network (DQN) था, जिसने तंत्रिका नेटवर्क को Q-लर्निंग के साथ जोड़ा, जो मूल्य-आधारित निर्णय लेने के लिए एक क्लासिक मशीन लर्निंग तकनीक है।

2013 का प्रारंभिक पेपर, जिसका शीर्षक "Playing Atari with Deep Reinforcement Learning" था, एक प्रीप्रिंट था जिसने दिखाया कि Q-लर्निंग के एक प्रकार के माध्यम से प्रशिक्षित एक convolutional तंत्रिका नेटवर्क परीक्षण किए गए 49 Atari गेमों में से सात को मानव विशेषज्ञों से बेहतर खेल सकता है। 2015 का अनुवर्ती Nature पेपर, "Human-level control through deep reinforcement learning," ने परिणामों को 49 गेमों तक विस्तारित किया, जिसमें DQN एजेंट ने आधे से अधिक गेमों में पेशेवर मानव परीक्षकों से बेहतर प्रदर्शन किया। इन प्रकाशनों को व्यापक रूप से आधुनिक गहन सुदृढीकरण शिक्षण उछाल को शुरू करने का श्रेय दिया जाता है, जिसने रोबोटिक्स, गेम खेलने और स्वायत्त प्रणालियों में बाद के कार्यों को प्रभावित किया।

Architecture and Training

DQN वास्तुकला ने Atari 2600 एमुलेटर से कच्चे पिक्सेल फ्रेम को संसाधित करने के लिए एक convolutional तंत्रिका नेटवर्क का उपयोग किया। प्रत्येक इनपुट में चार लगातार 84x84 ग्रेस्केल फ्रेम शामिल थे, जो अस्थायी संदर्भ प्रदान करने के लिए स्टैक किए गए थे। नेटवर्क में तीन convolutional परतें थीं जिसके बाद दो पूरी तरह से जुड़ी परतें थीं, जो प्रत्येक संभावित क्रिया के लिए एक Q-मान आउटपुट करती थीं (आमतौर पर 18 अलग-अलग जॉयस्टिक और बटन संयोजन)। प्रशिक्षण में अनुभव रीप्ले नामक एक तकनीक का उपयोग किया गया, जहां पिछले संक्रमणों को एक मेमोरी बफर में संग्रहीत किया गया और लगातार अपडेट के बीच सहसंबंधों को तोड़ने के लिए समान रूप से नमूना लिया गया। इसे एक लक्ष्य नेटवर्क के साथ जोड़ा गया था जिसे सीखने को स्थिर करने के लिए समय-समय पर अपडेट किया जाता था।

एजेंट को केवल कच्चा पिक्सेल डेटा और गेम स्कोर इनाम के रूप में प्राप्त हुआ, बिना किसी हाथ से तैयार की गई सुविधाओं या गेम-विशिष्ट ज्ञान के। इनाम संकेत को [-1, 1] की सीमा में क्लिप किया गया था ताकि बहुत अलग स्कोर पैमाने वाले गेमों में स्थिर प्रशिक्षण सुनिश्चित किया जा सके। अनुकूलन ने Adam ऑप्टिमाइज़र का उपयोग 0.00025 की सीखने की दर के साथ किया, और नेटवर्क को प्रति गेम 50 मिलियन फ्रेम के लिए प्रशिक्षित किया गया, जो प्रति शीर्षक लगभग 38 घंटे के गेमप्ले के बराबर है।

Key Results and Impact

2015 के Nature अध्ययन में, DQN एजेंट ने 49 गेमों में से 29 में अलौकिक प्रदर्शन हासिल किया, जिसमें Breakout, Pong और Enduro जैसे शीर्षक शामिल थे। Breakout पर, एजेंट ने ईंट की दीवार के किनारे से सुरंग बनाने की एक इष्टतम रणनीति खोजी, जो मानव खिलाड़ियों द्वारा आमतौर पर उपयोग नहीं की जाने वाली रणनीति है। हालांकि, दीर्घकालिक योजना या विरल इनाम की आवश्यकता वाले गेमों, जैसे Montezuma's Revenge, पर एजेंट ने खराब प्रदर्शन किया, जो एक सीमा थी जिसने बाद में अन्वेषण विधियों और आंतरिक प्रेरणा पर शोध को प्रेरित किया।

इस कार्य ने प्रदर्शित किया कि गहन शिक्षण को हाथ से डिज़ाइन की गई सुविधाओं की आवश्यकता के बिना सुदृढीकरण शिक्षण पर लागू किया जा सकता है, जो पहले के दृष्टिकोणों से एक महत्वपूर्ण विचलन था जो रैखिक फ़ंक्शन अनुमानकों पर निर्भर थे। इसने डेटा संवर्धन-जैसी तकनीकों के महत्व को भी उजागर किया, हालांकि मूल DQN ने स्पष्ट संवर्धन का उपयोग नहीं किया, बल्कि फ्रेम स्किपिंग और यादृच्छिक प्रारंभ स्थितियों पर निर्भर रहा।

Legacy and Influence

DeepMind Atari परिणाम कृत्रिम बुद्धिमत्ता अनुसंधान में एक प्रमुख मील का पत्थर थे, जिससे शैक्षणिक और औद्योगिक सेटिंग्स में गहन सुदृढीकरण शिक्षण को व्यापक रूप से अपनाया गया। DQN एल्गोरिदम अनगिनत बाद के तरीकों के लिए एक आधार रेखा बन गया, जिसमें Double DQN, Dueling DQN और Prioritized Experience Replay शामिल हैं। Atari 2600 बेंचमार्क स्वयं सुदृढीकरण शिक्षण एजेंटों के मूल्यांकन के लिए एक मानक मूल्यांकन सूट बन गया, जिसका उपयोग Berkeley AI Research और MIT CSAIL जैसे संस्थानों के शोधकर्ताओं द्वारा किया गया।

सफलता ने Google द्वारा 2014 में अधिग्रहण के बाद Google DeepMind की व्यापक प्रतिष्ठा में भी योगदान दिया। Atari के लिए विकसित तकनीकों को बाद में अधिक जटिल डोमेन, जैसे गो का खेल (AlphaGo) और निरंतर नियंत्रण कार्यों के लिए अनुकूलित किया गया। सुदृढीकरण शिक्षण में दृश्य इनपुट प्रसंस्करण के लिए convolutional नेटवर्क के उपयोग ने जनरेटिव AI और रोबोटिक्स में बाद के कार्यों को प्रभावित किया, जहां कच्चे सेंसर डेटा को सीधे तंत्रिका मॉडल द्वारा संसाधित किया जाता है।

Technical Details and Reproducibility

मूल कार्यान्वयन ने Arcade Learning Environment (ALE) का उपयोग किया, जो एक सॉफ्टवेयर फ्रेमवर्क है जो Atari 2600 गेमों का अनुकरण करता है और सुदृढीकरण शिक्षण एजेंटों के लिए एक मानकीकृत इंटरफ़ेस प्रदान करता है। DQN कोड को Google DeepMind द्वारा 2015 में ओपन-सोर्स किया गया था, जिससे अन्य शोधकर्ताओं को परिणामों को पुन: उत्पन्न करने और विस्तारित करने की अनुमति मिली। प्रशिक्षण प्रक्रिया के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की आवश्यकता थी, आमतौर पर प्रति गेम कई दिनों के लिए एक एकल GPU का उपयोग करना, जो उस समय उल्लेखनीय था लेकिन बाद के बड़े पैमाने के मॉडल की तुलना में मामूली था।

एक प्रमुख तकनीकी नवाचार एक लक्ष्य नेटवर्क का उपयोग था, जिसे हर 10,000 चरणों में अपडेट किया गया था ताकि एक स्थिर सीखने का लक्ष्य प्रदान किया जा सके। इसने उस अस्थिरता को संबोधित किया जो अक्सर Q-लर्निंग के लिए तंत्रिका नेटवर्क का उपयोग करते समय सामने आती है, जहां एक ही नेटवर्क का उपयोग क्रियाओं का चयन और मूल्यांकन दोनों के लिए किया जाता है। अनुभव रीप्ले बफर में 1 मिलियन संक्रमणों की क्षमता थी, और एजेंट ने एक epsilon-लालची अन्वेषण रणनीति का उपयोग किया जिसमें epsilon को पहले मिलियन फ्रेमों में 1.0 से 0.1 तक कम किया गया था।

Broader Context

DeepMind Atari कार्य मशीन लर्निंग और तंत्रिका नेटवर्क के व्यापक इतिहास के भीतर स्थित है, जो अस्थायी अंतर सीखने और फ़ंक्शन अनुमान में दशकों के शोध पर निर्माण करता है। यह गहन शिक्षण में अन्य प्रगति के समकालीन था, जैसे अवशिष्ट नेटवर्क वास्तुकला, हालांकि DQN ने एक सरल convolutional डिज़ाइन का उपयोग किया। DQN की सफलता ने अनुक्रमिक निर्णय लेने के लिए गहन शिक्षण को वैध बनाने में मदद की, जो छवि वर्गीकरण और भाषण पहचान जैसे पर्यवेक्षित कार्यों में इसकी उपलब्धियों का पूरक था।

बाद के शोध ने Atari परिणामों को अधिक चुनौतीपूर्ण वातावरणों, जिसमें 3D दुनिया और बहु-एजेंट सेटिंग्स शामिल हैं, तक विस्तारित किया है। जबकि मूल DQN को अधिक कुशल एल्गोरिदम द्वारा प्रतिस्थापित किया गया है, इसके वैचारिक योगदान - अनुभव रीप्ले, लक्ष्य नेटवर्क और कच्चे पिक्सेल से अंत-से-अंत सीखना - सुदृढीकरण शिक्षण में मौलिक बने हुए हैं। Atari बेंचमार्क का उपयोग नए एल्गोरिदम के मूल्यांकन के लिए जारी है, और 2013 और 2015 के पेपर क्षेत्र में सबसे अधिक उद्धृत किए जाने वाले पेपरों में बने हुए हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-reinforcement-learning·atari-2600·google-deepmind·neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास