अंग्रेज़ी से अनुवादित

क्यू-लर्निंग एक मॉडल-मुक्त सुदृढीकरण सीखने एल्गोरिथम है जो सीमित मार्कोव निर्णय प्रक्रियाओं के लिए इष्टतम क्रिया-चयन नीति सीखती है, राज्यों में क्रियाओं के अपेक्षित पुरस्कार (गुणवत्ता) का अनुमान लगाकर, बिना वातावरण मॉडल की आवश्यकता के।

Q-learning एक मॉडल-मुक्त सुदृढीकरण सीखने का एल्गोरिदम है जो एक एजेंट को उसकी वर्तमान स्थिति के आधार पर उसके संभावित कार्यों को मान निर्दिष्ट करने के लिए प्रशिक्षित करता है, बिना पर्यावरण के मॉडल की आवश्यकता के। यह स्टोकेस्टिक संक्रमणों और पुरस्कारों वाली समस्याओं को बिना अनुकूलन के संभाल सकता है। किसी भी परिमित मार्कोव निर्णय प्रक्रिया के लिए, Q-learning एक इष्टतम नीति पाता है, जो वर्तमान स्थिति से शुरू करते हुए, अनंत अन्वेषण समय और आंशिक रूप से यादृच्छिक नीति दिए जाने पर, सभी क्रमिक चरणों पर कुल पुरस्कार के अपेक्षित मूल्य को अधिकतम करने के अर्थ में होता है। "Q" उस फ़ंक्शन को संदर्भित करता है जिसकी गणना एल्गोरिदम करता है: किसी दी गई स्थिति में लिए गए कार्य का अपेक्षित पुरस्कार - अर्थात, गुणवत्ता।

एक सरल उदाहरण में, एक ग्रिड भूलभुलैया एजेंट 10 अंकों के लायक निकास तक पहुंचना सीखता है। एक चौराहे पर, Q-learning दाईं ओर जाने को बाईं ओर से अधिक मान निर्दिष्ट कर सकता है यदि दाईं ओर जाने से निकास तक तेजी से पहुंचा जा सकता है, और समय के साथ दोनों दिशाओं को आज़माकर इस विकल्प में सुधार करता है। यह दर्शाता है कि एल्गोरिदम पुनरावृत्त अद्यतनों के माध्यम से तत्काल पुरस्कार और दीर्घकालिक परिणामों के बीच संतुलन कैसे बनाता है।

सुदृढीकरण सीखने का संदर्भ

सुदृढीकरण सीखने में एक एजेंट, अवस्थाओं का एक समुच्चय \(\mathcal{S}\), और प्रत्येक अवस्था के लिए क्रियाओं का एक समुच्चय \(\mathcal{A}\) शामिल होता है। एक क्रिया \(a \in \mathcal{A}\) करने से, एजेंट एक अवस्था से दूसरी अवस्था में संक्रमण करता है। किसी विशिष्ट अवस्था में एक क्रिया करने से एजेंट को एक पुरस्कार मिलता है, जो एक संख्यात्मक स्कोर होता है। एजेंट का लक्ष्य अपने कुल पुरस्कार को अधिकतम करना है, जो भविष्य की अवस्थाओं से प्राप्त होने वाले अधिकतम पुरस्कार को अपनी वर्तमान अवस्था को प्राप्त करने के पुरस्कार में जोड़कर किया जाता है, जिससे वर्तमान क्रिया संभावित भविष्य के पुरस्कार से प्रभावित होती है। यह संभावित पुरस्कार वर्तमान अवस्था से शुरू होने वाले सभी भविष्य के चरणों के पुरस्कारों के अपेक्षित मूल्यों का एक भारित योग है।

एक उदाहरण के रूप में, ट्रेन में चढ़ने पर विचार करें, जहां पुरस्कार कुल चढ़ाई समय के ऋणात्मक द्वारा मापा जाता है। एक रणनीति यह है कि ट्रेन का दरवाजा खुलते ही उसमें प्रवेश किया जाए, जिससे प्रारंभिक प्रतीक्षा समय कम हो। हालांकि, यदि ट्रेन भीड़भाड़ वाली है, तो प्रवेश धीमा होता है क्योंकि उतरने वाले यात्री बाहर निकलने के लिए संघर्ष करते हैं। कुल चढ़ाई समय तब 0 सेकंड प्रतीक्षा प्लस 15 सेकंड संघर्ष समय होता है। अगले दिन, यादृच्छिक संयोग (अन्वेषण) से, एजेंट प्रतीक्षा करता है और दूसरों को पहले उतरने देता है, जिसके परिणामस्वरूप लंबी प्रतीक्षा लेकिन कम संघर्ष समय होता है। कुल मिलाकर, इस पथ का पुरस्कार अधिक होता है क्योंकि कुल चढ़ाई समय 5 सेकंड प्रतीक्षा प्लस 0 सेकंड संघर्ष समय है। अन्वेषण के माध्यम से, प्रारंभिक धैर्यपूर्ण क्रिया के परिणामस्वरूप बलपूर्ण रणनीति की तुलना में अधिक लागत होने के बावजूद, कुल लागत कम होती है, जो एक अधिक लाभदायक रणनीति को उजागर करती है।

एल्गोरिदम की कार्यप्रणाली

भविष्य में \(\Delta t\) चरणों के बाद, एजेंट अगला कदम तय करेगा। इस चरण के लिए भार \(\gamma^{\Delta t}\) के रूप में गणना की जाती है, जहां \(\gamma\) (छूट कारक) 0 और 1 के बीच की संख्या है। \(\gamma < 1\) मानते हुए, यह बाद में प्राप्त पुरस्कारों की तुलना में पहले प्राप्त पुरस्कारों को अधिक महत्व देता है, जो एक अच्छी शुरुआत के मूल्य को दर्शाता है। \(\gamma\) को प्रत्येक चरण \(\Delta t\) पर सफल होने या जीवित रहने की संभावना के रूप में भी व्याख्या किया जा सकता है।

एल्गोरिदम में एक फ़ंक्शन होता है जो अवस्था-क्रिया संयोजन की गुणवत्ता की गणना करता है: \(Q: \mathcal{S} \times \mathcal{A} \to \mathbb{R}\)। सीखना शुरू होने से पहले, \(Q\) को प्रोग्रामर द्वारा चुने गए संभवतः मनमाने निश्चित मान पर प्रारंभ किया जाता है। प्रत्येक समय \(t\) पर, एजेंट एक क्रिया \(A_t\) चुनता है, एक पुरस्कार \(R_{t+1}\) देखता है, एक नई अवस्था \(S_{t+1}\) में प्रवेश करता है (जो पिछली अवस्था \(S_t\) और चुनी गई क्रिया दोनों पर निर्भर हो सकती है), और \(Q\) को अद्यतन किया जाता है। मुख्य अद्यतन एक बेलमैन समीकरण है जो एक सरल मान पुनरावृत्ति अद्यतन के रूप में होता है, जो वर्तमान मान और नई जानकारी के भारित औसत का उपयोग करता है:

\(Q_{new}(S_t, A_t) \leftarrow (1 - \alpha) \cdot Q(S_t, A_t) + \alpha \cdot [R_{t+1} + \gamma \max_a Q(S_{t+1}, a)]\)

जहां \(\alpha\) सीखने की दर है, जो नियंत्रित करती है कि नई जानकारी पुरानी जानकारी को कितना अधिक्रमित करती है।

अन्वेषण और दोहन

एल्गोरिदम अन्वेषण (उनके पुरस्कारों की खोज के लिए नई क्रियाओं को आज़माना) और दोहन (उच्च पुरस्कार देने के लिए ज्ञात क्रियाओं को चुनना) के बीच संतुलन पर निर्भर करता है। एक आंशिक रूप से यादृच्छिक नीति, जैसे एप्सिलॉन-लोभी, अधिकांश समय सबसे अच्छी ज्ञात क्रिया का चयन करती है लेकिन कभी-कभी अन्वेषण के लिए एक यादृच्छिक क्रिया चुनती है। यह सुनिश्चित करता है कि एजेंट समय के साथ अपने अनुमानों में सुधार कर सके, जैसा कि ट्रेन चढ़ाई के उदाहरण में देखा गया है जहां यादृच्छिक अन्वेषण ने एक बेहतर रणनीति का खुलासा किया।

अभिसरण और इष्टतमता

किसी भी परिमित मार्कोव निर्णय प्रक्रिया के लिए, Q-learning एक इष्टतम नीति में अभिसरित होता है जो किसी भी प्रारंभिक अवस्था से अपेक्षित कुल पुरस्कार को अधिकतम करता है, बशर्ते अनंत अन्वेषण समय और एक उपयुक्त सीखने की दर अनुसूची हो। एल्गोरिदम को पर्यावरण की संक्रमण गतिशीलता के मॉडल की आवश्यकता नहीं होती है, जिससे यह उन समस्याओं पर लागू होता है जहां ऐसा मॉडल अज्ञात या जटिल है। यह मॉडल-मुक्त गुण इसे मॉडल-आधारित विधियों से अलग करता है जिन्हें स्पष्ट संक्रमण संभावनाओं की आवश्यकता होती है।

अनुप्रयोग और विस्तार

Q-learning को रोबोटिक्स, खेल खेलने और स्वायत्त प्रणालियों में लागू किया गया है। इसका सारणीबद्ध रूप छोटे अवस्था स्थानों के लिए काम करता है, लेकिन बड़े या सतत स्थानों के लिए, गहरे Q-नेटवर्क जैसे विस्तार Q-learning को गहन शिक्षण और तंत्रिका नेटवर्क फ़ंक्शन अनुमानकों के साथ जोड़ते हैं। इन प्रगतियों ने कृत्रिम बुद्धिमत्ता खेल एजेंटों और मशीन सीखने नियंत्रण कार्यों जैसे क्षेत्रों में सफलताएं सक्षम की हैं। एल्गोरिदम के सिद्धांत बर्कले एआई अनुसंधान और एमआईटी सीएसएआईएल जैसे संस्थानों में आधुनिक सुदृढीकरण सीखने अनुसंधान को भी रेखांकित करते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·machine-learning·algorithm
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास