मार्कोव निर्णय प्रक्रिया (Markov Decision Process)

अंग्रेज़ी से अनुवादित

मार्कोव निर्णय प्रक्रिया (MDP) अनिश्चितता के तहत अनुक्रमिक निर्णय-निर्माण के मॉडलिंग के लिए एक गणितीय ढांचा है, जिसे अवस्थाओं, क्रियाओं, संक्रमण प्रायिकताओं और पुरस्कारों द्वारा परिभाषित किया जाता है। यह सुदृढ़ीकरण अधिगम और स्टोकेस्टिक गतिशील प्रोग्रामिंग का आधार है।

एक मार्कोव निर्णय प्रक्रिया (MDP) अनुक्रमिक निर्णय लेने के लिए एक गणितीय मॉडल है जब परिणाम अनिश्चित होते हैं। यह एक प्रकार की स्टोकेस्टिक निर्णय प्रक्रिया है, जिसे अक्सर स्टोकेस्टिक गतिशील प्रोग्रामिंग के तरीकों का उपयोग करके हल किया जाता है। 1950 के दशक में संचालन अनुसंधान से उत्पन्न, MDP ने तब से पारिस्थितिकी, अर्थशास्त्र, स्वास्थ्य देखभाल, दूरसंचार, और सुदृढीकरण सीखने जैसे क्षेत्रों में मान्यता प्राप्त की है। सुदृढीकरण सीखने में, MDP ढांचा एक सीखने वाले एजेंट और उसके पर्यावरण के बीच बातचीत का मॉडल करता है, जो राज्यों, क्रियाओं और पुरस्कारों द्वारा विशेषता है, और Artificial intelligence चुनौतियों के प्रमुख तत्वों का एक सरलीकृत प्रतिनिधित्व प्रदान करता है, जिसमें कारण और प्रभाव, अनिश्चितता और स्पष्ट लक्ष्य शामिल हैं।

यह नाम मार्कोव श्रृंखलाओं से इसके संबंध से लिया गया है, जिसे रूसी गणितज्ञ आंद्रेई मार्कोव द्वारा विकसित किया गया था। "मार्कोव" गुण अंतर्निहित संरचना को संदर्भित करता है जहां राज्य संक्रमण केवल वर्तमान राज्य और क्रिया पर निर्भर करते हैं, पिछले इतिहास पर नहीं। इस प्रक्रिया को "निर्णय प्रक्रिया" कहा जाता है क्योंकि इसमें ऐसे निर्णय लेना शामिल है जो इन संक्रमणों को प्रभावित करते हैं, मार्कोव श्रृंखलाओं को अनिश्चितता के तहत निर्णय लेने में विस्तारित करते हैं।

औपचारिक परिभाषा

एक MDP को आमतौर पर एक 4-टपल \((S, A, P_a, R_a)\) के रूप में परिभाषित किया जाता है, जहां:

  • \(S\) राज्य स्थान है, जो असतत या सतत हो सकता है (जैसे, वास्तविक संख्याओं का समुच्चय)।
  • \(A\) क्रिया स्थान है, जिसमें \(A_s\) राज्य \(s\) से उपलब्ध क्रियाओं के समुच्चय को दर्शाता है। यह समुच्चय भी असतत या सतत हो सकता है।
  • \(P_a(s, s')\) संक्रमण संभावना है कि समय \(t\) पर राज्य \(s\) में क्रिया \(a\) समय \(t+1\) पर राज्य \(s'\) की ओर ले जाती है। असतत राज्यों के लिए, \(P_a(s, s') = \Pr(s_{t+1} = s' \mid s_t = s, a_t = a)\)। सतत राज्य स्थानों के लिए, संभावना को एक अभिन्न के माध्यम से परिभाषित किया जाता है, अक्सर लेबेस्ग माप के संबंध में।
  • \(R_a(s, s')\) तत्काल पुरस्कार (या अपेक्षित पुरस्कार) है जो \(s\) से \(s'\) में संक्रमण के लिए क्रिया \(a\) लेने के बाद प्राप्त होता है। पुरस्कार आम तौर पर एक यादृच्छिक चर होता है।

एक नीति फलन \(\pi\) राज्य स्थान से क्रिया स्थान तक एक (संभावित रूप से संभाव्य) मानचित्रण है, जो प्रत्येक राज्य में कौन सी क्रिया लेनी है यह निर्दिष्ट करता है।

अनुकूलन उद्देश्य

MDP में लक्ष्य एक नीति \(\pi\) खोजना है जो यादृच्छिक पुरस्कारों के संचयी फलन को अधिकतम करता है, आमतौर पर अनंत क्षितिज पर अपेक्षित छूट वाला योग: \(\mathbb{E}[\sum_{t=0}^{\infty} \gamma^t R_{a_t}(s_t, s_{t+1})]\), जहां \(\gamma \in [0, 1)\) एक छूट कारक है। एक बार नीति तय हो जाने पर, MDP एक मार्कोव श्रृंखला की तरह व्यवहार करता है, क्योंकि प्रत्येक राज्य में क्रिया \(\pi(s)\) द्वारा निर्धारित होती है।

सामान्य समाधान विधियों में मूल्य पुनरावृत्ति और नीति पुनरावृत्ति जैसी गतिशील प्रोग्रामिंग तकनीकें शामिल हैं, जो इष्टतम मूल्य फलन या नीतियों की गणना करती हैं। ये विधियाँ Reinforcement learning एल्गोरिदम जैसे क्यू-लर्निंग और SARSA में मौलिक हैं।

अनुप्रयोग

MDP व्यापक रूप से विभिन्न क्षेत्रों में लागू होते हैं। अर्थशास्त्र में, वे इष्टतम उपभोग और निवेश निर्णयों का मॉडल करते हैं। स्वास्थ्य देखभाल में, वे अनिश्चितता के तहत उपचार योजना का मार्गदर्शन करते हैं, जैसे पुरानी बीमारी प्रबंधन। दूरसंचार में, वे संसाधन आवंटन और नेटवर्क रूटिंग को अनुकूलित करते हैं। पारिस्थितिकी में, वे प्रजातियों के प्रबंधन के लिए संरक्षण रणनीतियों को सूचित करते हैं। Machine learning में, MDP सुदृढीकरण सीखने के लिए केंद्रीय हैं, जो एजेंटों को पर्यावरण के साथ बातचीत से सीखने में सक्षम बनाते हैं, जैसा कि रोबोटिक्स, खेल खेलने और स्वायत्त प्रणालियों में देखा जाता है।

सुदृढीकरण सीखने से संबंध

सुदृढीकरण सीखने (RL) एजेंट-पर्यावरण बातचीत को औपचारिक रूप देने के लिए MDP ढांचे का उपयोग करता है। RL में, एजेंट संक्रमण संभावनाओं या पुरस्कार फलनों को पहले से नहीं जानता है; इसके बजाय, यह पर्यावरण से नमूनों का उपयोग करके परीक्षण और त्रुटि के माध्यम से एक इष्टतम नीति सीखता है। यह RL को शास्त्रीय MDP समाधान से अलग करता है, जो ज्ञात मॉडल मापदंडों को मानता है। आधुनिक RL, जिसमें गहन सुदृढीकरण सीखना शामिल है, बड़े राज्य स्थानों को संभालने के लिए MDP को Neural network फलन अनुमानकों के साथ जोड़ता है, जैसा कि खेल खेलने और स्वायत्त ड्राइविंग जैसे अनुप्रयोगों में प्रदर्शित किया गया है।

विस्तार और विविधताएं

कई विस्तार बुनियादी MDP की सीमाओं को संबोधित करते हैं। आंशिक रूप से अवलोकनीय मार्कोव निर्णय प्रक्रियाएं (POMDP) उन स्थितियों को संभालती हैं जहां एजेंट पूर्ण राज्य को सीधे नहीं देख सकता है। फैक्टर्ड MDP स्केलेबिलिटी में सुधार के लिए राज्य चर में संरचना का उपयोग करते हैं। मल्टी-एजेंट MDP ढांचे को परस्पर क्रिया करने वाले उद्देश्यों के साथ कई निर्णय निर्माताओं तक विस्तारित करते हैं। ये विविधताएं मुख्य मार्कोव गुण को बनाए रखती हैं जबकि अधिक जटिल वास्तविक दुनिया की समस्याओं के अनुकूल होती हैं।

ऐतिहासिक संदर्भ

MDP का औपचारिकीकरण 1950 के दशक में रिचर्ड बेलमैन को श्रेय दिया जाता है, जिन्होंने गतिशील प्रोग्रामिंग भी विकसित की। स्टोकेस्टिक प्रक्रियाओं पर आंद्रेई मार्कोव के पहले के काम ने सैद्धांतिक आधार प्रदान किया। तब से, MDP संचालन अनुसंधान और कृत्रिम बुद्धिमत्ता का एक आधारशिला बन गया है, जो अनुक्रमिक निर्णय लेने में सैद्धांतिक और व्यावहारिक दोनों कार्यों को प्रभावित करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:markov-decision-process·reinforcement-learning·stochastic-processes·operations-research
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास