अंग्रेज़ी से अनुवादित

सुदृढ़ीकरण अधिगम एक मशीन अधिगम दृष्टिकोण है जिसमें एक एजेंट पर्यावरण में क्रियाएँ करके और पुरस्कार या दंड प्राप्त करके निर्णय लेना सीखता है, जिसका उद्देश्य समय के साथ संचयी पुरस्कार को अधिकतम करना होता है।

सुदृढीकरण अधिगम (RL) मशीन लर्निंग की एक शाखा है जिसमें एक एजेंट परीक्षण और त्रुटि द्वारा किसी वातावरण के भीतर कार्य करना सीखता है, प्रत्येक क्रिया के बाद एक संख्यात्मक पुरस्कार संकेत प्राप्त करता है और समय के साथ संचित कुल पुरस्कार को अधिकतम करने के लिए अपने व्यवहार को समायोजित करता है। पर्यवेक्षित अधिगम के विपरीत, जहां मॉडल को प्रत्येक इनपुट के लिए सही आउटपुट दिखाया जाता है, सुदृढीकरण अधिगम एजेंट को सही क्रिया कभी सीधे नहीं बताता; यह केवल, कभी-कभी बहुत देर से, यह प्रकट करता है कि क्रियाओं के अनुक्रम का परिणाम अच्छा था या बुरा, एक संरचना जिसे क्रेडिट असाइनमेंट समस्या के रूप में जाना जाता है।

औपचारिक ढांचा और इतिहास

सुदृढीकरण अधिगम को आमतौर पर एक मार्कोव निर्णय प्रक्रिया के रूप में औपचारिक रूप दिया जाता है, जिसमें एक एजेंट एक अवस्था का अवलोकन करता है, एक क्रिया चुनता है, एक पुरस्कार प्राप्त करता है, और एक नई अवस्था में संक्रमण करता है, इस लूप को दोहराते हुए एक नीति सीखता है जो अवस्थाओं को क्रियाओं से मैप करती है ताकि अपेक्षित भविष्य के पुरस्कार को अधिकतम किया जा सके। इस क्षेत्र की गणितीय नींव 20वीं सदी के मध्य की गतिशील प्रोग्रामिंग और इष्टतम नियंत्रण सिद्धांत से जुड़ी है, लेकिन एक विशिष्ट मशीन लर्निंग अनुशासन के रूप में इसका आधुनिक ढांचा रिचर्ड सटन और एंड्रयू बार्टो से निकटता से जुड़ा है, जिनकी पाठ्यपुस्तक इस क्षेत्र का मानक संदर्भ बन गई, और उन शोधकर्ताओं से भी जिन्होंने बाद में डीपमाइंड के सुदृढीकरण अधिगम कार्यक्रम का नेतृत्व किया, जिनमें डेविड सिल्वर शामिल हैं।

ऐतिहासिक सफलताएं

सुदृढीकरण अधिगम की सबसे सार्वजनिक रूप से दृश्यमान सफलताएं खेलों से आईं। AlphaGo ने गहरे तंत्रिका नेटवर्क को सुदृढीकरण अधिगम और ट्री सर्च के साथ जोड़कर 2016 में गो में विश्व चैंपियन ली सेडोल को हराया, एक परिणाम जिसे व्यापक रूप से विशेषज्ञ भविष्यवाणियों से वर्षों पहले आने के रूप में देखा गया। इसका उत्तराधिकारी AlphaZero ने दृष्टिकोण को सामान्यीकृत किया, केवल आत्म-खेल से शतरंज, शोगी और गो सीखा, बिना किसी मानव खेल डेटा के, केवल नियमों से शुरू करके। इन प्रणालियों ने प्रदर्शित किया कि एक एजेंट जटिल डोमेन में केवल पुरस्कार-संचालित परीक्षण और त्रुटि के साथ पर्याप्त कंप्यूट शक्ति के संयोजन से मानव-श्रेष्ठ प्रदर्शन तक पहुंच सकता है, एक विचार जिसे सटन ने बाद में "कड़वा सबक" के रूप में व्यक्त किया: सामान्य विधियां जो गणना का लाभ उठाती हैं, वे उन दृष्टिकोणों से बेहतर प्रदर्शन करती हैं जो मानव-निर्मित ज्ञान पर निर्भर करते हैं, जैसे-जैसे अधिक कंप्यूट शक्ति उपलब्ध होती है।

तकनीकें

सुदृढीकरण अधिगम एल्गोरिदम कई परिवारों में विभाजित हैं। मूल्य-आधारित विधियां, जैसे क्यू-लर्निंग और इसका गहन अधिगम विस्तार डीप क्यू-नेटवर्क, किसी दी गई अवस्था में दी गई क्रिया करने के दीर्घकालिक मूल्य का अनुमान लगाना सीखती हैं। पॉलिसी-ग्रेडिएंट विधियां सीधे एक नीति फ़ंक्शन सीखती हैं जो क्रियाएं आउटपुट करती हैं, और एक्टर-क्रिटिक विधियां दोनों दृष्टिकोणों को जोड़ती हैं। प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO), जिसे मुख्य रूप से जॉन शुलमैन द्वारा विकसित किया गया, अपनी सापेक्ष प्रशिक्षण स्थिरता के कारण सबसे व्यापक रूप से उपयोग किए जाने वाले पॉलिसी-ग्रेडिएंट एल्गोरिदम में से एक बन गया, और बाद में खेलों के बाहर, बड़े भाषा मॉडल के संरेखण में एक केंद्रीय भूमिका निभाई।

खेलों से भाषा मॉडल तक

सुदृढीकरण अधिगम की प्रासंगिकता मानव प्रतिक्रिया से सुदृढीकरण अधिगम के साथ नाटकीय रूप से व्यापक हुई, जिसमें मानव प्राथमिकता निर्णयों पर प्रशिक्षित एक पुरस्कार मॉडल हाथ-कोडित पुरस्कार फ़ंक्शन का स्थान लेता है, और एक एलएलएम को फिर PPO जैसे एल्गोरिदम के साथ ठीक-ट्यून किया जाता है ताकि उस सीखे गए पुरस्कार मॉडल के अनुसार उच्च स्कोर वाले आउटपुट उत्पन्न किए जा सकें। यह तकनीक एक कच्चे पूर्व-प्रशिक्षित बड़े भाषा मॉडल को ChatGPT जैसे सहायक में बदलने के लिए केंद्रीय थी जो विश्वसनीय रूप से निर्देशों का पालन करता है। हाल ही में, स्वचालित रूप से सत्यापन योग्य परिणामों वाले कार्यों पर सीधे लागू किया गया सुदृढीकरण अधिगम, जैसे कि जांचने योग्य उत्तर वाली गणित समस्याएं या कोड जो परीक्षण पास या विफल करता है, तर्क मॉडल जैसे OpenAI o1 और DeepSeek-R1 के पीछे की प्रमुख तकनीक बन गया, जो लंबी तर्क श्रृंखलाएं उत्पन्न करना सीखते हैं जो कठिन समस्याओं पर उनकी सटीकता में सुधार करती हैं, एक दृष्टिकोण जिसे अक्सर परीक्षण-समय गणना के छत्र के तहत वर्णित किया जाता है।

सीमाएं

सुदृढीकरण अधिगम कुख्यात रूप से नमूना-अक्षम है, जिसे अक्सर एक तुलनीय कौशल सीखने के लिए मानव की आवश्यकता से कहीं अधिक परीक्षण-और-त्रुटि अंतःक्रियाओं की आवश्यकता होती है, और यह पुरस्कार हैकिंग के प्रति संवेदनशील है, जहां एक एजेंट अपने पुरस्कार संकेत को अधिकतम करने का एक अनपेक्षित तरीका ढूंढता है जो तकनीकी रूप से उद्देश्य को संतुष्ट करता है लेकिन उस अंतर्निहित लक्ष्य को विफल करता है जिसे वह प्रस्तुत करने के लिए था। एक पुरस्कार फ़ंक्शन डिजाइन करना जो ईमानदारी से इच्छित व्यवहार को पकड़ता है, बिना खामियां पैदा किए जिनका एक अनुकूलन एजेंट शोषण कर सकता है, क्षेत्र की स्थायी खुली चुनौतियों में से एक बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·reinforcement-learning·decision-making
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास