अंग्रेज़ी से अनुवादित

अन्वेषण-दोहन व्यापार-अपव्यय (exploration-exploitation tradeoff) एक मौलिक निर्णय-निर्माण दुविधा है जो ज्ञात पुरस्कारों और नई जानकारी की खोज के बीच संतुलन बनाती है, जो सुदृढीकरण सीखने (reinforcement learning) और बहु-सशस्त्र डाकू समस्याओं (multi-armed bandit problems) के केंद्र में है।

अन्वेषण-दोहन समझौता, जिसे अन्वेषण-दोहन दुविधा के रूप में भी जाना जाता है, निर्णय लेने में एक मौलिक अवधारणा है जो कई क्षेत्रों में उत्पन्न होती है। इसमें दो विरोधी रणनीतियों को संतुलित करना शामिल है: दोहन, जो वर्तमान ज्ञान (जो अधूरा या भ्रामक हो सकता है) के आधार पर सर्वोत्तम विकल्प चुनता है, और अन्वेषण, जो नए विकल्पों को आजमाता है जो भविष्य में बेहतर परिणाम दे सकते हैं, लेकिन तत्काल पुरस्कारों को छोड़ने की कीमत पर। निर्णय लेने की समस्याओं में दीर्घकालिक लाभ को अधिकतम करने के लिए इष्टतम संतुलन खोजना महत्वपूर्ण है।

मशीन लर्निंग में, यह समझौता सुदृढीकरण लर्निंग (आरएल) के लिए आधारभूत है, जहां एजेंट अधूरे या विलंबित फीडबैक से निर्णय लेना सीखते हैं। एजेंट को यह तय करना होता है कि अपनी वर्तमान सर्वोत्तम ज्ञात नीति का दोहन करें या प्रदर्शन सुधारने के लिए नई नीतियों का अन्वेषण करें। यह दुविधा सरल बैंडिट समस्याओं से लेकर जटिल वास्तविक-विश्व प्रणालियों तक विभिन्न रूपों में प्रकट होती है।

मल्टी-आर्म्ड बैंडिट विधियाँ

मल्टी-आर्म्ड बैंडिट (एमएबी) समस्या इस समझौते का एक क्लासिक उदाहरण है, और इसे संबोधित करने के लिए कई विधियाँ विकसित की गई हैं। सामान्य दृष्टिकोणों में एप्सिलॉन-ग्रीडी, थॉम्पसन सैंपलिंग और अपर कॉन्फिडेंस बाउंड (यूसीबी) शामिल हैं। एप्सिलॉन-ग्रीडी में, एजेंट अधिकांश समय सर्वोत्तम ज्ञात क्रिया का दोहन करता है लेकिन संभावना एप्सिलॉन के साथ एक यादृच्छिक क्रिया चुनता है, जिससे निरंतर अन्वेषण सुनिश्चित होता है। यूसीबी उच्च अपर कॉन्फिडेंस बाउंड वाली क्रियाओं का चयन करके अन्वेषण और दोहन को संतुलित करता है, जो अनिश्चित पुरस्कारों वाली क्रियाओं को प्राथमिकता देता है। थॉम्पसन सैंपलिंग पश्च वितरण से नमूना लेने के लिए बायेसियन अनुमान का उपयोग करता है, जो स्वाभाविक रूप से दोनों रणनीतियों को संतुलित करता है।

अधिक जटिल आरएल परिदृश्यों में, प्रत्येक निर्णय को एमएबी के रूप में माना जा सकता है, जहां भुगतान अपेक्षित भविष्य का पुरस्कार है। उदाहरण के लिए, मोंटे कार्लो ट्री सर्च, जो शतरंज और गो जैसे खेलों में उपयोग किया जाता है, खोज को निर्देशित करने के लिए यूसीबी का एक प्रकार नियोजित करता है। ये विधियाँ कृत्रिम बुद्धिमत्ता प्रणालियों में व्यापक रूप से लागू होती हैं, जिनमें ओपनएआई और गूगल डीपमाइंड द्वारा विकसित प्रणालियाँ शामिल हैं।

अन्वेषण समस्याएँ

कई चुनौतियाँ व्यवहार में अन्वेषण को कठिन बनाती हैं। विरल पुरस्कार तब होते हैं जब पुरस्कार दुर्लभ होते हैं, जैसे कि अटारी गेम मोंटेज़ुमाज़ रिवेंज में, जहां एजेंट मार्गदर्शन की कमी के कारण अन्वेषण में बने नहीं रह सकते। भ्रामक पुरस्कार तब उत्पन्न होते हैं जब प्रारंभिक क्रियाएँ छोटे तत्काल पुरस्कार देती हैं लेकिन बड़े बाद के पुरस्कारों से विचलित करती हैं, एजेंटों को बेहतर रणनीतियों से दूर ले जाती हैं। नॉइज़ी टीवी समस्या उन स्थितियों का वर्णन करती है जहां कुछ अवलोकन अपरिवर्तनीय रूप से यादृच्छिक होते हैं, एजेंटों को अनुत्पादक अन्वेषण में फँसाते हैं, जैसे स्थैतिक वाला टेलीविजन देखना।

ये समस्याएँ परिष्कृत अन्वेषण रणनीतियों की आवश्यकता को उजागर करती हैं, विशेष रूप से डीप लर्निंग और न्यूरल नेटवर्क प्रशिक्षण में सामान्य बड़े एक्शन स्पेस में।

अन्वेषण पुरस्कार विधियाँ

अन्वेषण पुरस्कार (या अन्वेषण बोनस) विधियाँ अन्वेषण को पुरस्कार के एक अन्य रूप के रूप में मानकर दुविधा को दोहन के संतुलन में परिवर्तित करती हैं। एजेंट आंतरिक पुरस्कारों (अन्वेषण से) और बाह्य पुरस्कारों (पर्यावरण से) के योग को अधिकतम करता है। आंतरिक पुरस्कार स्वतंत्र रूप से डिज़ाइन किए जाते हैं, बाह्य पुरस्कारों के विपरीत, और आमतौर पर गैर-स्थिर होते हैं, राज्यों के परिचित होने पर घटते जाते हैं।

गणना-आधारित अन्वेषण बोनस की गणना के लिए किसी राज्य की यात्राओं की संख्या का उपयोग करता है, लेकिन यह केवल छोटे, असतत राज्य स्थानों में संभव है। घनत्व-आधारित अन्वेषण एक घनत्व मॉडल का उपयोग करके यात्रा गणनाओं का अनुमान लगाता है, जिससे निकटवर्ती राज्यों में सामान्यीकरण की अनुमति मिलती है। अधिकतम एन्ट्रॉपी अन्वेषण एजेंट की नीति की एन्ट्रॉपी को आंतरिक पुरस्कार के रूप में शामिल करता है, जो स्टोकेस्टिक व्यवहार और व्यापक कवरेज को प्रोत्साहित करता है।

पूर्वानुमान-आधारित अन्वेषण

पूर्वानुमान-आधारित विधियाँ एक फॉरवर्ड डायनेमिक्स मॉडल का उपयोग करती हैं जो वर्तमान राज्य और क्रिया को देखते हुए अगले राज्य की भविष्यवाणी करता है। मॉडल को एजेंट के इंटरैक्ट करने पर प्रशिक्षित किया जाता है, जिससे बार-बार देखे जाने वाले राज्य-क्रिया जोड़ों के लिए इसकी भविष्यवाणियाँ बेहतर होती हैं। अन्वेषण पुरस्कार तब पूर्वानुमान त्रुटि के रूप में परिभाषित किया जाता है, जैसे कि पूर्वानुमानित और वास्तविक अगले राज्यों के बीच का अंतर। यह एजेंट को उन राज्यों की तलाश करने के लिए प्रोत्साहित करता है जहां उसका मॉडल गलत है, जिससे नवीन अनुभवों की खोज को बढ़ावा मिलता है।

यह दृष्टिकोण जिज्ञासा-संचालित लर्निंग से संबंधित है और विभिन्न आरएल फ्रेमवर्क में खोजा गया है, जिनमें जनरेटिव एआई और बड़े भाषा मॉडल में एजेंटों के प्रशिक्षण के लिए उपयोग किए जाने वाले फ्रेमवर्क शामिल हैं।

अनुप्रयोग और निहितार्थ

अन्वेषण-दोहन समझौता आरएल से परे ऑनलाइन विज्ञापन, क्लिनिकल परीक्षण और अनुशंसा प्रणालियों जैसे क्षेत्रों तक फैला हुआ है। अमेज़न वेब सर्विसेज और एज़्योर में, बैंडिट एल्गोरिदम संसाधन आवंटन और उपयोगकर्ता सहभागिता को अनुकूलित करते हैं। एआई अनुसंधान में, मजबूत मॉडलों के प्रशिक्षण के लिए अन्वेषण और दोहन को संतुलित करना महत्वपूर्ण है, जैसा कि स्टैनफोर्ड एआई लैब और बर्कले एआई रिसर्च के कार्य में देखा गया है।

यह समझौता व्यक्तिगत विकल्पों से लेकर संगठनात्मक रणनीति तक, मानव निर्णय लेने को भी प्रभावित करता है। इसे समझना और संबोधित करना अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें करिकुलम लर्निंग और आरएलएचएफ में चल रहे विकास शामिल हैं ताकि सीखने की दक्षता और परिणाम की गुणवत्ता में सुधार हो सके।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:decision-making·reinforcement-learning·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास