अन्वेषण-दोहन दुविधा, जिसे अन्वेषण-दोहन व्यापार-संतुलन के रूप में भी जाना जाता है, निर्णय-निर्माण में एक मूल अवधारणा है जो अर्थशास्त्र से लेकर कृत्रिम बुद्धिमत्ता तक के क्षेत्रों में दिखाई देती है। इसमें दो विरोधी रणनीतियों को संतुलित करना शामिल है: दोहन, जिसका अर्थ है वर्तमान ज्ञान के आधार पर सर्वोत्तम विकल्प का चयन करना (जो अधूरा या भ्रामक हो सकता है), और अन्वेषण, जिसका अर्थ है नए विकल्पों को आज़माना जो बेहतर भविष्य के परिणामों की ओर ले जा सकते हैं, लेकिन दोहन के अवसर को छोड़ने की कीमत पर। दीर्घकालिक पुरस्कारों को अनुकूलित करने के लक्ष्य के लिए इस संतुलन को प्रभावी ढंग से हल करना आवश्यक है।
मशीन लर्निंग में, यह व्यापार-संतुलन सुदृढीकरण लर्निंग (RL) के लिए मौलिक है, जो एक प्रकार की लर्निंग है जहाँ एक एजेंट पर्यावरण से प्रतिक्रिया के आधार पर निर्णय लेता है, जो विलंबित या विरल हो सकती है। एजेंट को यह तय करना होता है कि वर्तमान में ज्ञात सर्वोत्तम नीति का दोहन करना है या भविष्य के प्रदर्शन को बेहतर बनाने के लिए नई नीतियों का अन्वेषण करना है। यह दुविधा स्वायत्त ड्राइविंग, अनुशंसा प्रणालियों और गेम-खेलने वाले AI जैसे क्षेत्रों में दिखाई देती है।
मल्टी-आर्म्ड बैंडिट विधियाँ
मल्टी-आर्म्ड बैंडिट (MAB) समस्या इस व्यापार-संतुलन का एक क्लासिक उदाहरण है, और इसके लिए कई विधियाँ विकसित की गई हैं। एप्सिलॉन-ग्रीडी एक सरल दृष्टिकोण है जहाँ एजेंट अधिकांश समय सर्वोत्तम ज्ञात क्रिया का दोहन करता है, लेकिन एप्सिलॉन संभावना के साथ एक यादृच्छिक क्रिया चुनता है। थॉम्पसन सैंपलिंग पुरस्कारों पर पश्च वितरण बनाए रखकर और उनसे सैंपल लेकर अन्वेषण और दोहन को संतुलित करता है। अपर बाउंड (UCB) एल्गोरिदम औसत पुरस्कारों की तुलना अनिश्चितता बोनस के साथ करके क्रियाओं का चयन करते हैं।
अधिक जटिल सेटिंग्स में, एक एजेंट प्रत्येक निर्णय बिंदु को एक MAB के रूप में मान सकता है जहाँ भुगतान अपेक्षित भविष्य का पुरस्कार होता है। उदाहरण के लिए, मोंटे कार्लो ट्री सर्च गेम ट्री अन्वेषण को निर्देशित करने के लिए एक UCB संस्करण का उपयोग करता है, जैसा कि शतरंज इंजन जैसे कार्यक्रमों में देखा जाता है।
अन्वेषण समस्याएँ
कुछ वातावरण व्यापार-संतुलन के लिए विशिष्ट चुनौतियाँ पैदा करते हैं।
विरल पुरस्कार: यदि पुरस्कार केवल कभी-कभार दिखाई देते हैं, तो एजेंट अन्वेषण में बने नहीं रह सकते। एक मानक उदाहरण अटारी गेम मोंटेज़ुमा का बदला है, जहाँ स्पष्ट पुरस्कार दुर्लभ हैं।
भ्रामक पुरस्कार: जब कुछ प्रारंभिक क्रियाएँ तत्काल लेकिन छोटे पुरस्कार देती हैं, और अन्य बड़े विलंबित पुरस्कार देती हैं, तो एजेंट प्रारंभिक छोटे पुरस्कारों के दोहन में फँस सकते हैं।
शोरगुल वाला टीवी समस्या: यदि कुछ अवलोकन अपरिवर्तनीय रूप से शोरगुल वाले हैं, जैसे यादृच्छिक छवियों वाला एक टेलीविजन, तो एक एजेंट उन अप्रत्याशित अवस्थाओं को बार-बार देखने में फँस सकता है।
ये समस्याएँ इष्टतम संतुलन प्राप्त करना कठिन बना देती हैं, जिसके लिए अन्वेषण को निर्देशित करने के लिए अतिरिक्त तकनीकों की आवश्यकता होती है।
अन्वेषण पुरस्कार विधियाँ
अन्वेषण पुरस्कार विधियाँ दुविधा को एक विशुद्ध दोहन समस्या में बदल देती हैं, अन्वेषण को एक आंतरिक पुरस्कार के रूप में मानकर। फिर एजेंट पर्यावरण से बाह्य पुरस्कार और आंतरिक अन्वेषण बोनस के योग को अधिकतम करने का लक्ष्य रखता है। आंतरिक और बाह्य पुरस्कार समय चरण t पर r_t^e और r_t^i के रूप में लिखे जाते हैं।
यह दृष्टिकोण दोहन से दो प्रमुख तरीकों से भिन्न है: पहला, अन्वेषण पुरस्कार शोधकर्ता द्वारा स्वतंत्र रूप से डिज़ाइन किया जाता है, जबकि बाह्य पुरस्कार पर्यावरण द्वारा दिए जाते हैं; दूसरा, जबकि बाह्य पुरस्कार आमतौर पर स्थिर होते हैं, आंतरिक पुरस्कार गैर-स्थिर होते हैं, जिसका अर्थ है कि एक ही क्रिया परिचित होने पर कम और कम बोनस देती है।
गणना-आधारित अन्वेषण मापता है कि एक अवस्था कितनी बार देखी जाती है और कम देखी गई अवस्थाओं को पुरस्कृत करता है, लेकिन यह केवल छोटे और असतत अवस्था स्थानों में संभव है। घनत्व-आधारित अन्वेषण इसे एक घनत्व मॉडल का उपयोग करके विस्तारित करता है, जहाँ एक अवस्था का दौरा पास की अवस्थाओं को भी आंशिक श्रेय देता है। अधिकतम एंट्रॉपी अन्वेषण एजेंट की नीति की एंट्रॉपी को एक आंतरिक पद के रूप में जोड़ता है, जो यादृच्छिक या विविध क्रियाओं को पसंद करने वाली नीति को प्रोत्साहित करता है।
पूर्वानुमान-आधारित अन्वेषण
एक अग्रगामी गतिशीलता मॉडल वर्तमान अवस्था और क्रिया से अगली अवस्था की भविष्यवाणी करता है: f: (s_t, a_t) को s_{t+1} पर मैप किया जाता है। जैसे-जैसे एजेंट पर्यावरण के साथ बातचीत करता है, यह इस मॉडल को परिचित पथों के लिए अवस्था संक्रमणों की भविष्यवाणी करने में बेहतर बनने के लिए प्रशिक्षित करता है। एक पूर्वानुमान-आधारित अन्वेषण बोनस आंतरिक पुरस्कार को मॉडल भविष्यवाणियों और वास्तविक अगली अवस्थाओं के बीच त्रुटि के रूप में परिभाषित करता है। जब एक अवस्था नई होती है, तो मॉडल त्रुटि अधिक होती है, जिससे वह क्रिया आकर्षक बन जाती है।
पूर्वानुमान द्वारा अन्वेषण उच्च-आयामी अवस्था स्थानों में विशेष रूप से उपयोगी है जहाँ गणनाओं का उपयोग नहीं किया जा सकता। मॉडल की त्रुटियाँ आश्चर्य के अनुमान के रूप में कार्य करती हैं, जो एजेंट को उन अवस्थाओं की तलाश करने के लिए प्रोत्साहित करती हैं जिनकी भविष्यवाणी करना कठिन है, बाहरी मार्गदर्शन के बिना व्यापक अन्वेषण को बढ़ावा देती हैं। यह विधि हाल के गहन सुदृढीकरण लर्निंग प्रणालियों में व्यापक रूप से उपयोग की जाती है।