बेयसियन रिग्रेट (Bayesian regret) निर्णय सिद्धांत और मशीन लर्निंग में एक अवधारणा है जो किसी एजेंट द्वारा उपयोगकर्ता की वास्तविक प्राथमिकताओं या उपयोगिता फलन के बारे में अनिश्चितता के कारण उत्पन्न होने वाली अपेक्षित हानि को मापता है। प्राथमिकता-आधारित सीखने में, एक AI प्रणाली को अक्सर स्पष्ट संख्यात्मक पुरस्कारों के बजाय अप्रत्यक्ष फीडबैक, जैसे तुलना या रैंकिंग, से पुरस्कारों का अनुमान लगाना पड़ता है। बेयसियन रिग्रेट सही प्राथमिकता मॉडल के तहत इष्टतम नीति के अपेक्षित संचयी पुरस्कार और सीखी गई नीति द्वारा प्राप्त अपेक्षित पुरस्कार के बीच के अंतर को औपचारिक रूप देता है, जहाँ अपेक्षा अज्ञात प्राथमिकताओं के पश्च वितरण पर ली जाती है।
यह शब्द विशेष रूप से उन परिस्थितियों में प्रासंगिक है जहाँ एक एजेंट को अन्वेषण - अनिश्चितता को कम करने के लिए जानकारी एकत्र करना - और दोहन - तत्काल पुरस्कार को अधिकतम करने के लिए कार्य करना - के बीच संतुलन बनाना होता है। कम बेयसियन रिग्रेट इंगित करता है कि एजेंट के निर्णय अधूरे ज्ञान के बावजूद लगभग इष्टतम हैं, जबकि उच्च रिग्रेट सीखने या निर्णय लेने में अक्षमता का संकेत देता है। यह माप फ्रीक्वेंटिस्ट रिग्रेट (frequentist regret) से भिन्न है, जो निश्चित लेकिन अज्ञात मापदंडों को मानता है, जबकि बेयसियन रिग्रेट एक पूर्व वितरण पर समाकलन करता है जिसे डेटा आने पर अद्यतन किया जाता है।
निर्णय सिद्धांत में आधार
बेयसियन रिग्रेट व्यक्तिपरक संभाव्यता के बेयसियन ढांचे पर आधारित है, जहाँ अनिश्चितता को संभाव्यता वितरणों द्वारा दर्शाया जाता है जिन्हें बेयस प्रमेय के माध्यम से संशोधित किया जाता है। प्राथमिकता सीखने के संदर्भ में, पूर्व वितरण उपयोगकर्ता प्राथमिकताओं के बारे में प्रारंभिक धारणाओं को एन्कोड करता है, और तुलना या विकल्पों को देखने के बाद पश्च वितरण की गणना की जाती है। यह अवधारणा शास्त्रीय अपेक्षित उपयोगिता सिद्धांत का विस्तार करती है, जो अनिश्चितता के तहत किए गए निर्णयों को स्पष्ट रूप से दंडित करती है।
एक औपचारिक परिभाषा अक्सर मल्टी-आर्म्ड बैंडिट और रीइन्फोर्समेंट लर्निंग साहित्य में दिखाई देती है। क्रियाओं या नीतियों के एक सेट को देखते हुए, T समय चरणों के बाद बेयसियन रिग्रेट, इष्टतम क्रिया के पुरस्कार और चुनी गई क्रिया के पुरस्कार के बीच अंतर का अपेक्षित योग है, जिसमें पुरस्कार पश्च वितरण और पर्यावरण की स्टोकेस्टिकता पर औसत किए जाते हैं। यह अपेक्षा चिकित्सकों को तैनाती से पहले एल्गोरिदम की तुलना करने की अनुमति देती है, अनुकरणित पूर्व वितरणों का उपयोग करके प्रदर्शन की भविष्यवाणी करती है।
मानव फीडबैक से रीइन्फोर्समेंट लर्निंग में भूमिका
आधुनिक कृत्रिम बुद्धिमत्ता में, बेयसियन रिग्रेट मानव फीडबैक से रीइन्फोर्समेंट लर्निंग (RLHF) के लिए केंद्रीय है, जो बड़े भाषा मॉडल को मानव मूल्यों के साथ संरेखित करने के लिए उपयोग की जाने वाली तकनीक है। OpenAI का ChatGPT और Anthropic का Claude जैसे सिस्टम एक पुरस्कार मॉडल सीखने के लिए मॉडल आउटपुट की मानव तुलना पर निर्भर करते हैं। बेयसियन रिग्रेट यह मापने में मदद करता है कि सीखा गया पुरस्कार मॉडल वास्तविक मानव प्राथमिकताओं का कितनी अच्छी तरह अनुमान लगाता है, जो क्वेरी नीतियों के चयन का मार्गदर्शन करता है जो अनिश्चितता को कुशलता से कम करती हैं।
शोधकर्ता अक्सर प्राथमिकताओं के लिए सक्रिय सीखने को बेयसियन रिग्रेट न्यूनीकरण समस्या के रूप में तैयार करते हैं। एजेंट उन क्वेरी को चुनता है जो पश्च वितरण के प्रसरण को सबसे तेज़ी से कम करने की उम्मीद करते हैं, जिससे भविष्य के रिग्रेट में कमी आती है। प्राथमिकता निष्कर्षण के लिए बेयसियन अनुकूलन जैसे एल्गोरिदम अभिसरण दरों की गारंटी देने के लिए रिग्रेट सीमाओं का उपयोग करते हैं, यह सुनिश्चित करते हुए कि मॉडल जटिलता बढ़ने पर भी आवश्यक मानव लेबलों की संख्या प्रबंधनीय रहती है।
अन्य रिग्रेट धारणाओं के साथ तुलना
रिग्रेट ऑनलाइन सीखने में एक व्यापक अवधारणा है, जिसमें कई प्रकार होते हैं। फ्रीक्वेंटिस्ट रिग्रेट मानता है कि सही पैरामीटर निश्चित है और संभावित सही मूल्यों पर सबसे खराब स्थिति के प्रदर्शन का मूल्यांकन करता है। इसके विपरीत, बेयसियन रिग्रेट पूर्व वितरण पर औसत करता है, जिससे यह पूर्व वितरण की सटीकता के प्रति संवेदनशील हो जाता है। यह अंतर व्यवहार में मायने रखता है: एक गलत तरीके से चुना गया पूर्व वितरण बेयसियन रिग्रेट अनुमानों को बढ़ा सकता है, जबकि फ्रीक्वेंटिस्ट सीमाएँ सबसे खराब स्थिति की गारंटी देती हैं लेकिन अत्यधिक निराशावादी हो सकती हैं।
एक और संबंधित धारणा सिंपल रिग्रेट (simple regret) है, जो संचयी प्रदर्शन के बजाय अंतिम अनुशंसित क्रिया की उप-इष्टतमता को मापता है। बेयसियन रिग्रेट अक्सर संचयी उद्देश्यों के लिए उपयोग किया जाता है, जैसे इंटरैक्टिव अनुशंसा प्रणालियों में जहाँ प्रत्येक इंटरैक्शन कुल उपयोगकर्ता संतुष्टि में योगदान देता है। प्राथमिकता संरेखण में, दोनों मीट्रिक्स का उपयोग किया जाता है, लेकिन बेयसियन रिग्रेट को तब पसंद किया जाता है जब लक्ष्य इंटरैक्शन के अनुक्रम पर कुल गलत संरेखण को कम करना होता है।
AI प्रणालियों में अनुप्रयोग
बेयसियन रिग्रेट कई तैनात AI संदर्भों में दिखाई देता है। संवादी एजेंटों में, यह मार्गदर्शन करता है कि सिस्टम को अपने वर्तमान विश्वास पर कार्य करने के बजाय कितनी बार स्पष्टीकरण प्रश्न पूछने चाहिए। स्वायत्त रोबोटिक्स में, यह कौशल अधिग्रहण के दौरान सुरक्षित अन्वेषण को संतुलित करने में मदद करता है। Google DeepMind जैसी कंपनियों ने अनुशंसा एल्गोरिदम के लिए रिग्रेट-जागरूक प्रशिक्षण का पता लगाया है, यह सुनिश्चित करते हुए कि अन्वेषणात्मक क्रियाएँ उपयोगकर्ता अनुभव को अनुचित रूप से नुकसान न पहुँचाएँ।
यह अवधारणा पाठ्यक्रम सीखने और अनुकूली शिक्षण रणनीतियों के मूल्यांकन को भी सूचित करती है। एक शिक्षार्थी की आंतरिक अनिश्चितता का मॉडलिंग करके, शिक्षक या AI ट्यूटर ऐसे अभ्यास चुन सकते हैं जो ज्ञान अधिग्रहण पर बेयसियन रिग्रेट को कम करते हैं। यह दृष्टिकोण संज्ञानात्मक विज्ञान और शैक्षिक प्रौद्योगिकी में अध्ययन किया गया है, जो माइकल जॉर्डन और ब्रेंडन लेक जैसे विद्वानों के शोध से जुड़ा है।
चुनौतियाँ और सीमाएँ
बड़े मॉडलों के लिए सटीक बेयसियन रिग्रेट की गणना अक्सर कठिन होती है, जिसके लिए नमूनाकरण या वैरिएशनल तरीकों के माध्यम से अनुमान की आवश्यकता होती है। पूर्व वितरण का चुनाव परिणामों को दृढ़ता से प्रभावित करता है; गलत रूप से निर्दिष्ट पूर्व वितरण भ्रामक रिग्रेट मूल्यों की ओर ले जाते हैं। इसके अतिरिक्त, मानव प्राथमिकताएँ गैर-स्थिर और संदर्भ-निर्भर हैं, जो एक निश्चित उपयोगिता फलन की धारणा को तोड़ देती हैं। परिणामस्वरूप, व्यावहारिक प्रणालियाँ रिग्रेट अनुमानों को सख्त अनुकूलन लक्ष्यों के बजाय अनुमानित तरीके से उपयोग करती हैं।
हालिया कार्य इन मुद्दों को बेयसियन रिग्रेट को वितरणात्मक मजबूती के साथ जोड़कर संबोधित करता है, सबसे खराब स्थिति वाले पूर्व वितरणों के खिलाफ सुरक्षा प्रदान करता है। MIT CSAIL और टोरंटो विश्वविद्यालय जैसे संस्थानों के शोधकर्ताओं ने ऐसे एल्गोरिदम प्रस्तावित किए हैं जो पूर्व वितरण प्रतिकूल होने पर भी कम रिग्रेट प्राप्त करते हैं। ये प्रगति बेयसियन रिग्रेट को वास्तविक दुनिया के संरेखण समस्याओं पर अधिक लागू करती है, जहाँ मानव फीडबैक शोरगुल वाला और विकसित होता है।
यह भी देखें
- रीइन्फोर्समेंट-लर्निंग-फ्रॉम-ह्यूमन-फीडबैक
- प्राथमिकता-सीखने
- मल्टी-आर्म्ड-बैंडिट
- बेयसियन-अनुमान
- पुरस्कार-मॉडलिंग