आधार दर किसी प्रासंगिक संदर्भ जनसंख्या के भीतर किसी घटना, गुण या श्रेणी की अंतर्निहित आवृत्ति या संभावना है, जो किसी विशिष्ट मामले या साक्ष्य से स्वतंत्र होती है। संभाव्यता सिद्धांत और सांख्यिकी में, यह बायेसियन अनुमान में पूर्व संभावना के रूप में कार्य करती है, जो नए डेटा पर विचार करने से पहले किसी परिणाम की संभावना के बारे में प्रारंभिक विश्वास का प्रतिनिधित्व करती है। उदाहरण के लिए, यदि कोई बीमारी किसी जनसंख्या के 1% को प्रभावित करती है, तो वह 1% उस बीमारी की आधार दर है। आधार दरें चिकित्सा, वित्त, मशीन लर्निंग और संज्ञानात्मक मनोविज्ञान जैसे क्षेत्रों के लिए मौलिक हैं, जहाँ सटीक निर्णयों के लिए पूर्व संभावनाओं को मामले-विशिष्ट जानकारी के साथ जोड़ने की आवश्यकता होती है।
आधार दर की उपेक्षा एक सुप्रलेखित संज्ञानात्मक पूर्वाग्रह है जिसमें व्यक्ति विशिष्ट, ज्वलंत या हाल की जानकारी को अधिक महत्व देते हैं और व्यापक सांख्यिकीय संदर्भ को कम महत्व देते हैं। इस घटना का व्यवस्थित अध्ययन मनोवैज्ञानिक डैनियल काह्नमैन और अमोस टावर्सकी ने 1970 के दशक में प्रसिद्ध कैब दुर्घटना परिदृश्य जैसी समस्याओं से जुड़े प्रयोगों के माध्यम से किया, जहाँ प्रतिभागी अक्सर गवाह की विश्वसनीयता के पक्ष में कैब के रंगों की आधार दर को अनदेखा कर देते थे। यह पूर्वाग्रह कई क्षेत्रों में बना रहता है, जिससे चिकित्सा निदान, कानूनी निर्णयों और भर्ती निर्णयों में त्रुटियाँ होती हैं। पूर्वानुमानों को कैलिब्रेट करने और तर्क में व्यवस्थित त्रुटियों से बचने के लिए आधार दरों को समझना आवश्यक है।
बायेसियन अनुमान और आधार दरें
बायेसियन सांख्यिकी में, आधार दर साक्ष्य B को देखने से पहले परिकल्पना A की पूर्व संभावना P(A) है। बेयस का प्रमेय इस पूर्व को संभावना P(B|A) और सीमांत संभावना P(B) का उपयोग करके पश्च संभावना P(A|B) प्राप्त करने के लिए अद्यतन करता है। सूत्र है: P(A|B) = [P(B|A) * P(A)] / P(B)। जब आधार दरें चरम होती हैं, तो वे पश्च पर हावी हो सकती हैं, भले ही संभावनाएँ मजबूत हों। उदाहरण के लिए, 1% आधार दर वाली बीमारी के लिए 99% संवेदनशीलता और 99% विशिष्टता वाला एक परीक्षण केवल लगभग 50% का सकारात्मक भविष्य कहनेवाला मान देता है, जिसका अर्थ है कि सकारात्मक परीक्षण परिणाम केवल आधे समय सही होता है। यह प्रति-सहज परिणाम इस बात पर प्रकाश डालता है कि नैदानिक तर्क में आधार दरों को क्यों शामिल किया जाना चाहिए।
मशीन लर्निंग में आधार दरें
Machine learning में, आधार दरें वर्गीकरण समस्याओं में वर्ग पूर्व के रूप में दिखाई देती हैं। एक डेटासेट जहाँ 99% उदाहरण एक वर्ग से संबंधित होते हैं, उस वर्ग के लिए उच्च आधार दर होती है, और एक मॉडल जो हमेशा बहुमत वर्ग की भविष्यवाणी करता है, अर्थपूर्ण पैटर्न सीखे बिना उच्च सटीकता प्राप्त कर सकता है। यह मुद्दा वर्ग असंतुलन समस्या के रूप में जाना जाता है। आधार दर प्रभावों को कम करने के लिए पुनर्नमूनाकरण, लागत-संवेदनशील शिक्षण और निर्णय सीमा समायोजन जैसी तकनीकों का उपयोग किया जाता है। Deep learning और Neural network प्रशिक्षण में, cross-entropy जैसे हानि फलन अंतर्निहित रूप से वर्ग पूर्व को शामिल करते हैं, और चिकित्सक अक्सर सत्य आधार दरों से मेल खाने के लिए मॉडल आउटपुट को कैलिब्रेट करते हैं। उदाहरण के लिए, धोखाधड़ी का पता लगाने में, जहाँ धोखाधड़ी वाले लेनदेन दुर्लभ (कम आधार दर) होते हैं, मॉडल को सटीकता और पुनर्स्मरण को संतुलित करने के लिए ट्यून किया जाना चाहिए, अक्सर अकेले सटीकता के बजाय सटीकता-पुनर्स्मरण वक्रों का उपयोग करते हुए।
संज्ञानात्मक पूर्वाग्रह और आधार दर उपेक्षा
आधार दर उपेक्षा प्रतिनिधित्व अनुमानी का एक रूप है, जहाँ लोग सांख्यिकीय आवृत्ति के बजाय समानता से संभावना का न्याय करते हैं। एक क्लासिक अध्ययन में, प्रतिभागियों को एक ऐसे व्यक्ति के बारे में बताया गया जिसे शर्मीला और साफ-सुथरा बताया गया, फिर पूछा गया कि क्या वे पुस्तकालयाध्यक्ष या किसान होने की अधिक संभावना रखते हैं। अधिकांश ने पुस्तकालयाध्यक्ष को चुना, जनसंख्या में किसानों की बहुत अधिक आधार दर को अनदेखा करते हुए। यह पूर्वाग्रह संस्कृतियों में मजबूत है और तब भी बना रहता है जब आधार दरें स्पष्ट रूप से प्रदान की जाती हैं। शोधकर्ताओं ने पाया है कि आधार दरों को प्रतिशत प्रारूप के बजाय आवृत्ति प्रारूप (जैसे, "1000 में से 10") में प्रस्तुत करने से उपेक्षा कम होती है, साथ ही संदर्भ वर्ग को अधिक ठोस बनाने से भी। कानूनी सेटिंग्स में, अभियोजक और जूरी अक्सर डीएनए साक्ष्य या प्रत्यक्षदर्शी गवाही का मूल्यांकन करते समय आधार दर उपेक्षा के शिकार होते हैं, जिससे न्याय में त्रुटियाँ होती हैं।
चिकित्सा और वित्त में अनुप्रयोग
चिकित्सा में, स्क्रीनिंग परीक्षणों की व्याख्या के लिए आधार दरें महत्वपूर्ण हैं। कम आधार दर वाली स्थिति के लिए, अत्यधिक सटीक परीक्षण भी कई गलत सकारात्मक परिणाम उत्पन्न करते हैं, जिससे अनावश्यक चिंता और प्रक्रियाएँ होती हैं। उदाहरण के लिए, 50 वर्ष से कम उम्र की महिलाओं में स्तन कैंसर के लिए नियमित मैमोग्राफी में बीमारी की कम आधार दर होती है, जिसके परिणामस्वरूप उच्च गलत-सकारात्मक दरें होती हैं। वित्त में, आधार दरें जोखिम मूल्यांकन और पोर्टफोलियो आवंटन को सूचित करती हैं। क्रेडिट स्कोरिंग मॉडल विभिन्न उधारकर्ता खंडों के लिए ब्याज दरें और क्रेडिट सीमाएँ निर्धारित करने के लिए ऐतिहासिक डिफ़ॉल्ट दरों (आधार दरों) का उपयोग करते हैं। बीमा कंपनियाँ प्रीमियम मूल्य निर्धारण और आरक्षित निधि के लिए बीमांकिक आधार दरों पर निर्भर करती हैं। दोनों क्षेत्रों में, आधार दरों को ध्यान में रखने में विफलता विनाशकारी गलत निर्णयों का कारण बन सकती है, जैसे वित्तीय संकटों के दौरान प्रणालीगत जोखिम को कम आंकना।
एआई सिस्टम में आधार दरें
Artificial intelligence और Generative AI में, आधार दरें मॉडल व्यवहार और मूल्यांकन को प्रभावित करती हैं। इंटरनेट टेक्स्ट पर प्रशिक्षित बड़े भाषा मॉडल भाषा पैटर्न की आधार दरों को विरासत में लेते हैं, जो प्रशिक्षण डेटा के तिरछा होने पर पक्षपाती आउटपुट का कारण बन सकते हैं। उदाहरण के लिए, एक मॉडल कुछ व्यवसायों को विशिष्ट लिंगों से जोड़ सकता है क्योंकि वे जुड़ाव कॉर्पस में अधिक बार होते हैं। शोधकर्ता डिबायसिंग तकनीकों और Top-P (Nucleus) Sampling और Temperature Scaling जैसे नमूनाकरण विधियों को समायोजित करके आउटपुट विविधता को नियंत्रित करके इसका समाधान करते हैं। Transformer (architecture) आर्किटेक्चर में, ध्यान तंत्र साक्ष्य को तौलना सीखते हैं, लेकिन अंतर्निहित आधार दरें अभी भी भविष्यवाणियों को आकार देती हैं। कैलिब्रेशन त्रुटि जैसे मूल्यांकन मेट्रिक्स मापते हैं कि मॉडल का आत्मविश्वास वास्तविक आधार दरों के साथ कितनी अच्छी तरह मेल खाता है। जैसे-जैसे एआई सिस्टम स्वास्थ्य देखभाल और आपराधिक न्याय जैसे उच्च-दांव वाले क्षेत्रों में तैनात किए जाते हैं, यह सुनिश्चित करना कि वे आधार दरों का सम्मान करते हैं, निष्पक्षता और विश्वसनीयता के लिए महत्वपूर्ण है।
ऐतिहासिक संदर्भ और अनुसंधान
आधार दरों में रुचि आधुनिक संभाव्यता सिद्धांत से पहले की है। 18वीं शताब्दी में, थॉमस बेयस ने उस प्रमेय को विकसित किया जो उनका नाम रखता है, और पियरे-साइमन लाप्लास ने बाद में इसे सामान्यीकृत किया। आधार दर उपेक्षा का औपचारिक अध्ययन 1970 के दशक में काह्नमैन और टावर्सकी के अनुमानी और पूर्वाग्रहों पर काम के साथ उभरा, जिसने काह्नमैन को 2002 में आर्थिक विज्ञान में नोबेल मेमोरियल पुरस्कार दिलाया। गेर्ड गिगेरेनज़र और अन्य द्वारा बाद के शोध ने तर्क दिया कि मनुष्य आधार दरों के साथ तर्क कर सकते हैं जब जानकारी प्राकृतिक आवृत्तियों में प्रस्तुत की जाती है, यह सुझाव देते हुए कि पूर्वाग्रह आंशिक रूप से प्रारूप का परिणाम है। cognitive science में, Joshua Tenenbaum और Brendan Lake जैसे शोधकर्ताओं ने पता लगाया है कि मनुष्य आधार दरों को कारण मॉडल के साथ कैसे एकीकृत करते हैं, Machine learning में कम्प्यूटेशनल दृष्टिकोणों को सूचित करते हुए। यह अवधारणा बायेसियन सांख्यिकी, निर्णय सिद्धांत और मजबूत एआई सिस्टम के विकास के लिए केंद्रीय बनी हुई है।