विश्वसनीयता आरेख (reliability diagram) एक ग्राफिकल उपकरण है जिसका उपयोग प्रायिकता-आधारित वर्गीकरणकर्ताओं (probabilistic classifiers) के अंशांकन (calibration) का मूल्यांकन करने के लिए किया जाता है। यह x-अक्ष पर भविष्यवाणी की गई प्रायिकताओं को और y-अक्ष पर सकारात्मक वर्ग की देखी गई आवृत्तियों को दर्शाता है। एक पूर्ण रूप से अंशांकित मॉडल में, बिंदु विकर्ण रेखा y = x के साथ स्थित होते हैं, जिसका अर्थ है कि जब मॉडल किसी घटना की 70% संभावना की भविष्यवाणी करता है, तो घटना लगभग 70% बार घटित होती है। इस विकर्ण से विचलन मॉडल की भविष्यवाणियों में व्यवस्थित अति-आत्मविश्वास (overconfidence) या अल्प-आत्मविश्वास (underconfidence) को प्रकट करता है।
आरेख का निर्माण भविष्यवाणियों को अंतरालों (जैसे, दशमलव) में विभाजित करके और प्रत्येक अंतराल के भीतर सकारात्मक परिणामों की अनुभवजन्य आवृत्ति की गणना करके किया जाता है। प्रत्येक अंतराल एक एकल बिंदु उत्पन्न करता है, और परिणामी वक्र संपूर्ण प्रायिकता सीमा में अंशांकन का एक दृश्य सारांश प्रदान करता है। विश्वसनीयता आरेख मौसम विज्ञान, चिकित्सा निदान और मशीन लर्निंग जैसे क्षेत्रों में मॉडल विश्वसनीयता का निदान और सुधार करने के लिए व्यापक रूप से उपयोग किए जाते हैं।
ऐतिहासिक उत्पत्ति
विश्वसनीयता आरेख की अवधारणा बीसवीं सदी के मध्य में मौसम पूर्वानुमान के क्षेत्र से उभरी। मौसम विज्ञानियों को वर्षा जैसी घटनाओं के प्रायिकता-आधारित पूर्वानुमानों को सत्यापित करने की आवश्यकता थी, और उन्होंने पूर्वानुमान प्रायिकताओं की तुलना देखे गए परिणामों से करने के लिए ग्राफिकल विधियाँ विकसित कीं। 1950 में ग्लेन डब्ल्यू. ब्रायर (Glenn W. Brier) के प्रारंभिक कार्य ने ब्रायर स्कोर (Brier score) पेश किया, जो पूर्वानुमान सटीकता का एक अदिश माप है, लेकिन अंशांकन का दृश्य प्रतिनिधित्व बाद में आया। 1970 के दशक तक, विश्वसनीयता आरेख मौसम विज्ञान सत्यापन में मानक उपकरण बन गए थे, जिन्हें अक्सर पूर्वानुमान प्रायिकताओं के वितरण को दर्शाने वाले हिस्टोग्राम के साथ जोड़ा जाता था।
इस संदर्भ में "विश्वसनीयता" शब्द भविष्यवाणी की गई प्रायिकताओं और देखी गई सापेक्ष आवृत्तियों के बीच सांख्यिकीय सहमति को संदर्भित करता है। मौसम विज्ञान में, आरेख को कभी-कभी "अंशांकन प्लॉट" (calibration plot) या "विश्वसनीयता वक्र" (reliability curve) कहा जाता था। यह दृष्टिकोण बाद में 1990 और 2000 के दशक में मशीन लर्निंग समुदाय द्वारा अपनाया गया, विशेष रूप से जब प्रायिकता-आधारित वर्गीकरणकर्ता अधिक सामान्य हो गए।
निर्माण और व्याख्या
विश्वसनीयता आरेख बनाने के लिए, पहले एक सत्यापन या परीक्षण डेटासेट पर एक मॉडल से भविष्यवाणी की गई प्रायिकताएँ प्राप्त की जाती हैं। इन भविष्यवाणियों को क्रमबद्ध किया जाता है और एक निश्चित संख्या में अंतरालों में समूहीकृत किया जाता है, आमतौर पर 10 या 20। प्रत्येक अंतराल के लिए, माध्य भविष्यवाणी की गई प्रायिकता को सकारात्मक उदाहरणों के अंश के विरुद्ध प्लॉट किया जाता है। उदाहरण के लिए, यदि एक अंतराल में 0.8 से 0.9 तक की भविष्यवाणियाँ हैं, और संबंधित उदाहरणों में से 85% सकारात्मक हैं, तो बिंदु (0.85, 0.85) विकर्ण पर स्थित होगा।
व्याख्या में विकर्ण से बिंदुओं की दूरी की जाँच करना शामिल है। विकर्ण के ऊपर के बिंदु अल्प-आत्मविश्वास को इंगित करते हैं (मॉडल देखी गई आवृत्तियों की तुलना में कम प्रायिकताओं की भविष्यवाणी करता है), जबकि नीचे के बिंदु अति-आत्मविश्वास को दर्शाते हैं। एक सामान्य सारांश आँकड़ा अपेक्षित अंशांकन त्रुटि (expected calibration error, ECE) है, जो अंतरालों में भविष्यवाणी की गई और देखी गई प्रायिकताओं के बीच पूर्ण अंतरों के भारित औसत की गणना करता है। कम ECE मान बेहतर अंशांकन का संकेत देते हैं।
विश्वसनीयता आरेख अक्सर भविष्यवाणी आवृत्तियों के हिस्टोग्राम के साथ होते हैं ताकि यह दिखाया जा सके कि मॉडल अपनी भविष्यवाणियों को कहाँ केंद्रित करता है। एक मॉडल जो हमेशा 0.5 के करीब प्रायिकताओं की भविष्यवाणी करता है, उसका हिस्टोग्राम बीच में केंद्रित होगा, जबकि एक अच्छी तरह से अंशांकित मॉडल में U-आकार का वितरण हो सकता है यदि यह कई उदाहरणों के बारे में आश्वस्त है।
मशीन लर्निंग में उपयोग
Machine learning में, विश्वसनीयता आरेख कच्ची सटीकता से परे मॉडलों का मूल्यांकन करने के लिए आवश्यक हो गए हैं। आधुनिक वर्गीकरणकर्ता, विशेष रूप से Deep learning मॉडल, अक्सर खराब अंशांकित प्रायिकताएँ उत्पन्न करते हैं। उदाहरण के लिए, एक Neural network जो क्रॉस-एन्ट्रॉपी हानि के साथ प्रशिक्षित होता है, अति-आत्मविश्वास प्रदर्शित कर सकता है, गलत भविष्यवाणियों को उच्च प्रायिकताएँ सौंप सकता है। यह मुद्दा 2017 में चुआन गुओ (Chuan Guo) और सहकर्मियों के एक पेपर में उजागर किया गया था, जिसमें दिखाया गया था कि गहरे नेटवर्क, विशेष रूप से कई वर्गों वाले डेटासेट पर, गलत अंशांकित होते हैं।
विश्वसनीयता आरेख इस गलत अंशांकन को देखने और पुनः अंशांकन तकनीकों का मार्गदर्शन करने के लिए उपयोग किए जाते हैं। सामान्य पोस्ट-प्रोसेसिंग विधियों में Temperature Scaling शामिल है, जो लॉगिट्स को एक एकल अदिश पैरामीटर द्वारा समायोजित करता है, और प्लैट स्केलिंग (Platt scaling), जो भविष्यवाणी की गई प्रायिकताओं पर एक लॉजिस्टिक प्रतिगमन फिट करता है। इन विधियों का उद्देश्य मॉडल की भविष्यवाणियों की रैंकिंग को बदले बिना विश्वसनीयता वक्र को विकर्ण के करीब लाना है।
आरेख विभिन्न मॉडलों की तुलना करने में भी उपयोगी है। समान सटीकता वाले दो मॉडलों में बहुत भिन्न अंशांकन गुण हो सकते हैं, और विश्वसनीयता आरेख प्रकट करता है कि कौन सा अधिक भरोसेमंद प्रायिकताएँ प्रदान करता है। यह उच्च-जोखिम वाले अनुप्रयोगों जैसे चिकित्सा निदान, स्वायत्त ड्राइविंग और वित्तीय जोखिम मूल्यांकन में विशेष रूप से महत्वपूर्ण है।
मौसम पूर्वानुमान में अनुप्रयोग
मौसम विज्ञान विश्वसनीयता आरेखों के लिए एक प्राथमिक क्षेत्र बना हुआ है। पूर्वानुमानकर्ता वर्षा, तापमान चरम सीमाओं और गंभीर तूफान जैसी घटनाओं के लिए प्रायिकता-आधारित भविष्यवाणियाँ जारी करते हैं। आरेख लंबी अवधि में इन प्रायिकताओं की विश्वसनीयता को सत्यापित करने में मदद करते हैं। उदाहरण के लिए, यदि एक पूर्वानुमान प्रणाली कई दिनों में 30% बारिश की संभावना की भविष्यवाणी करती है, तो उन दिनों में से लगभग 30% दिनों में बारिश होनी चाहिए। विश्वसनीयता आरेख पूर्वानुमान केंद्रों को इस स्थिरता की निगरानी करने और अपने मॉडलों में सुधार करने की अनुमति देते हैं।
यूरोपीय मध्यम-श्रेणी मौसम पूर्वानुमान केंद्र (European Centre for Medium-Range Weather Forecasts) और अन्य एजेंसियाँ नियमित रूप से अपने सत्यापन सूट में विश्वसनीयता आरेखों का उपयोग करती हैं। वे अक्सर विभिन्न लीड समय और सीमाओं के लिए अलग-अलग वक्र प्लॉट करते हैं। एक अच्छी तरह से अंशांकित पूर्वानुमान प्रणाली विकर्ण के करीब बिंदु दिखाती है, जबकि व्यवस्थित पूर्वाग्रह लगातार विचलन के रूप में दिखाई देते हैं।
अन्य मीट्रिक्स से संबंध
विश्वसनीयता आरेख ब्रायर स्कोर से निकटता से संबंधित है, जो विश्वसनीयता, रिज़ॉल्यूशन और अनिश्चितता घटकों में विघटित होता है। विश्वसनीयता घटक विकर्ण से आरेख के माध्य वर्ग विचलन से मेल खाता है। इस प्रकार, आरेख ब्रायर स्कोर के एक भाग का दृश्य प्रतिनिधित्व प्रदान करता है। ROC वक्र के अंतर्गत क्षेत्र (AUC) जैसे अन्य मीट्रिक्स विभेदन (discrimination) को मापते हैं, जो अंशांकन से अलग है। एक मॉडल में पूर्ण विभेदन हो सकता है (सभी सकारात्मक को नकारात्मक से ऊपर रैंक करना) लेकिन खराब अंशांकन, और इसके विपरीत।
व्यवहार में, विभेदन और अंशांकन दोनों महत्वपूर्ण हैं। विश्वसनीयता आरेख केवल अंशांकन पर ध्यान केंद्रित करते हैं, जिससे वे ROC वक्रों और परिशुद्धता-पुनर्स्मरण वक्रों के पूरक बन जाते हैं। कुछ शोधकर्ता दोनों की रिपोर्ट करने की वकालत करते हैं, क्योंकि एक मॉडल जो अच्छी तरह से अंशांकित है लेकिन खराब विभेदन करता है, सीमित उपयोग का है, और इसके विपरीत।
सीमाएँ और विस्तार
विश्वसनीयता आरेखों की ज्ञात सीमाएँ हैं। बिनिंग का चुनाव दृश्य उपस्थिति को प्रभावित कर सकता है; बहुत कम बिन स्थानीय गलत अंशांकन को छिपाते हैं, जबकि बहुत अधिक बिन शोर अनुमानों की ओर ले जाते हैं। आरेख यह भी मानता है कि डेटासेट प्रतिनिधि है और सकारात्मक वर्ग अच्छी तरह से परिभाषित है। बहु-वर्ग समस्याओं के लिए, आरेख आमतौर पर प्रत्येक वर्ग के लिए अलग से या एक-बनाम-बाकी (one-vs-rest) दृष्टिकोण का उपयोग करके खींचे जाते हैं।
विस्तार में क्रमिक भविष्यवाणियों और उत्तरजीविता विश्लेषण के लिए विश्वसनीयता आरेख शामिल हैं। हाल के वर्षों में, शोधकर्ताओं ने बिनिंग कलाकृतियों से बचने के लिए कर्नेल स्मूथिंग का उपयोग करके विश्वसनीयता वक्र जैसे विकल्प प्रस्तावित किए हैं। कुछ कार्य चरम प्रायिकताओं को बेहतर ढंग से देखने के लिए लॉगिट पैमाने पर आरेख भी प्लॉट करते हैं। इन विविधताओं के बावजूद, मूल अवधारणा अपरिवर्तित बनी हुई है।
सॉफ्टवेयर और कार्यान्वयन
कई प्रोग्रामिंग लाइब्रेरीज़ विश्वसनीयता आरेख उत्पन्न करने के लिए फ़ंक्शन प्रदान करती हैं। Python में, sklearn.calibration मॉड्यूल में calibration_curve शामिल है, जो प्लॉटिंग के लिए बिंदु लौटाता है। matplotlib लाइब्रेरी का उपयोग आमतौर पर विकर्ण संदर्भ रेखा के साथ आरेख खींचने के लिए किया जाता है। R में, verification पैकेज समान कार्यक्षमता प्रदान करता है। ये उपकरण चिकित्सकों के लिए अपने मॉडल मूल्यांकन पाइपलाइन के हिस्से के रूप में अंशांकन का आकलन करना आसान बनाते हैं।
Artificial intelligence अनुसंधान में, विश्वसनीयता आरेख अक्सर उन पेपरों में शामिल होते हैं जो नए अंशांकन विधियों का प्रस्ताव करते हैं या मॉडल अनिश्चितता का विश्लेषण करते हैं। उदाहरण के लिए, Large language model अंशांकन पर अध्ययन अक्सर यह दिखाने के लिए विश्वसनीयता आरेखों का उपयोग करते हैं कि ये मॉडल अपने आउटपुट के सही होने की प्रायिकता का कितनी अच्छी तरह अनुमान लगाते हैं। आरेख यह स्पष्ट करने में मदद करते हैं कि क्या किसी मॉडल का आत्मविश्वास स्कोर वास्तविक सटीकता के साथ संरेखित होता है।
भविष्य की दिशाएँ
जैसे-जैसे मशीन लर्निंग मॉडल अधिक जटिल होते जा रहे हैं और महत्वपूर्ण डोमेन में तैनात किए जा रहे हैं, अंशांकन एक प्रमुख चिंता बनी रहेगी। विश्वसनीयता आरेख संभवतः एक मानक नैदानिक उपकरण के रूप में काम करते रहेंगे। शोधकर्ता Generative AI और Transformer (architecture)-आधारित मॉडलों के संदर्भ में अंशांकन की खोज कर रहे हैं, जहाँ प्रायिकताओं को परिभाषित करना कम सीधा है। Reinforcement Learning from AI Feedback (RLAIF) या अन्य संरेखण तकनीकों का उपयोग करने जैसी पुनः अंशांकन की नई विधियों का मूल्यांकन विश्वसनीयता आरेखों के साथ किया जा सकता है।
स्वचालित निगरानी प्रणालियों में विश्वसनीयता आरेखों का एकीकरण एक और प्रवृत्ति है। उत्पादन वातावरण में, मॉडलों का निरंतर मूल्यांकन किया जा सकता है, और समय के साथ आरेख को ट्रैक करके अंशांकन में बदलाव का पता लगाया जा सकता है। यह भरोसेमंद AI के व्यापक लक्ष्य के साथ संरेखित होता है, जहाँ मॉडलों को न केवल सटीक होना चाहिए बल्कि अच्छी तरह से अंशांकित और अपनी अनिश्चितता के बारे में ईमानदार भी होना चाहिए।