ब्रीयर स्कोर एक उचित स्कोरिंग नियम है जिसका उपयोग संभाव्य भविष्यवाणियों की गुणवत्ता का मूल्यांकन करने के लिए किया जाता है। यह किसी घटना को सौंपी गई भविष्यवाणी की संभावना और वास्तविक परिणाम के बीच माध्य वर्ग अंतर की गणना करके पूर्वानुमानों की सटीकता को मापता है, जहां परिणाम को 1 के रूप में कोडित किया जाता है यदि घटना घटित होती है और अन्यथा 0 के रूप में। कम ब्रीयर स्कोर बेहतर भविष्य कहनेवाला प्रदर्शन दर्शाता है, जिसमें 0 का स्कोर एक आदर्श पूर्वानुमान और 1 का स्कोर द्विआधारी घटना के लिए सबसे खराब संभव पूर्वानुमान दर्शाता है। यह मीट्रिक 1950 में ग्लेन डब्ल्यू. ब्रीयर द्वारा मंथली वेदर रिव्यू में प्रकाशित एक पेपर में पेश किया गया था, जो मूल रूप से मौसम पूर्वानुमान के लिए डिज़ाइन किया गया था लेकिन बाद में वित्त, चिकित्सा और Machine learning जैसे क्षेत्रों में अपनाया गया।
ब्रीयर स्कोर उचित स्कोरिंग नियमों के रूप में जानी जाने वाली मीट्रिक्स के एक वर्ग से संबंधित है, जो पूर्वानुमानकर्ताओं को हेजिंग या अतिशयोक्ति के बजाय अपनी वास्तविक मान्यताओं की रिपोर्ट करने के लिए प्रोत्साहित करते हैं। द्विआधारी परिणाम के लिए, ब्रीयर स्कोर की गणना (f - o)^2 के औसत के रूप में की जाती है, जहां f भविष्यवाणी की गई संभावना है और o देखा गया परिणाम है (0 या 1)। स्कोर को तीन घटकों में विघटित किया जा सकता है: विश्वसनीयता, संकल्प और अनिश्चितता, जो पूर्वानुमान गुणवत्ता के विभिन्न पहलुओं में अंतर्दृष्टि प्रदान करते हैं। विश्वसनीयता मापती है कि भविष्यवाणी की गई संभावनाएं देखी गई आवृत्तियों के साथ कितनी अच्छी तरह संरेखित होती हैं, संकल्प विभिन्न परिणाम समूहों के बीच अंतर करने की पूर्वानुमान की क्षमता को मापता है, और अनिश्चितता घटना की अंतर्निहित परिवर्तनशीलता का प्रतिनिधित्व करती है।
ब्रीयर स्कोर लघुगणकीय स्कोर और गोलाकार स्कोर जैसे अन्य उचित स्कोरिंग नियमों से निकटता से संबंधित है, लेकिन इसका लाभ यह है कि यह द्विआधारी घटनाओं के लिए 0 और 1 के बीच बद्ध है, जिससे इसे समझना आसान हो जाता है। बहु-वर्गीय समस्याओं में, स्कोर को सभी श्रेणियों में वर्ग अंतरों के योग द्वारा सामान्यीकृत किया जाता है, और इसे वर्गों की संख्या से सामान्यीकृत किया जा सकता है। मीट्रिक का उपयोग एन्सेम्बल पूर्वानुमान में भी किया जाता है, जहां कई मॉडल संभावना अनुमान उत्पन्न करते हैं, और अंशांकन मूल्यांकन में, जहां यह भविष्यवाणी की गई संभावनाओं में व्यवस्थित पूर्वाग्रहों की पहचान करने में मदद करता है।
ऐतिहासिक विकास
ग्लेन डब्ल्यू. ब्रीयर, यू.एस. मौसम ब्यूरो में एक मौसम विज्ञानी, ने 1950 में संभाव्य मौसम पूर्वानुमानों की सटीकता का मूल्यांकन करने के तरीके के रूप में स्कोर पेश किया। उनके मूल पेपर, "Verification of Forecasts Expressed in Terms of Probability," ने पूर्वानुमान कौशल के माप के रूप में माध्य वर्ग त्रुटि का प्रस्ताव रखा। ब्रीयर स्कोर ने 1950 और 1960 के दशक के दौरान मौसम विज्ञान समुदाय में गति प्राप्त की, विशेष रूप से संख्यात्मक मौसम पूर्वानुमान मॉडल के आगमन के साथ जो संभाव्य आउटपुट उत्पन्न करते थे। 1973 में, एलन एच. मर्फी और रॉबर्ट एल. विंकलर ने स्कोर की सैद्धांतिक समझ में योगदान दिया, इसे विश्वसनीयता, संकल्प और अनिश्चितता घटकों में विघटित करके, जो पूर्वानुमान सत्यापन के लिए एक मानक ढांचा बन गया।
1980 और 1990 के दशक के दौरान, ब्रीयर स्कोर ने मौसम विज्ञान से परे अनुप्रयोग पाए। सांख्यिकीविदों और अर्थशास्त्रियों ने वित्त में संभाव्य पूर्वानुमानों का मूल्यांकन करने के लिए इसका उपयोग करना शुरू किया, जैसे कि शेयर बाजार की गतिविधियों या क्रेडिट डिफॉल्ट की भविष्यवाणी। 2000 के दशक में, Machine learning और Artificial intelligence के उदय ने ब्रीयर स्कोर को मॉडल मूल्यांकन की मुख्यधारा में ला दिया, विशेष रूप से वर्गीकरण कार्यों के लिए जहां मॉडल कठोर लेबल के बजाय संभावनाएं आउटपुट करते हैं। स्कोर अब कई मशीन लर्निंग लाइब्रेरीज़ में एक मानक मीट्रिक है और कैगल चुनौतियों जैसी प्रतियोगिताओं में उपयोग किया जाता है।
गणितीय परिभाषा
द्विआधारी घटना के लिए देखे गए परिणाम y (जहां y = 1 यदि घटना घटित होती है और y = 0 अन्यथा) और भविष्यवाणी की गई संभावना p (जहां 0 ≤ p ≤ 1) के साथ, एकल भविष्यवाणी के लिए ब्रीयर स्कोर BS = (p - y)^2 के रूप में परिभाषित किया गया है। N भविष्यवाणियों के सेट के लिए, माध्य ब्रीयर स्कोर इन वर्ग अंतरों का औसत है: BS = (1/N) Σ (p_i - y_i)^2। स्कोर 0 से 1 तक होता है, जिसमें 0 पूर्ण सटीकता और 1 सबसे खराब संभव स्कोर है जब पूर्वानुमान परिणाम के बिल्कुल विपरीत होता है।
K वर्गों के साथ बहु-वर्गीय समस्याओं के लिए, ब्रीयर स्कोर BS = (1/N) Σ Σ (p_ij - y_ij)^2 के रूप में परिभाषित किया गया है, जहां p_ij उदाहरण i में वर्ग j के लिए भविष्यवाणी की गई संभावना है, और y_ij 1 है यदि सही वर्ग j है और अन्यथा 0। यह सूत्रीकरण सुनिश्चित करता है कि स्कोर बद्ध रहे, अधिकतम संभव मान वर्गों की संख्या पर निर्भर करता है। बहु-वर्गीय ब्रीयर स्कोर अक्सर Deep learning मॉडल में उपयोग किया जाता है जो कई श्रेणियों पर संभावना वितरण आउटपुट करते हैं।
ब्रीयर स्कोर को अंशांकन और परिष्करण के संदर्भ में भी व्यक्त किया जा सकता है। अंशांकन भविष्यवाणी की गई संभावनाओं और देखी गई आवृत्तियों के बीच सहमति को संदर्भित करता है, जबकि परिष्करण भविष्यवाणियों की तीक्ष्णता को संदर्भित करता है। उच्च परिष्करण के साथ एक अच्छी तरह से अंशांकित मॉडल में कम ब्रीयर स्कोर होगा, जबकि कम परिष्करण के साथ खराब अंशांकित मॉडल में उच्च स्कोर होगा।
अपघटन और व्याख्या
ब्रीयर स्कोर को तीन योजक घटकों में विघटित किया जा सकता है: विश्वसनीयता (REL), संकल्प (RES), और अनिश्चितता (UNC)। अपघटन BS = REL - RES + UNC द्वारा दिया गया है। विश्वसनीयता प्रत्येक संभावना बिन के भीतर भविष्यवाणी की गई संभावनाओं और देखी गई आवृत्ति के बीच माध्य वर्ग अंतर को मापती है। कम विश्वसनीयता बेहतर अंशांकन दर्शाती है। संकल्प विभिन्न संभावना बिनों में देखी गई आवृत्तियों के विचरण को मापता है, उच्च संकल्प के साथ यह दर्शाता है कि पूर्वानुमान विभिन्न परिणाम समूहों को प्रभावी ढंग से अलग कर सकता है। अनिश्चितता देखे गए परिणामों का विचरण है, जो पूर्वानुमान से स्वतंत्र है और घटना की अंतर्निहित अप्रत्याशितता का प्रतिनिधित्व करता है।
यह अपघटन मॉडल प्रदर्शन के निदान के लिए विशेष रूप से उपयोगी है। उदाहरण के लिए, यदि किसी मॉडल में उच्च विश्वसनीयता लेकिन कम संकल्प है, तो यह अपनी भविष्यवाणियों में अति-आत्मविश्वासी हो सकता है। इसके विपरीत, यदि किसी मॉडल में उच्च संकल्प लेकिन खराब विश्वसनीयता है, तो यह अच्छी तरह से विभेदक लेकिन खराब अंशांकित हो सकता है। अपघटन चिकित्सकों को सुधार के लिए विशिष्ट क्षेत्रों की पहचान करने की अनुमति देता है, जैसे कि Temperature Scaling या Batch Normalization-आधारित विधियों जैसी तकनीकों का उपयोग करके संभावनाओं को पुनः अंशांकित करना।
व्यवहार में, ब्रीयर स्कोर की तुलना अक्सर आधार रेखा, जैसे कि जलवायु संबंधी औसत या एक स्थिर पूर्वानुमान के खिलाफ की जाती है। ब्रीयर स्किल स्कोर (BSS) एक सामान्यीकृत संस्करण है जो संदर्भ पूर्वानुमान पर पूर्वानुमान के सुधार को व्यक्त करता है, जिसकी गणना BSS = 1 - (BS_forecast / BS_reference) के रूप में की जाती है। एक सकारात्मक BSS इंगित करता है कि पूर्वानुमान संदर्भ से बेहतर है, जबकि एक नकारात्मक BSS खराब प्रदर्शन दर्शाता है।
मशीन लर्निंग में अनुप्रयोग
Machine learning में, ब्रीयर स्कोर का उपयोग आमतौर पर संभाव्य वर्गीकरणकर्ताओं का मूल्यांकन करने के लिए किया जाता है, विशेष रूप से द्विआधारी वर्गीकरण कार्यों में। कई मॉडल, जैसे कि लॉजिस्टिक रिग्रेशन, Neural network और Large language model, संभावनाएं आउटपुट करते हैं जिनका सीधे ब्रीयर स्कोर का उपयोग करके मूल्यांकन किया जा सकता है। सटीकता के विपरीत, जो केवल भविष्यवाणी किए गए वर्ग लेबल पर विचार करती है, ब्रीयर स्कोर गलत भविष्यवाणियों और अति-आत्मविश्वासी या कम-आत्मविश्वासी संभावनाओं दोनों को दंडित करता है। यह इसे उन अनुप्रयोगों के लिए एक मूल्यवान मीट्रिक बनाता है जहां भविष्यवाणियों का आत्मविश्वास महत्वपूर्ण है, जैसे कि चिकित्सा निदान, स्वायत्त ड्राइविंग और वित्तीय जोखिम मूल्यांकन।
ब्रीयर स्कोर का उपयोग एन्सेम्बल विधियों में भी किया जाता है, जहां कई मॉडल संभावना अनुमान उत्पन्न करते हैं जिन्हें औसत किया जाता है। इस संदर्भ में, स्कोर एन्सेम्बल के अंशांकन का मूल्यांकन करने में मदद करता है और व्यक्तिगत भविष्यवाणियों के चयन या भारांकन का मार्गदर्शन कर सकता है। इसके अतिरिक्त, ब्रीयर स्कोर का उपयोग Reinforcement learning और Generative AI में संभाव्य आउटपुट की गुणवत्ता का आकलन करने के लिए किया जाता है, जैसे कि टेक्स्ट जनरेशन के लिए Top-K Sampling या Top-P (Nucleus) Sampling रणनीतियों में।
Artificial intelligence सुरक्षा और विश्वसनीयता के संदर्भ में, ब्रीयर स्कोर का उपयोग Large language model के अंशांकन को मापने के लिए किया जाता है। उदाहरण के लिए, OpenAI और Anthropic द्वारा विकसित मॉडल का अक्सर उनके उत्तरों के लिए अच्छी तरह से अंशांकित आत्मविश्वास अनुमान प्रदान करने की क्षमता पर मूल्यांकन किया जाता है। एक कम ब्रीयर स्कोर इंगित करता है कि मॉडल का आत्मविश्वास उसकी वास्तविक सटीकता के साथ संरेखित है, जो वास्तविक दुनिया के अनुप्रयोगों में भरोसेमंद तैनाती के लिए महत्वपूर्ण है।
अन्य मीट्रिक्स के साथ तुलना
ब्रीयर स्कोर कई उचित स्कोरिंग नियमों में से एक है, जिसमें लघुगणकीय स्कोर (लॉग लॉस) और गोलाकार स्कोर शामिल हैं। लघुगणकीय स्कोर को -log(p_y) के रूप में परिभाषित किया गया है, जहां p_y सही परिणाम की भविष्यवाणी की गई संभावना है, और यह ब्रीयर स्कोर की तुलना में चरम संभावनाओं के प्रति अधिक संवेदनशील है। गोलाकार स्कोर को p_y / sqrt(Σ p_j^2) के रूप में परिभाषित किया गया है, जो बद्ध है और आउटलायर्स के प्रति कम संवेदनशील है। ब्रीयर स्कोर को अक्सर पसंद किया जाता है क्योंकि यह बद्ध है, समझने में आसान है, और लघुगणकीय स्कोर की तुलना में चरम मानों के प्रति कम संवेदनशील है।
सटीकता की तुलना में, ब्रीयर स्कोर संभाव्य भविष्यवाणियों का अधिक सूक्ष्म मूल्यांकन प्रदान करता है। सटीकता केवल सही लेबल के अनुपात को मापती है, भविष्यवाणियों के आत्मविश्वास को अनदेखा करती है। उदाहरण के लिए, एक मॉडल जो सही वर्ग के लिए 0.51 और गलत वर्ग के लिए 0.49 की भविष्यवाणी करता है, उसकी सटीकता उस मॉडल के समान है जो सही वर्ग के लिए 0.99 की भविष्यवाणी करता है, लेकिन बाद वाले का ब्रीयर स्कोर बहुत कम है। यह ब्रीयर स्कोर को उन डोमेन में मॉडल का मूल्यांकन करने के लिए विशेष रूप से उपयोगी बनाता है जहां निर्णय लेने के लिए संभावना अनुमानों का उपयोग किया जाता है।
ब्रीयर स्कोर रिसीवर ऑपरेटिंग विशेषता वक्र (AUC-ROC) के अंतर्गत क्षेत्र से भी संबंधित है, लेकिन वे प्रदर्शन के विभिन्न पहलुओं को मापते हैं। AUC-ROC रैंकिंग क्षमता पर केंद्रित है, जबकि ब्रीयर स्कोर अंशांकन और सटीकता पर केंद्रित है। एक मॉडल में उच्च AUC-ROC लेकिन खराब ब्रीयर स्कोर हो सकता है यदि इसकी संभावनाएं गलत अंशांकित हैं, और इसके विपरीत। इसलिए, ब्रीयर स्कोर का उपयोग अक्सर AUC-ROC के साथ एक व्यापक मूल्यांकन प्रदान करने के लिए किया जाता है।
सीमाएं और विचार
ब्रीयर स्कोर की एक सीमा यह है कि यह घटना की आधार दर के प्रति संवेदनशील है। दुर्लभ घटनाओं के लिए, अनिश्चितता घटक कम होता है, और स्कोर विश्वसनीयता और संकल्प द्वारा हावी होता है। यह विभिन्न आधार दरों वाले विभिन्न डेटासेट में स्कोर की तुलना करना मुश्किल बना सकता है। इसके अतिरिक्त, ब्रीयर स्कोर विभिन्न प्रकार की त्रुटियों की लागत, जैसे कि गलत सकारात्मक बनाम गलत नकारात्मक, को ध्यान में नहीं रखता है, जो कुछ अनुप्रयोगों में महत्वपूर्ण हो सकता है।
एक और विचार यह है कि ब्रीयर स्कोर मानता है कि भविष्यवाणी की गई संभावनाएं अच्छी तरह से अंशांकित हैं और परिणाम द्विआधारी या श्रेणीबद्ध हैं। निरंतर परिणामों के लिए, अन्य मीट्रिक्स जैसे कि निरंतर रैंक किया गया संभावना स्कोर (CRPS) अधिक उपयुक्त हैं। ब्रीयर स्कोर सीधे भविष्यवाणियों की तीक्ष्णता को भी नहीं मापता है, जो कि वह डिग्री है जिस तक पूर्वानुमान एक एकल मान के आसपास केंद्रित होते हैं। उच्च तीक्ष्णता लेकिन खराब अंशांकन वाले मॉडल में कम तीक्ष्णता लेकिन बेहतर अंशांकन वाले मॉडल की तुलना में उच्च ब्रीयर स्कोर हो सकता है।
व्यवहार में, ब्रीयर स्कोर का उपयोग अन्य मीट्रिक्स, जैसे कि अंशांकन प्लॉट और विश्वसनीयता आरेख, के साथ मिलकर मॉडल प्रदर्शन को पूरी तरह से समझने के लिए किया जाना चाहिए। आवेदन के संदर्भ पर विचार करना भी महत्वपूर्ण है, क्योंकि अंशांकन और संकल्प के बीच इष्टतम समझौता उपयोग के मामले के आधार पर भिन्न हो सकता है।
हाल के विकास और भविष्य की दिशाएं
Deep learning और Transformer (architecture)-आधारित मॉडल के उदय के साथ, ब्रीयर स्कोर कई शोध पत्रों और उद्योग अनुप्रयोगों में एक मानक मूल्यांकन मीट्रिक बन गया है। हाल के काम ने तंत्रिका नेटवर्क के अंशांकन में सुधार पर ध्यान केंद्रित किया है, जिसमें Temperature Scaling, Dropout और Model Pruning जैसी तकनीकों का उपयोग ब्रीयर स्कोर को कम करने के लिए किया जा रहा है। Generative AI के क्षेत्र में, ब्रीयर स्कोर का उपयोग Large language model के अंशांकन का मूल्यांकन करने के लिए किया जाता है, विशेष रूप से प्रश्न-उत्तर और तर्क कार्यों में।
शोधकर्ताओं ने अधिक जटिल सेटिंग्स के लिए ब्रीयर स्कोर के विस्तार का भी पता लगाया है, जैसे कि बहु-लेबल वर्गीकरण और क्रमिक प्रतिगमन। बहु-लेबल वर्गीकरण में, ब्रीयर स्कोर की गणना प्रत्येक लेबल के लिए स्वतंत्र रूप से की जा सकती है और फिर औसत की जा सकती है, जो समग्र अंशांकन का एक माप प्रदान करती है। क्रमिक प्रतिगमन में, ब्रीयर स्कोर को श्रेणियों के क्रम को ध्यान में रखने के लिए अनुकूलित किया जा सकता है, जो रेटिंग सिस्टम जैसे अनुप्रयोगों में महत्वपूर्ण है।
ब्रीयर स्कोर अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें नए स्कोरिंग नियम विकसित करने के निरंतर प्रयास हैं जो आउटलायर्स के प्रति अधिक मजबूत हैं और उच्च-आयामी डेटा के लिए बेहतर अनुकूल हैं। जैसे-जैसे Machine learning मॉडल अधिक जटिल होते जाते हैं और महत्वपूर्ण अनुप्रयोगों में तैनात किए जाते हैं, ब्रीयर स्कोर जैसे उचित स्कोरिंग नियमों का महत्व बढ़ने की संभावना है, यह सुनिश्चित करते हुए कि संभाव्य भविष्यवाणियां सटीक और अच्छी तरह से अंशांकित दोनों हैं।