कर्व (AUC) एक व्यापक रूप से उपयोग किया जाने वाला प्रदर्शन मीट्रिक है जो द्विआधारी वर्गीकरण मॉडल के लिए उपयोग होता है, जो सभी संभावित थ्रेशोल्ड मानों पर मॉडल की भविष्यवाणियों की समग्र गुणवत्ता का सारांश प्रस्तुत करता है। यह रिसीवर ऑपरेटिंग कैरेक्टरिस्टिक (ROC) कर्व से व्युत्पन्न होता है, जो विभिन्न थ्रेशोल्ड पर सत्य सकारात्मक दर (संवेदनशीलता) को असत्य सकारात्मक दर (1 - विशिष्टता) के विरुद्ध प्लॉट करता है। AUC इस कर्व के नीचे के क्षेत्र को मापता है, जो 0 और 1 के बीच एक एकल संख्या प्रदान करता है जो दर्शाता है कि मॉडल सकारात्मक और नकारात्मक वर्गों के बीच कितनी अच्छी तरह अंतर करता है। 1.0 का AUC एक पूर्ण वर्गीकरणकर्ता का प्रतिनिधित्व करता है, जबकि 0.5 यादृच्छिक अनुमान के बराबर प्रदर्शन दर्शाता है, और 0.5 से नीचे के मान बताते हैं कि मॉडल यादृच्छिक से भी बदतर है, हालांकि ऐसे मॉडल को अक्सर उलटा करके यादृच्छिक से बेहतर प्रदर्शन प्राप्त किया जा सकता है।
AUC की अवधारणा मॉडल मूल्यांकन में केंद्रीय है, जो नैदानिक निदान से लेकर मशीन लर्निंग तक के क्षेत्रों में उपयोग होती है। यह विशेष रूप से मूल्यवान है क्योंकि यह किसी विशिष्ट वर्गीकरण थ्रेशोल्ड से स्वतंत्र है, जो मॉडल गुणवत्ता का एक थ्रेशोल्ड-अज्ञेय दृश्य प्रदान करता है। यह AUC को विशेष रूप से उपयोगी बनाता है जब अंतिम ऑपरेटिंग बिंदु चुनने से पहले मॉडलों की तुलना की जाती है, क्योंकि इसमें असत्य सकारात्मक और असत्य नकारात्मक की सापेक्ष लागतों को पहले से निर्दिष्ट करने की आवश्यकता नहीं होती है।
ऐतिहासिक उत्पत्ति
ROC कर्व, जिससे AUC की गणना की जाती है, पहली बार द्वितीय विश्व युद्ध के दौरान विद्युत और रडार इंजीनियरों द्वारा 1941 में युद्धक्षेत्रों में दुश्मन की वस्तुओं का पता लगाने के लिए विकसित किया गया था। "रिसीवर ऑपरेटिंग कैरेक्टरिस्टिक" शब्द रडार रिसीवरों के प्रदर्शन के मूल्यांकन में इसकी उत्पत्ति को दर्शाता है। युद्ध के बाद, यह तकनीक मनोविज्ञान में उत्तेजनाओं की अवधारणात्मक पहचान को मॉडल करने के लिए पेश की गई, और बाद में यह चिकित्सा, रेडियोलॉजी, बायोमेट्रिक्स, मौसम विज्ञान और प्राकृतिक आपदा पूर्वानुमान में फैल गई। हाल के दशकों में, ROC विश्लेषण और AUC मशीन लर्निंग और डेटा माइनिंग अनुसंधान में मानक उपकरण बन गए हैं, जहां इनका उपयोग वर्गीकरण एल्गोरिदम की विभेदक शक्ति का आकलन करने के लिए किया जाता है।
ROC कर्व की मूल बातें
ROC कर्व का निर्माण वर्गीकरणकर्ता के सतत आउटपुट के हर संभावित थ्रेशोल्ड के लिए y-अक्ष पर सत्य सकारात्मक दर (TPR) और x-अक्ष पर असत्य सकारात्मक दर (FPR) को प्लॉट करके किया जाता है। TPR, जिसे संवेदनशीलता या पहचान की संभावना भी कहा जाता है, सही ढंग से पहचाने गए वास्तविक सकारात्मक का अनुपात है। FPR, जिसे असत्य अलार्म की संभावना भी कहा जाता है, वास्तविक नकारात्मक का अनुपात है जो गलत तरह से सकारात्मक के रूप में वर्गीकृत किया गया है, और यह 1 घटा विशिष्टता के बराबर है। कर्व इस प्रकार थ्रेशोल्ड के बदलते ही संवेदनशीलता और विशिष्टता के बीच व्यापार-बंद को दर्शाता है।
संभाव्य शब्दों में, जब सकारात्मक और नकारात्मक उदाहरणों के स्कोर के वितरण ज्ञात होते हैं, तो ROC कर्व को पहचान संभावना के संचयी वितरण फलन (CDF) (y-अक्ष) को असत्य सकारात्मक संभावना के CDF (x-अक्ष) के विरुद्ध प्लॉट करके प्राप्त किया जाता है, दोनों को नकारात्मक अनंत से विभेदन थ्रेशोल्ड तक मूल्यांकित किया जाता है। यह सूत्रीकरण AUC की सांख्यिकीय व्याख्या को रेखांकित करता है, जो यह संभावना है कि एक यादृच्छिक रूप से चुना गया सकारात्मक उदाहरण एक यादृच्छिक रूप से चुने गए नकारात्मक उदाहरण की तुलना में अधिक स्कोर प्राप्त करता है।
सारांश मीट्रिक के रूप में AUC
AUC पूरे ROC कर्व को एक एकल अदिश मान में संघनित करता है, जिससे मॉडलों की तुलना करना आसान हो जाता है। यह मान-व्हिटनी U सांख्यिकी या विलकॉक्सन रैंक-सम परीक्षण के बराबर है, जो पृथक्करण का एक गैर-पैरामीट्रिक माप प्रदान करता है। 0.5 का AUC एक वर्गीकरणकर्ता से मेल खाता है जो यादृच्छिक मौके से बेहतर प्रदर्शन नहीं करता है, जिसमें ROC कर्व बिना-विभेदन की विकर्ण रेखा के साथ स्थित होता है। 0.5 से ऊपर का AUC यादृच्छिक से बेहतर प्रदर्शन दर्शाता है, जिसमें कर्व ROC स्थान के ऊपरी बाएं कोने की ओर झुकता है। ऊपरी बायां कोना (0,1) पूर्ण वर्गीकरण का प्रतिनिधित्व करता है, जहां संवेदनशीलता और विशिष्टता दोनों 100% होती हैं।
AUC विशेष रूप से उपयोगी है क्योंकि यह वर्ग वितरण और लागत संदर्भ के प्रति अपरिवर्तनीय है। यह सकारात्मक मामलों की व्यापकता पर निर्भर नहीं करता है, जिससे यह असंतुलित डेटासेट पर मॉडलों का मूल्यांकन करने के लिए उपयुक्त है। हालांकि, इसका यह भी अर्थ है कि AUC किसी विशिष्ट ऑपरेटिंग संदर्भ में मॉडल के पूर्ण प्रदर्शन को प्रतिबिंबित नहीं करता है; यह केवल सापेक्ष रैंकिंग गुणवत्ता को मापता है।
व्याख्या और उपयोग के मामले
व्यवहार में, AUC का उपयोग लागत संरचनाओं या वर्ग वितरणों को निर्दिष्ट करने से पहले इष्टतम मॉडलों का चयन करने और अवर मॉडलों को हटाने के लिए किया जाता है। उदाहरण के लिए, चिकित्सा निदान में, उच्च AUC वाला परीक्षण पसंद किया जाता है क्योंकि यह विभिन्न थ्रेशोल्ड पर रोगग्रस्त और स्वस्थ व्यक्तियों के बीच अच्छे विभेदन को दर्शाता है। मशीन लर्निंग में, AUC आमतौर पर स्पैम पहचान, धोखाधड़ी पहचान और रोग भविष्यवाणी जैसे द्विआधारी वर्गीकरण कार्यों के लिए रिपोर्ट किया जाता है।
AUC मानों की व्याख्या इस प्रकार की जा सकती है: 0.9 से 1.0 उत्कृष्ट विभेदन दर्शाता है, 0.8 से 0.9 अच्छा विभेदन दर्शाता है, 0.7 से 0.8 उचित विभेदन दर्शाता है, और 0.5 से 0.7 खराब विभेदन दर्शाता है। 0.5 से नीचे के मान यादृच्छिक से बदतर माने जाते हैं, लेकिन जैसा कि उल्लेख किया गया है, मॉडल की भविष्यवाणियों को उलटा करने से यादृच्छिक से बेहतर वर्गीकरणकर्ता प्राप्त किया जा सकता है।
अन्य मीट्रिक्स से संबंध
AUC कई अन्य वर्गीकरण मीट्रिक्स से संबंधित है, जिनमें सटीकता, परिशुद्धता, रिकॉल और F1 स्कोर शामिल हैं। जबकि सटीकता सही भविष्यवाणियों के समग्र अनुपात को मापती है, यह थ्रेशोल्ड-निर्भर है और असंतुलित डेटासेट के लिए भ्रामक हो सकती है। परिशुद्धता और रिकॉल सकारात्मक वर्ग पर केंद्रित होते हैं, और F1 स्कोर उनका हार्मोनिक माध्य है। इसके विपरीत, AUC रैंकिंग गुणवत्ता का एक थ्रेशोल्ड-स्वतंत्र माप प्रदान करता है, जो अक्सर मॉडल तुलना के लिए अधिक मजबूत होता है।
AUC नैदानिक निर्णय लेने के लागत/लाभ विश्लेषण से भी जुड़ा है। ROC कर्व सत्य सकारात्मक (लाभ) और असत्य सकारात्मक (लागत) के बीच व्यापार-बंद को देखने की अनुमति देता है, और कर्व के नीचे का क्षेत्र सभी संभावित व्यापार-बंदों पर समग्र लाभ को दर्शाता है। यह AUC को नैदानिक महामारी विज्ञान में नैदानिक परीक्षणों के मूल्यांकन के लिए एक स्वाभाविक उपकरण बनाता है।
सीमाएं और चेतावनियां
अपनी लोकप्रियता के बावजूद, AUC की सीमाएं हैं। यह पूरे ROC कर्व का सारांश प्रस्तुत करता है, जो रुचि के विशिष्ट क्षेत्रों में प्रदर्शन को अस्पष्ट कर सकता है। उदाहरण के लिए, एक मॉडल में उच्च AUC हो सकता है लेकिन कम असत्य सकारात्मक दरों पर खराब प्रदर्शन हो सकता है, जो धोखाधड़ी पहचान जैसे अनुप्रयोगों में महत्वपूर्ण है जहां असत्य सकारात्मक महंगे होते हैं। इसके अतिरिक्त, AUC असंतुलित परीक्षण सेट पर अत्यधिक आशावादी हो सकता है, क्योंकि यह असत्य सकारात्मक की पूर्ण संख्या के प्रति असंवेदनशील है।
एक और चेतावनी यह है कि AUC उदाहरणों की सुसंगत रैंकिंग मानता है, लेकिन व्यवहार में, स्कोर में टाई गणना को प्रभावित कर सकते हैं। असतत ROC बिंदुओं से AUC का अनुमान लगाने के लिए ट्रेपेज़ॉइडल नियम जैसी विधियां आमतौर पर उपयोग की जाती हैं, लेकिन ये थोड़ी पूर्वाग्रह पेश कर सकती हैं। बड़े डेटासेट के लिए, कम्प्यूटेशनल दक्षता आमतौर पर कोई समस्या नहीं होती है, लेकिन अत्यंत बड़े पैमाने की समस्याओं के लिए, वैकल्पिक मीट्रिक्स को प्राथमिकता दी जा सकती है।
विस्तार और प्रकार
AUC को बहु-वर्ग वर्गीकरण समस्याओं तक विस्तारित किया गया है, जहां ROC कर्व को कई वर्गों को संभालने के लिए सामान्यीकृत किया जाता है। एक सामान्य दृष्टिकोण प्रत्येक वर्ग के लिए अन्य सभी के विरुद्ध (एक-बनाम-बाकी) AUC की गणना करना और परिणामों का औसत निकालना है। एक अन्य प्रकार परिशुद्धता-रिकॉल AUC है, जो अत्यधिक असंतुलित डेटासेट के लिए अधिक जानकारीपूर्ण है, क्योंकि यह सकारात्मक वर्ग के प्रदर्शन पर केंद्रित होता है।
डीप लर्निंग और न्यूरल नेटवर्क अनुसंधान में, AUC का उपयोग अक्सर प्रशिक्षण के दौरान हानि फलनों के साथ एक निगरानी मीट्रिक के रूप में किया जाता है। यह बड़े भाषा मॉडल मूल्यांकन में भी उपयोग होता है, जैसे द्विआधारी भावना वर्गीकरण या विषाक्तता पहचान जैसे कार्यों के लिए, जहां थ्रेशोल्ड-अज्ञेय प्रदर्शन वांछनीय होता है।
कम्प्यूटेशनल विचार
पूर्वानुमानित स्कोर और सत्य लेबल के सेट से AUC की गणना करना सीधा है। सबसे सामान्य विधि उदाहरणों को पूर्वानुमानित स्कोर द्वारा क्रमबद्ध करना और फिर ट्रेपेज़ॉइडल नियम का उपयोग करके ROC कर्व के नीचे के क्षेत्र की गणना करना है। वैकल्पिक रूप से, मान-व्हिटनी U सांख्यिकी का उपयोग किया जा सकता है, जिसमें सभी उदाहरणों को रैंक करना और सकारात्मक उदाहरणों के लिए रैंकों का योग शामिल है। दोनों विधियां समान परिणाम देती हैं और क्रमबद्धता के कारण समय जटिलता O(n log n) होती है।
बहुत बड़े डेटासेट के लिए, AUC का अनुमान लगाने के लिए अनुमानित विधियां या नमूनाकरण तकनीकों का उपयोग किया जा सकता है। scikit-learn जैसी लाइब्रेरीज़ AUC गणना के लिए अंतर्निहित फलन प्रदान करती हैं, जिससे यह कृत्रिम बुद्धिमत्ता और संबंधित क्षेत्रों के चिकित्सकों के लिए सुलभ हो जाता है।
निष्कर्ष
AUC द्विआधारी वर्गीकरणकर्ताओं के मूल्यांकन के लिए एक आधारशिला मीट्रिक बना हुआ है, जो विभेदक प्रदर्शन का एक मजबूत, थ्रेशोल्ड-स्वतंत्र माप प्रदान करता है। रडार इंजीनियरिंग में इसकी उत्पत्ति और विषयों में बाद में अपनाना इसकी बहुमुखी प्रतिभा को रेखांकित करता है। हालांकि इसकी सीमाएं हैं, विशेष रूप से असंतुलित सेटिंग्स में या जब विशिष्ट ऑपरेटिंग बिंदु मायने रखते हैं, AUC नैदानिक निदान से लेकर मशीन लर्निंग मॉडल चयन तक, शैक्षणिक अनुसंधान और औद्योगिक अनुप्रयोगों दोनों में एक मानक उपकरण बना हुआ है।