ROC वक्र के अंतर्गत क्षेत्रफल (AUC) द्विआधारी वर्गीकरण मॉडल के लिए एक अदिश प्रदर्शन मीट्रिक है। यह सभी संभावित वर्गीकरण थ्रेशोल्ड पर सकारात्मक और नकारात्मक वर्गों के बीच अंतर करने की मॉडल की समग्र क्षमता को मापता है। AUC रिसीवर ऑपरेटिंग विशेषता (ROC) वक्र से प्राप्त होता है, जो विभिन्न थ्रेशोल्ड सेटिंग्स पर सत्य सकारात्मक दर (संवेदनशीलता) को असत्य सकारात्मक दर (1 - विशिष्टता) के विरुद्ध प्लॉट करता है। AUC मान 0 से 1 तक होता है, जहां 0.5 यादृच्छिक अनुमान के बराबर प्रदर्शन दर्शाता है, और 1.0 पूर्ण विभेदन का प्रतिनिधित्व करता है। व्यवहार में, AUC का व्यापक रूप से Machine learning, नैदानिक निदान, और सिग्नल पहचान जैसे क्षेत्रों में उपयोग किया जाता है, ताकि किसी विशिष्ट थ्रेशोल्ड या लागत संदर्भ से स्वतंत्र रूप से मॉडलों की तुलना और चयन किया जा सके।
ROC वक्र की अवधारणा द्वितीय विश्व युद्ध के दौरान उत्पन्न हुई, जब विद्युत और रडार इंजीनियरों ने दुश्मन की वस्तुओं का पता लगाने की रिसीवर की क्षमता का मूल्यांकन करने के लिए इसे विकसित किया। "रिसीवर ऑपरेटिंग विशेषता" शब्द इसी उत्पत्ति को दर्शाता है। ROC वक्र को बाद में मनोविज्ञान, चिकित्सा और अन्य विषयों में अपनाया गया। AUC एक मानक सारांश माप बन गया क्योंकि यह ROC वक्र को एक संख्या में कम कर देता है, जिससे मॉडल तुलना और चयन सुगम हो जाता है।
गणितीय परिभाषा
एक द्विआधारी वर्गीकरणकर्ता के लिए जो प्रत्येक उदाहरण के लिए एक सतत स्कोर आउटपुट करता है, ROC वक्र वर्गीकरण थ्रेशोल्ड को बदलकर निर्मित किया जाता है। प्रत्येक थ्रेशोल्ड पर, सत्य सकारात्मक दर (TPR) और असत्य सकारात्मक दर (FPR) की गणना की जाती है। AUC, FPR पर 0 से 1 तक ROC वक्र का समाकलन है:
AUC = ∫₀¹ TPR(FPR) d(FPR)
समतुल्य रूप से, AUC उस संभावना को दर्शाता है कि एक यादृच्छिक रूप से चुना गया सकारात्मक उदाहरण एक यादृच्छिक रूप से चुने गए नकारात्मक उदाहरण की तुलना में उच्च स्कोर प्राप्त करता है। यह व्याख्या मान-व्हिटनी U सांख्यिकी या विलकॉक्सन रैंक-सम परीक्षण के रूप में जानी जाती है, और यह AUC को एक रैंक-आधारित मीट्रिक बनाती है जो निरपेक्ष स्कोर मानों से स्वतंत्र है।
व्याख्या और गुण
AUC मान मॉडल की विभेदन शक्ति का माप प्रदान करते हैं। 0.5 का AUC इंगित करता है कि मॉडल यादृच्छिक संयोग से बेहतर प्रदर्शन नहीं करता है, जो एक ROC वक्र के अनुरूप है जो कोई-विभेदन नहीं की विकर्ण रेखा के साथ स्थित है। 1.0 का AUC सकारात्मक और नकारात्मक वर्गों के पूर्ण पृथक्करण को इंगित करता है। 0.5 और 1.0 के बीच के मान विभिन्न डिग्री की विभेदन क्षमता दर्शाते हैं। 0.5 से नीचे का AUC सुझाव देता है कि मॉडल यादृच्छिक से भी बदतर है, लेकिन ऐसे मामलों में, मॉडल की भविष्यवाणियों को उलटने से एक अच्छा वर्गीकरणकर्ता प्राप्त हो सकता है, क्योंकि ROC वक्र बिंदु (0.5, 0.5) के बारे में सममित है।
AUC विशेष रूप से उपयोगी है क्योंकि यह थ्रेशोल्ड-स्वतंत्र है। सटीकता या F1-स्कोर जैसे मीट्रिक के विपरीत, जिनके लिए एक विशिष्ट थ्रेशोल्ड चुनने की आवश्यकता होती है, AUC सभी संभावित थ्रेशोल्ड पर मॉडल का मूल्यांकन करता है। यह इसे मॉडलों की तुलना के लिए एक मजबूत माप बनाता है जब इष्टतम थ्रेशोल्ड अज्ञात होता है या जब वर्ग वितरण असंतुलित होते हैं। हालांकि, AUC किसी विशिष्ट ऑपरेटिंग बिंदु पर मॉडल के प्रदर्शन के बारे में जानकारी प्रदान नहीं करता है, और यह अत्यधिक आशावादी हो सकता है यदि दो मॉडलों के ROC वक्र एक-दूसरे को काटते हैं।
ROC विश्लेषण से संबंध
ROC विश्लेषण लागत संदर्भ या वर्ग वितरण से स्वतंत्र रूप से इष्टतम मॉडल चुनने और उप-इष्टतम मॉडल को हटाने के लिए उपकरण प्रदान करता है। ROC वक्र स्वयं सत्य सकारात्मक (लाभ) और असत्य सकारात्मक (लागत) के बीच व्यापार-बंद का एक ग्राफिकल प्रतिनिधित्व है। AUC इस व्यापार-बंद को एक संख्या में सारांशित करता है। नैदानिक महामारी विज्ञान में, ROC विश्लेषण आमतौर पर नैदानिक परीक्षणों के प्रदर्शन का आकलन करने के लिए उपयोग किया जाता है। एक नैदानिक परीक्षण का AUC रोगग्रस्त और गैर-रोगग्रस्त व्यक्तियों के बीच अंतर करने की इसकी क्षमता को इंगित करता है। उदाहरण के लिए, 0.8 का AUC सुझाव देता है कि 80% समय, एक यादृच्छिक रूप से चुना गया रोगग्रस्त व्यक्ति का परीक्षण परिणाम एक यादृच्छिक रूप से चुने गए गैर-रोगग्रस्त व्यक्ति की तुलना में अधिक होगा।
गणना और अनुमान
व्यवहार में, AUC डेटा के एक सीमित नमूने से अनुमानित किया जाता है। सकारात्मक और नकारात्मक उदाहरणों के लिए पूर्वानुमानित स्कोर के एक सेट को देखते हुए, AUC की गणना रैंक-आधारित सूत्र का उपयोग करके की जा सकती है:
AUC = (Σᵢ₌₁ⁿ⁺ (rᵢ - i)) / (n⁺ * n⁻)
जहां n⁺ और n⁻ सकारात्मक और नकारात्मक उदाहरणों की संख्या हैं, और rᵢ संयुक्त क्रमबद्ध सूची में सकारात्मक उदाहरणों के रैंक हैं। वैकल्पिक रूप से, अनुभवजन्य ROC वक्र पर समलम्बाकार नियम लागू किया जा सकता है। कई सॉफ्टवेयर लाइब्रेरी, जिनमें python और R में शामिल हैं, AUC गणना के लिए अंतर्निहित फ़ंक्शन प्रदान करती हैं।
मशीन लर्निंग में अनुप्रयोग
AUC का व्यापक रूप से Machine learning में मॉडल मूल्यांकन और चयन के लिए उपयोग किया जाता है। यह विशेष रूप से स्पैम पहचान, धोखाधड़ी पहचान, चिकित्सा निदान, और क्रेडिट स्कोरिंग जैसे द्विआधारी वर्गीकरण कार्यों में प्रचलित है। इन डोमेन में, वर्ग वितरण अक्सर असंतुलित होते हैं, और AUC सटीकता की तुलना में अधिक विश्वसनीय माप प्रदान करता है क्योंकि यह वर्ग असंतुलन के प्रति असंवेदनशील है। AUC का उपयोग हाइपरपैरामीटर ट्यूनिंग, फीचर चयन, और मॉडल तुलना में भी किया जाता है। उदाहरण के लिए, Deep learning और Neural network अनुसंधान में, AUC अक्सर मॉडल प्रदर्शन प्रदर्शित करने के लिए अन्य मीट्रिक के साथ रिपोर्ट किया जाता है।
AUC का उपयोग रैंकिंग समस्याओं में भी किया जाता है, जहां लक्ष्य सकारात्मक वर्ग से संबंधित होने की संभावना के अनुसार उदाहरणों को क्रमबद्ध करना है। ऐसे मामलों में, AUC सीधे रैंकिंग की गुणवत्ता को मापता है। इसने सूचना पुनर्प्राप्ति और अनुशंसा प्रणालियों में इसके अपनाने को जन्म दिया है।
सीमाएं और विचार
अपनी लोकप्रियता के बावजूद, AUC की सीमाएं हैं। यह मॉडल के कैलिब्रेशन को प्रतिबिंबित नहीं करता है - अर्थात, पूर्वानुमानित संभावनाओं की सटीकता। समान AUC वाले दो मॉडलों में बहुत भिन्न संभावना आउटपुट हो सकते हैं। AUC यह भी मानता है कि असत्य सकारात्मक और असत्य नकारात्मक की लागत बराबर है, जो वास्तविक दुनिया के अनुप्रयोगों में शायद ही कभी सत्य है। जब लागत असमान होती है, तो प्रेसिजन-रिकॉल वक्र या लागत वक्र जैसे थ्रेशोल्ड-विशिष्ट मीट्रिक अधिक उपयुक्त हो सकते हैं। इसके अतिरिक्त, AUC भ्रामक हो सकता है जब ROC वक्र एक-दूसरे को काटते हैं, क्योंकि उच्च AUC वाला मॉडल ROC स्थान के कुछ क्षेत्रों में खराब प्रदर्शन कर सकता है।
एक और विचार यह है कि AUC एक वैश्विक माप है और यह इंगित नहीं करता है कि मॉडल कहां अच्छा या खराब प्रदर्शन करता है। उदाहरण के लिए, एक मॉडल में उच्च AUC हो सकता है लेकिन कम असत्य सकारात्मक दरों पर खराब प्रदर्शन हो सकता है, जो धोखाधड़ी पहचान जैसे अनुप्रयोगों में महत्वपूर्ण हो सकता है जहां असत्य सकारात्मक महंगे होते हैं।
विस्तार और विकल्प
AUC की अवधारणा को बहु-वर्ग वर्गीकरण समस्याओं तक विस्तारित किया गया है। एक दृष्टिकोण प्रत्येक वर्ग के लिए अन्य सभी के विरुद्ध (एक-बनाम-बाकी) AUC की गणना करना और उनका औसत लेना है। दूसरा बहु-वर्ग समस्याओं के लिए ROC सतह के अंतर्गत आयतन का उपयोग करना है। इसके अलावा, प्रेसिजन-रिकॉल वक्र और इसके अंतर्गत क्षेत्रफल (PR-AUC) अक्सर विकल्प के रूप में उपयोग किए जाते हैं, विशेष रूप से अत्यधिक असंतुलित डेटासेट के लिए। PR-AUC सकारात्मक वर्ग पर केंद्रित है और रिकॉल में सुधार के प्रति अधिक संवेदनशील है।
हाल के वर्षों में, AUC को मॉडल प्रशिक्षण के लिए लॉस फ़ंक्शन में शामिल किया गया है। उदाहरण के लिए, AUC अनुकूलन का उपयोग Large language model फाइन-ट्यूनिंग और अन्य Generative AI अनुप्रयोगों में रैंकिंग प्रदर्शन को सीधे अनुकूलित करने के लिए किया गया है। हालांकि, चूंकि AUC अवकलनीय नहीं है, इसलिए अक्सर सरोगेट लॉस का उपयोग किया जाता है।
ऐतिहासिक संदर्भ
ROC वक्र पहली बार द्वितीय विश्व युद्ध के दौरान (1941 से शुरू) रडार सिग्नल पहचान के लिए विकसित किया गया था। इसे बाद में अवधारणात्मक पहचान को मॉडल करने के लिए मनोविज्ञान में पेश किया गया। 1970 और 1980 के दशक में, ROC विश्लेषण चिकित्सा और रेडियोलॉजी में व्यापक रूप से उपयोग किया जाने लगा। सारांश माप के रूप में AUC ने 1990 और 2000 के दशक में मशीन लर्निंग के उदय के साथ प्रमुखता प्राप्त की। थॉमस-डाइटेरिच और माइकल-जॉर्डन जैसे शोधकर्ताओं ने वर्गीकरणकर्ता मूल्यांकन की सांख्यिकीय समझ में योगदान दिया, और AUC क्षेत्र में एक मानक मीट्रिक बन गया।
यह भी देखें
- मशीन लर्निंग
- तंत्रिका नेटवर्क
- गहन शिक्षण
- कृत्रिम बुद्धिमत्ता
- जनरेटिव एआई
- बड़ा भाषा मॉडल
- ट्रांसफॉर्मर
- ओपनएआई
- गूगल डीपमाइंड
- एंथ्रोपिक
संदर्भ
- Fawcett, T. (2006). An introduction to ROC analysis. Pattern Recognition Letters, 27(8), 861-874.
- Hanley, J. A., & McNeil, B. J. (1982). The meaning and use of the area under a receiver operating characteristic (ROC) curve. Radiology, 143(1), 29-36.
- Bradley, A. P. (1997). The use of the area under the ROC curve in the evaluation of machine learning algorithms. Pattern Recognition, 30(7), 1145-1159.