अंग्रेज़ी से अनुवादित

एक रिसीवर ऑपरेटिंग कैरेक्टरिस्टिक (ROC) वक्र एक ग्राफिकल प्लॉट है जो विभिन्न थ्रेशोल्ड मानों पर एक बाइनरी क्लासिफायर के प्रदर्शन को दर्शाता है, जिसमें सही सकारात्मक दर को गलत सकारात्मक दर के विरुद्ध प्लॉट किया जाता है। यह नैदानिक महामारी विज्ञान, मशीन लर्निंग और अन्य क्षेत्रों में व्यापक रूप से उपयोग किया जाता है ताकि नैदानिक या भविष्य कहने वाले मॉडलों का मूल्यांकन और तुलना की जा सके।

विशेषता वक्र (ROC वक्र) एक ग्राफिकल प्लॉट है जो बाइनरी वर्गीकरण मॉडल के प्रदर्शन को विभिन्न थ्रेशोल्ड मानों पर दर्शाता है। हालांकि इसे कई वर्गों तक सामान्यीकृत किया जा सकता है, यह अक्सर बाइनरी वर्गीकरण समस्याओं में सबसे अधिक उपयोग किया जाता है। ROC विश्लेषण का उपयोग नैदानिक महामारी विज्ञान में नैदानिक परीक्षण प्रदर्शन के मूल्यांकन के साथ-साथ मशीन लर्निंग, रेडियोलॉजी, बायोमेट्रिक्स और पूर्वानुमान में अक्सर किया जाता है। वक्र सभी संभावित वर्गीकरण थ्रेशोल्ड पर संवेदनशीलता और विशिष्टता के बीच व्यापार-बंद का एक व्यापक दृश्य प्रदान करता है, जिससे विशिष्ट ऑपरेटिंग बिंदु निर्दिष्ट किए बिना मॉडल तुलना सक्षम होती है।

ROC वक्र प्रत्येक थ्रेशोल्ड सेटिंग पर सही सकारात्मक दर (TPR) और गलत सकारात्मक दर (FPR) के खिलाफ प्लॉट है। सही सकारात्मक दर, जिसे संवेदनशीलता या पता लगाने की संभावना के रूप में भी जाना जाता है, सही ढंग से पहचाने गए वास्तविक सकारात्मक के अनुपात को मापता है। गलत सकारात्मक दर, जिसे गलत अलार्म की संभावना के रूप में भी जाना जाता है, 1 माइनस विशिष्टता के बराबर है और वास्तविक नकारात्मक के अनुपात को मापता है जो गलत तरीके से सकारात्मक के रूप में वर्गीकृत हैं। वक्र को निर्णय नियम के प्रकार I त्रुटि के कार्य के रूप में सांख्यिकीय शक्ति के प्लॉट के रूप में भी व्याख्या किया जा सकता है। जब सही सकारात्मक और गलत सकारात्मक परिणाम दोनों के लिए संभावना वितरण ज्ञात होते हैं, तो ROC वक्र y-अक्ष पर पता लगाने की संभावना के संचयी वितरण फ़ंक्शन के रूप में और x-अक्ष पर गलत सकारात्मक संभावना के संचयी वितरण फ़ंक्शन के रूप में प्राप्त किया जाता है।

ROC विश्लेषण संभावित रूप से इष्टतम मॉडल का चयन करने और लागत संदर्भ या वर्ग वितरण को निर्दिष्ट करने से स्वतंत्र और पहले suboptimal मॉडल को त्यागने के लिए उपकरण प्रदान करता है। यह नैदानिक निर्णय लेने के लागत/लाभ विश्लेषण से प्रत्यक्ष और स्वाभाविक तरीके से संबंधित है। ROC वक्र के अंतर्गत क्षेत्र (AUC) एक एकल अदिश मान है जो वर्गीकरणकर्ता के समग्र प्रदर्शन का सारांश देता है, जिसमें 1 के करीब मान बेहतर भेदभाव दर्शाते हैं और 0.5 यादृच्छिक अनुमान के बराबर प्रदर्शन दर्शाता है।

शब्दावली

सही सकारात्मक दर को संवेदनशीलता, पुनर्प्राप्ति या पता लगाने की संभावना के रूप में भी जाना जाता है। गलत सकारात्मक दर को गलत अलार्म की संभावना के रूप में भी जाना जाता है और यह 1 माइनस विशिष्टता के बराबर है। ROC वक्र को सापेक्ष परिचालन विशेषता वक्र के रूप में भी जाना जाता है, क्योंकि यह मानदंड बदलने पर दो परिचालन विशेषताओं (TPR और FPR) की तुलना है। कुछ क्षेत्रों में, वक्र को संवेदनशीलता बनाम (1 माइनस विशिष्टता) प्लॉट के रूप में संदर्भित किया जाता है। शब्द "सकारात्मक" और "नकारात्मक" भविष्यवाणी किए गए वर्ग लेबल को संदर्भित करते हैं, जबकि "सही" और "गलत" इंगित करते हैं कि भविष्यवाणी वास्तविक जमीनी सत्य से मेल खाती है या नहीं।

इतिहास

ROC वक्र पहली बार 1941 से द्वितीय विश्व युद्ध के दौरान युद्धक्षेत्रों में दुश्मन की वस्तुओं का पता लगाने के लिए विद्युत इंजीनियरों और रडार इंजीनियरों द्वारा विकसित किया गया था। इस उत्पत्ति ने इसका नाम, "रिसीवर ऑपरेटिंग कैरेक्टरिस्टिक" दिया, क्योंकि यह रडार रिसीवर की परिचालन विशेषताओं का वर्णन करता था। यह तकनीक जल्द ही मनोविज्ञान में उत्तेजनाओं की अवधारणात्मक पहचान को समझाने के लिए पेश की गई, विशेष रूप से संकेत पहचान सिद्धांत में। बाद के दशकों में, ROC विश्लेषण चिकित्सा, रेडियोलॉजी, बायोमेट्रिक्स, प्राकृतिक खतरों के पूर्वानुमान, मौसम विज्ञान और मॉडल प्रदर्शन मूल्यांकन में अपनाया गया। हाल के वर्षों में, यह Machine learning और डेटा खनन अनुसंधान में वर्गीकरण मॉडल के मूल्यांकन के लिए एक मानक उपकरण के रूप में तेजी से उपयोग हो रहा है।

मूल अवधारणा

एक वर्गीकरण मॉडल उदाहरणों का कुछ वर्गों या समूहों में मैपिंग है। वर्गीकरणकर्ता का आउटपुट एक मनमाना वास्तविक मान हो सकता है, जिसके लिए वर्ग सीमा निर्धारित करने के लिए थ्रेशोल्ड की आवश्यकता होती है, या यह एक असतत वर्ग लेबल हो सकता है। एक दो-वर्ग भविष्यवाणी समस्या पर विचार करें जहां परिणामों को सकारात्मक (p) या नकारात्मक (n) के रूप में लेबल किया जाता है। एक बाइनरी वर्गीकरणकर्ता से चार संभावित परिणाम उत्पन्न होते हैं: एक सही सकारात्मक (TP) तब होता है जब भविष्यवाणी p होती है और वास्तविक मान p होता है; एक गलत सकारात्मक (FP) तब होता है जब भविष्यवाणी p होती है लेकिन वास्तविक मान n होता है; एक सही नकारात्मक (TN) तब होता है जब भविष्यवाणी और वास्तविक मान दोनों n होते हैं; और एक गलत नकारात्मक (FN) तब होता है जब भविष्यवाणी n होती है लेकिन वास्तविक मान p होता है।

उदाहरण के लिए, किसी बीमारी के लिए नैदानिक परीक्षण में, एक गलत सकारात्मक तब होता है जब कोई व्यक्ति सकारात्मक परीक्षण करता है लेकिन वास्तव में उसे बीमारी नहीं होती है। एक गलत नकारात्मक तब होता है जब कोई व्यक्ति नकारात्मक परीक्षण करता है लेकिन वास्तव में उसे बीमारी होती है। इन चार परिणामों को 2x2 आकस्मिकता तालिका में व्यवस्थित किया जा सकता है, जिसे भ्रम मैट्रिक्स के रूप में भी जाना जाता है, जो विभिन्न मूल्यांकन मेट्रिक्स की गणना का आधार बनता है।

ROC स्थान

ROC स्थान x-अक्ष पर गलत सकारात्मक दर और y-अक्ष पर सही सकारात्मक दर द्वारा परिभाषित किया गया है। यह ग्राफिकल प्रतिनिधित्व सही सकारात्मक (लाभ) और गलत सकारात्मक (लागत) के बीच सापेक्ष व्यापार-बंद को दर्शाता है। प्रत्येक भविष्यवाणी परिणाम या भ्रम मैट्रिक्स का उदाहरण ROC स्थान में एक बिंदु का प्रतिनिधित्व करता है। सबसे अच्छी संभव भविष्यवाणी विधि ऊपरी बाएं कोने में निर्देशांक (0,1) पर एक बिंदु देगी, जो 100% संवेदनशीलता (कोई गलत नकारात्मक नहीं) और 100% विशिष्टता (कोई गलत सकारात्मक नहीं) का प्रतिनिधित्व करती है। इस बिंदु को सही वर्गीकरण कहा जाता है।

एक यादृच्छिक अनुमान विकर्ण रेखा के साथ एक बिंदु देगा, जिसे कोई-भेदभाव रेखा कहा जाता है, जो निचले बाएं से ऊपरी दाएं कोनों तक चलती है। यादृच्छिक अनुमान का एक सहज उदाहरण सिक्का उछालकर निर्णय लेना है। जैसे-जैसे नमूना आकार बढ़ता है, एक यादृच्छिक वर्गीकरणकर्ता का ROC बिंदु विकर्ण रेखा की ओर झुकता है; एक संतुलित सिक्के के लिए, यह बिंदु (0.5, 0.5) की ओर झुकता है। विकर्ण ROC स्थान को विभाजित करता है: विकर्ण के ऊपर के बिंदु अच्छे वर्गीकरण परिणामों (यादृच्छिक से बेहतर) का प्रतिनिधित्व करते हैं, जबकि नीचे के बिंदु खराब परिणामों (यादृच्छिक से बेहतर) का प्रतिनिधित्व करते हैं। विशेष रूप से, एक लगातार खराब भविष्यवक्ता के आउटपुट को अच्छा भविष्यवक्ता प्राप्त करने के लिए उलटा किया जा सकता है, क्योंकि केंद्र (0.5, 0.5) के पार एक बिंदु को दर्पण करने से एक पूरक वर्गीकरणकर्ता प्राप्त होता है।

थ्रेशोल्ड भिन्नता

एक ROC वक्र वर्गीकरण थ्रेशोल्ड को बदलकर और प्रत्येक थ्रेशोल्ड सेटिंग पर परिणामी TPR और FPR को प्लॉट करके उत्पन्न किया जाता है। एक वर्गीकरणकर्ता के लिए जो एक सतत स्कोर आउटपुट करता है, थ्रेशोल्ड को कम करने से TPR और FPR दोनों बढ़ते हैं, जबकि थ्रेशोल्ड को बढ़ाने से दोनों घटते हैं। वक्र उच्चतम थ्रेशोल्ड पर बिंदु (0,0) से (जहां कोई उदाहरण सकारात्मक के रूप में वर्गीकृत नहीं होते) निम्नतम थ्रेशोल्ड पर बिंदु (1,1) तक (जहां सभी उदाहरण सकारात्मक के रूप में वर्गीकृत होते हैं) एक पथ का पता लगाता है। वक्र पर प्रत्येक बिंदु एक विशिष्ट थ्रेशोल्ड मान से मेल खाता है, जिससे चिकित्सक एप्लिकेशन की आवश्यकताओं के अनुसार संवेदनशीलता और विशिष्टता को संतुलित करने वाले ऑपरेटिंग बिंदु का चयन कर सकते हैं।

वक्र के अंतर्गत क्षेत्र

ROC वक्र के अंतर्गत क्षेत्र, जिसे आमतौर पर AUC के रूप में संक्षिप्त किया जाता है, एक व्यापक रूप से उपयोग किया जाने वाला सारांश मीट्रिक है। AUC संभावना का प्रतिनिधित्व करता है कि एक यादृच्छिक रूप से चुना गया सकारात्मक उदाहरण वर्गीकरणकर्ता द्वारा यादृच्छिक रूप से चुने गए नकारात्मक उदाहरण से उच्च रैंक किया गया है। 1.0 का AUC सही भेदभाव दर्शाता है, जबकि 0.5 का AUC यादृच्छिक अनुमान से बेहतर नहीं प्रदर्शन दर्शाता है। 0.5 से नीचे AUC मान सुझाव देते हैं कि वर्गीकरणकर्ता यादृच्छिक से बेहतर प्रदर्शन कर रहा है, जो लेबलिंग त्रुटि या भविष्यवाणी को उलटने से प्रदर्शन में सुधार हो सकता है। AUC विशेष रूप से कई वर्गीकरणकर्ताओं की तुलना के लिए उपयोगी है क्योंकि यह एक एकल संख्या प्रदान करता है जो थ्रेशोल्ड पसंद और वर्ग वितरण से स्वतंत्र है।

अनुप्रयोग

ROC विश्लेषण कई डोमेन में लागू किया जाता है। नैदानिक महामारी विज्ञान में, इसका उपयोग नैदानिक परीक्षणों की सटीकता का मूल्यांकन करने के लिए किया जाता है, जैसे उच्च रक्तचाप के लिए रक्तचाप माप या बीमारी का पता लगाने के लिए बायोमार्कर। रेडियोलॉजी में, ROC वक्र इमेजिंग तकनीकों और रेडियोलॉजिस्ट की व्याख्याओं के प्रदर्शन का आकलन करने में मदद करते हैं। बायोमेट्रिक्स में, उनका उपयोग फिंगरप्रिंट और चेहरे की पहचान प्रणालियों का मूल्यांकन करने के लिए किया जाता है। मौसम विज्ञान में, ROC विश्लेषण पूर्वानुमान सत्यापन पर लागू होता है, जैसे प्राकृतिक खतरों की भविष्यवाणी। Machine learning में, ROC वक्र बाइनरी वर्गीकरणकर्ताओं के मूल्यांकन के लिए मानक उपकरण हैं, जिनमें Deep learning और Neural network मॉडल में उपयोग किए जाने वाले शामिल हैं। यह तकनीक Large language model आउटपुट का मूल्यांकन करने के लिए भी प्रासंगिक है, जैसे सामग्री मॉडरेशन या भावना विश्लेषण कार्यों में, जहां निरंतर आत्मविश्वास स्कोर के आधार पर बाइनरी निर्णय लिए जाते हैं।

सीमाएं और विचार

ROC वक्रों की कुछ सीमाएं हैं। वे मुख्य रूप से बाइनरी वर्गीकरण के लिए डिज़ाइन किए गए हैं, और जबकि कई वर्गों तक सामान्यीकरण संभव है, इसके लिए अधिक जटिल दृष्टिकोण की आवश्यकता होती है जैसे कि एक-बनाम-बाकी या एक-बनाम-एक रणनीतियां। वक्र सीधे गलत सकारात्मक और गलत नकारात्मक की लागत को शामिल नहीं करता है, जो एप्लिकेशन के अनुसार भिन्न हो सकती है। इसके अतिरिक्त, जब वर्ग वितरण अत्यधिक असंतुलित होते हैं, तो ROC वक्र प्रेसिजन-रीकॉल वक्रों की तुलना में प्रदर्शन का अत्यधिक आशावादी दृश्य प्रस्तुत कर सकता है, जो सकारात्मक वर्ग पर केंद्रित होते हैं। इन सीमाओं के बावजूद, ROC विश्लेषण अपनी थ्रेशोल्ड स्वतंत्रता और सहज ग्राफिकल प्रतिनिधित्व के कारण मॉडल मूल्यांकन में एक मौलिक उपकरण बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·statistics·model-evaluation·binary-classification
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास