प्रिसिजन और रिकॉल दो मौलिक प्रदर्शन मेट्रिक्स हैं जिनका उपयोग वर्गीकरण और सूचना पुनर्प्राप्ति में किसी मॉडल की भविष्यवाणियों की गुणवत्ता का मूल्यांकन करने के लिए किया जाता है। प्रिसिजन, जिसे सकारात्मक भविष्य कहनेवाला मान भी कहा जाता है, सभी पुनर्प्राप्त उदाहरणों में से प्रासंगिक उदाहरणों के अंश को मापता है। रिकॉल, जिसे संवेदनशीलता के रूप में भी जाना जाता है, उन प्रासंगिक उदाहरणों के अंश को मापता है जिन्हें सफलतापूर्वक पुनर्प्राप्त किया गया था। दोनों मेट्रिक्स प्रासंगिकता की अवधारणा पर आधारित हैं, जिसे आमतौर पर विशिष्ट कार्य द्वारा परिभाषित किया जाता है, जैसे कि डेटासेट में किसी विशेष वर्ग की पहचान करना।
वर्गीकरण कार्य में, किसी दिए गए वर्ग के लिए प्रिसिजन सही सकारात्मक (उन वस्तुओं की संख्या जिन्हें सही ढंग से वर्ग से संबंधित के रूप में लेबल किया गया है) को उस वर्ग से संबंधित के रूप में लेबल की गई कुल वस्तुओं की संख्या से विभाजित करने पर प्राप्त होता है, जो सही सकारात्मक और गलत सकारात्मक का योग है। रिकॉल सही सकारात्मक की संख्या को उन कुल वस्तुओं की संख्या से विभाजित करने पर प्राप्त होता है जो वास्तव में उस वर्ग से संबंधित हैं, जो सही सकारात्मक और गलत नकारात्मक का योग है। ये परिभाषाएँ सामान्य सूत्रों के अनुरूप हैं: प्रिसिजन प्रासंगिक पुनर्प्राप्त उदाहरणों को सभी पुनर्प्राप्त उदाहरणों से विभाजित करने के बराबर है, और रिकॉल प्रासंगिक पुनर्प्राप्त उदाहरणों को सभी प्रासंगिक उदाहरणों से विभाजित करने के बराबर है।
एक कंप्यूटर प्रोग्राम पर विचार करें जो डिजिटल तस्वीरों में कुत्तों को पहचानने के लिए डिज़ाइन किया गया है। यदि एक तस्वीर में दस बिल्लियाँ और बारह कुत्ते हैं, और प्रोग्राम आठ तत्वों को कुत्तों के रूप में पहचानता है, जिनमें से पाँच वास्तव में कुत्ते हैं (सही सकारात्मक) और तीन बिल्लियाँ हैं (गलत सकारात्मक), तो सात कुत्ते छूट जाते हैं (गलत नकारात्मक) और सात बिल्लियाँ सही ढंग से बाहर रखी जाती हैं (सही नकारात्मक)। प्रोग्राम का प्रिसिजन 5/8 है, क्योंकि चुने गए आठ तत्वों में से केवल पाँच प्रासंगिक हैं। इसका रिकॉल 5/12 है, क्योंकि बारह प्रासंगिक कुत्तों में से केवल पाँच पुनर्प्राप्त किए गए हैं। यह उदाहरण दर्शाता है कि प्रिसिजन और रिकॉल प्रदर्शन के विभिन्न पहलुओं को कैसे पकड़ते हैं।
परिकल्पना परीक्षण से संबंध
प्रिसिजन और रिकॉल को परिकल्पना परीक्षण के दृष्टिकोण से समझा जा सकता है। एक सामान्य सेटअप में, शून्य परिकल्पना यह है कि एक दिया गया आइटम अप्रासंगिक है (जैसे, कुत्ता नहीं)। एक प्रकार I त्रुटि तब होती है जब एक प्रासंगिक आइटम को गलत तरीके से अस्वीकार कर दिया जाता है, जो एक गलत सकारात्मक के अनुरूप है। एक प्रकार II त्रुटि तब होती है जब एक अप्रासंगिक आइटम को गलत तरीके से स्वीकार कर लिया जाता है, जो एक गलत नकारात्मक के अनुरूप है। पूर्ण प्रिसिजन (कोई गलत सकारात्मक नहीं) प्रकार I त्रुटियों की अनुपस्थिति के बराबर है, जबकि पूर्ण रिकॉल (कोई गलत नकारात्मक नहीं) प्रकार II त्रुटियों की अनुपस्थिति के बराबर है।
अधिक सामान्यतः, रिकॉल प्रकार II त्रुटि दर का पूरक है, जिसका अर्थ है कि रिकॉल एक घटा गलत नकारात्मक दर के बराबर है। प्रिसिजन प्रकार I त्रुटि दर से संबंधित है लेकिन अधिक जटिल तरीके से, क्योंकि यह जनसंख्या में प्रासंगिक बनाम अप्रासंगिक वस्तुओं के पूर्व वितरण पर भी निर्भर करता है। कुत्ते के उदाहरण में, दस बिल्लियों में से तीन प्रकार I त्रुटियाँ (गलत सकारात्मक) हैं, जिससे प्रकार I त्रुटि दर 3/10 होती है। बारह कुत्तों में से सात प्रकार II त्रुटियाँ (गलत नकारात्मक) हैं, जिससे प्रकार II त्रुटि दर 7/12 होती है।
प्रिसिजन गुणवत्ता के रूप में, रिकॉल मात्रा के रूप में
प्रिसिजन को अक्सर गुणवत्ता के माप के रूप में देखा जाता है, जो दर्शाता है कि पुनर्प्राप्त वस्तुओं में से कितनी वास्तव में प्रासंगिक हैं। उच्च प्रिसिजन का मतलब है कि एक एल्गोरिदम अप्रासंगिक परिणामों की तुलना में अधिक प्रासंगिक परिणाम लौटाता है। दूसरी ओर, रिकॉल मात्रा का एक माप है, जो दर्शाता है कि प्रासंगिक वस्तुओं में से कितनी पुनर्प्राप्त की गई हैं। उच्च रिकॉल का मतलब है कि एक एल्गोरिदम अधिकांश प्रासंगिक परिणाम लौटाता है, चाहे अप्रासंगिक परिणाम भी लौटाए जाएँ या नहीं।
ये मेट्रिक्स अलगाव में विशेष रूप से उपयोगी नहीं हैं। उदाहरण के लिए, डेटासेट में हर एक आइटम को पुनर्प्राप्त करके पूर्ण रिकॉल प्राप्त करना संभव है। इसके विपरीत, केवल बहुत कम संख्या में अत्यधिक संभावित आइटम चुनकर पूर्ण प्रिसिजन प्राप्त किया जा सकता है, भले ही कई प्रासंगिक आइटम छूट जाएँ। इसलिए, प्रिसिजन और रिकॉल का आमतौर पर एक साथ मूल्यांकन किया जाता है।
वर्गीकरण कार्य में, कक्षा C के लिए 1.0 का प्रिसिजन स्कोर का मतलब है कि कक्षा C से संबंधित के रूप में लेबल की गई हर वस्तु वास्तव में उस वर्ग से संबंधित है, लेकिन यह इस बारे में कुछ नहीं कहता है कि कक्षा C की कितनी वस्तुओं को सही ढंग से लेबल नहीं किया गया था। 1.0 का रिकॉल का मतलब है कि कक्षा C की हर वस्तु को कक्षा C से संबंधित के रूप में लेबल किया गया था, लेकिन यह इस बारे में कुछ नहीं कहता है कि अन्य वर्गों की कितनी वस्तुओं को गलत तरीके से कक्षा C के रूप में लेबल किया गया था।
प्रिसिजन-रिकॉल ट्रेडऑफ़
अक्सर, प्रिसिजन और रिकॉल के बीच एक व्युत्क्रम संबंध होता है। एक को बढ़ाने से आमतौर पर दूसरा कम हो जाता है, लेकिन एप्लिकेशन का संदर्भ यह तय कर सकता है कि कौन सा मेट्रिक अधिक मूल्यवान है। उदाहरण के लिए, एक धुआँ डिटेक्टर आमतौर पर कई प्रकार I त्रुटियाँ करने के लिए डिज़ाइन किया जाता है, ऐसी स्थितियों में सतर्क करता है जहाँ कोई खतरा नहीं होता है, क्योंकि प्रकार II त्रुटि की लागत (बड़ी आग के दौरान अलार्म बजाने में विफल होना) निषेधात्मक रूप से अधिक होती है। इसलिए धुआँ डिटेक्टरों को रिकॉल को ध्यान में रखकर डिज़ाइन किया जाता है, कई झूठे अलार्मों की कीमत पर भी सभी वास्तविक खतरों को पकड़ते हैं।
इसके विपरीत, आपराधिक न्याय प्रणाली अक्सर प्रिसिजन पर जोर देती है, जैसा कि ब्लैकस्टोन के अनुपात में परिलक्षित होता है: "यह बेहतर है कि दस दोषी व्यक्ति बच जाएँ, बजाय एक निर्दोष को कष्ट सहना पड़े।" यह सिद्धांत प्रकार I त्रुटि (एक निर्दोष व्यक्ति को दोषी ठहराना) की लागत पर प्रकाश डालता है। इस प्रकार, प्रणाली प्रिसिजन की ओर उन्मुख है, अधिक दोषी लोगों को मुक्त जाने देने की कीमत पर भी गलत दोषसिद्धि से बचती है, जो रिकॉल को कम करता है।
एक मस्तिष्क सर्जन द्वारा कैंसरग्रस्त ट्यूमर को हटाना भी इस ट्रेडऑफ़ को दर्शाता है। सर्जन को पुनर्जनन को रोकने के लिए सभी ट्यूमर कोशिकाओं को हटाना होगा, लेकिन मस्तिष्क के कार्य को संरक्षित करने के लिए स्वस्थ मस्तिष्क कोशिकाओं को हटाने से भी बचना होगा। यदि सर्जन मस्तिष्क के उस क्षेत्र को हटाने में अधिक उदार है, तो वे रिकॉल बढ़ाते हैं (सभी कैंसर कोशिकाओं को हटाते हैं) लेकिन प्रिसिजन कम करते हैं (स्वस्थ कोशिकाओं को हटाते हैं)। यदि सर्जन अधिक रूढ़िवादी है, तो वे प्रिसिजन बढ़ाते हैं लेकिन रिकॉल कम करते हैं। अधिक रिकॉल सभी कैंसर कोशिकाओं को हटाने की संभावना बढ़ाता है लेकिन स्वस्थ कोशिकाओं को हटाने का जोखिम भी बढ़ाता है। अधिक प्रिसिजन स्वस्थ कोशिकाओं को हटाने के जोखिम को कम करता है लेकिन सभी कैंसर कोशिकाओं को हटाने की संभावना भी कम करता है।
प्रिसिजन-रिकॉल वक्र और संयुक्त मेट्रिक्स
व्यवहार में, प्रिसिजन और रिकॉल स्कोर अलगाव में चर्चा नहीं की जाती हैं। एक प्रिसिजन-रिकॉल वक्र रिकॉल के एक फ़ंक्शन के रूप में प्रिसिजन को प्लॉट करता है, आमतौर पर यह दर्शाता है कि रिकॉल बढ़ने पर प्रिसिजन घटता है। यह वक्र विभिन्न थ्रेसहोल्ड पर मॉडल के प्रदर्शन का एक व्यापक दृश्य प्रदान करता है। वैकल्पिक रूप से, एक माप के मानों की तुलना दूसरे के निश्चित स्तर पर की जा सकती है, जैसे कि 0.75 के रिकॉल स्तर पर प्रिसिजन।
कई संयुक्त मेट्रिक्स प्रिसिजन और रिकॉल दोनों को शामिल करते हैं। F1 स्कोर, प्रिसिजन और रिकॉल का हार्मोनिक माध्य, मॉडल के प्रदर्शन को एक संख्या में सारांशित करने के लिए व्यापक रूप से उपयोग किया जाता है। F1 स्कोर विशेष रूप से तब उपयोगी होता है जब वर्ग वितरण असंतुलित होता है, क्योंकि यह प्रिसिजन और रिकॉल के बीच ट्रेडऑफ़ को संतुलित करता है। अन्य मेट्रिक्स, जैसे प्रिसिजन-रिकॉल वक्र के अंतर्गत क्षेत्र, का उपयोग मॉडलों का मूल्यांकन करने के लिए भी किया जाता है, विशेष रूप से Machine learning कार्यों में जहाँ सकारात्मक वर्ग दुर्लभ होते हैं।
मशीन लर्निंग में अनुप्रयोग
प्रिसिजन और रिकॉल कई Machine learning अनुप्रयोगों में आवश्यक हैं, विशेष रूप से Artificial intelligence प्रणालियों में जहाँ वर्गीकरण त्रुटियों के अलग-अलग परिणाम होते हैं। उदाहरण के लिए, Large language model मूल्यांकन में, प्रिसिजन और रिकॉल का उपयोग उत्पन्न प्रतिक्रियाओं या पुनर्प्राप्त दस्तावेजों की प्रासंगिकता का आकलन करने के लिए किया जा सकता है। Neural network आधारित वर्गीकरणकर्ताओं में, ये मेट्रिक्स निर्णय थ्रेसहोल्ड के चयन और मॉडल मापदंडों के ट्यूनिंग का मार्गदर्शन करते हैं।
असंतुलित वर्गीकरण समस्याओं में, जैसे धोखाधड़ी का पता लगाना या चिकित्सा निदान, सटीकता अक्सर भ्रामक होती है क्योंकि बहुमत वर्ग हावी होता है। प्रिसिजन और रिकॉल एक अधिक सूक्ष्म दृश्य प्रदान करते हैं, जिससे चिकित्सकों को गलत सकारात्मक और गलत नकारात्मक की विशिष्ट लागतों के लिए अनुकूलन करने की अनुमति मिलती है। Data Augmentation और Loss Functions जैसी तकनीकें अक्सर ऐसे परिदृश्यों में प्रिसिजन और रिकॉल में सुधार करने के लिए नियोजित की जाती हैं।
सीमाएँ और विचार
जबकि प्रिसिजन और रिकॉल शक्तिशाली हैं, उनकी सीमाएँ हैं। वे सही नकारात्मक के लिए जिम्मेदार नहीं हैं, जो कुछ संदर्भों में महत्वपूर्ण हो सकते हैं। उदाहरण के लिए, बड़ी संख्या में नकारात्मक उदाहरणों वाली द्विआधारी वर्गीकरण समस्या में, उच्च प्रिसिजन और रिकॉल वाला मॉडल अभी भी कई गलत सकारात्मक हो सकता है, जो समस्याग्रस्त हो सकता है। इसके अतिरिक्त, प्रिसिजन और रिकॉल सकारात्मक वर्ग की पसंद के प्रति संवेदनशील हैं, और बहु-वर्ग सेटिंग्स में परिभाषाएँ अस्पष्ट हो सकती हैं।
इसके अलावा, प्रिसिजन और रिकॉल विभिन्न डेटासेट या कार्यों में सीधे तुलनीय नहीं हैं, क्योंकि वे सकारात्मक वर्ग की आधार दर पर निर्भर करते हैं। एक दुर्लभ बीमारी डेटासेट पर उच्च रिकॉल वाला मॉडल एक सामान्य स्थिति पर अच्छा प्रदर्शन नहीं कर सकता है। इसलिए, इन मेट्रिक्स की व्याख्या करते समय संदर्भ और विभिन्न प्रकार की त्रुटियों से जुड़ी लागतों पर विचार करना महत्वपूर्ण है।