अंग्रेज़ी से अनुवादित

F1 स्कोर प्रेसिजन और रिकॉल का हार्मोनिक माध्य है, जिसका उपयोग वर्गीकरण मॉडलों का मूल्यांकन करने के लिए किया जाता है, जो गलत सकारात्मक और गलत नकारात्मक को संतुलित करता है।

F1 स्कोर एक सांख्यिकीय माप है जिसका उपयोग वर्गीकरण मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। इसे परिशुद्धता (precision) और प्रत्यावर्तन (recall) के हार्मोनिक माध्य के रूप में परिभाषित किया गया है, जो एक एकल मीट्रिक प्रदान करता है जो गलत सकारात्मक (false positives) और गलत नकारात्मक (false negatives) के बीच संतुलन को दर्शाता है। F1 स्कोर 0 से 1 के बीच होता है, जहां 1 पूर्ण परिशुद्धता और प्रत्यावर्तन को इंगित करता है, और 0 सबसे खराब प्रदर्शन को दर्शाता है। यह विशेष रूप से तब उपयोगी होता है जब वर्ग असंतुलित होते हैं, क्योंकि यह अकेले सटीकता (accuracy) की तुलना में मॉडल प्रदर्शन का अधिक सूचनात्मक दृश्य देता है।

F1 स्कोर की गणना 2 (परिशुद्धता प्रत्यावर्तन) / (परिशुद्धता + प्रत्यावर्तन) के रूप में की जाती है। परिशुद्धता सकारात्मक भविष्यवाणियों की कुल संख्या (सही सकारात्मक प्लस गलत सकारात्मक) के लिए सही सकारात्मक भविष्यवाणियों का अनुपात है, जबकि प्रत्यावर्तन वास्तविक सकारात्मक उदाहरणों की कुल संख्या (सही सकारात्मक प्लस गलत नकारात्मक) के लिए सही सकारात्मक भविष्यवाणियों का अनुपात है। हार्मोनिक माध्य यह सुनिश्चित करता है कि F1 स्कोर तब कम हो जब परिशुद्धता या प्रत्यावर्तन में से कोई भी कम हो, जिससे उन मॉडलों को दंडित किया जाता है जो एक को दूसरे के लिए त्याग देते हैं।

ऐतिहासिक संदर्भ

F1 स्कोर की जड़ें सूचना पुनर्प्राप्ति (information retrieval) और सांख्यिकीय वर्गीकरण में हैं। परिशुद्धता और प्रत्यावर्तन को एक एकल माप में संयोजित करने की अवधारणा 1950 के दशक से चली आ रही है, जिसमें कैरन सिमोनियन जैसे शोधकर्ताओं द्वारा प्रारंभिक कार्य शामिल है (हालांकि उनके योगदान हाल के हैं, मूलभूत विचार पहले विकसित किए गए थे)। हार्मोनिक माध्य के विशिष्ट सूत्रीकरण को क्रिस बिशप और अन्य द्वारा मशीन लर्निंग मूल्यांकन के संदर्भ में औपचारिक रूप दिया गया था। F1 स्कोर ने 1990 के दशक में पाठ पुनर्प्राप्ति के उदय के साथ प्रमुखता प्राप्त की और बाद में मशीन लर्निंग और डीप लर्निंग अनुसंधान में एक मानक मीट्रिक बन गया।

गणितीय परिभाषा

F1 स्कोर को इस प्रकार परिभाषित किया गया है:

F1 = 2 (परिशुद्धता प्रत्यावर्तन) / (परिशुद्धता + प्रत्यावर्तन)

परिशुद्धता = TP / (TP + FP)

प्रत्यावर्तन = TP / (TP + FN)

जहां TP सही सकारात्मक की संख्या है, FP गलत सकारात्मक की संख्या है, और FN गलत नकारात्मक की संख्या है। F1 स्कोर को भ्रम मैट्रिक्स (confusion matrix) के संदर्भ में भी व्यक्त किया जा सकता है, जो सही सकारात्मक, सही नकारात्मक, गलत सकारात्मक और गलत नकारात्मक की गणना का सारांश देता है।

अन्य मीट्रिक्स से संबंध

F1 स्कोर F-मापों के एक परिवार का हिस्सा है, जो परिशुद्धता और प्रत्यावर्तन के भारित हार्मोनिक माध्य हैं। सामान्य सूत्र Fβ = (1 + β²) (परिशुद्धता प्रत्यावर्तन) / (β² * परिशुद्धता + प्रत्यावर्तन) है, जहां β प्रत्यावर्तन के सापेक्ष परिशुद्धता के भार को नियंत्रित करता है। जब β = 1 होता है, तो F1 स्कोर प्राप्त होता है, जो परिशुद्धता और प्रत्यावर्तन को समान भार देता है। अन्य सामान्य मीट्रिक्स में सटीकता शामिल है, जो कुल भविष्यवाणियों के लिए सही भविष्यवाणियों का अनुपात है, और मैथ्यूज सहसंबंध गुणांक (MCC), जो सभी चार भ्रम मैट्रिक्स श्रेणियों पर विचार करता है। F1 स्कोर अक्सर असंतुलित डेटासेट में सटीकता पर पसंद किया जाता है क्योंकि सटीकता भ्रामक हो सकती है जब एक वर्ग हावी हो।

मशीन लर्निंग में अनुप्रयोग

F1 स्कोर व्यापक रूप से कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में वर्गीकरण मॉडल के मूल्यांकन के लिए उपयोग किया जाता है, विशेष रूप से प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर दृष्टि और सूचना पुनर्प्राप्ति में। उदाहरण के लिए, बड़े भाषा मॉडल मूल्यांकन में, F1 का उपयोग प्रश्न-उत्तर प्रणालियों की गुणवत्ता को मापने के लिए किया जाता है, जहां परिशुद्धता प्राप्त उत्तरों की प्रासंगिकता को दर्शाती है और प्रत्यावर्तन कवरेज की पूर्णता को दर्शाता है। तंत्रिका नेटवर्क प्रशिक्षण में, F1 का उपयोग अक्सर सर्वोत्तम मॉडल चेकपॉइंट का चयन करने के लिए एक सत्यापन मीट्रिक के रूप में किया जाता है। ओपनएआई और गूगल डीपमाइंड जैसी कंपनियां अपने शोध पत्रों में मॉडल प्रदर्शन को बेंचमार्क करने के लिए F1 स्कोर की रिपोर्ट करती हैं।

लाभ और सीमाएं

F1 स्कोर कई लाभ प्रदान करता है। यह एक एकल संख्या प्रदान करता है जो परिशुद्धता और प्रत्यावर्तन के बीच संतुलन का सारांश देती है, जिससे मॉडलों की तुलना करना आसान हो जाता है। यह वर्ग असंतुलन के प्रति मजबूत है, क्योंकि यह सही नकारात्मक पर विचार नहीं करता है, जो तिरछे डेटासेट में हावी हो सकते हैं। हालांकि, F1 स्कोर की सीमाएं हैं। यह मानता है कि परिशुद्धता और प्रत्यावर्तन समान रूप से महत्वपूर्ण हैं, जो सभी अनुप्रयोगों में सत्य नहीं हो सकता है। उदाहरण के लिए, चिकित्सा निदान में, सकारात्मक मामलों को याद न करने से बचने के लिए प्रत्यावर्तन (संवेदनशीलता) परिशुद्धता से अधिक महत्वपूर्ण हो सकती है। इसके अतिरिक्त, F1 स्कोर त्रुटियों के अंतर्निहित वितरण के बारे में जानकारी प्रदान नहीं करता है, और यह भ्रम मैट्रिक्स में छोटे बदलावों के प्रति संवेदनशील हो सकता है।

विविधताएं और विस्तार

विशिष्ट आवश्यकताओं को संबोधित करने के लिए F1 स्कोर की कई विविधताएं मौजूद हैं। मैक्रो-F1 स्कोर प्रत्येक वर्ग के लिए स्वतंत्र रूप से F1 स्कोर की गणना करता है और फिर उन्हें औसत करता है, जिससे सभी वर्गों को समान भार मिलता है। माइक्रो-F1 स्कोर सभी वर्गों में सही सकारात्मक, गलत सकारात्मक और गलत नकारात्मक को एकत्रित करता है और फिर परिशुद्धता और प्रत्यावर्तन की गणना करता है, जो समग्र F1 के बराबर है। भारित-F1 स्कोर प्रत्येक वर्ग में नमूनों की संख्या से भारित वर्ग-वार F1 स्कोर का औसत करता है। ये विविधताएं आमतौर पर बहु-वर्ग वर्गीकरण कार्यों में उपयोग की जाती हैं, जैसे कि ट्रांसफॉर्मर मॉडल द्वारा संभाले जाने वाले कार्य।

उद्योग और अनुसंधान में उपयोग

F1 स्कोर शैक्षणिक अनुसंधान और उद्योग अभ्यास में एक मानक मीट्रिक है। डीप लर्निंग अनुसंधान में, पेपर अक्सर SQuAD जैसे प्रश्न-उत्तर और GLUE जैसे प्राकृतिक भाषा समझ के लिए बेंचमार्क डेटासेट पर F1 स्कोर की रिपोर्ट करते हैं। अमेज़न वेब सर्विसेज, एज़्योर और गूगल क्लाउड जैसी तकनीकी कंपनियां मॉडल मूल्यांकन के लिए स्वचालित रूप से F1 स्कोर की गणना करने वाले उपकरण और सेवाएं प्रदान करती हैं। जनरेटिव एआई में, F1 का उपयोग उत्पन्न पाठ की गुणवत्ता का आकलन करने के लिए किया जाता है, उदाहरण के लिए, सारांश कार्यों में जहां परिशुद्धता और प्रत्यावर्तन उत्पन्न और संदर्भ सारांशों के बीच ओवरलैप को मापते हैं।

कम्प्यूटेशनल विचार

F1 स्कोर की गणना सीधी है और इसके लिए केवल भ्रम मैट्रिक्स की आवश्यकता होती है। व्यवहार में, पायथन में scikit-learn जैसी लाइब्रेरी F1 स्कोर की कुशलता से गणना करने के लिए फ़ंक्शन प्रदान करती हैं। बड़े पैमाने पर मूल्यांकन के लिए, जैसे कि एडब्ल्यूएस ट्रेनियम या सेरेब्रास हार्डवेयर से जुड़े, लाखों भविष्यवाणियों को संभालने के लिए F1 गणना समानांतर की जाती है। मीट्रिक का उपयोग वास्तविक समय प्रणालियों में भी किया जाता है, जैसे वेमो सेल्फ-ड्राइविंग कार धारणा, जहां सुरक्षा के लिए परिशुद्धता और प्रत्यावर्तन के बीच संतुलन महत्वपूर्ण है।

निष्कर्ष

F1 स्कोर मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में वर्गीकरण प्रदर्शन का मूल्यांकन करने के लिए एक मौलिक मीट्रिक बना हुआ है। इसका हार्मोनिक माध्य सूत्रीकरण परिशुद्धता और प्रत्यावर्तन का संतुलित दृश्य प्रदान करता है, जिससे यह असंतुलित डेटासेट और बहु-वर्ग समस्याओं के लिए अपरिहार्य हो जाता है। अपनी सीमाओं के बावजूद, F1 स्कोर अनुसंधान और उद्योग दोनों में व्यापक रूप से अपनाया जाता रहा है, और यह संभावना है कि एआई मॉडल अधिक जटिल होने के साथ यह एक प्रमुख मूल्यांकन उपकरण बना रहेगा।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·evaluation-metrics·classification·statistics
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास