नामित इकाई पहचान (NER), जिसे इकाई पहचान, इकाई चंकिंग, और इकाई निष्कर्षण के रूप में भी जाना जाता है, सूचना निष्कर्षण का एक उप-कार्य है जो असंरचित पाठ में उल्लिखित नामित इकाइयों का पता लगाने और उन्हें पूर्व-परिभाषित श्रेणियों जैसे व्यक्ति नाम (PER), संगठन (ORG), स्थान (LOC), भू-राजनीतिक इकाइयाँ (GPE), वाहन (VEH), चिकित्सा कोड, समय अभिव्यक्तियाँ, मात्राएँ, मौद्रिक मूल्य, और प्रतिशत में वर्गीकृत करने का प्रयास करता है। NER प्रणालियों पर अधिकांश शोध को एक अचिह्नित पाठ खंड लेने के रूप में संरचित किया गया है, जैसे "जिम ने 2006 में एक्मे कॉर्प के 300 शेयर खरीदे" को एक चिह्नित खंड में परिवर्तित करना जो इकाइयों के नामों को उजागर करता है: "[जिम]व्यक्ति ने [एक्मे कॉर्प]संगठन के 300 शेयर [2006]समय में खरीदे।" इस उदाहरण में, एक टोकन से युक्त एक व्यक्ति नाम, एक दो-टोकन कंपनी नाम, और एक लौकिक अभिव्यक्ति का पता लगाया और वर्गीकृत किया गया है।
शब्द "नामित इकाई" कार्य को उन इकाइयों तक सीमित करता है जिनके लिए एक या कई स्ट्रिंग्स, जैसे शब्द या वाक्यांश, कुछ संदर्भ के लिए काफी सुसंगत रूप से खड़े होते हैं। यह सॉल क्रिप्के द्वारा परिभाषित कठोर निर्देशकों से निकटता से संबंधित है, हालांकि व्यवहार में NER कई नामों और संदर्भों से निपटता है जो दार्शनिक रूप से "कठोर" नहीं हैं। उदाहरण के लिए, 1903 में हेनरी फोर्ड द्वारा बनाई गई ऑटोमोटिव कंपनी को "फोर्ड" या "फोर्ड मोटर कंपनी" के रूप में संदर्भित किया जा सकता है, हालांकि "फोर्ड" कई अन्य इकाइयों को भी संदर्भित कर सकता है। कठोर निर्देशकों में उचित नाम के साथ-साथ कुछ जैविक प्रजातियों और पदार्थों के लिए शब्द शामिल हैं, लेकिन सर्वनाम (कोरफेरेंस समाधान देखें), विवरण जो किसी संदर्भ को उसके गुणों से चुनते हैं, और व्यक्तियों के बजाय वस्तुओं के प्रकारों के नाम शामिल नहीं हैं।
समस्या परिभाषा
पूर्ण नामित इकाई पहचान को अक्सर वैचारिक रूप से और संभवतः कार्यान्वयन में भी, दो अलग समस्याओं में विभाजित किया जाता है: नामों का पता लगाना, और नामों का उस इकाई के प्रकार के आधार पर वर्गीकरण जिसे वे संदर्भित करते हैं (जैसे, व्यक्ति, संगठन, या स्थान)। पहला चरण आमतौर पर एक विभाजन समस्या के रूप में सरलीकृत किया जाता है: नामों को टोकन के सतत खंडों के रूप में परिभाषित किया जाता है, बिना किसी नेस्टिंग के, ताकि "बैंक ऑफ अमेरिका" एक एकल नाम हो, इस तथ्य की उपेक्षा करते हुए कि इस नाम के अंदर, उप-स्ट्रिंग "अमेरिका" स्वयं एक नाम है। यह विभाजन समस्या औपचारिक रूप से चंकिंग के समान है। दूसरे चरण में चीजों की श्रेणियों को व्यवस्थित करने के लिए एक ऑन्टोलॉजी चुनने की आवश्यकता होती है।
लौकिक अभिव्यक्तियाँ और कुछ संख्यात्मक अभिव्यक्तियाँ (जैसे, धन, प्रतिशत) को भी NER कार्य के संदर्भ में नामित इकाइयों के रूप में माना जा सकता है। जबकि इन प्रकारों के कुछ उदाहरण कठोर निर्देशकों के अच्छे उदाहरण हैं (जैसे, वर्ष 2001), कई अमान्य भी हैं (जैसे, "मैं जून में अपनी छुट्टियाँ लेता हूँ")। पहले मामले में, वर्ष 2001 ग्रेगोरियन कैलेंडर के 2001वें वर्ष को संदर्भित करता है। दूसरे मामले में, महीना जून एक अनिर्धारित वर्ष के महीने को संदर्भित कर सकता है (पिछला जून, अगला जून, हर जून)। यह तर्कसंगत है कि ऐसे मामलों में व्यावहारिक कारणों से नामित इकाई की परिभाषा को ढीला किया जाता है। इसलिए नामित इकाई शब्द की परिभाषा सख्त नहीं है और अक्सर उस संदर्भ में समझाया जाना चाहिए जिसमें इसका उपयोग किया जाता है।
साहित्य में नामित इकाई प्रकारों के कुछ पदानुक्रम प्रस्तावित किए गए हैं। BBN श्रेणियाँ, 2002 में प्रस्तावित, प्रश्न उत्तर के लिए उपयोग की जाती हैं और इनमें 29 प्रकार और 64 उपप्रकार शामिल हैं। सेकिन का विस्तारित पदानुक्रम, जो 2002 में भी प्रस्तावित था, 200 उपप्रकारों से बना है। हाल ही में, 2011 में, रिटर ने सोशल मीडिया पाठ पर NER पर अभूतपूर्व प्रयोगों में सामान्य फ्रीबेस इकाई प्रकारों पर आधारित एक पदानुक्रम का उपयोग किया।
कठिनाइयाँ
NER में संदर्भ समाधान अस्पष्टताएँ हो सकती हैं जहाँ एक ही नाम एक ही प्रकार की विभिन्न इकाइयों को संदर्भित कर सकता है। उदाहरण के लिए, "JFK" संयुक्त राज्य अमेरिका के पूर्व राष्ट्रपति या उनके बेटे को संदर्भित कर सकता है। एक ही नाम पूरी तरह से अलग प्रकारों को संदर्भित कर सकता है: "JFK" न्यूयॉर्क में हवाई अड्डे को संदर्भित कर सकता है, और "IRA" व्यक्तिगत सेवानिवृत्ति खाता, अंतर्राष्ट्रीय पठन संघ, या आयरिश रिपब्लिकन आर्मी को संदर्भित कर सकता है। यह लक्षणालंकार के कारण हो सकता है; उदाहरण के लिए, "व्हाइट हाउस" एक स्थान के बजाय एक संगठन को संदर्भित कर सकता है।
औपचारिक मूल्यांकन
NER प्रणाली के आउटपुट की गुणवत्ता का मूल्यांकन करने के लिए, कई माप परिभाषित किए गए हैं। सामान्य माप सटीकता, पुनर्प्राप्ति, और F1 स्कोर कहलाते हैं। हालाँकि, इन मूल्यों की गणना कैसे की जाए, इस पर कई मुद्दे बने हुए हैं। ये सांख्यिकीय माप वास्तविक इकाई को ठीक से खोजने या चूकने, और गैर-इकाई खोजने के स्पष्ट मामलों के लिए काफी अच्छी तरह से काम करते हैं। हालाँकि, NER कई अन्य तरीकों से विफल हो सकता है, जिनमें से कई तर्कसंगत रूप से "आंशिक रूप से सही" हैं और उन्हें पूर्ण सफलता या विफलता के रूप में नहीं गिना जाना चाहिए। उदाहरण के लिए, एक वास्तविक इकाई की पहचान करना लेकिन वांछित से कम टोकन के साथ (जैसे, "जॉन स्मिथ, एम.डी." का अंतिम टोकन चूकना), वांछित से अधिक टोकन के साथ (जैसे, "द यूनिवर्सिटी ऑफ एमडी" का पहला शब्द शामिल करना), आसन्न इकाइयों को अलग तरह से विभाजित करना (जैसे, "स्मिथ, जोन्स रॉबिन्सन" को 2 बनाम 3 इकाइयों के रूप में मानना), इसे पूरी तरह से गलत प्रकार निर्दिष्ट करना (जैसे, एक व्यक्तिगत नाम को संगठन कहना), इसे एक संबंधित लेकिन गलत प्रकार निर्दिष्ट करना (जैसे, "पदार्थ" बनाम "दवा", या "स्कूल" बनाम "संगठन"), या एक इकाई की सही पहचान करना जब उपयोगकर्ता एक छोटी या बड़ी-सीमा वाली इकाई चाहता था (जैसे, "जेम्स मैडिसन" को व्यक्तिगत नाम के रूप में पहचानना जब यह "जेम्स मैडिसन यूनिवर्सिटी" का हिस्सा है)। कुछ NER प्रणालियाँ प्रतिबंध लगाती हैं कि इकाइयाँ कभी ओवरलैप या नेस्ट नहीं हो सकतीं, जिसका अर्थ है कि कुछ मामलों में मनमाने या कार्य-विशिष्ट विकल्प बनाने पड़ते हैं।
सटीकता मापने की एक अत्यधिक सरल विधि केवल यह गिनना है कि पाठ में सभी टोकन का कितना अंश सही या गलत तरीके से इकाई संदर्भों के हिस्से के रूप में (या सही प्रकार की इकाइयों के रूप में) पहचाना गया था। यह कम से कम दो समस्याओं से ग्रस्त है: पहला, वास्तविक दुनिया के पाठ में अधिकांश टोकन इकाई नामों का हिस्सा नहीं हैं, इसलिए आधार रेखा सटीकता (हमेशा "इकाई नहीं" की भविष्यवाणी करना) अत्यधिक उच्च है, आमतौर पर 90% से अधिक; और दूसरा, इकाई नाम के पूर्ण स्पैन की गलत भविष्यवाणी को ठीक से दंडित नहीं किया जाता है (किसी व्यक्ति का केवल पहला नाम खोजना जब उसका अंतिम नाम उसके बाद आता है, आधी सटीकता के रूप में स्कोर किया जा सकता है)।
CoNLL जैसे शैक्षणिक सम्मेलनों में, F1 स्कोर का एक प्रकार निम्नानुसार परिभाषित किया गया है: सटीकता भविष्यवाणी की गई इकाई नाम स्पैन की संख्या है जो स्वर्ण मानक मूल्यांकन डेटा में स्पैन के साथ बिल्कुल मेल खाते हैं। उदाहरण के लिए, जब [व्यक्ति हंस] [व्यक्ति ब्लिक] की भविष्यवाणी की जाती है लेकिन [व्यक्ति हंस ब्लिक] की आवश्यकता थी, भविष्यवाणी किए गए नाम के लिए सटीकता शून्य है। सटीकता फिर सभी भविष्यवाणी की गई इकाई नामों पर औसत की जाती है। पुनर्प्राप्ति इसी तरह स्वर्ण मानक में नामों की संख्या है जो भविष्यवाणियों में बिल्कुल उसी स्थान पर दिखाई देते हैं। F1 स्कोर इन दोनों का हार्मोनिक माध्य है। उपरोक्त परिभाषा से यह निम्नानुसार है कि कोई भी भविष्यवाणी जो एक टोकन चूकती है, एक स्प्यूरियस टोकन शामिल करती है, या गलत प्रकार रखती है, उस स्पैन के लिए पूर्ण विफलता के रूप में गिना जाता है।
दृष्टिकोण और अनुप्रयोग
पारंपरिक NER प्रणालियाँ हाथ से बनाए गए नियमों और सशर्त यादृच्छिक क्षेत्रों जैसे फीचर-आधारित सांख्यिकीय मॉडल पर निर्भर थीं। मशीन लर्निंग और डीप लर्निंग के उदय के साथ, आधुनिक प्रणालियाँ अक्सर तंत्रिका नेटवर्क वास्तुकलाओं का उपयोग करती हैं, जिसमें Transformer (architecture)-आधारित मॉडल शामिल हैं, जो अत्याधुनिक प्रदर्शन के लिए मानक बन गए हैं। ये मॉडल अक्सर बड़े कोरपोरा पर पूर्व-प्रशिक्षित होते हैं और NER कार्यों के लिए ठीक-ट्यून किए जाते हैं, जो OpenAI, Anthropic, और Google DeepMind जैसे संगठनों द्वारा विकसित बड़े भाषा मॉडल में प्रगति से लाभान्वित होते हैं। NER व्यापक रूप से प्रश्न उत्तर, खोज, और ज्ञान आधार निर्माण के लिए सूचना निष्कर्षण पाइपलाइनों में उपयोग किया जाता है, और यह कई प्राकृतिक भाषा प्रसंस्करण अनुप्रयोगों में एक प्रमुख घटक है।
यह भी देखें
- सूचना निष्कर्षण
- कोरफेरेंस समाधान
- चंकिंग
- सशर्त यादृच्छिक क्षेत्र
- Transformer (architecture)
- बड़ा भाषा मॉडल