शास्त्रीय एकभाषी शब्द-अर्थ अस्पष्टता निवारण

अंग्रेज़ी से अनुवादित

क्लासिक एकभाषी शब्द-अर्थ विच्छेदन (monolingual word-sense disambiguation) किसी दिए गए संदर्भ में किसी शब्द का कौन-सा अर्थ अभिप्रेत है, यह निर्धारित करने का कार्य है, जिसमें ज्ञान-आधारित या पर्यवेक्षित विधियों का उपयोग किया जाता है। यह 1980 के दशक से 2010 के दशक तक प्राकृतिक भाषा प्रसंस्करण में एक केंद्रीय समस्या थी, इससे पहले कि गहन अधिगम (deep learning) दृष्टिकोण आए।

क्लासिकल एकभाषीय शब्द-अर्थ विघटन (डब्ल्यूएसडी) वह कम्प्यूटेशनल कार्य है जिसमें एक ही भाषा के भीतर, किसी शब्द के चारों ओर के संदर्भ के आधार पर उसके सही अर्थ की पहचान की जाती है। अनुवाद-समकक्षों का उपयोग करने वाली क्रॉस-भाषाई विधियों के विपरीत, क्लासिकल डब्ल्यूएसडी शब्दकोशों या थिसॉरस जैसी अर्थ-सूचियों पर निर्भर करता है ताकि प्रत्येक अस्पष्ट शब्द-प्रयोग को एक विशिष्ट अर्थ-लेबल सौंपा जा सके। यह समस्या 1980 के दशक से लेकर 2010 के दशक की शुरुआत तक प्राकृतिक भाषा प्रसंस्करण अनुसंधान का केंद्रीय फोकस थी, इससे पहले कि Neural network और Large language model दृष्टिकोणों के उदय ने पारंपरिक तकनीकों को काफी हद तक विस्थापित कर दिया।

यह कार्य आमतौर पर एक पर्यवेक्षित या ज्ञान-आधारित वर्गीकरण समस्या के रूप में तैयार किया जाता है। पर्यवेक्षित डब्ल्यूएसडी में, एक प्रणाली को मैन्युअल रूप से एनोटेट किए गए कोरपोरा पर प्रशिक्षित किया जाता है, जहां प्रत्येक अस्पष्ट शब्द को पूर्व-निर्धारित सूची से उसके सही अर्थ के साथ लेबल किया जाता है। इसके विपरीत, ज्ञान-आधारित विधियां संदर्भ और उम्मीदवार अर्थों के बीच समानता की गणना करने के लिए वर्डनेट या शब्दकोश परिभाषाओं जैसे शाब्दिक संसाधनों का उपयोग करती हैं। मूल्यांकन आमतौर पर सेंसेवल और सेमेवल जैसे बेंचमार्क डेटासेट के खिलाफ किया जाता है, जिन्होंने 1998 से मानकीकृत परीक्षण सेट प्रदान किए हैं।

ऐतिहासिक विकास

डब्ल्यूएसडी की उत्पत्ति 1950 के दशक के प्रारंभिक मशीन अनुवाद अनुसंधान से जुड़ी है, लेकिन क्लासिकल युग 1980 के दशक में मशीन-पठनीय शब्दकोशों की उपलब्धता के साथ शुरू हुआ। Xerox PARC और MIT CSAIL जैसे संस्थानों के शोधकर्ताओं ने अर्थ चयन के लिए साक्ष्य के रूप में शब्दकोश परिभाषाओं और उदाहरण वाक्यों का उपयोग करने की खोज की। 1985 में प्रिंसटन-विश्वविद्यालय में वर्डनेट के निर्माण के साथ इस क्षेत्र को गति मिली, जिसने एक संरचित शाब्दिक डेटाबेस प्रदान किया जो अंग्रेजी डब्ल्यूएसडी के लिए वास्तविक मानक अर्थ-सूची बन गया।

1990 के दशक में, सांख्यिकीय विधियां प्रमुख हो गईं। यारोस्की (1995) के अग्रणी कार्य ने एक-अर्थ-प्रति-प्रवचन परिकल्पना और एक बूटस्ट्रैपिंग एल्गोरिदम पेश किया, जिसने लेबल किए गए उदाहरणों के केवल एक छोटे बीज सेट का उपयोग करके उच्च सटीकता हासिल की। इस अवधि में 1998 में शुरू होने वाले पहले सेंसेवल मूल्यांकन अभियान भी देखे गए, जिन्होंने कठोर तुलनात्मक बेंचमार्क स्थापित किए और व्यवस्थित प्रगति को बढ़ावा दिया।

2000 के दशक में पर्यवेक्षित मशीन लर्निंग दृष्टिकोणों का उदय हुआ, जिसमें स्थानीय संदर्भ, सह-घटना (कोलोकेशन) और वाक्य-विन्यास निर्भरताओं से प्राप्त समृद्ध फीचर सेटों पर लागू support vector machines और निर्णय-वृक्ष शामिल थे। Carnegie Mellon University के शोधकर्ताओं द्वारा विकसित प्रणालियों ने लगातार लीडरबोर्ड में शीर्ष स्थान प्राप्त किया, जो मोटे-दाने वाले कार्यों पर लगभग 70% सटीकता हासिल करती थीं। हालांकि, प्रदर्शन स्थिर हो गया, और क्षेत्र को अर्थ-ग्रैन्युलैरिटी और डोमेन अनुकूलन की अंतर्निहित कठिनाई से जूझना पड़ा।

प्रमुख विधियां और एल्गोरिदम

क्लासिकल डब्ल्यूएसडी विधियां तीन व्यापक श्रेणियों में आती हैं। ज्ञान-आधारित विधियां बिना लेबल किए डेटा के बाहरी संसाधनों पर निर्भर करती हैं। 1986 में माइकल लेस्क द्वारा प्रस्तावित लेस्क एल्गोरिदम, उस अर्थ का चयन करता है जिसकी शब्दकोश परिभाषा का संदर्भ के साथ सबसे अधिक शब्द-अतिव्यापन होता है। वेरिएंट ने वर्डनेट से अर्थ-समानता मापों का उपयोग करके इसे बेहतर बनाया, जैसे कि जियांग-कॉनरथ और रेसनिक मेट्रिक्स, जो सूचना सामग्री और वर्गीकरण दूरी के आधार पर संबंधितता की गणना करते हैं।

पर्यवेक्षित विधियां डब्ल्यूएसडी को एक वर्गीकरण समस्या के रूप में मानती हैं। फीचर इंजीनियरिंग महत्वपूर्ण थी, जिसमें सामान्य फीचर में आसपास के शब्द (बैग-ऑफ-वर्ड्स), पार्ट-ऑफ-स्पीच टैग और वाक्य-विन्यास संबंध शामिल थे। Naive Bayes, अधिकतम-एन्ट्रॉपी-मॉडल और सपोर्ट-वेक्टर-मशीन जैसे एल्गोरिदम व्यापक रूप से उपयोग किए गए। सेंसेवल-2 (2001) और सेंसेवल-3 (2004) में सर्वश्रेष्ठ प्रणालियों ने इन तकनीकों का उपयोग किया, जिन्हें अक्सर एन्सेम्बल विधियों और डोमेन-विशिष्ट ट्यूनिंग के साथ जोड़ा गया।

बूटस्ट्रैपिंग और अर्ध-पर्यवेक्षित विधियों ने लेबल किए गए डेटा की कमी को संबोधित किया। यारोस्की का एल्गोरिदम एक छोटे बीज सेट पर एक क्लासिफायर को पुनरावृत्त रूप से प्रशिक्षित करता है, फिर प्रशिक्षण सेट का विस्तार करने के लिए बिना लेबल वाले डेटा पर अपनी भविष्यवाणियों का उपयोग करता है, एक-अर्थ-प्रति-प्रवचन बाधा का लाभ उठाता है। यह दृष्टिकोण शाब्दिक नमूना कार्यों पर उल्लेखनीय सफलता प्राप्त करता है, जहां लक्ष्य शब्दों का एक छोटा सेट कई संदर्भों में एनोटेट किया जाता है।

मूल्यांकन और बेंचमार्क

सेंसेवल और सेमेवल अभियानों ने प्राथमिक मूल्यांकन ढांचा प्रदान किया। सेंसेवल-1 (1998) ने शाब्दिक नमूना और सभी-शब्द दोनों कार्यों की शुरुआत की, जहां बाद वाले को चल रहे पाठ में हर सामग्री शब्द को विघटित करने की आवश्यकता होती है। बाद के संस्करणों, जिनमें सेंसेवल-2, सेंसेवल-3 और सेमेवल-2007 शामिल हैं, ने कार्यों को परिष्कृत किया और बहुभाषी ट्रैक जोड़े। अंग्रेजी शाब्दिक नमूना कार्यों में आमतौर पर 20 से 40 अस्पष्ट शब्द शामिल थे, जबकि सभी-शब्द कार्यों में वॉल स्ट्रीट जर्नल और विकिपीडिया जैसे स्रोतों से निरंतर पाठ का उपयोग किया गया।

मेट्रिक्स में परिशुद्धता, प्रत्यावर्तन और एफ1 स्कोर शामिल हैं, जिसमें प्रत्यावर्तन की गणना अक्सर उन शब्दों के अनुपात के रूप में की जाती है जिन्हें सिस्टम विघटित करने का प्रयास करता है। सर्वश्रेष्ठ क्लासिकल प्रणालियों ने सभी-शब्द कार्यों पर लगभग 65-70% एफ1 स्कोर हासिल किया, जबकि शाब्दिक नमूना कार्यों ने सीमित शब्द सेट के कारण उच्च सटीकता प्राप्त की। एक उल्लेखनीय चुनौती "ज्ञान अधिग्रहण बाधा" थी: मैन्युअल अर्थ एनोटेशन महंगा है, और अर्थ-सूचियों में अक्सर सूक्ष्म-दाने वाले भेद होते हैं जिन पर मानव और मशीन दोनों के लिए सहमत होना कठिन होता है।

सीमाएं और आधुनिक दृष्टिकोणों में संक्रमण

क्लासिकल डब्ल्यूएसडी को कई स्थायी सीमाओं का सामना करना पड़ा। निश्चित अर्थ-सूचियों पर निर्भरता ने प्रणालियों को डोमेन और भाषाओं में भंगुर बना दिया। सूक्ष्म-दाने वाले अर्थ, जैसे कि "बैंक" के विभिन्न प्रकारों (वित्तीय संस्थान बनाम नदी किनारे) के बीच अंतर करना, विशेष रूप से कठिन साबित हुआ, और अंतर-एनोटेटर सहमति अक्सर 80% से कम थी। इसके अलावा, फीचर-आधारित मॉडल लंबी दूरी के अर्थ संदर्भ को प्रभावी ढंग से पकड़ नहीं सके।

2010 के दशक में शब्द-एम्बेडिंग के आगमन, उसके बाद 2018 में बीईआरटी जैसे Transformer (architecture) मॉडल ने क्षेत्र को बदल दिया। ये मॉडल प्रासंगिक प्रतिनिधित्व सीखते हैं जो अंतर्निहित रूप से शब्द अर्थों को एन्कोड करते हैं, और डब्ल्यूएसडी डेटासेट पर फाइन-ट्यूनिंग से पर्याप्त सुधार होते हैं, जो अक्सर सभी-शब्द कार्यों पर 80% एफ1 से अधिक होते हैं। परिणामस्वरूप, क्लासिकल डब्ल्यूएसडी विधियां अब काफी हद तक ऐतिहासिक रुचि की हैं, हालांकि वे शाब्दिक अर्थ विज्ञान की नींव को समझने और कम-संसाधन परिदृश्यों के लिए प्रासंगिक बनी हुई हैं जहां आधुनिक मॉडल अव्यावहारिक हैं।

विरासत और प्रभाव

विस्थापित होने के बावजूद, क्लासिकल डब्ल्यूएसडी ने मौलिक अवधारणाओं का योगदान दिया जो आधुनिक एनएलपी में बनी हुई हैं। अर्थ-सूचियों और मूल्यांकन बेंचमार्क के विचार ने बाद के कार्यों जैसे इकाई लिंकिंग और अर्थ भूमिका लेबलिंग को प्रभावित किया। डब्ल्यूएसडी में अग्रणी बूटस्ट्रैपिंग और अर्ध-पर्यवेक्षित तकनीकें अभी भी सीमित लेबल वाले डेटा वाले डोमेन में उपयोग की जाती हैं। इसके अलावा, क्लासिकल डब्ल्यूएसडी में पहचानी गई चुनौतियां, जैसे अर्थ-ग्रैन्युलैरिटी और संदर्भ निर्भरता, Large language model व्याख्यात्मकता और मूल्यांकन पर अनुसंधान को सूचित करती रहती हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·lexical-semantics·computational-linguistics
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास