निर्भरता पार्सिंग (Dependency parsing) प्राकृतिक भाषा प्रसंस्करण (NLP) में एक विधि है जिसका उपयोग किसी वाक्य की व्याकरणिक संरचना का विश्लेषण करने के लिए किया जाता है। यह व्यक्तिगत शब्दों के बीच द्विआधारी संबंध स्थापित करता है, जिन्हें निर्भरता संबंध (dependency relations) कहा जाता है, जहाँ एक शब्द मुख्य (head या governor) होता है और दूसरा आश्रित (dependent या modifier) होता है। परिणाम एक वृक्ष-समान संरचना होती है जो यह दर्शाती है कि शब्द एक-दूसरे पर कैसे निर्भर हैं, जो वाक्यात्मक संरचना का एक निरूपण प्रदान करती है और सूचना निष्कर्षण, मशीन अनुवाद और प्रश्नोत्तर जैसे विभिन्न डाउनस्ट्रीम कार्यों के लिए उपयोगी होती है।
संविधान पार्सिंग (constituency parsing) के विपरीत, जो शब्दों को नेस्टेड वाक्यांशों में समूहित करती है, निर्भरता पार्सिंग शब्दों के बीच सीधे संबंधों पर केंद्रित होती है। यह दृष्टिकोण लचीले शब्द क्रम वाली भाषाओं के लिए विशेष रूप से प्रभावी है, क्योंकि यह एक निश्चित वाक्यांश संरचना पर निर्भर नहीं करता। निर्भरता पार्सिंग कम्प्यूटेशनल भाषाविज्ञान का एक केंद्रीय विषय रहा है और सांख्यिकीय तथा तंत्रिका मॉडलों के आगमन के साथ इसमें महत्वपूर्ण प्रगति देखी गई है।
इतिहास और विकास
निर्भरता व्याकरण की सैद्धांतिक नींव 20वीं सदी के मध्य में लुसिएन टेस्नीयर के कार्य से जुड़ी है, जिन्होंने प्रस्तावित किया कि वाक्यात्मक संरचना वाक्यांश संरचना के बजाय शब्दों के बीच निर्भरता संबंधों पर आधारित होती है। 1960 और 1970 के दशक में, रिचर्ड हडसन और इगोर मेल'चुक जैसे भाषाविदों ने निर्भरता व्याकरण को और विकसित किया, जिन्होंने निर्भरता संबंधों और वैलेंसी की अवधारणा को औपचारिक रूप दिया।
कम्प्यूटेशनल क्षेत्र में, प्रारंभिक निर्भरता पार्सर नियम-आधारित थे और हस्त-निर्मित व्याकरणों पर निर्भर थे। 1990 के दशक में सांख्यिकीय दृष्टिकोणों का उदय हुआ, जैसे माइकल कोलिन्स का कार्य, जिसमें एनोटेटेड कॉर्पोरा पर पार्सर प्रशिक्षित करने के लिए मशीन लर्निंग का उपयोग किया गया। पेन ट्रीबैंक और अन्य एनोटेटेड डेटासेट की शुरुआत ने पार्सरों के प्रशिक्षण और मूल्यांकन के लिए आवश्यक संसाधन प्रदान किए।
एक प्रमुख मील का पत्थर संक्रमण-आधारित (transition-based) और ग्राफ-आधारित (graph-based) पार्सिंग एल्गोरिदम का विकास था। संक्रमण-आधारित पार्सर, जैसे आर्क-स्टैंडर्ड और आर्क-ईगर एल्गोरिदम, स्थानीय निर्णय लेकर निर्भरता वृक्ष को वृद्धिशील रूप से निर्मित करते हैं। दूसरी ओर, ग्राफ-आधारित पार्सर सभी संभावित निर्भरता वृक्षों को स्कोर करते हैं और चू-लियू-एडमंड्स एल्गोरिदम जैसी तकनीकों का उपयोग करके उच्चतम स्कोर वाले वृक्ष का चयन करते हैं। ये दृष्टिकोण गहन शिक्षण के उदय तक क्षेत्र पर हावी रहे।
आधुनिक दृष्टिकोण
गहन शिक्षण के आगमन के साथ, निर्भरता पार्सिंग में क्रांति आ गई है। तंत्रिका नेटवर्क-आधारित पार्सर, जैसे आवर्ती तंत्रिका नेटवर्क (RNN) और बाद में ट्रांसफॉर्मर का उपयोग करने वाले, ने अत्याधुनिक परिणाम प्राप्त किए हैं। 2017 में डोज़ैट और मैनिंग द्वारा बायाफिन पार्सर (Biaffine Parser) की शुरुआत, जो बायाफिन अटेंशन तंत्र का उपयोग करता है, ने सटीकता में महत्वपूर्ण सुधार किया। हाल ही में, BERT जैसे पूर्व-प्रशिक्षित भाषा मॉडल को पार्सिंग आर्किटेक्चर में शामिल किया गया है, जिससे प्रदर्शन और बढ़ गया है।
आधुनिक पार्सर अक्सर बड़े बहुभाषी कॉर्पोरा पर प्रशिक्षित होते हैं, जैसे यूनिवर्सल डिपेंडेंसीज़ (UD) परियोजना, जो 100 से अधिक भाषाओं के लिए एनोटेटेड डेटा प्रदान करती है। इसने क्रॉस-लिंगुअल ट्रांसफर और ऐसे पार्सर के विकास को सक्षम बनाया है जो एक ही मॉडल के साथ कई भाषाओं को संभाल सकते हैं। तंत्रिका-नेटवर्क आर्किटेक्चर और गहन-शिक्षण तकनीकों के उपयोग ने निर्भरता पार्सिंग को अधिक मजबूत और सटीक बना दिया है।
अनुप्रयोग
निर्भरता पार्सिंग कई NLP प्रणालियों में एक मूलभूत घटक है। इसका उपयोग इनमें होता है:
- सूचना निष्कर्षण: संस्थाओं के बीच संबंधों की पहचान करना, जैसे किसने किसके साथ क्या किया।
- मशीन अनुवाद: अधिक सटीक अनुवाद उत्पन्न करने के लिए स्रोत भाषा की वाक्यात्मक संरचना को समझना।
- प्रश्नोत्तर: प्रश्नों को पार्स करके आशय समझना और प्रासंगिक उत्तर निकालना।
- भावना विश्लेषण: शब्दों के बीच संबंधों का विश्लेषण करके राय की ध्रुवता निर्धारित करना।
- पाठ सारांशीकरण: संक्षिप्त सारांश उत्पन्न करने के लिए प्रमुख वाक्यांशों और उनके संबंधों की पहचान करना।
इसके अतिरिक्त, निर्भरता वृक्षों का उपयोग अक्सर अन्य मशीन लर्निंग मॉडलों में विशेषताओं के रूप में किया जाता है, जो नामित इकाई पहचान और सह-संदर्भ समाधान जैसे कार्यों पर प्रदर्शन में सुधार करने के लिए वाक्यात्मक जानकारी प्रदान करता है।
मूल्यांकन और बेंचमार्क
निर्भरता पार्सर का मूल्यांकन आमतौर पर अनलेबल्ड अटैचमेंट स्कोर (UAS) और लेबल्ड अटैचमेंट स्कोर (LAS) जैसे मेट्रिक्स का उपयोग करके किया जाता है। UAS उन शब्दों के प्रतिशत को मापता है जिनका मुख्य सही है, जबकि LAS के लिए सही निर्भरता लेबल की भी आवश्यकता होती है। ये मेट्रिक्स एनोटेटेड कॉर्पोरा से लिए गए होल्ड-आउट परीक्षण सेटों पर गणना किए जाते हैं।
CoNLL साझा कार्यों जैसे बेंचमार्क ने क्षेत्र को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। CoNLL 2017 और 2018 साझा कार्य बहुभाषी निर्भरता पार्सिंग पर केंद्रित थे, जो विभिन्न प्रणालियों की तुलना के लिए एक सामान्य मंच प्रदान करते हैं। यूनिवर्सल डिपेंडेंसीज़ ट्रीबैंक इन मूल्यांकनों के लिए मानक डेटासेट के रूप में कार्य करते हैं।
चुनौतियाँ और भविष्य की दिशाएँ
महत्वपूर्ण प्रगति के बावजूद, निर्भरता पार्सिंग को अभी भी चुनौतियों का सामना करना पड़ रहा है। एक प्रमुख मुद्दा लंबी-दूरी की निर्भरताओं को संभालना है, जहाँ मुख्य और आश्रित वाक्य में एक-दूसरे से काफी दूर होते हैं। एक और चुनौती कम-संसाधन भाषाओं की पार्सिंग है, जहाँ एनोटेटेड डेटा दुर्लभ है। इससे निपटने के लिए क्रॉस-लिंगुअल ट्रांसफर और अर्ध-पर्यवेक्षित शिक्षण जैसी तकनीकों की खोज की जा रही है।
भविष्य की दिशाओं में निर्भरता पार्सिंग में शब्दार्थ संबंधी जानकारी का एकीकरण, साथ ही बहुत लंबे वाक्यों को संभालने में सक्षम अधिक कुशल मॉडल का विकास शामिल है। बड़े-भाषा-मॉडल और ट्रांसफॉर्मर आर्किटेक्चर का उपयोग संभव की सीमाओं को आगे बढ़ा रहा है, और निर्भरता पार्सिंग कृत्रिम-बुद्धिमत्ता और मशीन-लर्निंग में अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है।
यह भी देखें
- संविधान पार्सिंग
- यूनिवर्सल डिपेंडेंसीज़
- प्राकृतिक भाषा प्रसंस्करण
- वाक्यविन्यास
- शब्दार्थ भूमिका लेबलिंग