फ़िल्टर्ड-पॉपिंग रिकर्सिव ट्रांज़िशन नेटवर्क (FPRTN) प्राकृतिक भाषा को पार्स करने के लिए एक कम्प्यूटेशनल मॉडल है, जिसका पहली बार वर्णन 1988 में एडिनबर्ग विश्वविद्यालय के शोधकर्ताओं द्वारा एक तकनीकी रिपोर्ट में किया गया था। यह पहले के रिकर्सिव ट्रांज़िशन नेटवर्क (RTN) प्रारूप को फ़िल्टर्ड पॉपिंग नामक एक तंत्र जोड़कर विस्तारित करता है, जो नेटवर्क को कुछ संदर्भ-संवेदनशील व्याकरणिक निर्माणों को संभालने की अनुमति देता है जिन्हें सरल RTN संसाधित नहीं कर सकते। FPRTN को नियतात्मक पार्सिंग पर शोध के भाग के रूप में विकसित किया गया था और बाद में इसे वाक्यात्मक विश्लेषण के लिए कनेक्शनिस्ट और तंत्रिका दृष्टिकोणों पर एक प्रारंभिक प्रभाव के रूप में मान्यता दी गई।
FPRTN का मूल विचार अवस्थाओं और संक्रमणों का एक नेटवर्क है जो पुशडाउन ऑटोमेटन के समान उप-नेटवर्क को पुनरावर्ती रूप से कॉल कर सकता है। एक मानक RTN में, एक पॉप ऑपरेशन नियंत्रण को उप-नेटवर्क से कॉलर को लौटाता है, लेकिन यह अस्पष्टता पैदा कर सकता है जब कई उप-नेटवर्क सक्रिय हों। फ़िल्टर्ड पॉपिंग एक शर्त - एक फ़िल्टर - जोड़ता है जिसे पॉप की अनुमति देने से पहले संतुष्ट होना चाहिए, जिससे खोज स्थान सीमित हो जाता है और पार्सर को लंबी-दूरी की निर्भरताओं और समझौते की घटनाओं को संभालने में सक्षम बनाता है। फ़िल्टर आमतौर पर फीचर संरचनाओं या संदर्भ जानकारी पर आधारित होता है जो नेटवर्क के माध्यम से प्रसारित होती है।
ऐतिहासिक विकास
FPRTN को 1980 के दशक के अंत में यूनाइटेड किंगडम में अल्वे प्राकृतिक भाषा अनुसंधान कार्यक्रम के भाग के रूप में पेश किया गया था। प्राथमिक प्रकाशन 1988 की एक रिपोर्ट थी जिसका शीर्षक था "फ़िल्टर्ड पॉपिंग इन रिकर्सिव ट्रांज़िशन नेटवर्क्स", जिसे एडिनबर्ग विश्वविद्यालय में क्रिस मेलिश और अन्य शोधकर्ताओं सहित लिखा गया था। यह कार्य 1970 के दशक के पहले के RTN मॉडलों पर आधारित था, जैसे कि बोल्ट बेरानेक और न्यूमैन (BBN) में विलियम वुड्स द्वारा विकसित, जो LUNAR प्रश्न-उत्तर प्रणाली में उपयोग किए गए थे। एडिनबर्ग समूह का उद्देश्य वास्तविक-विश्व पाठ के लिए RTN-आधारित पार्सर की दक्षता और कवरेज में सुधार करना था।
इस दृष्टिकोण पर बाद में "ऑगमेंटेड ट्रांज़िशन नेटवर्क्स" (ATN) के संदर्भ में चर्चा की गई, जिसने RTN में रजिस्टर और शर्त तंत्र जोड़े। FPRTN ने ATN के लिए एक अधिक प्रतिबंधित विकल्प प्रस्तुत किया, जो नियतात्मक पार्सिंग पर ध्यान केंद्रित करता था और बैकट्रैकिंग को कम करता था। इस तकनीक को कनेक्शनिस्ट पार्सिंग में भी खोजा गया, जहां फ़िल्टर शर्तों को तंत्रिका नेटवर्क सक्रियण के रूप में लागू किया गया, जो प्रतीकात्मक और उप-प्रतीकात्मक प्रतिमानों को जोड़ता था।
तकनीकी विवरण
औपचारिक रूप से, एक FPRTN एक निर्देशित ग्राफ है जिसमें अवस्थाओं का एक सेट, लेबल किए गए संक्रमणों का एक सेट, और उप-नेटवर्क कॉल और रिटर्न संचालन का एक सेट होता है। प्रत्येक संक्रमण एक शर्त से जुड़ा हो सकता है, और प्रत्येक पॉप ऑपरेशन में एक फ़िल्टर होता है जिसे संतुष्ट होना चाहिए। पार्सर सक्रिय उप-नेटवर्क संदर्भों का एक स्टैक बनाए रखता है। जब एक पॉप का प्रयास किया जाता है, तो फ़िल्टर वर्तमान इनपुट और स्टैक शीर्ष की जांच करता है; यदि फ़िल्टर विफल हो जाता है, तो पॉप अवरुद्ध हो जाता है, और पार्सर को वैकल्पिक पथों का पता लगाना चाहिए। यह तंत्र यूनिफिकेशन-आधारित व्याकरणों में फीचर यूनिफिकेशन के उपयोग के समान है और इसे आधुनिक NLP प्रणालियों में उपयोग किए जाने वाले फीचर-आधारित पार्सिंग के अग्रदूत के रूप में देखा जा सकता है।
FPRTN की एक प्रमुख संपत्ति यह है कि वे नियमित व्याकरणों की तुलना में अधिक अभिव्यंजक हैं लेकिन पूर्ण संदर्भ-संवेदनशील व्याकरणों की तुलना में कम अभिव्यंजक हैं। वे क्रॉस-सीरियल निर्भरताओं को संभाल सकते हैं, जो डच और स्विस जर्मन जैसी भाषाओं में आम हैं, लेकिन वे इसे कम्प्यूटेशनल रूप से सुगम तरीके से करते हैं। फ़िल्टरिंग तंत्र को कुशलतापूर्वक लागू किया जा सकता है, और मॉडल को कुछ निर्माणों को बहुपद समय में पार्स करने के लिए दिखाया गया था, जबकि अप्रतिबंधित ATN घातीय हो सकते थे।
तंत्रिका मॉडलों पर प्रभाव
हालांकि FPRTN प्रतीकात्मक परंपरा में विकसित किए गए थे, उन्हें पार्सिंग के बाद के तंत्रिका नेटवर्क मॉडलों के लिए एक प्रेरणा के रूप में उद्धृत किया गया है। 1990 के दशक में, एडिनबर्ग विश्वविद्यालय और अन्य स्थानों के शोधकर्ताओं ने RTN के कनेक्शनिस्ट कार्यान्वयनों की खोज की, जहां संक्रमण निर्णय तंत्रिका नेटवर्क द्वारा किए गए थे। कार्य की यह पंक्ति भाषा प्रसंस्करण के लिए अनुक्रम-से-अनुक्रम मॉडल और आवर्ती नेटवर्क के विकास को प्रभावित करती है। हाल ही में, सीखे गए नियंत्रकों के साथ स्टैक-जैसी संरचनाओं का उपयोग करने का विचार तंत्रिका स्टैक मशीन और विभेदक तंत्रिका कंप्यूटर जैसे मॉडलों में दिखाई दिया है, जो 2010 के दशक में गूगल डीपमाइंड में विकसित किए गए थे।
फ़िल्टर्ड-पॉपिंग तंत्र आधुनिक ट्रांसफॉर्मर में ध्यान और गेटिंग तंत्र से अवधारणात्मक रूप से संबंधित है। उदाहरण के लिए, ट्रांसफॉर्मर में मल्टी-हेड अटेंशन को फ़िल्टरिंग के एक नरम संस्करण के रूप में देखा जा सकता है, जहां सीखी गई प्रासंगिकता के आधार पर जानकारी चुनिंदा रूप से प्रसारित की जाती है। FPRTN में स्पष्ट स्टैक ट्रांसफॉर्मर में स्थितीय एन्कोडिंग और परत-वार प्रसंस्करण के अनुरूप है, हालांकि बाद वाले स्पष्ट रूप से वाक्यात्मक संरचना के लिए डिज़ाइन नहीं किए गए हैं। शोधकर्ताओं ने नोट किया है कि FPRTN तंत्रिका पार्सर के प्रेरक पूर्वाग्रहों को समझने के लिए एक स्पष्ट औपचारिक ढांचा प्रदान करते हैं।
अनुप्रयोग और विरासत
FPRTN मुख्य रूप से अंग्रेजी और अन्य भाषाओं के लिए प्रयोगात्मक पार्सर में उपयोग किए गए थे। उन्हें अल्वे प्राकृतिक भाषा टूलकिट में शामिल किया गया था, जो 1980 के दशक के अंत में यूके विश्वविद्यालयों में वितरित किया गया था। यह प्रारूप SRI इंटरनेशनल में कोर लैंग्वेज इंजन (CLE) के विकास में भी उपयोग किया गया था, जो 1990 के दशक में एक प्रमुख परियोजना थी। CLE ने यूनिफिकेशन व्याकरण और RTN-जैसी नियंत्रण संरचनाओं का एक संयोजन उपयोग किया, और इसका डिज़ाइन बाद के वाणिज्यिक प्रणालियों जैसे प्रारंभिक आवाज सहायकों के भाषा समझ घटकों को प्रभावित करता था।
2000 के दशक में, प्रतीकात्मक पार्सिंग में रुचि सांख्यिकीय और तंत्रिका दृष्टिकोणों के पक्ष में घट गई, लेकिन FPRTN अवधारणा व्याकरण प्रारूपों के अध्ययन और हाइब्रिड प्रणालियों के डिजाइन में प्रासंगिक बनी हुई है। फ़िल्टर्ड पॉपिंग का विचार अन्य डोमेनों में लागू किया गया है, जैसे प्रोग्राम विश्लेषण और अर्थ पार्सिंग, जहां संदर्भ-संवेदनशील बाधाओं की आवश्यकता होती है। 2020 के दशक तक, यह प्रारूप कभी-कभी बड़े भाषा मॉडल और उनकी वाक्यात्मक संरचना को पकड़ने की क्षमता पर शोध में उद्धृत किया जाता है, कुछ अध्ययन ट्रांसफॉर्मर के व्यवहार की तुलना RTN-आधारित पार्सर से करते हैं।
यह भी देखें
- रिकर्सिव ट्रांज़िशन नेटवर्क
- augmented-transition-network
- प्राकृतिक भाषा प्रसंस्करण
- वाक्यात्मक पार्सिंग
- unification-grammar
- तंत्रिका नेटवर्क
- ट्रांसफॉर्मर
- अनुक्रम-से-अनुक्रम
- गूगल डीपमाइंड