गहन भाषाई प्रसंस्करण प्राकृतिक भाषा प्रसंस्करण (NLP) में एक ढांचा है जो सैद्धांतिक और वर्णनात्मक भाषाविज्ञान पर आधारित है। यह मुख्य रूप से औपचारिक वाक्य-विन्यास और अर्थ सिद्धांतों, जैसे कि संयोजक श्रेणी व्याकरण (CCG), हेड-ड्रिवेन फ्रेज़ स्ट्रक्चर ग्रामर (HPSG), लेक्सिकल फंक्शनल ग्रामर (LFG), ट्री-एडजॉइनिंग ग्रामर (TAG), और प्राग स्कूल के माध्यम से भाषा का मॉडल बनाता है। उथले तरीकों के विपरीत, गहन भाषाई प्रसंस्करण अभिव्यंजक संरचनात्मक प्रतिनिधित्व उत्पन्न करता है जो सीधे दूरस्थ निर्भरताओं और अंतर्निहित विधेय-तर्क संरचनाओं को पकड़ता है, जिसका उद्देश्य भाषा का ज्ञान-समृद्ध विश्लेषण करना है।
यह ज्ञान-गहन दृष्टिकोण ऐतिहासिक रूप से काफी कम्प्यूटेशनल शक्ति की मांग करता था, और कभी-कभी इसे अव्यावहारिक माना जाता था। हालाँकि, 2000 के दशक की शुरुआत तक, शोध ने गहन प्रसंस्करण की दक्षता में काफी सुधार किया था, और आधुनिक युग में, गहन भाषाई प्रसंस्करण का उपयोग करने वाले अनुप्रयोगों के लिए दक्षता अब कोई बड़ी बाधा नहीं है।
उथले भाषाई प्रसंस्करण से तुलना
परंपरागत रूप से, गहन भाषाई प्रसंस्करण पार्सिंग और जनरेशन दोनों के लिए कम्प्यूटेशनल व्याकरण विकास से संबंधित था। ये व्याकरण मैन्युअल रूप से विकसित, बनाए रखे जाते थे, और चलाने में कम्प्यूटेशनल रूप से महंगे थे। हाल के वर्षों में, मशीन लर्निंग दृष्टिकोण, जिन्हें उथले भाषाई प्रसंस्करण के रूप में भी जाना जाता है, ने NLP को मौलिक रूप से बदल दिया है। मजबूत, व्यापक-कवरेज मशीन लर्निंग उपकरणों का तेजी से निर्माण काफी कम मैन्युअल श्रम की आवश्यकता होती है, इसलिए गहन तरीकों पर कम ध्यान दिया गया है।
हालाँकि, कुछ कम्प्यूटेशनल भाषाविदों का तर्क है कि कंप्यूटर के लिए प्राकृतिक भाषा को समझने या अनुमान लगाने के लिए, विस्तृत वाक्य-विन्यास और अर्थ प्रतिनिधित्व आवश्यक है। उथले सिस्टम में मानव-जैसी समझ की कमी हो सकती है। पहले, वाक्य पर विचार करें: "Things would be different if Microsoft were located in Georgia." एक उथला सूचना निष्कर्षण सिस्टम गलती से अनुमान लगा सकता है कि Microsoft का मुख्यालय जॉर्जिया में है, जबकि मनुष्य प्रति-तथ्यात्मक से समझते हैं कि Microsoft वहाँ कभी स्थित नहीं था। दूसरे, विचार करें: "The National Institute for Psychology in Israel was established in May 1971 as the Israel Center for Psychobiology by Prof. Joel." एक उथला सिस्टम गलती से अनुमान लगा सकता है कि इज़राइल 1971 में स्थापित किया गया था, जबकि मनुष्य जानते हैं कि यह संस्थान को संदर्भित करता है। ऐसे उदाहरण दिखाते हैं कि उथला प्रसंस्करण ग्रंथों और एनोटेटेड संसाधनों के सांख्यिकीय हेरफेर के माध्यम से ज्ञान-हीन विश्लेषण प्रदान करता है, जबकि गहन प्रसंस्करण मैन्युअल रूप से विकसित व्याकरण के माध्यम से ज्ञान-समृद्ध विश्लेषण प्रदान करता है।
उप-समुदाय और औपचारिकताएँ
गहन कम्प्यूटेशनल भाषाविद् अपनाए गए व्याकरणिक औपचारिकता के आधार पर उप-समुदायों में विभाजित हैं। एक प्रमुख सहयोग DELPH-IN पहल है, जो HPSG के साथ काम करती है; HPSG सम्मेलन इसका केंद्रीय मंच है। ParGram और ParSem सहयोग LFG-आधारित व्याकरण और अर्थ विकास पर केंद्रित हैं, जिसमें LFG सम्मेलन एक केंद्रीय घटना है। XTAG शोध समूह TAG के साथ काम करता है, और TAG+ सम्मेलन इसका केंद्रीय समागम है। ये समूह संपूर्ण नहीं हैं, क्योंकि अन्य औपचारिकताएँ और समुदाय भी गहन भाषाई प्रसंस्करण में योगदान करते हैं।
आधुनिक विकास और एकीकरण
जबकि गहन भाषाई प्रसंस्करण की जड़ें मैन्युअल व्याकरण लेखन में हैं, यह तेजी से Machine learning और Deep learning तकनीकों के साथ एकीकृत हुआ है। कुछ शोध गहन वाक्य-विन्यास और अर्थ प्रतिनिधित्व को Neural network मॉडल के साथ जोड़ते हैं ताकि पार्सिंग सटीकता और मजबूती में सुधार हो सके। हालाँकि, अधिकांश मुख्यधारा NLP अब Transformer (architecture) वास्तुकला पर निर्मित Large language model पर निर्भर करता है, जो गहन व्याकरण-आधारित दृष्टिकोणों के विपरीत है। इसके बावजूद, गहन भाषाई प्रसंस्करण उन कार्यों के लिए मूल्यवान बना हुआ है जिनमें सटीक अर्थ व्याख्या की आवश्यकता होती है, जैसे कि विशेष डोमेन में Machine learning या प्राकृतिक भाषा अनुमान।
समकालीन AI से संबंध
व्यापक Artificial intelligence शोध के संदर्भ में, गहन भाषाई प्रसंस्करण उभरते सांख्यिकीय तरीकों के लिए एक प्रतीकात्मक, नियम-आधारित विकल्प प्रदान करता है। Nokia Bell Labs और Xerox PARC जैसे संगठनों ने ऐतिहासिक रूप से कम्प्यूटेशनल भाषाविज्ञान में योगदान दिया। MIT CSAIL, Stanford AI Lab, और University of Toronto में आधुनिक प्रयास अक्सर हाइब्रिड की खोज करते हैं। गहन प्रसंस्करण में उपयोग किए जाने वाले औपचारिक व्याकरण व्याख्या योग्य संरचनाएँ प्रदान करते हैं, Neural network मॉडल के अपारदर्शी प्रतिनिधित्व के विपरीत। यह व्याख्या योग्यता उन कार्यों के लिए महत्वपूर्ण मानी जाती है जिनमें जवाबदेही या तार्किक तर्क की आवश्यकता होती है।
प्रतिस्पर्धा के बावजूद, गहन भाषाई प्रसंस्करण एक शोध प्रतिमान के रूप में बना हुआ है। इसने ट्रीबैंक और व्याकरण इंजीनियरिंग उपकरणों सहित संसाधनों के विकास को प्रभावित किया है, और सैद्धांतिक भाषाविज्ञान को सूचित करना जारी रखता है। 2020 के दशक तक, किसी एक दृष्टिकोण ने उन्नत NLP अनुप्रयोगों में गहन, संरचित भाषा समझ की आवश्यकता को पूरी तरह से प्रतिस्थापित नहीं किया है।