प्राकृतिक भाषा प्रसंस्करण, या एनएलपी, कृत्रिम बुद्धिमत्ता की वह उपशाखा है जो कंप्यूटरों को मानव भाषा, बोली जाने वाली या लिखित, को संसाधित करने, व्याख्या करने और उत्पन्न करने में सक्षम बनाने पर केंद्रित है। यह वर्तनी-जाँच और शब्द-भेद टैगिंग जैसे संकीर्ण कार्यों से लेकर अनुवाद, सारांशीकरण और संवाद जैसे खुले-अंत वाले कार्यों तक के कार्यों को शामिल करता है, और यह बड़े भाषा मॉडल प्रौद्योगिकी का मूल क्षेत्र है जो 2020 के दशक के मध्य में एआई प्रवचन पर हावी है।
प्रारंभिक युग: नियम और प्रतीक
1950 के दशक से 1980 के दशक तक की सबसे प्रारंभिक एनएलपी प्रणालियाँ, हस्त-निर्मित भाषाई नियमों और प्रतीकात्मक तर्क पर आधारित थीं, जो प्रतीकात्मक एआई के साथ संरेखित दृष्टिकोण था। एलिज़ा, जोसेफ वेइज़ेनबाम द्वारा बनाया गया 1966 का एक चैटबॉट, एक रोजेरियन मनोचिकित्सक का अनुकरण करने के लिए सरल पैटर्न मिलान का उपयोग करता था और क्षेत्र की महत्वाकांक्षाओं का एक प्रारंभिक, यद्यपि सीमित, प्रदर्शन बन गया। नियम-आधारित मशीन अनुवाद प्रणालियाँ भी इसी अवधि के दौरान विकसित की गईं, जिन्हें मिश्रित सफलता मिली।
सांख्यिकीय युग
1980 के दशक के अंत से 2000 के दशक तक, एनएलपी सांख्यिकीय विधियों की ओर स्थानांतरित हो गया, जिसमें अनुवाद, टैगिंग और पार्सिंग जैसे कार्यों को संभालने के लिए हस्त-लिखित नियमों के बजाय पाठ कोष से सीखी गई संभावनाओं का उपयोग किया गया। इस अवधि ने एन-ग्राम भाषा मॉडल और सांख्यिकीय मशीन अनुवाद जैसी तकनीकें उत्पन्न कीं, और बड़े एनोटेटेड कोष को केंद्रीय शोध अवसंरचना के रूप में स्थापित किया, जो प्रशिक्षण डेटा पैमाने पर आधुनिक जोर का अग्रदूत था।
तंत्रिका और ट्रांसफॉर्मर युग
2010 के दशक की शुरुआत में तंत्रिका दृष्टिकोणों ने सांख्यिकीय पाइपलाइनों को बदलना शुरू कर दिया, जिसमें वर्ड2वेक (2013) जैसे शब्द-स्तरीय एम्बेडिंग ने शब्दों को सिमेंटिक संबंधों को पकड़ने वाले सघन वैक्टर के रूप में प्रस्तुत किया, और आवर्ती तंत्रिका नेटवर्क तथा अनुवाद जैसे अनुक्रम-से-अनुक्रम कार्यों के लिए एलएसटीएम आर्किटेक्चर ने सहायता की। 2017 में ट्रांसफॉर्मर आर्किटेक्चर की शुरुआत क्षेत्र के लिए परिवर्तनकारी साबित हुई, जिससे बड़े पाठ कोष पर कहीं अधिक कुशल प्रशिक्षण संभव हुआ। बर्ट (2018) ने भाषा समझ के लिए बड़े पैमाने पर पूर्व-प्रशिक्षण की शक्ति दिखाई, जबकि जीपीटी श्रृंखला ने प्रदर्शित किया कि पर्याप्त पैमाने पर अगले-टोकन भविष्यवाणी पर प्रशिक्षित एक एकल स्वप्रतिगामी मॉडल कार्य-विशिष्ट आर्किटेक्चर के बिना एनएलपी कार्यों की एक विशाल श्रृंखला कर सकता है, जिसकी परिणति सामान्य-उद्देश्य वाले बड़े भाषा मॉडल में हुई।
आधुनिक दायरा
समकालीन एनएलपी अनुसंधान और अनुप्रयोग मशीन अनुवाद, वाक् पहचान, सिमेंटिक खोज, भावना विश्लेषण, सारांशीकरण, प्रश्नोत्तर, और चैटबॉट तथा आवाज सहायकों के अंतर्निहित संवाद प्रणालियों तक फैले हुए हैं। बड़े भाषा मॉडलों के उदय के बाद से, कई पहले से अलग एनएलपी उप-कार्यों को अब आमतौर पर विशेष आर्किटेक्चर को प्रशिक्षित करने के बजाय एक एकल सामान्य-उद्देश्य मॉडल को प्रॉम्प्ट करके संबोधित किया जाता है, यह बदलाव जिसने संकीर्ण पर्यवेक्षित प्रणालियों की आवश्यकता को कम कर दिया, लेकिन नए मूल्यांकन और विश्वसनीयता प्रश्न उठाए, जिनमें मतिभ्रम शामिल है।
चुनौतियाँ
एनएलपी प्रणालियाँ अब भी उन कम-संसाधन भाषाओं से जूझ रही हैं जिनमें बड़े प्रशिक्षण कोष, सांस्कृतिक रूप से विशिष्ट मुहावरे और संदर्भ, और सुसंगत तथ्यात्मक विश्वसनीयता का अभाव है। प्रशिक्षण पाठ में मौजूद पूर्वाग्रह को मॉडल आउटपुट में पुनरुत्पादित या प्रवर्धित किया जा सकता है, यह चिंता स्टोकेस्टिक तोता आलोचना में प्रमुखता से उठाई गई है, और यह एल्गोरिदमिक पूर्वाग्रह शमन में व्यापक प्रयासों के साथ अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है।