सूचना निष्कर्षण (IE) प्राकृतिक भाषा प्रसंस्करण का एक क्षेत्र है जो असंरचित या अर्ध-संरचित पाठ से स्वचालित रूप से संरचित जानकारी प्राप्त करता है। इसमें नामित इकाई पहचान, संबंध निष्कर्षण और घटना निष्कर्षण जैसे कार्य शामिल हैं, और यह ज्ञान आधार, प्रश्न उत्तर प्रणाली और पाठ खनन अनुप्रयोगों के निर्माण के लिए मौलिक है। IE प्रणालियाँ कच्चे पाठ को मशीन-पठनीय डेटा में बदलती हैं, जिससे खोज, तर्क और विश्लेषण जैसे डाउनस्ट्रीम कार्य सक्षम होते हैं।
सूचना निष्कर्षण की उत्पत्ति 1960 और 1970 के दशक में देखी जा सकती है, जिसमें न्यूयॉर्क विश्वविद्यालय में लिंग्विस्टिक स्ट्रिंग प्रोजेक्ट और 1970 के दशक के अंत में येल विश्वविद्यालय में विकसित FRUMP प्रणाली जैसी प्रारंभिक प्रणालियाँ शामिल थीं। यह क्षेत्र 1980 के दशक में मैसेज अंडरस्टैंडिंग कॉन्फ्रेंस (MUC) के साथ प्रमुखता में आया, जो अमेरिकी रक्षा उन्नत अनुसंधान परियोजना एजेंसी (DARPA) द्वारा वित्त पोषित प्रतियोगिताओं की एक श्रृंखला थी, जिसने नामित इकाई पहचान और टेम्पलेट भरने जैसे मानक IE कार्यों को परिभाषित किया। बाद में, अमेरिकी राष्ट्रीय मानक और प्रौद्योगिकी संस्थान (NIST) द्वारा 1999 से 2008 तक चलाए गए स्वचालित सामग्री निष्कर्षण (ACE) कार्यक्रम ने अधिक जटिल एनोटेशन दिशानिर्देशों के साथ इकाई, संबंध और घटना निष्कर्षण को शामिल करने के लिए दायरे का विस्तार किया।
मुख्य कार्य
सूचना निष्कर्षण में आमतौर पर कई उप-कार्य शामिल होते हैं। नामित इकाई पहचान (NER) व्यक्तियों, संगठनों, स्थानों, तिथियों और संख्यात्मक अभिव्यक्तियों जैसी इकाइयों के संदर्भों की पहचान करती है। संबंध निष्कर्षण इकाइयों के बीच शब्दार्थ संबंधों को निर्धारित करता है, जैसे "के लिए काम करता है" या "में स्थित है"। घटना निष्कर्षण पाठ में वर्णित घटनाओं की पहचान करता है, जिसमें घटना ट्रिगर, प्रतिभागी और लौकिक विशेषताएँ शामिल हैं। कोरफेरेंस समाधान एक दस्तावेज़ में एक ही इकाई के विभिन्न संदर्भों को जोड़ता है, जो जानकारी एकत्र करने के लिए आवश्यक है। ये कार्य अक्सर एक पाइपलाइन में किए जाते हैं, हालाँकि आधुनिक प्रणालियाँ उन्हें संयुक्त रूप से मॉडल कर सकती हैं।
विधियाँ और दृष्टिकोण
प्रारंभिक IE प्रणालियाँ हस्त-निर्मित नियमों और शब्दकोशों पर निर्भर थीं। उदाहरण के लिए, 1990 के दशक में SRI इंटरनेशनल में विकसित FASTUS प्रणाली ने पैटर्न की पहचान करने के लिए परिमित-अवस्था ट्रांसड्यूसर का उपयोग किया। सांख्यिकीय विधियाँ, जैसे छिपे हुए मार्कोव मॉडल और सशर्त यादृच्छिक क्षेत्र (CRF), 2000 के दशक में लोकप्रिय हुईं, जैसा कि स्टैनफोर्ड NER प्रणाली द्वारा उदाहरण दिया गया है। गहन शिक्षण के आगमन के साथ, तंत्रिका नेटवर्क वास्तुकलाएँ, विशेष रूप से आवर्ती तंत्रिका नेटवर्क और बाद में ट्रांसफॉर्मर, ने अत्याधुनिक परिणाम प्राप्त किए। 2018 में Google द्वारा पेश किए गए BERT जैसे मॉडल, प्रासंगिक शब्द प्रतिनिधित्व का उपयोग करते हैं जो इकाई और संबंध निष्कर्षण सटीकता में काफी सुधार करते हैं। हाल ही में, बड़े भाषा मॉडल (LLM) को प्रॉम्प्टिंग और फाइन-ट्यूनिंग के माध्यम से IE पर लागू किया गया है, जिससे न्यूनतम कार्य-विशिष्ट प्रशिक्षण डेटा के साथ शून्य-शॉट और कुछ-शॉट निष्कर्षण सक्षम होता है।
अनुप्रयोग
सूचना निष्कर्षण उद्योग और अनुसंधान में व्यापक रूप से उपयोग किया जाता है। जैव चिकित्सा क्षेत्र में, प्रणालियाँ वैज्ञानिक साहित्य से जीन-रोग संबंध और दवा अंतःक्रियाएँ निकालती हैं, जिससे दवा खोज में सहायता मिलती है। वित्त में, IE कंपनी की कमाई, विलय और जोखिम संकेतक निकालने के लिए समाचार और रिपोर्टों की निगरानी करता है। कानूनी प्रौद्योगिकी अनुबंधों में खंडों और पक्षों की पहचान करने के लिए IE का उपयोग करती है। खोज इंजन ज्ञान पैनल और संरचित स्निपेट उत्पन्न करने के लिए IE का लाभ उठाते हैं। सोशल मीडिया विश्लेषण उत्पाद संदर्भों और सार्वजनिक भावना को ट्रैक करने के लिए IE का उपयोग करता है। निकाला गया डेटा अक्सर ज्ञान ग्राफ़ को आबाद करता है, जैसे Google का नॉलेज ग्राफ़, जो इकाई-आधारित खोज सुविधाओं को शक्ति प्रदान करता है।
चुनौतियाँ और सीमाएँ
प्रगति के बावजूद, IE को कई चुनौतियों का सामना करना पड़ता है। भाषा में अस्पष्टता, जैसे बहुअर्थीता और कोरफेरेंस, त्रुटियों का कारण बन सकती है। डोमेन अनुकूलन कठिन बना हुआ है: एक डोमेन (जैसे समाचार) पर प्रशिक्षित मॉडल अक्सर दूसरे डोमेन (जैसे चिकित्सा पाठ) पर लागू होने पर खराब प्रदर्शन करते हैं। कम-संसाधन भाषाओं और विशेष शब्दावली में पर्याप्त प्रशिक्षण डेटा की कमी होती है। इसके अतिरिक्त, जटिल लौकिक और कारण संबंधों वाली घटनाओं का निष्कर्षण अभी भी एक खुली समस्या है। मूल्यांकन भी मुश्किल है क्योंकि एनोटेशन डेटासेट और कार्यों में भिन्न होते हैं। 2020 के दशक की शुरुआत तक, LLM ने कुछ मुद्दों को कम किया है लेकिन नए मुद्दे पेश किए हैं, जैसे मतिभ्रम और निकाले गए तथ्यों में असंगति।
भविष्य की दिशाएँ
वर्तमान शोध इकाइयों और संबंधों के संयुक्त निष्कर्षण पर केंद्रित है, जिसमें अंतःक्रियाओं को पकड़ने के लिए ग्राफ तंत्रिका नेटवर्क का उपयोग और सटीकता में सुधार के लिए बाहरी ज्ञान आधारों को शामिल करना शामिल है। वृद्धिशील और आजीवन शिक्षण में भी रुचि है, जहाँ IE प्रणालियाँ पिछले ज्ञान को भूलने के बिना नए डोमेन के अनुकूल होती हैं। जनरेटिव AI के उदय के साथ, संवादात्मक या निर्देश-पालन तरीके से IE के लिए LLM का उपयोग करने और निकाली गई जानकारी को व्याख्यात्मक और विश्वसनीय बनाने पर बढ़ता काम हो रहा है। IE का ज्ञान ग्राफ़ निर्माण और तर्क के साथ एकीकरण एक जीवंत क्षेत्र बना हुआ है, जिसमें स्वचालित वैज्ञानिक खोज और उद्यम डेटा प्रबंधन में संभावित अनुप्रयोग हैं।