दस्तावेज़-अवधि मैट्रिक्स (डीटीएम) एक विरल मैट्रिक्स है जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण और सूचना पुनर्प्राप्ति में दस्तावेजों के संग्रह में अवधियों (शब्दों या एन-ग्राम) की आवृत्ति को दर्शाने के लिए किया जाता है। इसके मानक रूप में, प्रत्येक पंक्ति एक एकल दस्तावेज़ से मेल खाती है, प्रत्येक स्तंभ कोष्ठ शब्दावली से एक अद्वितीय अवधि से मेल खाता है, और प्रत्येक कोशिका में एक संख्यात्मक मान होता है, आमतौर पर अवधि आवृत्ति (उस दस्तावेज़ में उस अवधि के प्रकट होने की संख्या)। डीटीएम कई पाठ विश्लेषण एल्गोरिदम के लिए प्राथमिक इनपुट के रूप में कार्य करता है, जिसमें मशीन-लर्निंग में विषय मॉडलिंग, दस्तावेज़ क्लस्टरिंग और वर्गीकरण मॉडल शामिल हैं।
मैट्रिक्स को अक्सर दस्तावेज़ की लंबाई और अवधि के महत्व को ध्यान में रखने के लिए सामान्यीकृत या भारित किया जाता है। एक सामान्य भार योजना अवधि आवृत्ति-व्युत्क्रम दस्तावेज़ आवृत्ति (टीएफ-आईडीएफ) है, जो कई दस्तावेजों में दिखाई देने वाली अवधियों को कम भार देती है और दुर्लभ अवधियों को अधिक भार देती है। अन्य परिवर्तनों में बाइनरी एन्कोडिंग (उपस्थिति या अनुपस्थिति) और सबलाइनियर स्केलिंग (जैसे, लॉग(1 + आवृत्ति)) शामिल हैं। डीटीएम एक अवधि-दस्तावेज़ मैट्रिक्स से अलग है, जो इसका स्थानांतरण है, हालांकि दोनों अक्सर व्यवहार में एक दूसरे के स्थान पर उपयोग किए जाते हैं।
निर्माण और पूर्वप्रसंस्करण
डीटीएम बनाने के लिए कई पूर्वप्रसंस्करण चरणों की आवश्यकता होती है। सबसे पहले, कच्चे पाठ को व्यक्तिगत अवधियों में टोकनाइज़ किया जाता है, आमतौर पर रिक्त स्थान और विराम चिह्नों पर विभाजित करके। स्टॉप शब्द (सामान्य शब्द जैसे 'और' और 'है') अक्सर हटा दिए जाते हैं, और स्टेमिंग या लेम्मेटाइज़ेशन शब्दों को उनके मूल रूपों में कम कर देता है (जैसे, 'दौड़ना' से 'दौड़')। फिर शब्दावली को सभी दस्तावेजों में अद्वितीय अवधियों के सेट के रूप में परिभाषित किया जाता है, जिसे अक्सर बहुत दुर्लभ या सर्वव्यापी अवधियों को हटाने के लिए न्यूनतम और अधिकतम दस्तावेज़ आवृत्ति द्वारा फ़िल्टर किया जाता है। परिणामी मैट्रिक्स आमतौर पर एक विरल प्रारूप में संग्रहीत किया जाता है, क्योंकि अधिकांश कोशिकाएं शून्य होती हैं, विशेष रूप से बड़े कोष्ठों के लिए।
बड़े पैमाने के अनुप्रयोगों के लिए, पायथन में scikit-learn जैसी लाइब्रेरी कुशल कार्यान्वयन प्रदान करती हैं (जैसे, CountVectorizer और TfidfVectorizer)। ये उपकरण टोकनाइज़ेशन, शब्दावली निर्माण और विरल सरणी भंडारण को संभालते हैं। मैट्रिक्स को स्ट्रीमिंग डेटा के लिए वृद्धिशील रूप से भी बनाया जा सकता है, हालांकि यह कम आम है।
मशीन लर्निंग में अनुप्रयोग
मशीन-लर्निंग में, डीटीएम पाठ के लिए एक मानक फीचर प्रतिनिधित्व है। लॉजिस्टिक रिग्रेशन, सपोर्ट वेक्टर मशीन और नाइव बेज़ क्लासिफायर जैसे शास्त्रीय एल्गोरिदम सीधे मैट्रिक्स पर काम करते हैं। उदाहरण के लिए, स्पैम का पता लगाना एक डीटीएम का उपयोग करता है जहां प्रत्येक दस्तावेज़ एक ईमेल होता है, और मॉडल प्रत्येक अवधि के लिए भार सीखता है। के-मीन्स या पदानुक्रमित क्लस्टरिंग जैसे क्लस्टरिंग एल्गोरिदम उनके अवधि वैक्टर के आधार पर दस्तावेजों को समूहित करते हैं, जिससे समाचार लेख वर्गीकरण जैसे कार्य सक्षम होते हैं।
विषय मॉडल, जैसे कि अव्यक्त डिरिचलेट आवंटन (एलडीए), इनपुट के रूप में एक डीटीएम लेते हैं और अवधियों पर वितरण के रूप में अव्यक्त विषयों का अनुमान लगाते हैं। मैट्रिक्स सूचना-पुनर्प्राप्ति प्रणालियों को भी रेखांकित करता है, जहां दस्तावेज़ वैक्टर के बीच कोसाइन समानता खोज परिणामों को रैंक करती है। डीप-लर्निंग में, डीटीएम सीधे इनपुट के रूप में कम आम है, क्योंकि तंत्रिका नेटवर्क आमतौर पर घने एम्बेडिंग का उपयोग करते हैं, लेकिन यह बेसलाइन मॉडल और व्याख्या योग्य सुविधाओं के लिए उपयोगी बना हुआ है।
आधुनिक भाषा मॉडल से संबंध
बड़े-भाषा-मॉडल और ट्रांसफार्मर आर्किटेक्चर के उदय के साथ, डीटीएम को बड़े पैमाने पर शब्द एम्बेडिंग और प्रासंगिक एम्बेडिंग जैसे घने वेक्टर प्रतिनिधित्व द्वारा प्रतिस्थापित किया गया है। हालांकि, डीटीएम अभी भी कुछ पाइपलाइनों में भूमिका निभाता है। उदाहरण के लिए, इसका उपयोग हाइब्रिड मॉडल में फीचर इंजीनियरिंग के लिए, शब्दावली कवरेज का मूल्यांकन करने के लिए, और सटीक अवधि मिलान की आवश्यकता वाले कार्यों के लिए किया जाता है, जैसे कानूनी दस्तावेज़ विश्लेषण या बायोमेडिकल पाठ खनन। मैट्रिक्स शास्त्रीय और तंत्रिका दृष्टिकोणों की तुलना करने के लिए एक बेंचमार्क के रूप में भी कार्य करता है।
जनरेटिव-एआई प्रणालियों में, डीटीएम शायद ही कभी सीधे उपयोग किया जाता है, लेकिन इसकी अवधि आवृत्ति और दस्तावेज़ भार की अवधारणाएं पुनर्प्राप्ति-संवर्धित पीढ़ी (आरएजी) प्रणालियों में टीएफ-आईडीएफ-आधारित पुनर्प्राप्ति जैसी तकनीकों को सूचित करती हैं। ये सिस्टम उत्तर गुणवत्ता में सुधार के लिए एक विरल पुनर्प्राप्ति चरण (अक्सर डीटीएम-जैसे सूचकांक का उपयोग करके) को एक घने तंत्रिका पुनर्प्राप्तिकर्ता के साथ जोड़ते हैं।
सीमाएं और विकल्प
डीटीएम में उल्लेखनीय सीमाएं हैं। यह शब्द क्रम को अनदेखा करता है, प्रत्येक अवधि को स्वतंत्र मानता है (बैग-ऑफ-वर्ड्स धारणा), और उच्च आयामीता और विरलता से ग्रस्त है। यह विभिन्न शब्दों (जैसे, 'कार' और 'ऑटोमोबाइल') के बीच अर्थ संबंधी समानता को भी पकड़ने में विफल रहता है। विकल्पों में एन-ग्राम प्रतिनिधित्व (जो छोटे अनुक्रमों को पकड़ते हैं), हैशिंग वेक्टराइज़र (जो मेमोरी को कम करते हैं), और वर्ड2वेक या बीईआरटी जैसे मॉडल से घने एम्बेडिंग शामिल हैं। इन कमियों के बावजूद, डीटीएम कई पाठ कार्यों के लिए एक सरल, व्याख्या योग्य और कम्प्यूटेशनल रूप से कुशल आधार रेखा बना हुआ है।
ऐतिहासिक संदर्भ
डीटीएम का उपयोग 1960 के दशक में सूचना पुनर्प्राप्ति के शुरुआती दिनों से किया जा रहा है, विशेष रूप से कॉर्नेल विश्वविद्यालय में जेरार्ड साल्टन द्वारा विकसित स्मार्ट प्रणाली में। यह 1990 और 2000 के दशक में वेब और डिजिटल पुस्तकालयों के विकास के साथ पाठ खनन की आधारशिला बन गया। इसके गणितीय गुणों का सूचना-पुनर्प्राप्ति के क्षेत्र में व्यापक रूप से अध्ययन किया गया था, और यह पाठ एनालिटिक्स और प्राकृतिक-भाषा-प्रसंस्करण पर पाठ्यक्रमों में एक मानक शिक्षण उपकरण बना हुआ है।
यह भी देखें
- बैग-ऑफ-वर्ड्स
- टीएफ-आईडीएफ
- विषय-मॉडलिंग
- पाठ-खनन
संदर्भ
- मैनिंग, सी. डी., राघवन, पी., और शुट्ज़, एच. (2008)। सूचना पुनर्प्राप्ति का परिचय। कैम्ब्रिज यूनिवर्सिटी प्रेस।
- साल्टन, जी., और मैकगिल, एम. जे. (1983)। आधुनिक सूचना पुनर्प्राप्ति का परिचय। मैकग्रा-हिल।