पाठ वर्गीकरण, जिसे पाठ श्रेणीकरण या दस्तावेज़ वर्गीकरण के रूप में भी जाना जाता है, किसी पाठ दस्तावेज़ को स्वचालित रूप से एक या अधिक पूर्वनिर्धारित श्रेणियों या वर्गों में निर्दिष्ट करने का कार्य है। यह प्राकृतिक भाषा प्रसंस्करण (NLP) और मशीन लर्निंग में एक मौलिक समस्या है, जिसके अनुप्रयोग स्पैम फ़िल्टरिंग और ईमेल रूटिंग से लेकर भावना विश्लेषण और लेख छँटाई तक हैं। यह क्षेत्र सूचना पुनर्प्राप्ति, पुस्तकालय विज्ञान और कंप्यूटर विज्ञान की तकनीकों पर आधारित है, जो मैनुअल अनुक्रमण से परिष्कृत एल्गोरिथम दृष्टिकोणों तक विकसित हुआ है।
इस समस्या को अक्सर एक पर्यवेक्षित शिक्षण कार्य के रूप में तैयार किया जाता है, जहाँ एक मॉडल को दस्तावेज़ों और उनकी संबंधित श्रेणियों के लेबल वाले डेटासेट पर प्रशिक्षित किया जाता है। हालाँकि, अनपर्यवेक्षित और अर्ध-पर्यवेक्षित प्रकार भी मौजूद हैं। लक्ष्य एक क्लासिफायर बनाना है जो उनकी सामग्री के आधार पर नए, अनदेखे दस्तावेज़ों को सटीक रूप से वर्गीकृत कर सके। कार्य की जटिलता श्रेणियों की संख्या, भाषा की अस्पष्टता और पाठ के डोमेन के साथ भिन्न होती है।
सामग्री-आधारित बनाम अनुरोध-आधारित वर्गीकरण
ऐतिहासिक रूप से, दस्तावेज़ वर्गीकरण को दो दार्शनिक दृष्टिकोणों से देखा गया है: सामग्री-आधारित और अनुरोध-आधारित। सामग्री-आधारित वर्गीकरण किसी दस्तावेज़ को उन विषयों के आधार पर एक वर्ग में निर्दिष्ट करता है जो उसकी सामग्री पर हावी होते हैं। उदाहरण के लिए, एक पुस्तकालय नियम के लिए आवश्यक हो सकता है कि किसी पुस्तक की कम से कम 20% सामग्री उस वर्ग के बारे में हो जिसमें उसे निर्दिष्ट किया गया है। स्वचालित प्रणालियों में, यह अक्सर शब्दों की आवृत्ति या प्रमुख अवधारणाओं की उपस्थिति को मापने में अनुवादित होता है।
अनुरोध-आधारित वर्गीकरण, जिसे अनुरोध-उन्मुख अनुक्रमण के रूप में भी जाना जाता है, उपयोगकर्ताओं की अपेक्षित सूचना आवश्यकताओं पर विचार करता है। क्लासिफायर पूछता है: "इस इकाई को किन विवरणकों के अंतर्गत पाया जाना चाहिए?" और "किस संभावित क्वेरी के लिए यह दस्तावेज़ प्रासंगिक है?" यह दृष्टिकोण अक्सर नीति-संचालित होता है, जो किसी विशेष पुस्तकालय या डेटाबेस के उद्देश्य को दर्शाता है। उदाहरण के लिए, एक नारीवादी अध्ययन पुस्तकालय एक सामान्य इतिहास पुस्तकालय की तुलना में दस्तावेज़ों को अलग तरह से अनुक्रमित कर सकता है, जो अपने विशिष्ट दर्शकों की सेवा के लिए सामग्री के विभिन्न पहलुओं पर जोर देता है।
मैनुअल अनुक्रमण से स्वचालित वर्गीकरण तक
वर्गीकरण (दस्तावेज़ों को वर्गों में निर्दिष्ट करना) और विषय अनुक्रमण (दस्तावेज़ों को विषय निर्दिष्ट करना) के बीच का अंतर बहस का विषय रहा है, लेकिन जैसा कि सूचना वैज्ञानिक एफ. डब्ल्यू. लैंकेस्टर ने तर्क दिया, यह अंतर फलदायी नहीं है। एक वर्गीकरण प्रणाली को एक थिसॉरस में बदला जा सकता है और इसके विपरीत, जिसका अर्थ है कि किसी दस्तावेज़ को एक विषय शब्द निर्दिष्ट करना उसे उस शब्द द्वारा अनुक्रमित दस्तावेज़ों के वर्ग में निर्दिष्ट करने के बराबर है। यह अंतर्दृष्टि पारंपरिक पुस्तकालय विज्ञान और आधुनिक स्वचालित दृष्टिकोणों को जोड़ती है।
स्वचालित दस्तावेज़ वर्गीकरण (ADC) 20वीं सदी के मध्य में एक क्षेत्र के रूप में उभरा, जिसमें 1950 और 1960 के दशक के शुरुआती कार्यों ने सरल शब्द-मिलान नियमों का उपयोग किया। 1990 के दशक में मशीन लर्निंग के आगमन, विशेष रूप से सपोर्ट वेक्टर मशीनों (SVM) और नाइव बेयस क्लासिफायर के उपयोग ने एक महत्वपूर्ण प्रगति को चिह्नित किया। ये विधियाँ लेबल किए गए उदाहरणों से सीखती हैं, स्वचालित रूप से पाठ में उन पैटर्नों की पहचान करती हैं जो श्रेणियों से सहसंबंधित होते हैं।
मशीन लर्निंग तकनीकें
आधुनिक पाठ वर्गीकरण मुख्य रूप से मशीन लर्निंग और डीप लर्निंग पर निर्भर करता है। पारंपरिक तकनीकों में शामिल हैं:
- नाइव बेयस क्लासिफायर: बेयस प्रमेय पर आधारित एक संभाव्य दृष्टिकोण, जिसे अक्सर इसकी सरलता और प्रभावशीलता के कारण आधार रेखा के रूप में उपयोग किया जाता है।
- सपोर्ट वेक्टर मशीन (SVM): एक शक्तिशाली रैखिक क्लासिफायर जो वर्गों को अलग करने के लिए एक इष्टतम हाइपरप्लेन ढूंढता है, जिसे अक्सर गैर-रैखिक सीमाओं के लिए कर्नेल विधियों के साथ जोड़ा जाता है।
- के-निकटतम पड़ोसी (KNN): एक गैर-पैरामीट्रिक विधि जो किसी दस्तावेज़ को उसके k सबसे समान प्रशिक्षण उदाहरणों के बहुमत वर्ग के आधार पर वर्गीकृत करती है।
- निर्णय वृक्ष और रैंडम फ़ॉरेस्ट: नियम-आधारित मॉडल जो फीचर स्पेस को विभाजित करते हैं।
- tf-idf भारांकन: दस्तावेज़ों को शब्द आवृत्तियों के वैक्टर के रूप में प्रस्तुत करने की एक तकनीक, जो कोरपस में शब्दों के सामान्य होने के आधार पर व्युत्क्रम रूप से भारित होती है।
डीप लर्निंग के उदय के साथ, तंत्रिका नेटवर्क आर्किटेक्चर प्रमुख हो गए हैं। प्रारंभिक तंत्रिका मॉडल ने शब्द एम्बेडिंग और कन्वोल्यूशनल या आवर्तक नेटवर्क का उपयोग किया। 2017 में Transformer (architecture) आर्किटेक्चर की शुरुआत, इसके सेल्फ-अटेंशन तंत्र के साथ, ने इस क्षेत्र में क्रांति ला दी। BERT और इसके उत्तराधिकारियों जैसे पूर्व-प्रशिक्षित मॉडल, जो ट्रांसफार्मर पर बने हैं, शब्दों के प्रासंगिक प्रतिनिधित्व सीखकर अत्याधुनिक परिणाम प्राप्त करते हैं। इन मॉडलों को अक्सर अपेक्षाकृत कम मात्रा में लेबल किए गए डेटा के साथ विशिष्ट वर्गीकरण कार्यों पर फाइन-ट्यून किया जाता है।
विभिन्न डोमेन में अनुप्रयोग
पाठ वर्गीकरण के व्यावहारिक अनुप्रयोगों की एक विस्तृत श्रृंखला है:
- स्पैम फ़िल्टरिंग: वैध संदेशों से अवांछित या दुर्भावनापूर्ण ईमेल को अलग करना, एक ऐसा कार्य जो 1990 के दशक के अंत से व्यापक रूप से तैनात किया गया है।
- ईमेल रूटिंग: विषय के आधार पर आने वाले ईमेल को स्वचालित रूप से उपयुक्त विभाग या मेलबॉक्स में निर्देशित करना।
- भाषा पहचान: किसी पाठ की भाषा निर्धारित करना, कई NLP प्रणालियों के लिए एक महत्वपूर्ण पूर्व-प्रसंस्करण चरण।
- शैली वर्गीकरण: साहित्यिक या पत्रकारिता शैली के अनुसार दस्तावेज़ों को वर्गीकृत करना, जो डिजिटल पुस्तकालयों और सामग्री प्रबंधन के लिए उपयोगी है।
- पठनीयता मूल्यांकन: उपयुक्त आयु समूहों या कौशल स्तरों से मेल खाने के लिए किसी पाठ की पढ़ने की कठिनाई का अनुमान लगाना।
- भावना विश्लेषण: किसी दस्तावेज़ में व्यक्त दृष्टिकोण या भावनात्मक स्वर का निर्धारण करना, जो सोशल मीडिया निगरानी और ग्राहक प्रतिक्रिया विश्लेषण में व्यापक रूप से उपयोग किया जाता है।
- स्वास्थ्य-संबंधी वर्गीकरण: सार्वजनिक स्वास्थ्य निगरानी के लिए सोशल मीडिया पोस्ट का विश्लेषण करना, जैसे रोग प्रकोप या प्रतिकूल दवा प्रतिक्रियाओं को ट्रैक करना।
- लेख छँटाई: जीव विज्ञान जैसे क्षेत्रों में मैनुअल क्यूरेशन के लिए प्रासंगिक लेखों का चयन करना, जहाँ स्वचालित प्रणालियाँ वैज्ञानिक साहित्य की भारी मात्रा को प्रबंधित करने में मदद करती हैं।
चुनौतियाँ और भविष्य की दिशाएँ
इसकी सफलताओं के बावजूद, पाठ वर्गीकरण को कई चुनौतियों का सामना करना पड़ता है। अस्पष्ट भाषा, व्यंग्य और संदर्भ-निर्भर अर्थ को संभालना कठिन बना हुआ है। डोमेन अनुकूलन - जहाँ एक प्रकार के पाठ (जैसे समाचार लेख) पर प्रशिक्षित मॉडल को दूसरे (जैसे कानूनी दस्तावेज़) पर लागू किया जाता है - अक्सर अतिरिक्त फाइन-ट्यूनिंग की आवश्यकता होती है। वर्ग असंतुलन, जहाँ कुछ श्रेणियों में बहुत कम उदाहरण होते हैं, भी प्रदर्शन को खराब कर सकता है।
Large language model में हालिया प्रगति, जैसे कि OpenAI, Anthropic और Google DeepMind द्वारा विकसित, ने नई संभावनाएँ खोली हैं। विशाल मात्रा में पाठ पर प्रशिक्षित ये मॉडल, न्यूनतम कार्य-विशिष्ट प्रशिक्षण के साथ वर्गीकरण कर सकते हैं, कभी-कभी शून्य-शॉट या कुछ-शॉट तरीके से भी। वे जटिल निर्देशों को भी संभाल सकते हैं और अपने वर्गीकरण के लिए स्पष्टीकरण उत्पन्न कर सकते हैं, जिससे व्याख्या क्षमता बढ़ती है।
2020 के दशक की शुरुआत तक, शोध अधिक कुशल आर्किटेक्चर, लंबे दस्तावेज़ों के बेहतर प्रबंधन और वर्गीकरण प्रणालियों में निष्पक्षता में सुधार और पूर्वाग्रह को कम करने के तरीकों का पता लगाना जारी रखता है। पाठ वर्गीकरण का Generative AI और Deep learning जैसी अन्य AI तकनीकों के साथ एकीकरण, आने वाले वर्षों में और नवाचार उत्पन्न करने की संभावना है।