दस्तावेज़ वर्गीकरण, जिसे दस्तावेज़ श्रेणीकरण भी कहा जाता है, पुस्तकालय विज्ञान, सूचना विज्ञान और कंप्यूटर विज्ञान में एक कार्य है जिसमें किसी दस्तावेज़ को एक या अधिक वर्गों या श्रेणियों में निर्दिष्ट करना शामिल है। यह निर्धारण मैन्युअल रूप से, अक्सर पुस्तकालयाध्यक्षों या विषय विशेषज्ञों द्वारा, या एल्गोरिथमिक रूप से कम्प्यूटेशनल तकनीकों का उपयोग करके किया जा सकता है। बौद्धिक वर्गीकरण ऐतिहासिक रूप से पुस्तकालय विज्ञान का केंद्र रहा है, जबकि एल्गोरिथमिक वर्गीकरण सूचना विज्ञान और कंप्यूटर विज्ञान का एक मुख्य विषय है, हालाँकि दोनों क्षेत्र काफी हद तक ओवरलैप होते हैं और अंतःविषय अनुसंधान को बढ़ावा देते हैं।
वर्गीकृत किए जाने वाले दस्तावेज़ों में पाठ, चित्र, संगीत और अन्य मीडिया शामिल हो सकते हैं, जिनमें से प्रत्येक अलग-अलग वर्गीकरण चुनौतियाँ प्रस्तुत करता है। जब तक अन्यथा निर्दिष्ट न किया जाए, यह शब्द आमतौर पर पाठ वर्गीकरण का संकेत देता है। दस्तावेज़ों को विषय वस्तु या अन्य विशेषताओं जैसे दस्तावेज़ प्रकार, लेखक या प्रकाशन वर्ष द्वारा वर्गीकृत किया जा सकता है, लेकिन विषय वर्गीकरण सबसे आम फोकस है। विषय वर्गीकरण का मार्गदर्शन करने वाले दो व्यापक दर्शन हैं: सामग्री-आधारित और अनुरोध-आधारित दृष्टिकोण।
सामग्री-आधारित बनाम अनुरोध-आधारित वर्गीकरण
सामग्री-आधारित वर्गीकरण किसी दस्तावेज़ को विशेष विषयों के लिए समर्पित सामग्री के भार या अनुपात के आधार पर एक वर्ग में निर्दिष्ट करता है। उदाहरण के लिए, पुस्तकालय अक्सर एक नियम लागू करते हैं कि किसी पुस्तक की कम से कम 20% सामग्री निर्दिष्ट वर्ग से संबंधित होनी चाहिए। स्वचालित प्रणालियों में, यह भार दस्तावेज़ के भीतर कुछ शब्दों या शब्दों की आवृत्ति के अनुरूप हो सकता है।
अनुरोध-आधारित वर्गीकरण, जिसे अनुरोध-उन्मुख वर्गीकरण या अनुक्रमण के रूप में भी जाना जाता है, उपयोगकर्ताओं की अपेक्षित आवश्यकताओं को प्राथमिकता देता है। एक वर्गीकरणकर्ता पूछता है कि कौन से वर्णनकर्ता किसी उपयोगकर्ता को दस्तावेज़ खोजने में मदद करेंगे, सभी संभावित क्वेरी पर विचार करते हुए और यह निर्धारित करते हुए कि दस्तावेज़ किन क्वेरी के लिए प्रासंगिक है। यह दृष्टिकोण अक्सर एक विशिष्ट दर्शक वर्ग या संस्थागत नीति को दर्शाता है; उदाहरण के लिए, एक नारीवादी अध्ययन डेटाबेस सामान्य ऐतिहासिक पुस्तकालय की तुलना में दस्तावेज़ों को अलग तरह से अनुक्रमित कर सकता है। अनुरोध-आधारित वर्गीकरण को विशुद्ध रूप से उपयोगकर्ता-संचालित के बजाय नीति-संचालित के रूप में बेहतर ढंग से समझा जाता है, जब तक कि यह वास्तविक उपयोगकर्ता व्यवहार के बारे में अनुभवजन्य डेटा को शामिल नहीं करता।
वर्गीकरण बनाम अनुक्रमण
दस्तावेज़ों को वर्गों में निर्दिष्ट करने (वर्गीकरण) और दस्तावेज़ों को विषय निर्दिष्ट करने (विषय अनुक्रमण) के बीच का अंतर अक्सर सतही माना जाता है। सूचना वैज्ञानिक फ्रेडरिक विल्फ्रिड लैंकेस्टर ने तर्क दिया कि ऐसे शब्दावली संबंधी अंतर अर्थहीन हैं और भ्रम पैदा करते हैं। यह दृष्टिकोण वर्गीकरण प्रणालियों और थिसॉरी की विनिमेयता द्वारा समर्थित है: एक वर्गीकरण योजना को थिसॉरस में बदला जा सकता है और इसके विपरीत। किसी दस्तावेज़ को एक विषय शब्द निर्दिष्ट करना उसे उस शब्द द्वारा अनुक्रमित दस्तावेज़ों के वर्ग में निर्दिष्ट करने के बराबर है, क्योंकि एक ही शब्द साझा करने वाले सभी दस्तावेज़ एक ही वर्ग से संबंधित होते हैं।
स्वचालित दस्तावेज़ वर्गीकरण
स्वचालित दस्तावेज़ वर्गीकरण (ADC) दस्तावेज़ों को वर्गीकृत करने के लिए कम्प्यूटेशनल विधियों और Machine learning का उपयोग करता है। ADC कार्य तीन श्रेणियों में आते हैं: पर्यवेक्षित वर्गीकरण, जहाँ बाहरी प्रतिक्रिया (जैसे मानव लेबल) सही वर्गीकरण प्रदान करती है; अप्रशिक्षित वर्गीकरण, जिसे दस्तावेज़ क्लस्टरिंग भी कहा जाता है, जो बाहरी संदर्भ के बिना संचालित होता है; और अर्ध-पर्यवेक्षित वर्गीकरण, जो लेबल किए गए और बिना लेबल वाले डेटा को जोड़ता है। विभिन्न लाइसेंस मॉडल के तहत कई सॉफ्टवेयर उत्पाद मौजूद हैं।
सामान्य तकनीकों में कृत्रिम Neural network दृष्टिकोण, निर्णय वृक्ष (जैसे ID3 या C4.5), अपेक्षा अधिकतमीकरण, अव्यक्त शब्दार्थ अनुक्रमण, नाइव बेयस वर्गीकरणकर्ता, सपोर्ट वेक्टर मशीन (SVM), k-निकटतम पड़ोसी एल्गोरिदम, और शब्द आवृत्ति-व्युत्क्रम दस्तावेज़ आवृत्ति (tf-idf) शामिल हैं। Deep learning और Transformer (architecture) आर्किटेक्चर में प्रगति ने अधिक परिष्कृत मॉडल सक्षम किए हैं, जैसे Large language model-आधारित वर्गीकरणकर्ता जो सरल शब्द गणना से परे शब्दार्थ संदर्भ को पकड़ते हैं।
अनुप्रयोग
दस्तावेज़ वर्गीकरण के व्यावहारिक अनुप्रयोग विविध हैं। स्पैम फ़िल्टरिंग में, एल्गोरिदम अवांछित ईमेल को वैध संदेशों से अलग करते हैं। ईमेल रूटिंग विषय के आधार पर संदेशों को उपयुक्त प्राप्तकर्ताओं तक निर्देशित करने के लिए वर्गीकरण का उपयोग करती है। भाषा पहचान स्वचालित रूप से किसी दस्तावेज़ की भाषा का पता लगाती है, जबकि शैली वर्गीकरण उसके साहित्यिक या अलंकारिक प्रकार को निर्धारित करता है। पठनीयता मूल्यांकन विभिन्न आयु समूहों या पढ़ने के स्तरों के लिए पाठ की जटिलता का आकलन करता है, अक्सर पाठ सरलीकरण प्रणालियों का समर्थन करता है। भावना विश्लेषण किसी दस्तावेज़ में व्यक्त दृष्टिकोण या भावनात्मक स्वर की पहचान करता है। सार्वजनिक स्वास्थ्य निगरानी में, सोशल मीडिया पोस्ट का वर्गीकरण रोग प्रकोप की निगरानी में मदद करता है। लेख ट्राइएज, विशेष रूप से जीव विज्ञान में, डेटाबेस में मैन्युअल क्यूरेशन के लिए प्रासंगिक पत्रों का चयन करता है।
चुनौतियाँ और रुझान
स्वचालित वर्गीकरण में एक प्रमुख चुनौती दस्तावेज़ प्रकारों की विविधता और प्राकृतिक भाषा की अस्पष्टता को संभालना है। प्रारंभिक प्रणालियाँ हस्तनिर्मित विशेषताओं पर निर्भर थीं, लेकिन आधुनिक विधियाँ प्रतिनिधित्व स्वचालित रूप से सीखने के लिए Deep learning का लाभ उठाती हैं। Generative AI और पूर्व-प्रशिक्षित Transformer (architecture) मॉडल के उदय ने क्षेत्र को फाइन-ट्यूनिंग और फ्यू-शॉट लर्निंग की ओर स्थानांतरित कर दिया है, जिससे विशाल लेबल किए गए डेटासेट की आवश्यकता कम हो गई है। हालाँकि, पूर्वाग्रह, व्याख्यात्मकता और कम्प्यूटेशनल लागत जैसे मुद्दे सक्रिय अनुसंधान क्षेत्र बने हुए हैं। पुस्तकालय विज्ञान, सूचना विज्ञान और कंप्यूटर विज्ञान के बीच अंतःविषय सहयोग मैन्युअल और एल्गोरिथमिक दोनों वर्गीकरण को परिष्कृत करना जारी रखता है, यह सुनिश्चित करते हुए कि सिस्टम विकसित उपयोगकर्ता आवश्यकताओं और दस्तावेज़ प्रारूपों के अनुकूल बने रहें।