बैग-ऑफ-वर्ड्स मॉडल प्राकृतिक भाषा प्रसंस्करण और सूचना पुनर्प्राप्ति में उपयोग किया जाने वाला एक सरलीकृत प्रतिनिधित्व है। इस मॉडल में, एक पाठ जैसे कि वाक्य या दस्तावेज़ को उसके शब्दों के एक बहुसमुच्चय के रूप में प्रस्तुत किया जाता है, जिसमें व्याकरण और शब्द क्रम को अनदेखा किया जाता है लेकिन बहुलता को बनाए रखा जाता है। यह नाम इस विचार से आया है कि एक पाठ को शब्दों के एक "थैले" के रूप में देखा जा सकता है, जहाँ संरचना खो जाती है और केवल शब्दों की गिनती मायने रखती है। यह Machine learning और Artificial intelligence में पाठ वर्गीकरण, भावना विश्लेषण और दस्तावेज़ पुनर्प्राप्ति जैसे कार्यों के लिए एक सामान्य आधार रेखा है।
यह कैसे काम करता है
बैग-ऑफ-वर्ड्स प्रतिनिधित्व का निर्माण टोकनाइज़ेशन से शुरू होता है, जो एक पाठ को व्यक्तिगत शब्दों या टोकनों में विभाजित करने की प्रक्रिया है। विराम चिह्न आमतौर पर हटा दिए जाते हैं, और शब्दों को अक्सर लोअरकेस में बदल दिया जाता है। फिर दस्तावेज़ों के एक संग्रह में दिखाई देने वाले सभी अद्वितीय टोकनों से एक शब्दावली बनाई जाती है। प्रत्येक दस्तावेज़ को गिनती के एक वेक्टर में परिवर्तित किया जाता है, जहाँ प्रत्येक आयाम शब्दावली में एक शब्द से मेल खाता है और मान उस शब्द के दस्तावेज़ में आने की संख्या है। यह वेक्टर विरल है, क्योंकि अधिकांश दस्तावेज़ों में शब्दावली का केवल एक छोटा सा हिस्सा होता है।
उदाहरण के लिए, वाक्य "the cat sat on the mat" एक वेक्टर उत्पन्न करेगा जिसमें गिनती होगी: "the" दो बार आता है, और "cat", "sat", "on", "mat" प्रत्येक एक बार आते हैं। शब्दों का क्रम पूरी तरह से अनदेखा किया जाता है, इसलिए "the cat sat" और "sat cat the" समान प्रतिनिधित्व देंगे। क्रम जानकारी का यह नुकसान मॉडल की प्राथमिक सीमा है, लेकिन यह प्रतिनिधित्व को सरल और कम्प्यूटेशनल रूप से कुशल भी बनाता है।
अनुप्रयोग और सीमाएँ
बैग-ऑफ-वर्ड्स प्रतिनिधित्व Deep learning के उदय से पहले शास्त्रीय Machine learning पाइपलाइनों में व्यापक रूप से उपयोग किए जाते थे। वे लॉजिस्टिक रिग्रेशन, सपोर्ट वेक्टर मशीन और नाइव बेयस क्लासिफायर जैसे एल्गोरिदम के लिए इनपुट विशेषताओं के रूप में कार्य करते हैं। सूचना पुनर्प्राप्ति में, वेक्टर स्पेस मॉडल, जिसे 1975 में जेरार्ड साल्टन और सहयोगियों द्वारा पेश किया गया था, दस्तावेज़ों और क्वेरीज़ को बैग-ऑफ-वर्ड्स वेक्टर के रूप में प्रस्तुत करता है और उनकी तुलना कोसाइन समानता द्वारा करता है।
मॉडल की कई ज्ञात सीमाएँ हैं। यह शब्द क्रम को पकड़ नहीं सकता, इसलिए "not good" और "good not" जैसे वाक्यांशों को समान रूप से माना जाता है। यह शब्दार्थ को भी अनदेखा करता है: "car" और "automobile" जैसे पर्यायवाची शब्दों को अलग-अलग आयामों के रूप में माना जाता है, जबकि "bank" जैसे बहुअर्थी शब्दों को एक साथ मिला दिया जाता है। परिणामी वेक्टर उच्च-आयामी और विरल होते हैं, जो बड़ी शब्दावली के मामले में अतिअनुकूलन और खराब सामान्यीकरण का कारण बन सकते हैं। इन मुद्दों को कम करने के लिए, व्यवसायी अक्सर टर्म फ्रीक्वेंसी-इनवर्स डॉक्यूमेंट फ्रीक्वेंसी (TF-IDF) जैसी भारांकन योजनाएँ लागू करते हैं या छोटे अनुक्रमों को पकड़ने के लिए n-ग्राम का उपयोग करते हैं।
विविधताएँ और विस्तार
कई विस्तार मूल बैग-ऑफ-वर्ड्स मॉडल की कमजोरियों को संबोधित करते हैं। TF-IDF कच्ची गिनती को उन भारों से बदल देता है जो सामान्य शब्दों को कम महत्व देते हैं और दुर्लभ शब्दों पर जोर देते हैं। एन-ग्राम मॉडल बैग को n शब्दों के सन्निहित अनुक्रमों को शामिल करने के लिए विस्तारित करते हैं, जिससे कुछ स्थानीय क्रम जानकारी संरक्षित रहती है। हैशिंग ट्रिक शब्दों को हैश फ़ंक्शन का उपयोग करके एक निश्चित आकार के वेक्टर में मैप करती है, जिससे शब्दावली संग्रहीत करने की आवश्यकता से बचा जाता है। ये विधियाँ कई अनुप्रयोगों में उपयोगी बनी हुई हैं, विशेष रूप से जब लेबल किया गया डेटा दुर्लभ होता है।
एक और महत्वपूर्ण विस्तार शब्द एम्बेडिंग का उपयोग है, जो शब्दों को घने निम्न-आयामी वेक्टर में मैप करता है जो शब्दार्थ समानता को पकड़ते हैं। बैग-ऑफ-वर्ड्स के विपरीत, एम्बेडिंग शब्दों के बीच कुछ संबंधों को संरक्षित करते हैं। हालाँकि, एम्बेडिंग आमतौर पर Neural network विधियों का उपयोग करके सीखे जाते हैं, जिन्हें अधिक डेटा और गणना की आवश्यकता होती है। बैग-ऑफ-वर्ड्स मॉडल एक मजबूत आधार रेखा बना हुआ है: कई पाठ वर्गीकरण कार्यों में, बैग-ऑफ-वर्ड्स विशेषताओं पर एक रैखिक क्लासिफायर अधिक जटिल मॉडल के प्रदर्शन से मेल खा सकता है।
आधुनिक AI से संबंध
Large language model और Transformer (architecture) वास्तुकला के आगमन के साथ, बैग-ऑफ-वर्ड्स प्रतिनिधित्व जटिल प्राकृतिक भाषा समझ कार्यों के लिए काफी हद तक विस्थापित हो गए हैं। 2017 में पेश की गई ट्रांसफॉर्मर वास्तुकला, शब्द क्रम जानकारी इंजेक्ट करने के लिए Positional Encoding और अनुक्रम में सभी शब्दों के बीच संबंधों को मॉडल करने के लिए Multi-Head Attention का उपयोग करती है। ये तंत्र मॉडल को संदर्भ और लंबी दूरी की निर्भरताओं को पकड़ने की अनुमति देते हैं जो बैग-ऑफ-वर्ड्स प्रतिनिधित्व के लिए अदृश्य हैं। Sequence-to-Sequence (Seq2Seq) और Encoder-Decoder Architecture जैसी वास्तुकलाएँ भी गिनती-आधारित वेक्टर के बजाय सीखे गए एम्बेडिंग पर निर्भर करती हैं।
फिर भी, बैग-ऑफ-वर्ड्स मॉडल आधुनिक AI को प्रभावित करना जारी रखता है। इसका उपयोग अक्सर हाइब्रिड सिस्टम में एक विशेषता निष्कर्षण चरण के रूप में किया जाता है, और इसकी सरलता इसे मशीन-लर्निंग अवधारणाओं को समझने के लिए एक उपयोगी शैक्षणिक उपकरण बनाती है। यह मॉडल Generative AI अनुप्रयोगों में अधिक परिष्कृत प्रतिनिधित्वों का मूल्यांकन करने के लिए एक आधार रेखा के रूप में भी दिखाई देता है। यहाँ तक कि जैसे-जैसे Deep learning आगे बढ़ता है, बैग-ऑफ-वर्ड्स मॉडल प्राकृतिक भाषा प्रसंस्करण के इतिहास में एक मौलिक अवधारणा बना रहता है।