सबवर्ड टोकनाइज़ेशन प्राकृतिक भाषा प्रसंस्करण में एक तकनीक है जो कच्चे पाठ को टोकनों के अनुक्रम में परिवर्तित करती है, जहाँ प्रत्येक टोकन एक पूरा शब्द, शब्द का एक भाग, या यहाँ तक कि एक एकल वर्ण भी हो सकता है। यह शब्द-स्तरीय टोकनाइज़ेशन के बीच स्थित है, जो प्रत्येक शब्द को एक अविभाज्य इकाई मानता है, और वर्ण-स्तरीय टोकनाइज़ेशन, जो पाठ को व्यक्तिगत वर्णों के रूप में संसाधित करता है। सबवर्ड इकाइयों का उपयोग करके, टोकनाइज़र बड़े शब्दकोशों को कुशलतापूर्वक संभाल सकते हैं, दुर्लभ या अदृश्य शब्दों का प्रतिनिधित्व कर सकते हैं, और सार्थक रूपात्मक जानकारी को संरक्षित कर सकते हैं। यह दृष्टिकोण आधुनिक बड़े भाषा मॉडल और अन्य तंत्रिका नेटवर्क वास्तुकलाओं के लिए मौलिक है जो पाठ को संसाधित करते हैं।
मूल विचार शब्दों को छोटे टुकड़ों में तोड़ना है जो प्रशिक्षण कोष में बार-बार दिखाई देते हैं। उदाहरण के लिए, शब्द "unhappiness" को "un", "happi", और "ness" में विभाजित किया जा सकता है, या यदि यह पर्याप्त सामान्य है तो "unhappiness" को एक ही टोकन के रूप में रखा जा सकता है। यह लचीलापन मॉडल को ज्ञात सबवर्ड इकाइयों को जोड़कर नए शब्दों को समझने की अनुमति देता है, साथ ही शब्दकोली का आकार प्रबंधनीय रखता है। सबवर्ड टोकनाइज़ेशन 2010 के दशक के मध्य से व्यापक रूप से अपनाया गया है और Transformer (architecture)-आधारित मॉडलों का एक प्रमुख घटक है।
इतिहास और विकास
सबवर्ड टोकनाइज़ेशन की अवधारणा मशीन अनुवाद और भाषा मॉडलिंग में खुले-शब्दकोली समस्याओं को संभालने की आवश्यकता से उभरी। 1990 और 2000 के दशक में प्रारंभिक दृष्टिकोणों ने रूपात्मक विश्लेषण का उपयोग किया, लेकिन ये अक्सर भाषा-विशिष्ट और कम्प्यूटेशनल रूप से महंगे थे। एक प्रमुख सफलता 2016 में रिको सेनरिच और सहयोगियों द्वारा पाठ संपीड़न के लिए बाइट-पेयर एन्कोडिंग (BPE) की शुरुआत के साथ आई, जिसे टोकनाइज़ेशन के लिए अनुकूलित किया गया। उनके पेपर "न्यूरल मशीन ट्रांसलेशन ऑफ रेयर वर्ड्स विद सबवर्ड यूनिट्स" ने प्रदर्शित किया कि BPE Sequence-to-Sequence (Seq2Seq) मॉडलों में दुर्लभ शब्दों को प्रभावी ढंग से संभाल सकता है।
उसी समय के आसपास, वर्डपीस मॉडल Google में विकसित किया गया था, शुरुआत में भाषण पहचान के लिए और बाद में BERT द्वारा लोकप्रिय बनाया गया। एक और संस्करण, यूनिग्राम भाषा मॉडल, 2018 में ताकु कुडो द्वारा पेश किया गया था और ALBERT और T5 जैसे मॉडलों में उपयोग किया गया। ये विधियाँ सबवर्ड इकाइयों का चयन कैसे करती हैं, इसमें भिन्न हैं, लेकिन सभी पाठ का एक इष्टतम विभाजन खोजने के लक्ष्य को साझा करती हैं।
विधियाँ और एल्गोरिदम
बाइट-पेयर एन्कोडिंग (BPE)
BPE एक डेटा संपीड़न एल्गोरिदम है जो क्रमिक रूप से लगातार प्रतीकों की सबसे लगातार जोड़ी (शुरुआत में वर्ण) को एक नए प्रतीक में विलय करता है। टोकनाइज़ेशन के लिए, प्रक्रिया पाठ के कोर्यस के साथ शुरू होती है जो वर्णों में विभाजित होती है, फिर बार-बार आसन्न जोड़ियों की गिनती करता है और लक्ष्य शब्दकोली आकार तक पहुंचने तक सबसे लगातार जोड़ी को मिलाता है। परिणामी शब्दकोली में वर्ण, सबवर्ड और पूरे शब्द शामिल होते हैं। BPE का उपयोग कई मॉडलों में किया जाता है, जिसमें OpenAI से GPT श्रृंखला और Meta से LLaMA शामिल हैं।
वर्डपेस
वर्डपेस BPE के समान है लेकिन विलय के लिए संभावना-आधारित मानदंड का उपयोग करता है। यह व्यक्तिगत वर्णों से शुरू करके और फिर नए टोकन जोड़कर एक शब्दकोली बनाता है जो प्रशिक्षण डेटा की संभावना को अधिकतम करते हैं। यह दृष्टिकोण अधिक भाषाई रूप से सार्थक सबवर्ड उत्पन्न करता है। वर्डपेस का उपयोग BERT, ELECTRA, और Google के अन्य मॉडलों में किया जाता है।
यूनिग्राम भाषा मॉडल
यूनिग्राम टोकनाइज़ेशन प्रत्येक सबवर्ड को एक स्वतंत्र इकाई मानता है और प्रत्येक शब्द के लिए सर्वोत्तम विभाजन चुनने के लिए एक संभाव्य मॉडल का उपयोग करता है। यह संभावित सबवर्डों के एक बड़े शब्दकोली के साथ शुरू होता है और फिर प्रत्येक टोकन के समग्र संभावना में योगदान के आधार पर इसे छाँटता है। यह विधि कई विभाजनों की अनुमति देती है और सेंटेंसपीस कार्यान्वयनों में उपयोग की जाती है।
आधुनिक भाषा मॉडलों में भूमिका
सबवर्ड टोकनाइज़ेशन लगभग सभी समकालीन बड़े भाषा मॉडलों के लिए एक महत्वपूर्ण पूर्व-प्रसंस्करण चरण है। GPT-4, क्लॉड, और जेमिनी जैसे मॉडल टोकनाइज़रों पर निर्भर करते हैं जो पाठ को सबवर्ड टोकनों में परिवर्तित करते हैं, उन्हें Transformer (architecture) वास्तुकला में डालने से पहले। टोकनाइज़र का चुनाव मॉडल प्रदर्शन, कम्प्यूटेशनल दक्षता और कई भाषाओं को संभालने की क्षमता को प्रभावित करता है।
उदाहरण के लिए, बड़े शब्दकोली वाला टोकनाइज़र अधिक शब्दों को एकल टोकन के रूप में प्रस्तुत कर सकता है, अनुक्रम लंबाई और कम्प्यूटेशनल लागत को कम करता है, लेकिन मॉडल की मेमोरी फुटप्रिंट भी बढ़ा सकता है। इसके विपरीत, छोटा शब्दकोली अधिक शब्दों को विभाजित करने के लिए मजबूर करता है, जो लंबे अनुक्रम और अर्थ के संभावित नुकसान का कारण बन सकता है। टोकनाइज़र आमतौर पर बड़े कोर्यस पर प्रशिक्षित होते हैं और मॉडल प्रशिक्षण के दौरान स्थिर रखे जाते हैं।
सबवर्ड टोकनाइज़ेशन क्रॉस-भाषाई स्थानांतरण को भी सक्षम बनाता है। भाषाओं में सबवर्ड इकाइयों को साझा करके, मॉडल कोड-स्विचिंग और कम-संसाधन भाषाओं में दुर्लभ शब्दों को बेहतर ढंग से संभाल सकते हैं। यह mBERT और XLM-RoBERTa जैसे बहुभाषी मॉडलों के लिए विशेष रूप से महत्वपूर्ण है।
चुनौतियाँ और भविष्य की दिशाएँ
व्यापक उपयोग के बावजूद, सबवर्ड टोकनाइज़ेशन की सीमाएँ हैं। एक मुद्दा यह है कि यह मनमाना विभाजन उत्पन्न कर सकता है जो रूपात्मक सीमाओं के साथ संरेखित नहीं होता, जिससे मॉडलों के लिए शब्द संरचना सीखना कठिन हो जाता है। एक और चुनौती विशेष डोमेनों जैसे चिकित्सा या कानून में आउट-ऑफ-वोकैबुलरी शब्दों का प्रबंधन है, जहाँ नए शब्द अक्सर दिखाई देते हैं। कुछ शोधकर्ताओं ने इन मुद्दों से बचने के लिए वर्ण-स्तरीय या बाइट-स्तरीय टोकनाइज़ेशन का प्रस्ताव किया है, लेकिन इन दृष्टिकोणों को अक्सर लंबे अनुक्रम और अधिक गणना की आवश्यकता होती है।
हाल के विकास में अनुकूली टोकनाइज़ेशन शामिल है, जहाँ टोकनाइज़र को प्रशिक्षण के दौरान समायोजित किया जा सकता है, और अंत-से-अंत मॉडल जो बिना निश्चित टोकनाइज़र के पाठ को विभाजित करना सीखते हैं। हालाँकि, 2025 तक, सबवर्ड टोकनाइज़ेशन अधिकांश उत्पादन प्रणालियों में मानक बना हुआ है, और चल रहे अनुसंधान का उद्देश्य इसकी दक्षता और भाषाई गुणवत्ता में सुधार करना है।