अंग्रेज़ी से अनुवादित

टोकन भाषा मॉडलों द्वारा संसाधित पाठ की मूल इकाई है, जो शब्दों, उप-शब्दों या वर्णों का प्रतिनिधित्व करता है। मूल्य निर्धारण, संदर्भ सीमाएँ और गति सभी टोकन में मापी जाती हैं, जिससे वे मॉडल संचालन और लागत के लिए मौलिक बन जाते हैं।

टोकन वह मूलभूत इकाई है जिसे एक भाषा मॉडल पढ़ता और लिखता है। बड़े भाषा मॉडलों के संदर्भ में, टोकन आवश्यक रूप से पूरे शब्द नहीं होते; वे उपशब्द, वर्ण, या यहां तक कि बाइट-स्तरीय निरूपण भी हो सकते हैं। कच्चे पाठ को टोकन में बदलने की प्रक्रिया को टोकनाइज़ेशन कहा जाता है, और यह एक महत्वपूर्ण पूर्व-प्रसंस्करण चरण है जो यह निर्धारित करता है कि मॉडल भाषा की व्याख्या और उत्पादन कैसे करता है। एक भाषा मॉडल के सभी परिचालन मीट्रिक, जिनमें मूल्य निर्धारण, संदर्भ विंडो आकार, और प्रसंस्करण गति शामिल हैं, टोकन में मापे जाते हैं, जिससे वे आधुनिक कृत्रिम बुद्धिमत्ता प्रणालियों की मुद्रा बन जाते हैं।

टोकनाइज़ेशन मॉडलों को एक विशाल शब्दावली को कुशलतापूर्वक संभालने की अनुमति देता है। हर संभव शब्द को संग्रहीत करने के बजाय, एक टोकनाइज़र सीखी गई शब्दावली के आधार पर पाठ को छोटे टुकड़ों में तोड़ता है, जो आमतौर पर 30,000 से 100,000 टोकन तक होती है। उदाहरण के लिए, शब्द "unhappiness" को "un", "happi", और "ness" में विभाजित किया जा सकता है, जबकि सामान्य शब्द जैसे "the" एकल टोकन के रूप में रहते हैं। यह दृष्टिकोण कम्प्यूटेशनल दक्षता को भाषाई कवरेज के साथ संतुलित करता है, जिससे मॉडल अव्यावहारिक शब्दकोश आकार के बिना विविध भाषाओं और तकनीकी शब्दजाल को संसाधित कर सकते हैं।

टोकनाइज़ेशन विधियाँ

पिछले कुछ वर्षों में कई टोकनाइज़ेशन एल्गोरिदम विकसित किए गए हैं। बाइट-पेयर एन्कोडिंग (BPE), जिसे 2016 में रिको सेनरिच और सहयोगियों द्वारा पेश किया गया था, सबसे व्यापक रूप से उपयोग की जाने वाली विधियों में से एक है। BPE एक प्रशिक्षण कॉर्पस में वर्णों या उपशब्दों के सबसे लगातार जोड़े को तब तक पुनरावृत्त रूप से मर्ज करता है जब तक कि लक्ष्य शब्दावली आकार तक नहीं पहुंच जाता। एक और लोकप्रिय विधि वर्डपीस है, जिसे Google में विकसित किया गया था, जो मर्ज का चयन करने के लिए संभावना-आधारित दृष्टिकोण का उपयोग करती है। हाल ही में, Google द्वारा बनाया गया सेंटेंसपीस, पूरे पाठ को वर्णों के अनुक्रम के रूप में मानता है और स्पष्ट शब्द सीमाओं के बिना भाषाओं, जैसे जापानी या चीनी, को संभाल सकता है।

यूनिग्राम भाषा मॉडल टोकनाइज़ेशन, जो सेंटेंसपीस में भी लागू किया गया है, एक प्रशिक्षित यूनिग्राम मॉडल के आधार पर पाठ के सबसे संभावित विभाजन का चयन करके एक संभाव्य दृष्टिकोण अपनाता है। प्रत्येक विधि में संपीड़न दर, आउट-ऑफ-वोकैबुलरी हैंडलिंग, और डाउनस्ट्रीम मॉडल प्रदर्शन के संदर्भ में व्यापार-ऑफ होते हैं। टोकनाइज़र का चुनाव महत्वपूर्ण रूप से प्रभावित करता है कि मॉडल दुर्लभ शब्दों, रूपात्मक विविधताओं, और बहुभाषी पाठ को कितनी अच्छी तरह समझता है।

भाषा मॉडलों में भूमिका

ट्रांसफॉर्मर-आधारित मॉडलों में, टोकन को संख्यात्मक एम्बेडिंग में परिवर्तित किया जाता है जो तंत्रिका नेटवर्क के इनपुट के रूप में कार्य करते हैं। प्रत्येक टोकन को शब्दावली से एक अद्वितीय पूर्णांक ID सौंपा जाता है, और इन ID को उच्च-आयामी वैक्टर में मैप किया जाता है जो शब्दार्थ और वाक्यात्मक जानकारी को पकड़ते हैं। मॉडल इन एम्बेडिंग के अनुक्रमों को ध्यान और फीड-फॉरवर्ड नेटवर्क की कई परतों के माध्यम से संसाधित करता है, टोकन के बीच पैटर्न और संबंध सीखता है।

उत्पादन के दौरान, मॉडल पूर्ववर्ती संदर्भ के आधार पर अगले टोकन के लिए पूरी टोकन शब्दावली पर एक संभाव्यता वितरण आउटपुट करता है। यह ऑटोरेग्रेसिव प्रक्रिया तब तक जारी रहती है जब तक कि एक विशेष अंत-अनुक्रम टोकन उत्पन्न नहीं होता या अधिकतम लंबाई तक नहीं पहुंच जाती। टोकन की ग्रैन्युलैरिटी मॉडल की सुसंगत पाठ उत्पन्न करने की क्षमता को प्रभावित करती है; उपशब्द टोकन नए शब्दों के लचीले संयोजन की अनुमति देते हैं, जबकि वर्ण-स्तरीय टोकन के लिए बहुत लंबे अनुक्रम और अधिक गणना की आवश्यकता होगी।

संदर्भ विंडो और सीमाएँ

संदर्भ विंडो आकार, टोकन में मापा जाता है, यह परिभाषित करता है कि मॉडल एक बार में कितना पाठ विचार कर सकता है। शुरुआती मॉडल जैसे GPT-2 में 1,024 टोकन की संदर्भ विंडो थी, जबकि आधुनिक मॉडल जैसे GPT-4 Turbo 128,000 टोकन तक का समर्थन करते हैं, और कुछ मॉडल जैसे Claude 3 200,000-टोकन संदर्भ प्रदान करते हैं। ये सीमाएँ सीधे उन कार्यों के प्रकारों को प्रभावित करती हैं जो मॉडल कर सकता है, जैसे लंबे दस्तावेज़ों का विश्लेषण, पूरी पुस्तकों का सारांश, या विस्तारित इंटरैक्शन पर सुसंगत बातचीत बनाए रखना।

जब इनपुट संदर्भ विंडो से अधिक हो जाता है, मॉडल आमतौर पर सबसे पुराने टोकन को छोटा करते हैं या लंबे पाठों को प्रबंधित करने के लिए स्लाइडिंग विंडो या पुनर्प्राप्ति संवर्धन जैसी तकनीकों का उपयोग करते हैं। संदर्भ विंडो मेमोरी उपयोग और कम्प्यूटेशनल लागत को भी प्रभावित करती है; लंबे संदर्भों के लिए अधिक ध्यान गणनाओं की आवश्यकता होती है, जो मानक ट्रांसफॉर्मर में अनुक्रम लंबाई के साथ द्विघात रूप से बढ़ती हैं। इसने कुशल ध्यान तंत्रों, जैसे स्पार्स ध्यान और रैखिक ध्यान, पर शोध को प्रेरित किया है ताकि निषेधात्मक संसाधन मांगों के बिना संदर्भ लंबाई बढ़ाई जा सके।

मूल्य निर्धारण और लागत

API प्रदाता टोकन उपयोग के आधार पर शुल्क लेते हैं, आमतौर पर इनपुट और आउटपुट टोकन के बीच अंतर करते हैं। उदाहरण के लिए, OpenAI का GPT-4 Turbo $0.01 प्रति 1,000 इनपुट टोकन और $0.03 प्रति 1,000 आउटपुट टोकन खर्च करता है, जबकि Anthropic का Claude 3 Opus $0.015 इनपुट और $0.075 आउटपुट प्रति 1,000 टोकन शुल्क लेता है। ये मूल्य टोकन प्रसंस्करण की कम्प्यूटेशनल लागत को दर्शाते हैं, जिसमें आउटपुट टोकन अनुक्रमिक उत्पादन प्रक्रिया के कारण अधिक महंगे होते हैं।

टोकन गिनती फाइन-ट्यूनिंग और प्रशिक्षण की लागत भी निर्धारित करती है। एक मॉडल को प्रशिक्षित करने में अरबों टोकन संसाधित करना शामिल है, और कुल लागत टोकन की संख्या के साथ रैखिक रूप से बढ़ती है। उदाहरण के लिए, Llama 2 जैसे 70-बिलियन-पैरामीटर मॉडल को प्रशिक्षित करने के लिए लगभग 2 ट्रिलियन टोकन की आवश्यकता थी, जिसकी लागत लाखों डॉलर थी। टोकन मूल्य निर्धारण को समझना AI अनुप्रयोगों के बजट के लिए आवश्यक है, विशेष रूप से बड़े पैमाने पर पाठ प्रसंस्करण या वास्तविक समय इंटरैक्शन से जुड़े।

गति और थ्रूपुट

प्रसंस्करण गति टोकन प्रति सेकंड (TPS) में मापी जाती है। अनुमान गति हार्डवेयर और मॉडल आकार के आधार पर व्यापक रूप से भिन्न होती है। उच्च-स्तरीय GPU जैसे NVIDIA A100 पर, एक 7-बिलियन-पैरामीटर मॉडल 20-30 टोकन प्रति सेकंड उत्पन्न कर सकता है, जबकि विशेष हार्डवेयर पर छोटे मॉडल सैकड़ों टोकन प्रति सेकंड प्राप्त कर सकते हैं। Groq जैसी कंपनियों ने कस्टम चिप्स विकसित किए हैं जो अत्यधिक उच्च थ्रूपुट प्राप्त करते हैं, उनका LPU (भाषा प्रसंस्करण इकाई) कुछ मॉडलों के लिए 500 टोकन प्रति सेकंड से अधिक वितरित करता है।

गति वास्तविक समय अनुप्रयोगों जैसे चैटबॉट, कोड पूर्णता, और लाइव अनुवाद के लिए महत्वपूर्ण है। विलंबता, पहले टोकन का समय, मिलीसेकंड में भी मापा जाता है और मॉडल के आकार और अनुमान स्टैक की दक्षता पर निर्भर करता है। क्वांटाइज़ेशन, मॉडल प्रूनिंग, और सट्टा डिकोडिंग जैसी तकनीकों का उपयोग टोकन थ्रूपुट में सुधार करने के लिए किया जाता है, जिससे अधिक उत्तरदायी और लागत प्रभावी तैनाती सक्षम होती है।

टोकन दक्षता और अनुकूलन

शोधकर्ता और चिकित्सक लगातार टोकन दक्षता में सुधार करने का प्रयास करते हैं। इसमें टोकनाइज़र विकसित करना शामिल है जो पाठ को अधिक प्रभावी ढंग से संपीड़ित करते हैं, समान जानकारी का प्रतिनिधित्व करने के लिए आवश्यक टोकन की संख्या को कम करते हैं। उदाहरण के लिए, कुछ मॉडल मनमाने पाठ को संभालने के लिए बाइट-स्तरीय टोकनाइज़ेशन का उपयोग करते हैं, जबकि अन्य कोड या वैज्ञानिक संकेतन के लिए विशेष शब्दावली नियोजित करते हैं।

प्रॉम्प्ट इंजीनियरिंग भी टोकन दक्षता पर केंद्रित है, क्योंकि छोटे प्रॉम्प्ट लागत और विलंबता को कम करते हैं। निर्देश ट्यूनिंग और फ्यू-शॉट लर्निंग जैसी तकनीकों का उद्देश्य न्यूनतम टोकन उपयोग के साथ वांछित आउटपुट प्राप्त करना है। इसके अतिरिक्त, मॉडल डिस्टिलेशन और क्वांटाइज़ेशन प्रति टोकन कम्प्यूटेशनल लागत को कम कर सकते हैं, जिससे मॉडल महत्वपूर्ण प्रदर्शन हानि के बिना तेज़ और सस्ते चलते हैं।

भविष्य की दिशाएँ

जैसे-जैसे भाषा मॉडल विकसित होते हैं, टोकनाइज़ेशन अनुसंधान का एक सक्रिय क्षेत्र बना रहता है। मल्टीमॉडल मॉडल अब न केवल पाठ बल्कि छवियों, ऑडियो, और वीडियो को भी टोकनाइज़ करते हैं, अलग या एकीकृत टोकनाइज़र का उपयोग करते हुए। उदाहरण के लिए, GPT-4V जैसे मॉडल छवि पैच को टोकन के रूप में संसाधित करते हैं, जबकि ऑडियो मॉडल तरंगों को असतत निरूपण में परिवर्तित करते हैं। टोकन प्रकारों का यह विस्तार अधिक बहुमुखी AI प्रणालियों को सक्षम करता है जो मोडैलिटीज़ में समझ और उत्पादन कर सकते हैं।

गतिशील टोकनाइज़ेशन में भी बढ़ती रुचि है, जहां विभाजन संदर्भ या कार्य के आधार पर अनुकूलित होता है। कुछ शोध बड़े टोकन इकाइयों, जैसे पूरे वाक्यांश या वाक्य, का उपयोग करने की खोज करते हैं ताकि दक्षता और सुसंगतता में सुधार हो सके। हालांकि, इन दृष्टिकोणों को लचीलापन बनाए रखने और नए इनपुट को संभालने में चुनौतियों का सामना करना पड़ता है। टोकनाइज़ेशन तकनीकों का चल रहा विकास भाषा मॉडलों की क्षमताओं और अर्थव्यवस्था को आकार देता रहेगा।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:language-models·tokenization·natural-language-processing·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास