तंत्रिका नेटवर्क के संदर्भ में क्वांटीकरण (Quantization) उस प्रक्रिया को संदर्भित करता है जिसमें मॉडल में उपयोग किए जाने वाले पैरामीटर (वज़न) और मध्यवर्ती मानों (एक्टिवेशन) की संख्यात्मक परिशुद्धता को कम किया जाता है। मानक गहन शिक्षण में, मॉडल आमतौर पर 32-बिट फ्लोटिंग-पॉइंट (FP32) संख्याओं का उपयोग करके प्रशिक्षित किए जाते हैं, जो उच्च परिशुद्धता प्रदान करते हैं लेकिन महत्वपूर्ण मेमोरी और कंप्यूट संसाधनों की खपत करते हैं। क्वांटीकरण इन मानों को निम्न-परिशुद्धता प्रारूपों, जैसे 8-बिट पूर्णांक (INT8) या 4-बिट पूर्णांक (INT4) में मैप करता है, जिससे मॉडल का आकार घटता है और पूर्णांक अंकगणित का समर्थन करने वाले हार्डवेयर पर अनुमान (inference) तेज होता है। यह तकनीक बड़े पैमाने पर Artificial intelligence प्रणालियों को तैनात करने के लिए आवश्यक बन गई है, विशेष रूप से एज डिवाइसों और डेटा केंद्रों में जहां दक्षता सर्वोपरि है।
क्वांटीकरण की अवधारणा डिजिटल सिग्नल प्रोसेसिंग से उत्पन्न हुई है, जहां इसे इनपुट मानों को एक बड़े सेट (अक्सर सतत) से एक छोटे, गणनीय सेट में मैप करने के रूप में परिभाषित किया जाता है। तंत्रिका नेटवर्क में, यह मैपिंग क्वांटीकरण त्रुटि (quantization error) का परिचय देती है, जिसे क्वांटीकरण शोर भी कहा जाता है, जो सावधानीपूर्वक प्रबंधित न किए जाने पर मॉडल की सटीकता को कम कर सकता है। हालांकि, आधुनिक क्वांटीकरण विधियों का उद्देश्य अंशांकन (calibration), फाइन-ट्यूनिंग, या उन्नत एल्गोरिदम के माध्यम से इस त्रुटि को कम करना है, जिससे मॉडल न्यूनतम प्रदर्शन हानि के साथ कम परिशुद्धता पर कार्य कर सकें।
ऐतिहासिक पृष्ठभूमि
तंत्रिका नेटवर्क में क्वांटीकरण का अनुप्रयोग Machine learning अनुसंधान के शुरुआती दिनों से जुड़ा है, जब हार्डवेयर बाधाओं ने निम्न-परिशुद्धता अंकगणित के उपयोग को प्रेरित किया। 1980 और 1990 के दशक में, शोधकर्ताओं ने कम्प्यूटेशनल जटिलता को कम करने के लिए बाइनरी और टर्नरी वज़न नेटवर्क की खोज की, लेकिन ये शुरुआती प्रयास उपयुक्त हार्डवेयर की कमी और मॉडलों के मामूली पैमाने के कारण काफी हद तक सीमित थे। 2010 के दशक में Deep learning का पुनरुत्थान, जो ग्राफिक्स प्रोसेसिंग यूनिट्स और बड़े डेटासेट द्वारा संचालित था, ने शुरू में उच्च-परिशुद्धता प्रशिक्षण का पक्ष लिया। हालांकि, जैसे-जैसे मॉडल आकार में बढ़े और मोबाइल फोनों और एम्बेडेड सिस्टमों पर तैनात होने लगे, क्वांटीकरण एक महत्वपूर्ण अनुकूलन के रूप में फिर से उभरा।
2015 में "BinaryConnect" के प्रकाशन के साथ एक महत्वपूर्ण मील का पत्थर हुआ, जिसने प्रदर्शित किया कि बाइनरी वज़न छोटे डेटासेट पर प्रतिस्पर्धी सटीकता प्राप्त कर सकते हैं। इसके बाद टर्नरी वज़न नेटवर्क और बाद में पोस्ट-ट्रेनिंग क्वांटीकरण (PTQ) विधियों पर काम हुआ, जिन्हें पुनः प्रशिक्षण की आवश्यकता नहीं होती। 2010 के दशक के अंत तक, TensorFlow और PyTorch जैसे फ्रेमवर्क ने क्वांटीकरण उपकरणों को एकीकृत कर दिया, जिससे यह तकनीक चिकित्सकों के लिए सुलभ हो गई। 2020 के दशक में बड़े भाषा मॉडल का उदय, जैसे कि OpenAI और Anthropic द्वारा विकसित, ने क्वांटीकरण में रुचि को और तेज कर दिया, क्योंकि इन मॉडलों की मेमोरी फुटप्रिंट अक्सर सैकड़ों गीगाबाइट से अधिक होती है।
गणितीय आधार
तंत्रिका नेटवर्क में क्वांटीकरण सिग्नल प्रोसेसिंग के समान मौलिक सिद्धांतों का पालन करता है। एक क्वांटाइज़र इनपुट मान \(x\) को एक परिमित सेट से आउटपुट मान \(Q(x)\) में मैप करता है। चरण आकार \(\Delta\) के साथ एक समान क्वांटाइज़र के लिए, मैपिंग अक्सर इस प्रकार व्यक्त की जाती है:
\[ Q(x) = \Delta \cdot \left\lfloor \frac{x}{\Delta} + \frac{1}{2} \right\rfloor \]
जहां \(\lfloor \cdot \rfloor\) फ्लोर फ़ंक्शन को दर्शाता है। यह एक मिड-ट्रेड क्वांटाइज़र है, जो \(\Delta\) के निकटतम पूर्णांक गुणक तक पूर्णांकित करता है। क्वांटीकरण त्रुटि इनपुट और आउटपुट के बीच का अंतर है, और छोटे चरण आकारों के लिए, माध्य वर्ग त्रुटि लगभग \(\Delta^2/12\) होती है। क्वांटाइज़र में एक बिट जोड़ने से \(\Delta\) आधा हो जाता है, जिससे शोर शक्ति चार के कारक से कम हो जाती है, जो लगभग -6 dB के बराबर है।
तंत्रिका नेटवर्क में, क्वांटीकरण आमतौर पर टेंसरों पर लागू किया जाता है, जो बहु-आयामी सरणियाँ हैं। इस प्रक्रिया को दो चरणों में विघटित किया जा सकता है: अग्रेषित क्वांटीकरण, जो प्रत्येक मान को एक पूर्णांक सूचकांक में मैप करता है, और पुनर्निर्माण, जो सूचकांक को एक प्रतिनिधि मान में वापस मैप करता है। उदाहरण के लिए, INT8 क्वांटीकरण में, एक फ्लोटिंग-पॉइंट मान \(x\) को एक पूर्णांक \(q\) उत्पन्न करने के लिए कारक \(s\) और शून्य-बिंदु \(z\) द्वारा स्केल किया जाता है:
\[ q = \text{round}(\frac{x}{s} + z) \]
और डीक्वांटाइज़्ड मान \(\hat{x} = s(q - z)\) है। स्केलिंग कारक \(s\) मानों की सीमा के आधार पर चुना जाता है, जो अक्सर सत्यापन डेटासेट पर अंशांकन द्वारा निर्धारित किया जाता है।
क्वांटीकरण के प्रकार
क्वांटीकरण विधियों को मोटे तौर पर दो प्रकारों में वर्गीकृत किया जा सकता है: पोस्ट-ट्रेनिंग क्वांटीकरण (PTQ) और क्वांटीकरण-जागरूक प्रशिक्षण (QAT)। PTQ एक मॉडल के प्रशिक्षित होने के बाद लागू किया जाता है, जिसके लिए अतिरिक्त प्रशिक्षण डेटा की आवश्यकता नहीं होती। यह सरल और तेज़ है, लेकिन विशेष रूप से बहुत कम परिशुद्धता के लिए सटीकता में गिरावट ला सकता है। दूसरी ओर, QAT प्रशिक्षण के दौरान क्वांटीकरण का अनुकरण करता है, जिससे मॉडल कम परिशुद्धता के अनुकूल हो सकता है। यह अक्सर बेहतर सटीकता देता है लेकिन अधिक कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।
एक और अंतर समान (uniform) और गैर-समान (non-uniform) क्वांटीकरण के बीच है। समान क्वांटीकरण समान रूप से दूरी वाले स्तरों का उपयोग करता है, जो हार्डवेयर पर लागू करना सरल है। गैर-समान क्वांटीकरण, जैसे लॉगरिदमिक या k-मीन्स-आधारित क्लस्टरिंग, उच्च मान घनत्व वाले क्षेत्रों में अधिक स्तर आवंटित करता है, जो त्रुटि को कम कर सकता है लेकिन हार्डवेयर समर्थन को जटिल बनाता है। इसके अतिरिक्त, क्वांटीकरण केवल वज़न, केवल एक्टिवेशन, या दोनों पर लागू किया जा सकता है। केवल-वज़न क्वांटीकरण मॉडल संपीड़न के लिए सामान्य है, जबकि पूर्ण पूर्णांक अनुमान के लिए एक्टिवेशन क्वांटीकरण आवश्यक है।
हार्डवेयर समर्थन और तैनाती
क्वांटीकरण विशेष रूप से उस हार्डवेयर पर प्रभावी है जो निम्न-परिशुद्धता अंकगणित का समर्थन करता है। Intel और AMD ने अपने CPUs में INT8 निर्देशों को शामिल किया है, जबकि NVIDIA GPUs (हालांकि प्रदान की गई सूची में नहीं हैं, व्यापक रूप से उपयोग किए जाते हैं) और AWS Trainium और Groq जैसे विशेष त्वरक क्वांटाइज़्ड अनुमान के लिए अनुकूलित हैं। Qualcomm और Arm Holdings के मोबाइल और एम्बेडेड प्रोसेसर भी कम मेमोरी बैंडविड्थ और बिजली खपत से लाभान्वित होते हैं। उदाहरण के लिए, Apple का न्यूरल इंजन और Samsung Electronics के Exynos चिप्स डिवाइस पर AI कार्यों को कुशलतापूर्वक चलाने के लिए क्वांटीकरण का लाभ उठाते हैं।
क्लाउड वातावरण में, Amazon Web Services, Google Cloud, और Microsoft Azure ऐसी सेवाएँ प्रदान करते हैं जो विलंबता और लागत को कम करने के लिए क्वांटाइज़्ड मॉडल का उपयोग करती हैं। TSMC और Broadcom ऐसे चिप्स का निर्माण करते हैं जो मिश्रित-परिशुद्धता अंकगणित का समर्थन करते हैं, जिससे लचीली तैनाती संभव होती है। क्वांटीकरण की प्रवृत्ति ने Transformer (architecture)-आधारित मॉडलों के डिज़ाइन को भी प्रभावित किया है, जहां गुणवत्ता में महत्वपूर्ण हानि के बिना मेमोरी उपयोग को कम करने के लिए ध्यान (attention) परतों को क्वांटाइज़ किया जा सकता है।
बड़े भाषा मॉडलों पर प्रभाव
बड़े भाषा मॉडल (LLMs) क्वांटीकरण अनुसंधान का प्राथमिक चालक बन गए हैं। GPT-3 जैसे मॉडल, जिनमें 175 बिलियन पैरामीटर हैं, FP32 में सैकड़ों गीगाबाइट मेमोरी की आवश्यकता होती है, जिससे तैनाती अव्यावहारिक हो जाती है। 8-बिट या 4-बिट में क्वांटीकरण मेमोरी फुटप्रिंट को 4 से 8 गुना कम कर सकता है, जिससे ये मॉडल उपभोक्ता हार्डवेयर पर चल सकते हैं या डेटा केंद्रों में कुशलतापूर्वक सेवा दी जा सकती हैं। GPTQ और AWQ जैसी तकनीकें LLMs को 4-बिट में क्वांटाइज़ करने के लिए विकसित की गई हैं, जबकि उनकी अधिकांश क्षमताओं को संरक्षित रखा जाता है।
हालांकि, LLMs एक्टिवेशन मानों में आउटलायर्स के कारण अद्वितीय चुनौतियाँ प्रस्तुत करते हैं, जो क्वांटीकरण सीमाओं को विकृत कर सकते हैं। शोधकर्ताओं ने मिश्रित-परिशुद्धता योजनाएँ प्रस्तावित की हैं जो महत्वपूर्ण परतों को उच्च परिशुद्धता में रखती हैं, और गतिशील क्वांटीकरण विधियाँ जो इनपुट वितरणों के अनुकूल होती हैं। Google DeepMind और meta (सूची में नहीं) जैसी कंपनियों ने LLMs के लिए क्वांटीकरण पर व्यापक अध्ययन प्रकाशित किए हैं, और Hugging Face के Transformers लाइब्रेरी (सूची में नहीं) जैसे ओपन-सोर्स उपकरण क्वांटीकरण समर्थन को एकीकृत करते हैं।
चुनौतियाँ और भविष्य की दिशाएँ
क्वांटीकरण में प्राथमिक चुनौती दक्षता और सटीकता के बीच संतुलन बनाना है। आक्रामक क्वांटीकरण महत्वपूर्ण प्रदर्शन गिरावट का कारण बन सकता है, विशेष रूप से उन कार्यों के लिए जिनमें सूक्ष्म तर्क की आवश्यकता होती है, जैसे Generative AI और Machine learning अनुप्रयोग। एन्ट्रॉपी-आधारित या पर्सेंटाइल-आधारित सीमा चयन जैसी अंशांकन विधियाँ इसे कम करने में मदद करती हैं, लेकिन उन्हें सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है। एक और मुद्दा बहुत कम परिशुद्धता (जैसे 2-बिट) के लिए मानकीकृत हार्डवेयर समर्थन की कमी है, हालांकि SambaNova और Graphcore जैसी उभरती चिप्स इस स्थान की खोज कर रही हैं।
भविष्य के अनुसंधान के अनुकूली क्वांटीकरण पर ध्यान केंद्रित करने की संभावना है, जहां परत की संवेदनशीलता के आधार पर परिशुद्धता को गतिशील रूप से समायोजित किया जाता है, और Model Pruning और अन्य संपीड़न तकनीकों के साथ क्वांटीकरण के संयुक्त अनुकूलन पर। इसके अतिरिक्त, जैसे-जैसे Neural network आर्किटेक्चर विकसित होते हैं, क्वांटीकरण विधियों को Transformer (architecture) मॉडलों में ध्यान तंत्र जैसे नए संचालनों के अनुकूल होना चाहिए। अंतिम लक्ष्य लगभग-हानिरहित संपीड़न प्राप्त करना है, जिससे AI मॉडल Waymo सेल्फ-ड्राइविंग कारों से लेकर Intuitive Surgical चिकित्सा रोबोटों तक किसी भी डिवाइस पर चल सकें।
निष्कर्ष
क्वांटीकरण कुशल AI तैनाती का आधार बन गया है, जिससे उत्पादन वातावरण में गहन शिक्षण का व्यापक उपयोग संभव हुआ है। संख्यात्मक परिशुद्धता को कम करके, यह मेमोरी आवश्यकताओं को कम करता है, अनुमान को तेज करता है, और ऊर्जा खपत को काटता है, जबकि स्वीकार्य सटीकता बनाए रखता है। जैसे-जैसे हार्डवेयर विकसित होता है और मॉडल बड़े होते जाते हैं, क्वांटीकरण AI टूलकिट में एक महत्वपूर्ण उपकरण बना रहेगा, जो सैद्धांतिक क्षमताओं और व्यावहारिक तैनाती के बीच की खाई को पाटता है।