अंग्रेज़ी से अनुवादित

एक तकनीक जो तंत्रिका नेटवर्क के भारों को संग्रहीत और संगणित करने के लिए उपयोग की जाने वाली संख्यात्मक परिशुद्धता को कम करती है, जिससे मॉडल का आकार घटता है और अनुमान की गति बढ़ती है, आमतौर पर सटीकता में छोटे, नियंत्रणीय नुकसान के साथ।

क्वांटाइज़ेशन एक तकनीक है जो एक तंत्रिका नेटवर्क के वज़न और, कुछ मामलों में, उसकी सक्रियताओं को दर्शाने के लिए उपयोग की जाने वाली संख्यात्मक परिशुद्धता को कम करती है, ताकि मॉडल का आकार घटाया जा सके और उसे चलाने के लिए आवश्यक गणना को कम किया जा सके। तंत्रिका नेटवर्क को आमतौर पर 32-बिट या 16-बिट फ्लोटिंग-पॉइंट संख्याओं का उपयोग करके प्रशिक्षित किया जाता है, लेकिन एक प्रशिक्षित मॉडल को वास्तव में अच्छी तरह से दर्शाने की आवश्यकता वाले कई मानों को बहुत कम परिशुद्धता वाले प्रारूपों, जैसे कि 8-बिट या यहां तक कि 4-बिट पूर्णांक, का उपयोग करके अनुमानित किया जा सकता है, जिसमें सटीकता का केवल एक छोटा, अक्सर स्वीकार्य, नुकसान होता है। एक Large language model पर लागू, क्वांटाइज़ेशन मॉडल की मेमोरी फुटप्रिंट को उसकी मूल प्रशिक्षण परिशुद्धता की तुलना में चार गुना या उससे अधिक कम कर सकता है, जिससे मॉडल को उस हार्डवेयर पर चलाना संभव हो जाता है जिसमें अन्यथा आवश्यकता से कहीं कम मेमोरी होती है।

डिजिटल सिग्नल प्रोसेसिंग और कंप्यूटिंग में एक सामान्य तकनीक के रूप में क्वांटाइज़ेशन डीप लर्निंग से बहुत पहले से अस्तित्व में है, लेकिन तंत्रिका नेटवर्क पर, और विशेष रूप से बड़े भाषा मॉडल पर इसका अनुप्रयोग, 2020 के दशक की शुरुआत में व्यापक रूप से प्रचलित हो गया, जब मॉडल का आकार दसियों और सैकड़ों अरबों मापदंडों तक बढ़ गया, जिससे कई उपयोगकर्ताओं के लिए पूर्ण-परिशुद्धता परिनियोजन निषेधात्मक रूप से महंगा हो गया। 2023 में Llama जैसे बड़े ओपन-वेट मॉडल की रिलीज़ ने विशेष रूप से क्वांटाइज़ेशन में समुदाय की रुचि में वृद्धि की, क्योंकि इसने व्यक्तियों को एक एकल उपभोक्ता GPU या यहां तक कि एक लैपटॉप पर दसियों अरबों मापदंडों वाले मॉडल चलाने की अनुमति दी, जो पूर्ण परिशुद्धता पर अन्यथा असंभव था।

यह कैसे काम करता है

क्वांटाइज़ेशन वज़न मानों की एक सतत या उच्च-परिशुद्धता सीमा को निम्न-परिशुद्धता मानों के एक छोटे, असतत सेट पर मैप करता है, आमतौर पर मूल मानों को लक्ष्य प्रारूप की प्रतिनिधित्व योग्य सीमा में स्केल करके और गोल करके। पोस्ट-ट्रेनिंग क्वांटाइज़ेशन इस रूपांतरण को बिना आगे प्रशिक्षण के पहले से प्रशिक्षित मॉडल पर लागू करता है, और यह सबसे सामान्य और सस्ता दृष्टिकोण है; यह प्रत्येक वज़न को स्वतंत्र रूप से परिवर्तित करने जितना सरल हो सकता है या अधिक परिष्कृत हो सकता है, विशिष्ट मॉडल के लिए पेश की गई त्रुटि को कम करने के लिए स्केलिंग कारकों को चुनने के लिए कैलिब्रेशन डेटा का उपयोग करके, और कभी-कभी प्रति परत या प्रति वज़न समूह। क्वांटाइज़ेशन-अवेयर ट्रेनिंग इसके बजाय प्रशिक्षण प्रक्रिया के दौरान कम परिशुद्धता के प्रभावों को शामिल करती है, जो आम तौर पर बहुत कम बिट-चौड़ाई पर अधिक सटीकता बनाए रखती है, लेकिन इसके लिए प्रशिक्षण बुनियादी ढांचे और डेटा तक पहुंच की आवश्यकता होती है जो अधिकांश उपयोगकर्ताओं के पास एक पूर्व-प्रशिक्षित मॉडल के लिए नहीं होती है। 2020 के दशक के मध्य तक सामान्य लक्ष्य प्रारूपों में 8-बिट पूर्णांक क्वांटाइज़ेशन शामिल था, जो आमतौर पर नगण्य गुणवत्ता हानि उत्पन्न करता है, और अधिक आक्रामक 4-बिट और कभी-कभी कम प्रारूप, जो काफी छोटे मॉडल आकार के लिए एक बड़ी, हालांकि अक्सर अभी भी मामूली, गुणवत्ता में कमी का व्यापार करते हैं।

अनुप्रयोग

क्वांटाइज़ेशन प्राथमिक तकनीकों में से एक है, साथ ही Knowledge distillation और Mixture of experts जैसे वास्तुशिल्प दृष्टिकोण, जो प्रचुर GPU मेमोरी वाले डेटा केंद्रों के बाहर बड़े मॉडलों को तैनात करने के लिए व्यावहारिक बनाने के लिए उपयोग किया जाता है। यह भाषा मॉडलों की अधिकांश स्थानीय और Edge AI तैनाती को रेखांकित करता है, जिससे ओपन-वेट मॉडल उपभोक्ता हार्डवेयर, एकल त्वरक कार्ड, या यहां तक कि मोबाइल उपकरणों पर चल सकते हैं। इसका उपयोग बड़े AI प्रयोगशालाओं में उत्पादन सेवा बुनियादी ढांचे में भी किया जाता है ताकि पैमाने पर Inference (AI) की लागत कम हो सके, क्योंकि आधुनिक त्वरक जैसे कि समर्पित कम-परिशुद्धता अंकगणितीय इकाइयों के साथ निर्मित GPU (in AI) हार्डवेयर पर कम-परिशुद्धता गणना आम तौर पर तेज़ और सस्ती होती है। स्थानीय रूप से बड़े मॉडलों को क्वांटाइज़ करने और चलाने के लिए लोकप्रिय ओपन-सोर्स टूलिंग, जिसमें कुशल पूर्णांक और कम-बिट अनुमान के आसपास निर्मित प्रारूप और लाइब्रेरी शामिल हैं, Hugging Face जैसे भंडारों के साथ ओपन-वेट्स पारिस्थितिकी तंत्र के व्यापक हिस्से बन गए।

व्यापार-नापसंद और सीमाएं

क्वांटाइज़ेशन में केंद्रीय व्यापार-नापसंद आकार और गति लाभ बनाम सटीकता हानि के बीच संतुलन है, और यह हानि एक समान नहीं है: कुछ कार्य, विशेष रूप से जिन्हें सटीक अंकगणित या सूक्ष्म तर्क की आवश्यकता होती है, आक्रामक क्वांटाइज़ेशन के तहत खुले-अंत पाठ निर्माण की तुलना में अधिक ध्यान देने योग्य रूप से खराब होते हैं। अत्यंत कम बिट-चौड़ाई, जैसे कि 2-बिट या उससे कम, आम तौर पर अधिकांश उपयोग मामलों के लिए क्षतिपूर्ति के लिए विशेष तकनीकों के बिना एक महत्वपूर्ण और अक्सर अस्वीकार्य गुणवत्ता में गिरावट उत्पन्न करती है। क्योंकि क्वांटाइज़ेशन आमतौर पर प्रशिक्षण के बाद लागू किया जाता है और तुलनात्मक रूप से सस्ता और तेज़ होता है, यह अक्सर पहला और सबसे आसान साधन होता है जिसे चिकित्सक तब अपनाते हैं जब एक मॉडल को मूल पूर्ण-परिशुद्धता संस्करण की तुलना में सख्त मेमोरी या विलंबता बाधाओं के तहत चलाने की आवश्यकता होती है, जिसे अक्सर LoRA-आधारित Fine-tuning तकनीकों जैसे कि QLoRA के साथ संयोजन में उपयोग किया जाता है, जो क्वांटाइज़्ड बेस वज़न को प्रशिक्षित कम-रैंक एडेप्टर के एक छोटे सेट के साथ जोड़ते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:efficiency·model-deployment·inference
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास