अंग्रेज़ी से अनुवादित

AWQ (एक्टिवेशन-अवेयर वेट क्वांटाइज़ेशन) बड़े भाषा मॉडलों के लिए एक मॉडल संपीड़न तकनीक है जो एक्टिवेशन आँकड़ों के आधार पर वेट्स को क्वांटाइज़ करके मेमोरी और कंप्यूट आवश्यकताओं को कम करती है, जिससे एज डिवाइसों पर कुशल अनुमान संभव होता है।

AWQ (एक्टिवेशन-अवेयर वेट क्वांटाइज़ेशन) एक मॉडल संपीड़न विधि है जो बड़े भाषा मॉडल (LLMs) के लिए डिज़ाइन की गई है, जो पूर्ण मॉडल पुनर्प्रशिक्षण की आवश्यकता के बिना अनुमान की मेमोरी फुटप्रिंट और कम्प्यूटेशनल लागत को कम करती है। 2023 में MIT CSAIL और Carnegie Mellon University के शोधकर्ताओं द्वारा विकसित, AWQ तंत्रिका नेटवर्क में सबसे महत्वपूर्ण भारों की पहचान करता है, जो अकेले भार परिमाण के बजाय एक्टिवेशन आँकड़ों का विश्लेषण करता है, और उन महत्वपूर्ण भारों को उच्च परिशुद्धता पर संरक्षित करता है जबकि बाकी को कम बिट चौड़ाई में क्वांटाइज़ करता है। यह दृष्टिकोण LLMs को उपभोक्ता-ग्रेड हार्डवेयर, मोबाइल उपकरणों और एज कंप्यूटिंग प्लेटफार्मों पर न्यूनतम गुणवत्ता हानि के साथ चलाने की अनुमति देता है।

AWQ इस सिद्धांत पर कार्य करता है कि एक प्रशिक्षित Neural network में सभी भार मॉडल के प्रदर्शन में समान रूप से योगदान नहीं करते हैं। प्रतिनिधि इनपुट डेटा द्वारा कौन से भार सक्रिय होते हैं, यह देखकर, विधि एक प्रति-चैनल स्केलिंग कारक निर्धारित करती है जो महत्वपूर्ण भारों को क्वांटाइज़ेशन त्रुटि से बचाती है। पिछली क्वांटाइज़ेशन तकनीकों के विपरीत जो व्यापक खोज या ग्रेडिएंट-आधारित अनुकूलन पर निर्भर करती हैं, AWQ एक सरल फिर भी प्रभावी डेटा-मुक्त या कैलिब्रेशन-डेटा-संचालित प्रक्रिया का उपयोग करता है, जिससे यह कम्प्यूटेशनल रूप से कुशल और मौजूदा अनुमान पाइपलाइनों में एकीकृत करने में आसान हो जाता है।

तकनीकी आधार

AWQ का मुख्य नवाचार भार क्वांटाइज़ेशन का मार्गदर्शन करने के लिए एक्टिवेशन आँकड़ों का उपयोग है। पारंपरिक पोस्ट-ट्रेनिंग क्वांटाइज़ेशन विधियाँ, जैसे कि राउंड-टू-नियरेस्ट (RTN), सभी भारों को समान रूप से मानती हैं, जो अक्सर कम बिट चौड़ाई पर महत्वपूर्ण सटीकता हानि की ओर ले जाती हैं। इसके बजाय AWQ एक छोटे कैलिब्रेशन डेटासेट, आमतौर पर कुछ सौ नमूनों, में प्रत्येक भार चैनल के लिए एक्टिवेशन परिमाण की गणना करता है, और एक स्केलिंग कारक प्राप्त करता है जो महत्वपूर्ण चैनलों के महत्व को बढ़ाता है। यह स्केलिंग क्वांटाइज़ेशन से पहले लागू की जाती है, और व्युत्क्रम स्केलिंग डीक्वांटाइज़ेशन के बाद लागू की जाती है, यह सुनिश्चित करते हुए कि मॉडल का आउटपुट वितरण स्थिर रहता है।

यह विधि विभिन्न बिट चौड़ाई का समर्थन करती है, जिसमें 4-बिट और 3-बिट क्वांटाइज़ेशन शामिल हैं, और इसे प्रूनिंग और नॉलेज डिस्टिलेशन जैसी अन्य संपीड़न तकनीकों के साथ जोड़ा जा सकता है। LLaMA और OPT जैसे मॉडलों पर बेंचमार्क परीक्षणों में, AWQ ने 4-बिट परिशुद्धता पर लगभग-नुकसान-मुक्त प्रदर्शन प्राप्त किया, जिसमें पूर्ण-परिशुद्धता बेसलाइन की तुलना में पर्प्लेक्सिटी में 0.1 से कम की वृद्धि हुई। 3-बिट परिशुद्धता पर, हानि अधिक स्पष्ट थी लेकिन फिर भी अन्य अत्याधुनिक तरीकों के साथ प्रतिस्पर्धी थी।

विकास और रिलीज़

AWQ को जी लिन, जियामिंग टैंग, हाओटियन टैंग, शांग यांग, वेई-मिंग चेन, वेई-चेन वांग, गुआंगक्सुआन ज़ियाओ, ज़िंग्यू डांग, चुआंग गान और सोंग हान द्वारा "AWQ: एक्टिवेशन-अवेयर वेट क्वांटाइज़ेशन फॉर एलएलएम कंप्रेशन एंड एक्सेलेरेशन" शीर्षक वाले एक पेपर में पेश किया गया था, जिसे 2024 कॉन्फ्रेंस ऑन मशीन लर्निंग एंड सिस्टम्स (MLSys) में प्रस्तुत किया गया था। शोध MIT CSAIL और Carnegie Mellon University में आयोजित किया गया था, जिसमें Samsung Research और अन्य संस्थानों का योगदान था। लेखकों ने एक ओपन-सोर्स कार्यान्वयन जारी किया, जिसमें awq नामक एक लाइब्रेरी और vLLM और हगिंग फेस ट्रांसफॉर्मर्स जैसे लोकप्रिय अनुमान फ्रेमवर्क के साथ एकीकरण शामिल था।

यह परियोजना Machine learning समुदाय में तेजी से लोकप्रिय हुई, जिसमें GitHub रिपॉजिटरी ने महीनों के भीतर हजारों स्टार्स प्राप्त किए। इस विधि को कई हार्डवेयर और सॉफ्टवेयर विक्रेताओं द्वारा अपनाया गया, जिनमें AMD, Intel और Qualcomm शामिल हैं, जिन्होंने एज और डेटा सेंटर तैनाती के लिए अपने मॉडल अनुकूलन टूलकिट में AWQ को शामिल किया।

अनुप्रयोग और प्रभाव

AWQ का व्यापक रूप से संसाधन-सीमित उपकरणों पर LLMs तैनात करने के लिए उपयोग किया गया है। उदाहरण के लिए, Apple और Samsung Electronics ने ऑन-डिवाइस Generative AI अनुप्रयोगों, जैसे कि टेक्स्ट सारांशण और कोड पूर्णता, के लिए AWQ का पता लगाया है, जहां मेमोरी और बैटरी बाधाएं महत्वपूर्ण हैं। क्लाउड प्रदाताओं, जिनमें Amazon Web Services और Google Cloud शामिल हैं, ने अनुमान लागत कम करने और थ्रूपुट बढ़ाने के लिए अपने मॉडल सर्विंग प्लेटफार्मों में AWQ को एकीकृत किया है।

यह तकनीक उन मॉडलों के निष्पादन को भी सक्षम बनाती है जिन्हें अन्यथा उच्च-अंत GPU की आवश्यकता होती है, उपभोक्ता हार्डवेयर पर। AWQ के साथ 4-बिट परिशुद्धता पर क्वांटाइज़ किया गया 7-बिलियन-पैरामीटर मॉडल 8 जीबी रैम वाले लैपटॉप पर चल सकता है, जिससे Large language model अनुसंधान और प्रयोग व्यक्तिगत डेवलपर्स और छोटे संगठनों के लिए अधिक सुलभ हो जाता है।

अन्य विधियों के साथ तुलना

AWQ की तुलना अक्सर GPTQ (जीपीटी क्वांटाइज़ेशन), एक और लोकप्रिय पोस्ट-ट्रेनिंग क्वांटाइज़ेशन विधि, से की जाती है। जबकि GPTQ क्वांटाइज़ेशन त्रुटि को कम करने के लिए दूसरे क्रम की जानकारी का उपयोग करता है, AWQ एक्टिवेशन आँकड़ों पर निर्भर करता है, जो गणना करने के लिए सस्ते होते हैं और कम कैलिब्रेशन डेटा की आवश्यकता होती है। व्यवहार में, AWQ लागू करने के लिए तेज़ और कैलिब्रेशन डेटासेट में भिन्नताओं के प्रति अधिक मजबूत होता है, जबकि GPTQ कभी-कभी कुछ मॉडलों पर थोड़ी कम पर्प्लेक्सिटी प्राप्त करता है। दोनों विधियाँ पूरक हैं और एक साथ उपयोग की जा सकती हैं, AWQ GPTQ से पहले एक प्रीप्रोसेसिंग चरण के रूप में कार्य करता है।

एक और संबंधित दृष्टिकोण स्मूथक्वांट है, जो क्वांटाइज़ेशन कठिनाई को एक्टिवेशन से भार में स्थानांतरित करता है। AWQ विशेष रूप से भार क्वांटाइज़ेशन पर ध्यान केंद्रित करके भिन्न होता है, जिससे इसे लागू करना सरल हो जाता है और मिश्रित-परिशुद्धता एक्टिवेशन के लिए समर्थन की कमी वाले हार्डवेयर त्वरक के लिए अधिक उपयुक्त होता है।

भविष्य की दिशाएँ

जैसे-जैसे LLMs आकार में बढ़ते रहते हैं, कुशल अनुमान एक महत्वपूर्ण चुनौती बनी रहती है। AWQ के सिद्धांतों को अन्य मोडैलिटी, जैसे कि विज़न-लैंग्वेज मॉडल और डिफ्यूजन मॉडल, तक बढ़ाया गया है, जिसके आशाजनक परिणाम सामने आए हैं। शोधकर्ता अनुकूली क्वांटाइज़ेशन योजनाओं की भी खोज कर रहे हैं जो इनपुट जटिलता के आधार पर बिट चौड़ाई को गतिशील रूप से समायोजित करते हैं, साथ ही हार्डवेयर-जागरूक कार्यान्वयन जो Arm Holdings और TSMC-निर्मित चिप्स में विशेष निर्देशों का लाभ उठाते हैं।

AWQ की ओपन-सोर्स प्रकृति ने उपकरणों और बेंचमार्क का एक जीवंत पारिस्थितिकी तंत्र को बढ़ावा दिया है, और यह अब कई मॉडल अनुकूलन वर्कफ़्लो में एक मानक घटक है। इसकी सफलता ने प्रूनिंग, डिस्टिलेशन और आर्किटेक्चर खोज के लिए एक्टिवेशन-जागरूक तकनीकों में आगे के शोध को प्रेरित किया है, जो कुशल Deep learning अनुमान में एक मौलिक योगदान के रूप में अपनी जगह को मजबूत करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:model-compression·quantization·large-language-models·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 5 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास