अंग्रेज़ी से अनुवादित

GPTQ एक पोस्ट-ट्रेनिंग क्वांटाइज़ेशन विधि है जो बड़े भाषा मॉडलों को संपीड़ित करने के लिए उपयोग की जाती है, जिससे मेमोरी उपयोग कम होता है और न्यूनतम सटीकता हानि के साथ अनुमान प्रक्रिया तेज होती है। यह मॉडल वेट्स को 4-बिट पूर्णांक जैसे निम्न-बिट प्रतिनिधित्व में परिवर्तित करता है।

GPTQ एक पोस्ट-ट्रेनिंग क्वांटिज़ेशन तकनीक है जिसे बड़े भाषा मॉडल (LLMs) के वज़न की संख्यात्मक परिशुद्धता को कम करके उन्हें संपीड़ित करने के लिए डिज़ाइन किया गया है। 2022 में एलियास फ्रांटर, सालेह अश्कबूस, टॉर्स्टन होफ्लर और डैन अलिस्तार सहित शोधकर्ताओं द्वारा विकसित, यह अरबों पैरामीटर वाले मॉडल को सीमित मेमोरी वाले उपभोक्ता हार्डवेयर पर चलाने में सक्षम बनाता है। यह विधि ओपन-सोर्स AI पारिस्थितिकी तंत्रों में LLaMA और Mistral जैसे मॉडलों को स्थानीय उपकरणों पर तैनात करने के लिए व्यापक रूप से अपनाई जाती है।

क्वांटिज़ेशन-अवेयर ट्रेनिंग के विपरीत, GPTQ को किसी पुनर्प्रशिक्षण या मूल प्रशिक्षण डेटासेट तक पहुंच की आवश्यकता नहीं होती है। यह पोस्ट-ट्रेनिंग संचालित होता है, कम-परिशुद्धता प्रतिनिधित्व द्वारा उत्पन्न त्रुटि को कम करने के लिए वज़न को समायोजित करने हेतु एक छोटे कैलिब्रेशन डेटासेट का उपयोग करता है। यह इसे बड़े मॉडलों के लिए व्यावहारिक बनाता है जहां पूर्ण पुनर्प्रशिक्षण कम्प्यूटेशनल रूप से निषेधात्मक है। GPTQ आमतौर पर वज़न को 4-बिट पूर्णांकों में संपीड़ित करता है, जिससे मेमोरी उपयोग में चार गुना कमी आती है जबकि मॉडल की अधिकांश मूल भविष्यवाणी क्षमता बरकरार रहती है।

तकनीकी दृष्टिकोण

GPTQ अनुमानित द्वितीय-क्रम जानकारी पर आधारित है, विशेष रूप से हानि फ़ंक्शन के हेसियन मैट्रिक्स पर, यह निर्धारित करने के लिए कि कौन से वज़न परिवर्तन आउटपुट पर सबसे कम प्रभाव डालते हैं। यह परतों को क्रमिक रूप से संसाधित करता है, वज़न मैट्रिक्स के स्तंभों को क्वांटाइज़ करता है जबकि क्वांटिज़ेशन त्रुटि की भरपाई के लिए शेष वज़न को अद्यतन करता है। ऑप्टिमल ब्रेन क्वांटिज़ेशन ढांचे से व्युत्पन्न यह पुनरावृत्त दृष्टिकोण, क्वांटाइज़ करने के लिए वज़न का एक लालची चयन करता है और संचयी त्रुटि को कम करने के लिए एक बंद-रूप अद्यतन लागू करता है।

यह विधि विभिन्न बिट-चौड़ाई का समर्थन करती है, जिसमें 3-बिट और 2-बिट शामिल हैं, हालांकि 4-बिट संपीड़न और सटीकता के संतुलन के कारण सबसे आम है। GPTQ समूह-वार क्वांटिज़ेशन को भी शामिल करता है, जहां वज़न को समूहों में विभाजित किया जाता है और प्रत्येक समूह का अपना स्केलिंग कारक होता है, जो आउटलायर-भारी वितरणों के लिए सटीकता में सुधार करता है। कार्यान्वयन GPU त्वरण के लिए अनुकूलित है, अनुमान के दौरान कुशल मैट्रिक्स संचालन के लिए CUDA कर्नेल का लाभ उठाता है।

प्रदर्शन और सटीकता

अनुभवजन्य मूल्यांकन दिखाते हैं कि GPTQ OPT-175B जैसे मॉडलों को 4-बिट परिशुद्धता में संपीड़ित कर सकता है, जिसमें भाषा मॉडलिंग पर्प्लेक्सिटी और डाउनस्ट्रीम कार्यों जैसे मानक बेंचमार्क पर नगण्य सटीकता गिरावट होती है। उदाहरण के लिए, 4-बिट में संपीड़ित एक 175-अरब-पैरामीटर मॉडल को लगभग 87.5 GB मेमोरी की आवश्यकता होती है, जो 32-बिट फ्लोट में 350 GB से कम है, जिससे एकल उच्च-स्तरीय GPU पर तैनाती संभव होती है। कुछ मामलों में, 3-बिट क्वांटिज़ेशन थोड़ी बड़ी त्रुटियां पेश करता है लेकिन फिर भी कई अनुप्रयोगों के लिए उपयोगी रहता है।

सटीकता हानि मॉडल वास्तुकला और कैलिब्रेशन डेटा आकार के अनुसार भिन्न होती है। प्रशिक्षण वितरण से कुछ सौ नमूनों का उपयोग आमतौर पर पर्याप्त होता है। यह विधि विशेष रूप से ट्रांसफॉर्मर-आधारित मॉडलों के लिए प्रभावी है, जो आधुनिक बड़े भाषा मॉडल पर हावी हैं। निकटतम-पूर्णांक क्वांटिज़ेशन जैसी पुरानी तकनीकों की तुलना में, GPTQ लगातार त्रुटि को कम करता है, विशेष रूप से अत्यधिक वज़न वितरण वाले मॉडलों के लिए।

अपनाना और पारिस्थितिकी तंत्र

GPTQ ओपन-सोर्स मशीन लर्निंग समुदाय में एक मानक उपकरण बन गया है। यह हगिंग फेस ट्रांसफॉर्मर्स और AutoGPTQ पैकेज जैसी लोकप्रिय लाइब्रेरीज़ में एकीकृत है, जो मॉडलों को क्वांटाइज़ करने और लोड करने के लिए एक उपयोगकर्ता-अनुकूल इंटरफ़ेस प्रदान करता है। हगिंग फेस हब जैसे प्लेटफार्मों पर कई पूर्व-क्वांटाइज़्ड मॉडल चेकपॉइंट उपलब्ध हैं, जिससे उपयोगकर्ता स्वयं क्वांटिज़ेशन किए बिना लोकप्रिय मॉडलों के 4-बिट संस्करण डाउनलोड कर सकते हैं।

यह विधि प्रूनिंग और ज्ञान आसवन जैसी अन्य संपीड़न तकनीकों की पूरक है, और अक्सर CPU अनुमान के लिए llama.cpp परियोजना में रनटाइम अनुकूलन के साथ संयुक्त होती है। इसकी लोकप्रियता इसकी सरलता और प्रभावशीलता से उपजी है, जो सीमित कम्प्यूटेशनल संसाधनों वाले शौकीनों और शोधकर्ताओं के लिए बड़े मॉडलों को सुलभ बनाती है। AWS और Google Cloud सहित क्लाउड सेवाएं प्रदान करने वाली कंपनियों ने भी GPTQ-क्वांटाइज़्ड मॉडलों को अपने जनरेटिव AI प्रस्तावों में एकीकृत किया है।

सीमाएं और विकल्प

GPTQ की कुछ सीमाएं हैं। कैलिब्रेशन प्रक्रिया के लिए एक प्रतिनिधि डेटासेट की आवश्यकता होती है, और खराब कैलिब्रेशन सटीकता हानि का कारण बन सकता है। यह मुख्य रूप से वज़न क्वांटिज़ेशन को लक्षित करता है, सक्रियणों को उच्च परिशुद्धता में छोड़ देता है, जो बहुत लंबे अनुक्रमों के लिए मेमोरी बचत को सीमित करता है। इसके अतिरिक्त, यह विधि 1-बिट जैसी अत्यंत कम बिट-चौड़ाई के लिए कम प्रभावी है, जहां अधिक आक्रामक तकनीकों की आवश्यकता होती है।

वैकल्पिक पोस्ट-ट्रेनिंग क्वांटिज़ेशन विधियों में AWQ (एक्टिवेशन-अवेयर वेट क्वांटिज़ेशन) शामिल है, जो सक्रियण परिमाण के आधार पर महत्वपूर्ण वज़न की रक्षा करता है, और llama.cpp में उपयोग किया जाने वाला GGUF क्वांटिज़ेशन, जो विभिन्न बिट-चौड़ाई विकल्प प्रदान करता है। ये विधियां अक्सर तुलनीय परिणाम उत्पन्न करती हैं, और चुनाव लक्ष्य हार्डवेयर और तैनाती परिदृश्य पर निर्भर करता है। शोध क्वांटिज़ेशन दक्षता में सुधार जारी रखता है, नए दृष्टिकोण मिश्रित-परिशुद्धता और अनुकूली योजनाओं की खोज कर रहे हैं।

प्रभाव और भविष्य की दिशाएं

GPTQ ने एज डिवाइसों और व्यक्तिगत कंप्यूटरों पर बड़े भाषा मॉडलों को तैनात करने की बाधा को काफी कम कर दिया है। इसने मॉडल संपीड़न में बाद के कार्यों को प्रभावित किया है और अकादमिक साहित्य में अक्सर उद्धृत किया जाता है। भविष्य के विकास वज़न और सक्रियणों के संयुक्त क्वांटिज़ेशन, AMD और Intel प्रोसेसरों के लिए हार्डवेयर-विशिष्ट अनुकूलन, और मानक ट्रांसफॉर्मर डिज़ाइन से परे उभरती तंत्रिका नेटवर्क वास्तुकलाओं के साथ एकीकरण पर केंद्रित हो सकते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:model-compression·quantization·large-language-models·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 5 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास