अनुमानात्मक डिकोडिंग एक इन्फ्रेंस-टाइम अनुकूलन तकनीक है जो बड़े भाषा मॉडल के लिए स्वप्रतिगामी पाठ निर्माण को तेज करती है, जिसमें एक छोटा, तेज़ ड्राफ्ट मॉडल मुख्य मॉडल से आगे कई उम्मीदवार टोकन प्रस्तावित करता है, जिन्हें मुख्य मॉडल फिर एक समानांतर पास में सत्यापित या अस्वीकार करता है। चूंकि सत्यापन एक साथ कई टोकन की जांच कर सकता है, यह तकनीक मानक डिकोडिंग के समान आउटपुट वितरण उत्पन्न कर सकती है, जबकि बड़े मॉडल के माध्यम से कम अनुक्रमिक पास की आवश्यकता होती है, जिससे विलंबता कम होती है और मॉडल जो उत्पन्न करता उसे बदले बिना।
यह दृष्टिकोण 2022 और 2023 में Google और DeepMind के शोध में वर्णित किया गया था और 2024 तक प्रमुख इन्फ्रेंस सिस्टम में अपनाया गया, जो उत्पादन में बड़े मॉडल की सेवा की लागत और विलंबता को कम करने के लिए एक मानक तकनीक बन गया।
यह कैसे काम करता है
मानक स्वप्रतिगामी अनुमान में, एक मॉडल एक समय में एक टोकन उत्पन्न करता है, और प्रत्येक टोकन के लिए अगले को उत्पन्न करने से पहले एक पूर्ण फॉरवर्ड पास की आवश्यकता होती है, जो एक स्वाभाविक रूप से अनुक्रमिक प्रक्रिया है। अनुमानात्मक डिकोडिंग इस बाधा को तोड़ती है, जिसमें एक छोटा ड्राफ्ट मॉडल, जो चलाने में बहुत सस्ता होता है, उम्मीदवार टोकन की एक छोटी श्रृंखला उत्पन्न करता है। बड़ा लक्ष्य मॉडल फिर इन सभी उम्मीदवारों का एक बैच किए गए फॉरवर्ड पास में मूल्यांकन करता है, यह जांचते हुए कि क्या वह प्रत्येक प्रस्तावित टोकन को समान संभावना देता। जो टोकन इस जांच में पास होते हैं उन्हें स्वीकार किया जाता है; पहला टोकन जो विफल होता है उसे लक्ष्य मॉडल की अपनी भविष्यवाणी से सही किया जाता है, और उस बिंदु के बाद के किसी भी शेष ड्राफ्ट टोकन को त्याग दिया जाता है। चूंकि कई टोकन पर एक पूर्ण फॉरवर्ड पास एक टोकन पर पास से थोड़ा अधिक खर्च करता है, क्योंकि आधुनिक GPU पर गणना अक्सर अंकगणित के बजाय मेमोरी बैंडविड्थ द्वारा प्रभावित होती है, स्वीकृत बहु-टोकन चरण एक महत्वपूर्ण शुद्ध गति प्रदान करते हैं।
डिज़ाइन विविधताएँ
मुख्य विचार के कई विविध संस्करण प्रस्तावित किए गए हैं। कुछ सिस्टम ड्राफ्ट मॉडल के रूप में एक आसुत या अन्यथा संबंधित छोटे मॉडल का उपयोग करते हैं; अन्य लक्ष्य मॉडल की अपनी परतों का एक उपसमुच्चय, या हाल के संदर्भ से n-ग्राम पर आधारित एक हल्का लुकअप का उपयोग करते हैं, जिससे एक अलग ड्राफ्ट मॉडल को प्रशिक्षित और बनाए रखने की आवश्यकता से बचा जा सके। मेडुसा और समान दृष्टिकोण मूल मॉडल से ही अतिरिक्त भविष्यवाणी हेड जोड़ते हैं ताकि बिना किसी अलग मॉडल के कई भविष्य के टोकन प्रस्तावित किए जा सकें। ड्राफ्ट रणनीति का चुनाव स्वीकृति दर को प्रभावित करता है, जिसका अर्थ है कि ड्राफ्ट टोकन कितनी बार लक्ष्य मॉडल के उत्पादन से मेल खाते हैं, और ड्राफ्ट चरण चलाने की अतिरिक्त लागत को भी।
प्रभाव
अनुमानात्मक डिकोडिंग इस मायने में उल्लेखनीय है कि यह एक मुफ्त अनुकूलन के करीब है, इस अर्थ में कि, सही ढंग से लागू होने पर, यह मॉडल के आउटपुट वितरण को नहीं बदलता या पुनःप्रशिक्षण की आवश्यकता नहीं होती; यह केवल बदलता है कि वह आउटपुट कितनी जल्दी गणना की जाती है। यह इसे हानिपूर्ण दक्षता तकनीकों जैसे क्वांटीकरण या ज्ञान आसवन से अलग करता है, जो आउटपुट गुणवत्ता को प्रभावित कर सकते हैं। 2020 के दशक के मध्य तक, अनुमानात्मक डिकोडिंग प्रमुख मॉडल प्रदाताओं द्वारा मानक सेवा अवसंरचना के हिस्से के रूप में व्यापक रूप से तैनात की गई थी, विशेष रूप से विलंबता-संवेदनशील अनुप्रयोगों जैसे चैट इंटरफेस और कोडिंग सहायक जैसे GitHub Copilot और Claude Code के लिए, और अक्सर बड़े पैमाने पर सीमांत मॉडल चलाने की लागत को कम करने के लिए अन्य सेवा अनुकूलन के साथ संयुक्त किया गया था।