टॉप-पी सैम्पलिंग, जिसे न्यूक्लियस सैम्पलिंग के रूप में भी जाना जाता है, एक स्टोकेस्टिक डिकोडिंग रणनीति है जिसका उपयोग ऑटोरेग्रेसिव प्रोबेबिलिस्टिक मॉडल से अनुक्रम उत्पन्न करने के लिए किया जाता है, विशेष रूप से प्राकृतिक भाषा निर्माण में। इसे मूल रूप से अरी होल्ट्ज़मैन, येजिन चोई और सहकर्मियों द्वारा 2019 में प्रस्तावित किया गया था, ताकि नियतात्मक डिकोडिंग विधियों जैसे बीम सर्च द्वारा उत्पन्न दोहरावपूर्ण और अर्थहीन पाठ की समस्या का समाधान किया जा सके। यह तकनीक तब से प्रोटीन इंजीनियरिंग और भूभौतिकी जैसे क्षेत्रों में भी लागू की गई है।
टॉप-पी सैम्पलिंग में, एक प्रायिकता सीमा p निर्धारित की जाती है, और अनुक्रम में अगला आइटम केवल उच्च-प्रायिकता वाले उम्मीदवारों के सबसे छोटे संभावित समूह से नमूना लिया जाता है जिनकी संचयी प्रायिकता p से अधिक होती है। यह विधि मॉडल की निश्चितता के आधार पर उम्मीदवार पूल के आकार को अनुकूलित करती है, जिससे यह टॉप-के सैम्पलिंग की तुलना में अधिक लचीली होती है, जो निश्चित संख्या में उम्मीदवारों से नमूना लेती है। अपनी प्रभावशीलता के कारण, टॉप-पी सैम्पलिंग कई Large language model अनुप्रयोगों में व्यापक रूप से उपयोग की जाती है।
तकनीक
पाठ निर्माण के प्रत्येक चरण में, एक भाषा मॉडल अगले टोकन के लिए अपनी पूरी शब्दावली पर एक प्रायिकता वितरण की गणना करता है। जबकि उच्चतम प्रायिकता वाले टोकन का चयन करना (ग्रीडी सर्च) या उच्च-प्रायिकता वाले अनुक्रमों का सीमित समूह (बीम सर्च) संभव है, ये नियतात्मक विधियाँ अक्सर ऐसा पाठ उत्पन्न करती हैं जो नीरस, दोहरावपूर्ण या अर्थहीन होता है। टॉप-पी सैम्पलिंग इन समस्याओं से बचने के लिए यादृच्छिकता का परिचय देती है जबकि गुणवत्ता बनाए रखती है।
मुख्य विचार प्रत्येक चरण में टोकन के एक छोटे, अधिक विश्वसनीय समूह से नमूना लेना है, जिसे न्यूक्लियस कहा जाता है। इस न्यूक्लियस में सबसे संभावित अगले टोकन शामिल होते हैं जिनकी संयुक्त, या संचयी, प्रायिकता सीमा p से थोड़ी अधिक होती है। केवल इस गतिशील-आकार के समूह से नमूना लेकर, मॉडल विभिन्न स्थितियों के अनुकूल हो सकता है। जब मॉडल अगले टोकन के बारे में आश्वस्त होता है (जैसे, एक टोकन की बहुत अधिक प्रायिकता होती है), न्यूक्लियस छोटा होगा। जब मॉडल अनिश्चित होता है (प्रायिकताएँ अधिक समान रूप से वितरित होती हैं), न्यूक्लियस बड़ा होगा, जिससे अधिक विविधता मिलेगी।
प्रत्येक चरण में प्रक्रिया इस प्रकार है:
- मॉडल सभी संभावित अगले टोकन के लिए प्रायिकताओं की गणना करता है।
- टोकन को उनकी प्रायिकता के अवरोही क्रम में क्रमबद्ध किया जाता है।
- न्यूक्लियस सूची के शीर्ष से टोकन का चयन करके बनाया जाता है जब तक कि उनकी संचयी प्रायिकता पूर्वनिर्धारित सीमा p से अधिक न हो जाए।
- इस न्यूक्लियस के भीतर के टोकन की प्रायिकताओं को फिर से स्केल किया जाता है ताकि उनका योग 1 हो। न्यूक्लियस के बाहर के सभी टोकन को हटा दिया जाता है (प्रायिकता 0 दी जाती है)।
- अंतिम अगला टोकन इस नए, छोटे वितरण से यादृच्छिक रूप से नमूना लिया जाता है।
औपचारिक रूप से, न्यूक्लियस, V^(p) ⊆ V, टोकन के सबसे छोटे समूह के रूप में परिभाषित किया गया है जो संतुष्ट करता है: V^(p) में सभी x के लिए P(x | x_1, ..., x_{t-1}) का योग p से अधिक या बराबर है। यहाँ, P(x | x_1, ..., x_{t-1}) पूर्ववर्ती टोकन x_1, ..., x_{t-1} दिए जाने पर टोकन x की प्रायिकता का प्रतिनिधित्व करता है।
उदाहरण
कल्पना करें कि एक निश्चित चरण में, एक भाषा मॉडल के पास पाँच शब्दों की शब्दावली है: [the, a, cat, dog, eats] और निम्नलिखित प्रायिकताएँ उत्पन्न करता है:
- the: 0.5
- a: 0.2
- cat: 0.1
- dog: 0.1
- eats: 0.1
यदि हम p = 0.8 निर्धारित करते हैं:
- टोकन को प्रायिकता के अनुसार क्रमबद्ध किया जाता है: [the, a, cat, dog, eats]।
- संचयी प्रायिकता की गणना की जाती है:
- the: 0.5
- the + a: 0.5 + 0.2 = 0.7
- the + a + cat: 0.7 + 0.1 = 0.8
- न्यूक्लियस सबसे छोटा समूह है जिसकी संचयी प्रायिकता ≥ 0.8 है, जो V^(0.8) = {the, a, cat} है।
- इस समूह के लिए प्रायिकताओं को 1 का योग करने के लिए फिर से स्केल किया जाता है:
- P(the) = 0.5 / 0.8 = 0.625
- P(a) = 0.2 / 0.8 = 0.25
- P(cat) = 0.1 / 0.8 = 0.125
- अगला टोकन फिर इस नए वितरण से नमूना लिया जाता है, जिसका अर्थ है कि dog और eats के चुने जाने की संभावना 0% है।
टॉप-के सैम्पलिंग
टॉप-के सैम्पलिंग एक समान तकनीक है जहाँ उम्मीदवार टोकन का पूल k सबसे संभावित टोकन तक सीमित होता है। टॉप-पी का मुख्य लाभ इसकी अनुकूलनशीलता है। जब मॉडल अगले टोकन के बारे में बहुत आश्वस्त होता है (एक शिखरित वितरण), न्यूक्लियस V^(p) बहुत छोटा हो सकता है। जब मॉडल अनिश्चित होता है (एक सपाट वितरण), न्यूक्लियस बहुत बड़ा हो सकता है, जिससे अधिक विविधता मिलती है। इसके विपरीत, टॉप-के हमेशा निश्चित संख्या में टोकन से नमूना लेता है, जो संदर्भ के आधार पर बहुत प्रतिबंधात्मक या बहुत व्यापक हो सकता है।
अनुप्रयोग
जबकि टॉप-पी सैम्पलिंग सबसे प्रसिद्ध रूप से बड़े भाषा मॉडल के लिए एक डिकोडिंग रणनीति के रूप में उपयोग की जाती है, इस तकनीक को प्रोबेबिलिस्टिक मॉडल से अनुक्रमिक डेटा उत्पन्न करने या विश्लेषण करने वाले अन्य वैज्ञानिक क्षेत्रों में भी उपयोग के लिए अनुकूलित किया गया है।
प्राकृतिक भाषा निर्माण
अपने मूल क्षेत्र प्राकृतिक भाषा निर्माण में, टॉप-पी सैम्पलिंग को नियतात्मक विधियों की तुलना में अधिक विविध और सुसंगत पाठ उत्पन्न करने की क्षमता के लिए महत्व दिया जाता है। यह स्वचालित प्रश्न निर्माण जैसे कार्यों में फायदेमंद साबित हुई है, जहाँ प्रश्न-उत्तर मॉडल के लिए प्रभावी प्रशिक्षण डेटा बनाने के लिए नमूना विविधता महत्वपूर्ण है।
दवा और प्रोटीन डिज़ाइन
टॉप-पी सैम्पलिंग का उपयोग कम्प्यूटेशनल जीव विज्ञान में विशेष भाषा मॉडल से नए आणविक और प्रोटीन अनुक्रम उत्पन्न करने के लिए किया जाता है। डी नोवो दवा डिज़ाइन में, आणविक संरचनाओं पर प्रशिक्षित रासायनिक भाषा मॉडल नए, मान्य दवा उम्मीदवारों के केंद्रित पुस्तकालय उत्पन्न करने के लिए न्यूक्लियस सैम्पलिंग का उपयोग करते हैं। इसी तरह, प्रोटीन इंजीनियरिंग में, प्रोटीन अनुक्रमों पर प्रशिक्षित भाषा मॉडल वांछित गुणों वाले नए अनुक्रम प्रस्तावित करने के लिए टॉप-पी सैम्पलिंग का उपयोग करते हैं, जिससे प्राकृतिक वेरिएंट से परे खोज स्थान का विस्तार होता है।
भूभौतिकी
भूभौतिकी में, टॉप-पी सैम्पलिंग को सिंथेटिक भूकंपीय डेटा उत्पन्न करने या उपसतह संरचनाओं के मॉडल बनाने के लिए लागू किया गया है। भूवैज्ञानिक अनुक्रमों के प्रोबेबिलिस्टिक मॉडल से नमूना लेकर, शोधकर्ता विविध प्रशंसनीय परिदृश्य बना सकते हैं जो अनिश्चितता मात्रा निर्धारण और भूकंपीय सर्वेक्षणों की व्याख्या में मदद करते हैं।
अन्य डिकोडिंग विधियों से संबंध
टॉप-पी सैम्पलिंग ऑटोरेग्रेसिव मॉडल के साथ उपयोग की जाने वाली कई स्टोकेस्टिक डिकोडिंग रणनीतियों में से एक है। यह तापमान स्केलिंग जैसी अन्य तकनीकों का पूरक है, जो नमूना लेने से पहले प्रायिकता वितरण की तीक्ष्णता को समायोजित करती है, और पुनरावृत्ति दंड, जो मॉडल को टोकन दोहराने से हतोत्साहित करता है। व्यवहार में, टॉप-पी को अक्सर उत्पन्न पाठ की विविधता और गुणवत्ता को ठीक करने के लिए तापमान स्केलिंग के साथ जोड़ा जाता है। उदाहरण के लिए, कम तापमान वितरण को अधिक शिखरित बनाता है, और टॉप-पी फिर एक छोटा न्यूक्लियस चुनता है, जिसके परिणामस्वरूप अधिक रूढ़िवादी आउटपुट मिलते हैं।
कार्यान्वयन संबंधी विचार
व्यवहार में, टॉप-पी सैम्पलिंग के लिए प्रत्येक निर्माण चरण में प्रायिकता वितरण को क्रमबद्ध करने की आवश्यकता होती है, जो ग्रीडी डिकोडिंग की तुलना में कम्प्यूटेशनल ओवरहेड जोड़ता है। हालाँकि, कई अनुप्रयोगों के लिए, आउटपुट गुणवत्ता में लाभ लागत से अधिक होता है। PyTorch और TensorFlow जैसे फ्रेमवर्क में कुशल कार्यान्वयन संचयी योग संचालन और मास्किंग का उपयोग करके इस प्रक्रिया को अनुकूलित करते हैं। सीमा p एक हाइपरपैरामीटर है जिसे ट्यून किया जा सकता है; कई भाषा निर्माण कार्यों के लिए सामान्य मान 0.9 से 0.95 तक होते हैं, लेकिन इष्टतम मान विशिष्ट मॉडल और अनुप्रयोग पर निर्भर करता है।
प्रभाव और अपनाना
2019 में अपनी शुरुआत के बाद से, टॉप-पी सैम्पलिंग कई बड़े भाषा मॉडलों की डिकोडिंग रणनीतियों में एक मानक घटक बन गई है, जिसमें OpenAI, Anthropic, और Google DeepMind द्वारा विकसित मॉडल शामिल हैं। यह अक्सर टेक्स्ट जनरेशन एपीआई और ओपन-सोर्स लाइब्रेरीज़ में डिफ़ॉल्ट सैम्पलिंग विधि है। तकनीक की अनुकूलनशीलता ने इसे जनरेटिव एआई सिस्टम में रचनात्मकता और सुसंगतता को संतुलित करने में एक महत्वपूर्ण उपकरण बना दिया है, जो चैटबॉट, सामग्री जनरेटर और अन्य अनुप्रयोगों के मानव-समान पाठ उत्पन्न करने के तरीके को प्रभावित करता है।