टॉप-पी सैंपलिंग, जिसे न्यूक्लियस सैंपलिंग के रूप में भी जाना जाता है, एक स्टोकेस्टिक डिकोडिंग रणनीति है जिसका उपयोग स्वतःप्रतिगामी संभाव्य मॉडलों, जैसे बड़े भाषा मॉडल से अनुक्रम उत्पन्न करने के लिए किया जाता है। इसे मूल रूप से 2019 में एरी होल्ट्ज़मैन, येजिन चोई और सहकर्मियों द्वारा प्राकृतिक भाषा निर्माण के लिए प्रस्तावित किया गया था, ताकि अन्य सामान्य डिकोडिंग विधियों जैसे बीम खोज द्वारा उत्पन्न दोहरावपूर्ण और अर्थहीन पाठ की समस्या का समाधान किया जा सके। यह तकनीक तब से अन्य वैज्ञानिक क्षेत्रों में भी लागू की गई है, जिनमें प्रोटीन इंजीनियरिंग और भूभौतिकी शामिल हैं।
टॉप-पी सैंपलिंग में, एक संभाव्यता सीमा p निर्धारित की जाती है, और अनुक्रम में अगला आइटम केवल उच्च-संभाव्यता वाले उम्मीदवारों के सबसे छोटे संभव समूह से नमूना लिया जाता है जिनकी संचयी संभाव्यता p से अधिक होती है। यह विधि मॉडल की निश्चितता के आधार पर उम्मीदवार पूल के आकार को अनुकूलित करती है, जिससे यह टॉप-के सैंपलिंग की तुलना में अधिक लचीला होता है, जो उम्मीदवारों की एक निश्चित संख्या से नमूना लेता है। अपनी प्रभावशीलता के कारण, टॉप-पी सैंपलिंग कई बड़े भाषा मॉडल अनुप्रयोगों में व्यापक रूप से उपयोग की जाती है।
तकनीक
पाठ निर्माण प्रक्रिया के प्रत्येक चरण में, एक भाषा मॉडल अपने पूरे शब्दकोष पर अगले टोकन के लिए संभाव्यता वितरण की गणना करता है। जबकि उच्चतम संभाव्यता वाले टोकन को चुनना (ग्रीडी खोज) या उच्च-संभाव्यता वाले अनुक्रमों का सीमित समूह (बीम खोज) संभव है, ये नियतात्मक विधियाँ अक्सर नीरस, दोहरावपूर्ण या अर्थहीन पाठ उत्पन्न करती हैं। टॉप-पी सैंपलिंग इन समस्याओं से बचने के लिए यादृच्छिकता का परिचय देती है जबकि गुणवत्ता बनाए रखती है।
मुख्य विचार प्रत्येक चरण पर टोकन के एक छोटे, अधिक विश्वसनीय समूह से नमूना लेना है, जिसे न्यूक्लियस कहा जाता है। इस न्यूक्लियस में सबसे संभावित अगले टोकन शामिल होते हैं जिनकी संयुक्त, या संचयी संभाव्यता सीमा p से थोड़ी अधिक होती है। केवल इस गतिशील रूप से आकार वाले समूह से नमूना लेकर, मॉडल विभिन्न स्थितियों के अनुकूल हो सकता है। जब मॉडल अगले टोकन के बारे में आश्वस्त होता है (जैसे, एक टोकन की बहुत उच्च संभाव्यता होती है), न्यूक्लियस छोटा होगा। जब मॉडल अनिश्चित होता है (संभावनाएँ अधिक समान रूप से वितरित होती हैं), न्यूक्लियस बड़ा होगा, जिससे अधिक विविधता की अनुमति मिलती है।
प्रत्येक चरण पर प्रक्रिया इस प्रकार है:
- मॉडल सभी संभावित अगले टोकन के लिए संभावनाओं की गणना करता है।
- टोकन को उनकी संभाव्यता के अनुसार अवरोही क्रम में क्रमबद्ध किया जाता है।
- न्यूक्लियस का निर्माण सूची के शीर्ष से टोकन का चयन करके किया जाता है जब तक कि उनकी संचयी संभाव्यता पूर्वनिर्धारित सीमा p से अधिक न हो जाए।
- इस न्यूक्लियस के भीतर टोकन की संभावनाओं को फिर से स्केल किया जाता है ताकि उनका योग 1 हो। न्यूक्लियस के बाहर के सभी टोकन को हटा दिया जाता है (संभाव्यता 0 दी जाती है)।
- अंतिम अगला टोकन इस नए, छोटे वितरण से यादृच्छिक रूप से नमूना लिया जाता है।
औपचारिक रूप से, न्यूक्लियस, V^(p) ⊆ V, सबसे छोटा टोकन समूह है जो संतुष्ट करता है:
∑_{x ∈ V^(p)} P(x | x_1, …, x_{t-1}) ≥ p
इस सूत्र में, P(x | x_1, …, x_{t-1}) पूर्ववर्ती टोकन x_1, …, x_{t-1} दिए जाने पर टोकन x की संभाव्यता का प्रतिनिधित्व करता है।
उदाहरण
कल्पना करें कि एक निश्चित चरण में, एक भाषा मॉडल के पास पाँच शब्दों का शब्दकोष है: [the, a, cat, dog, eats] और यह निम्नलिखित संभावनाएँ उत्पन्न करता है:
- the: 0.5
- a: 0.2
- cat: 0.1
- dog: 0.1
- eats: 0.1
यदि हम p = 0.8 निर्धारित करते हैं:
- टोकन को संभाव्यता के अनुसार क्रमबद्ध किया जाता है: [the, a, cat, dog, eats]।
- संचयी संभाव्यता की गणना की जाती है:
- the: 0.5
- the + a: 0.5 + 0.2 = 0.7
- the + a + cat: 0.7 + 0.1 = 0.8
- न्यूक्लियस सबसे छोटा समूह है जिसकी संचयी संभाव्यता ≥ 0.8 है, जो V^(0.8) = {the, a, cat} है।
- इस समूह के लिए संभावनाओं को 1 का योग करने के लिए फिर से स्केल किया जाता है:
- P(the) = 0.5 / 0.8 = 0.625
- P(a) = 0.2 / 0.8 = 0.25
- P(cat) = 0.1 / 0.8 = 0.125
- अगला टोकन तब इस नए वितरण से नमूना लिया जाता है, जिसका अर्थ है कि dog और eats के चुने जाने की संभावना 0% है।
टॉप-के सैंपलिंग
टॉप-के सैंपलिंग एक समान तकनीक है जहाँ उम्मीदवार टोकन का पूल सबसे संभावित k टोकन तक सीमित होता है। टॉप-पी का मुख्य लाभ इसकी अनुकूलनशीलता है। जब मॉडल अगले टोकन के बारे में बहुत आश्वस्त होता है (एक शिखरित वितरण), न्यूक्लियस V^(p) बहुत छोटा हो सकता है। जब मॉडल अनिश्चित होता है (एक समतल वितरण), न्यूक्लियस बहुत बड़ा हो सकता है, जिससे अधिक विविधता की अनुमति मिलती है। इसके विपरीत, टॉप-के हमेशा टोकन की एक निश्चित संख्या से नमूना लेता है, जो संदर्भ के आधार पर बहुत प्रतिबंधात्मक या बहुत व्यापक हो सकता है।
अनुप्रयोग
जबकि टॉप-पी सैंपलिंग सबसे प्रसिद्ध रूप से बड़े भाषा मॉडल के लिए डिकोडिंग रणनीति के रूप में उपयोग की जाती है, इस तकनीक को संभाव्य मॉडलों से अनुक्रमिक डेटा उत्पन्न करने या विश्लेषण करने वाले अन्य वैज्ञानिक क्षेत्रों में भी अनुकूलित किया गया है।
प्राकृतिक भाषा निर्माण
प्राकृतिक भाषा निर्माण के अपने मूल क्षेत्र में, टॉप-पी सैंपलिंग को नियतात्मक विधियों की तुलना में अधिक विविध और सुसंगत पाठ उत्पन्न करने की क्षमता के लिए महत्व दिया जाता है। यह स्वचालित प्रश्न निर्माण जैसे कार्यों में लाभकारी साबित हुई है, जहाँ नमूना विविधता प्रश्न-उत्तर मॉडल के लिए प्रभावी प्रशिक्षण डेटा बनाने के लिए महत्वपूर्ण है।
दवा और प्रोटीन डिज़ाइन
टॉप-पी सैंपलिंग का उपयोग कम्प्यूटेशनल जीव विज्ञान में विशेष भाषा मॉडलों से नए आणविक और प्रोटीन अनुक्रम उत्पन्न करने के लिए किया जाता है। डी नोवो दवा डिज़ाइन में, आणविक संरचनाओं पर प्रशिक्षित रासायनिक भाषा मॉडल न्यूक्लियस सैंपलिंग का उपयोग नए, मान्य दवा उम्मीदवारों के केंद्रित पुस्तकालय उत्पन्न करने के लिए करते हैं। इसी तरह, प्रोटीन इंजीनियरिंग में, टॉप-पी सैंपलिंग अनुक्रम स्थान का अन्वेषण करने में मदद करती है जबकि कार्यात्मक प्रोटीन उत्पन्न करने की संभावना बनाए रखती है।
भूभौतिकी
भूभौतिकी में, टॉप-पी सैंपलिंग को संभाव्य मॉडलों से भूकंपीय तरंग रूपों या अन्य अनुक्रमिक डेटा उत्पन्न करने के लिए लागू किया गया है, जो भूकंप सिमुलेशन या उपसतह इमेजिंग जैसे कार्यों में सहायता करता है। न्यूक्लियस की अनुकूली प्रकृति उत्पन्न डेटा में यथार्थवादी परिवर्तनशीलता की अनुमति देती है, जो जटिल प्राकृतिक घटनाओं के मॉडलिंग के लिए महत्वपूर्ण है।
अन्य डिकोडिंग रणनीतियों से संबंध
टॉप-पी सैंपलिंग जनरेटिव मॉडल में उपयोग की जाने वाली कई स्टोकेस्टिक डिकोडिंग विधियों में से एक है। इसे अक्सर तापमान स्केलिंग के साथ जोड़ा जाता है ताकि आउटपुट की यादृच्छिकता को और नियंत्रित किया जा सके। जबकि तापमान स्केलिंग सैंपलिंग से पहले संभाव्यता वितरण की तीक्ष्णता को समायोजित करती है, टॉप-पी सैंपलिंग वितरण को टोकन के एक उपसमूह तक सीमित करती है। इन तकनीकों का उपयोग एक साथ किया जा सकता है ताकि विविधता और सुसंगतता के बीच संतुलन प्राप्त किया जा सके।
ग्रीडी खोज या बीम खोज जैसी नियतात्मक विधियों की तुलना में, टॉप-पी सैंपलिंग स्टोकेस्टिकता का परिचय देती है, जो दोहरावपूर्ण लूप को रोक सकती है और अधिक विविध आउटपुट उत्पन्न कर सकती है। हालाँकि, यह यादृच्छिकता कभी-कभी असंगतता का कारण बन सकती है, और p का चुनाव महत्वपूर्ण है। कम p मान (जैसे, 0.5) आउटपुट को अधिक केंद्रित और नियतात्मक बनाता है, जबकि उच्च p मान (जैसे, 0.95) विविधता बढ़ाता है लेकिन गुणवत्ता कम कर सकता है।
कार्यान्वयन संबंधी विचार
व्यवहार में, टॉप-पी सैंपलिंग अधिकांश आधुनिक गहन शिक्षण ढाँचों में लागू की जाती है और बड़े भाषा मॉडल के लिए एपीआई में एक मानक पैरामीटर है, जैसे कि OpenAI, Anthropic, और Google DeepMind से। सीमा p आम तौर पर सामान्य पाठ निर्माण कार्यों के लिए 0.9 और 0.95 के बीच निर्धारित की जाती है, लेकिन इष्टतम मान विशिष्ट अनुप्रयोग और रचनात्मकता और सटीकता के बीच वांछित व्यापार-बंद पर निर्भर करता है।
कार्यान्वयन में एक चुनौती यह सुनिश्चित करना है कि संचयी संभाव्यता गणना कुशल हो, विशेष रूप से बड़े शब्दकोषों के लिए। हालाँकि, चूँकि न्यूक्लियस आम तौर पर छोटा होता है, कम्प्यूटेशनल ओवरहेड न्यूनतम होता है। इसके अतिरिक्त, टॉप-पी सैंपलिंग को RLHF (मानव प्रतिक्रिया से सुदृढीकरण सीखना) जैसी अन्य तकनीकों के साथ जोड़ा जा सकता है ताकि उत्पन्न पाठ को मानवीय प्राथमिकताओं के साथ संरेखित किया जा सके।
सीमाएँ और विस्तार
अपने लाभों के बावजूद, टॉप-पी सैंपलिंग की सीमाएँ हैं। सीमा p स्थिर है और संदर्भ के अनुकूल नहीं होती, जो कुछ परिदृश्यों में उप-इष्टतम प्रदर्शन का कारण बन सकती है। शोधकर्ताओं ने वितरण की एन्ट्रॉपी के आधार पर गतिशील p मानों जैसे विस्तारों का पता लगाया है, लेकिन ये अभी तक व्यापक रूप से अपनाए नहीं गए हैं। इसके अलावा, टॉप-पी सैंपलिंग वैश्विक सुसंगतता की गारंटी नहीं देती, क्योंकि यह केवल प्रत्येक चरण पर स्थानीय संभावनाओं पर विचार करती है।
एक और सीमा यह है कि टॉप-पी सैंपलिंग अभी भी दोहरावपूर्ण पाठ उत्पन्न कर सकती है यदि मॉडल का वितरण कुछ टोकन पर भारी रूप से शिखरित है। ऐसे मामलों में, टॉप-पी को टॉप-के या तापमान समायोजन जैसी अन्य रणनीतियों के साथ जोड़ना आवश्यक हो सकता है। इन चुनौतियों के बावजूद, टॉप-पी सैंपलिंग जनरेटिव एआई टूलबॉक्स में एक मौलिक उपकरण बनी हुई है, जिसका व्यापक रूप से अनुसंधान और उत्पादन प्रणालियों दोनों में उपयोग किया जाता है।