टॉप-पी सैंपलिंग, जिसे न्यूक्लियस सैंपलिंग के रूप में भी जाना जाता है, एक स्टोकेस्टिक डिकोडिंग रणनीति है जिसका उपयोग ऑटोरेग्रेसिव प्रोबेबिलिस्टिक मॉडल से अनुक्रम उत्पन्न करने के लिए किया जाता है, विशेष रूप से प्राकृतिक भाषा निर्माण में। इसे मूल रूप से 2019 में एरी होल्ट्ज़मैन, येजिन चोई और सहयोगियों द्वारा प्रस्तावित किया गया था, ताकि बीम सर्च जैसी नियतात्मक डिकोडिंग विधियों द्वारा उत्पन्न दोहराव वाले और अर्थहीन पाठ की समस्या का समाधान किया जा सके। इस तकनीक को तब से अन्य वैज्ञानिक क्षेत्रों, जैसे प्रोटीन इंजीनियरिंग और भूभौतिकी में भी लागू किया गया है।
टॉप-पी सैंपलिंग में, एक प्रायिकता सीमा p निर्धारित की जाती है, और किसी अनुक्रम में अगला आइटम केवल उच्च-प्रायिकता वाले उम्मीदवारों के सबसे छोटे संभव समूह से नमूना किया जाता है जिसकी संचयी प्रायिकता p से अधिक होती है। यह विधि मॉडल की निश्चितता के आधार पर उम्मीदवार पूल के आकार को अनुकूलित करती है, जिससे यह टॉप-के सैंपलिंग की तुलना में अधिक लचीला हो जाता है, जो एक निश्चित संख्या में उम्मीदवारों से नमूना लेता है। अपनी प्रभावशीलता के कारण, टॉप-पी सैंपलिंग कई बड़े भाषा मॉडल अनुप्रयोगों में व्यापक रूप से उपयोग की जाती है।
तकनीक
पाठ निर्माण प्रक्रिया के प्रत्येक चरण में, एक भाषा मॉडल अपने पूरे शब्दावली पर अगले टोकन के लिए एक प्रायिकता वितरण की गणना करता है। जबकि उच्चतम प्रायिकता वाले टोकन को चुनना (ग्रीडी सर्च) या उच्च-प्रायिकता वाले अनुक्रमों का एक सीमित समूह (बीम सर्च) संभव है, ये नियतात्मक विधियाँ अक्सर नीरस, दोहराव वाला या अर्थहीन पाठ उत्पन्न करती हैं। टॉप-पी सैंपलिंग इन समस्याओं से बचने के लिए यादृच्छिकता का परिचय देती है जबकि गुणवत्ता बनाए रखती है।
मुख्य विचार प्रत्येक चरण में टोकन के एक छोटे, अधिक विश्वसनीय समूह से नमूना लेना है, जिसे न्यूक्लियस कहा जाता है। इस न्यूक्लियस में सबसे संभावित अगले टोकन शामिल होते हैं जिनकी संयुक्त, या संचयी, प्रायिकता सीमा p से थोड़ी अधिक होती है। केवल इस गतिशील आकार के समूह से नमूना लेकर, मॉडल विभिन्न स्थितियों के अनुकूल हो सकता है। जब मॉडल अगले टोकन के बारे में आश्वस्त होता है (उदाहरण के लिए, एक टोकन की बहुत उच्च प्रायिकता होती है), तो न्यूक्लियस छोटा होगा। जब मॉडल अनिश्चित होता है (प्रायिकताएँ अधिक समान रूप से वितरित होती हैं), तो न्यूक्लियस बड़ा होगा, जिससे अधिक विविधता मिलेगी।
प्रत्येक चरण में प्रक्रिया इस प्रकार है:
- मॉडल सभी संभावित अगले टोकन के लिए प्रायिकताओं की गणना करता है।
- टोकन को उनकी प्रायिकता के अनुसार अवरोही क्रम में क्रमबद्ध किया जाता है।
- न्यूक्लियस का निर्माण सूची के शीर्ष से टोकन का चयन करके किया जाता है जब तक कि उनकी संचयी प्रायिकता पूर्वनिर्धारित सीमा p से अधिक न हो जाए।
- इस न्यूक्लियस के भीतर टोकन की प्रायिकताओं को फिर से स्केल किया जाता है ताकि उनका योग 1 हो। न्यूक्लियस के बाहर के सभी टोकन को हटा दिया जाता है (उन्हें 0 की प्रायिकता दी जाती है)।
- अंतिम अगला टोकन इस नए, छोटे वितरण से यादृच्छिक रूप से नमूना किया जाता है।
औपचारिक रूप से, न्यूक्लियस, \(V^{(p)} \subseteq V\), टोकन के सबसे छोटे समूह के रूप में परिभाषित किया गया है जो संतुष्ट करता है:
\[\sum_{x \in V^{(p)}} P(x|x_1, \dots, x_{t-1}) \geq p\]
इस सूत्र में, \(P(x|x_1, \dots, x_{t-1})\) पूर्ववर्ती टोकन \(x_1, \dots, x_{t-1}\) दिए जाने पर एक टोकन \(x\) की प्रायिकता का प्रतिनिधित्व करता है।
उदाहरण
कल्पना करें कि एक निश्चित चरण में, एक भाषा मॉडल के पास पाँच शब्दों की शब्दावली है: [the, a, cat, dog, eats] और निम्नलिखित प्रायिकताएँ उत्पन्न करता है:
- the: 0.5
- a: 0.2
- cat: 0.1
- dog: 0.1
- eats: 0.1
यदि हम \(p = 0.8\) निर्धारित करते हैं:
- टोकन को प्रायिकता के अनुसार क्रमबद्ध किया जाता है: [the, a, cat, dog, eats]।
- संचयी प्रायिकता की गणना की जाती है:
- the: 0.5
- the + a: 0.5 + 0.2 = 0.7
- the + a + cat: 0.7 + 0.1 = 0.8
- न्यूक्लियस संचयी प्रायिकता ≥ 0.8 वाला सबसे छोटा समूह है, जो \(V^{(0.8)} = \{\text{the, a, cat}\}\) है।
- इस समूह के लिए प्रायिकताओं को योग 1 करने के लिए फिर से स्केल किया जाता है:
- P(the) = 0.5 / 0.8 = 0.625
- P(a) = 0.2 / 0.8 = 0.25
- P(cat) = 0.1 / 0.8 = 0.125
- अगला टोकन तब इस नए वितरण से नमूना किया जाता है, जिसका अर्थ है कि dog और eats के चुने जाने की संभावना 0% है।
टॉप-के सैंपलिंग
टॉप-के सैंपलिंग एक समान तकनीक है जहाँ उम्मीदवार टोकन का पूल सबसे संभावित \(k\) टोकन तक सीमित होता है। टॉप-पी का मुख्य लाभ इसकी अनुकूलनशीलता है। जब मॉडल अगले टोकन के बारे में बहुत आश्वस्त होता है (एक शिखरित वितरण), तो न्यूक्लियस \(V^{(p)}\) बहुत छोटा हो सकता है। जब मॉडल अनिश्चित होता है (एक सपाट वितरण), तो न्यूक्लियस बहुत बड़ा हो सकता है, जिससे अधिक विविधता मिलती है। इसके विपरीत, टॉप-के हमेशा एक निश्चित संख्या में टोकन से नमूना लेता है, जो संदर्भ के आधार पर बहुत प्रतिबंधात्मक या बहुत व्यापक हो सकता है।
अनुप्रयोग
जबकि टॉप-पी सैंपलिंग सबसे प्रसिद्ध रूप से बड़े भाषा मॉडल के लिए एक डिकोडिंग रणनीति के रूप में उपयोग की जाती है, इस तकनीक को अन्य वैज्ञानिक क्षेत्रों में भी अनुकूलित किया गया है जिनमें प्रोबेबिलिस्टिक मॉडल से अनुक्रमिक डेटा उत्पन्न करना या विश्लेषण करना शामिल है।
प्राकृतिक भाषा निर्माण
अपने मूल क्षेत्र प्राकृतिक भाषा निर्माण में, टॉप-पी सैंपलिंग को नियतात्मक विधियों की तुलना में अधिक विविध और सुसंगत पाठ उत्पन्न करने की क्षमता के लिए महत्व दिया जाता है। यह स्वचालित प्रश्न निर्माण जैसे कार्यों में लाभकारी साबित हुई है, जहाँ नमूना विविधता प्रश्न-उत्तर मॉडल के लिए प्रभावी प्रशिक्षण डेटा बनाने में महत्वपूर्ण है।
दवा और प्रोटीन डिज़ाइन
टॉप-पी सैंपलिंग का उपयोग कम्प्यूटेशनल जीव विज्ञान में विशेष भाषा मॉडल से नवीन आणविक और प्रोटीन अनुक्रम उत्पन्न करने के लिए किया जाता है। डी नोवो दवा डिज़ाइन में, आणविक संरचनाओं पर प्रशिक्षित रासायनिक भाषा मॉडल नए, मान्य दवा उम्मीदवारों के केंद्रित पुस्तकालय उत्पन्न करने के लिए न्यूक्लियस सैंपलिंग का उपयोग करते हैं। इसी तरह, प्रोटीन भाषा मॉडल वांछित गुणों वाले नवीन प्रोटीन अनुक्रम प्रस्तावित करने के लिए टॉप-पी सैंपलिंग का लाभ उठाते हैं, जो प्रोटीन इंजीनियरिंग प्रयासों में सहायता करता है।
भूभौतिकी
भूभौतिकी में, टॉप-पी सैंपलिंग को भूवैज्ञानिक घटनाओं के अनुक्रम उत्पन्न करने या उपसतह संरचनाओं को मॉडल करने के लिए लागू किया गया है। उदाहरण के लिए, इसका उपयोग भूकंपीय व्युत्क्रमण या जलाशय लक्षण वर्णन में उपसतह गुणों की भविष्यवाणी करने वाले प्रोबेबिलिस्टिक मॉडल से नमूना लेने के लिए किया जा सकता है, जो भूवैज्ञानिक व्याख्याओं में अनिश्चितता को मापने में मदद करता है।
कार्यान्वयन और उपयोग
व्यवहार में, टॉप-पी सैंपलिंग को अक्सर अन्य डिकोडिंग रणनीतियों, जैसे तापमान स्केलिंग, के साथ जोड़ा जाता है, ताकि उत्पन्न पाठ की यादृच्छिकता और गुणवत्ता को ठीक से समायोजित किया जा सके। तापमान स्केलिंग टॉप-पी लागू करने से पहले प्रायिकता वितरण की तीक्ष्णता को समायोजित करती है, जिससे विविधता पर और अधिक नियंत्रण मिलता है। कई मशीन लर्निंग फ्रेमवर्क और लाइब्रेरी टॉप-पी सैंपलिंग के लिए अंतर्निहित समर्थन प्रदान करते हैं, जिससे इसे मौजूदा पाइपलाइनों में एकीकृत करना आसान हो जाता है।
टॉप-पी सैंपलिंग प्रमुख AI कंपनियों के APIs में एक मानक सुविधा है, जिसमें ओपनएआई, एंथ्रोपिक, और गूगल-डीपमाइंड शामिल हैं, साथ ही हगिंग फेस के ट्रांसफॉर्मर्स जैसी ओपन-सोर्स लाइब्रेरी में भी। इसे आमतौर पर पाठ निर्माण कार्यों में एक पैरामीटर (जैसे, top_p) के रूप में निर्दिष्ट किया जाता है, जिसमें संतुलित आउटपुट के लिए सामान्य मान 0.9 से 0.95 तक होते हैं।
p का चुनाव आउटपुट को महत्वपूर्ण रूप से प्रभावित करता है। एक कम p (जैसे, 0.5) मॉडल को अधिक रूढ़िवादी बनाता है, उच्च-प्रायिकता वाले टोकन पर ध्यान केंद्रित करता है, जबकि एक उच्च p (जैसे, 0.99) अधिक विविधता की अनुमति देता है लेकिन असंगति का जोखिम बढ़ा सकता है। शोधकर्ता और चिकित्सक अक्सर विशिष्ट कार्य और वांछित आउटपुट विशेषताओं के आधार पर p को ट्यून करते हैं।
यह भी देखें
- टॉप-के सैंपलिंग
- temperature-sampling
- बीम सर्च
- greedy-decoding