तापमान स्केलिंग Machine learning और Deep learning में एक मौलिक तकनीक है जो Neural network के लॉजिट्स (कच्चे आउटपुट स्कोर) को सॉफ्टमैक्स फ़ंक्शन लागू करने से पहले संशोधित करती है। लॉजिट्स को तापमान पैरामीटर T से विभाजित करके, परिणामी संभाव्यता वितरण या तो तेज (T < 1) या चापलूस (T > 1) हो जाता है। यह समायोजन जनरेटिव मॉडल में सैंपलिंग की यादृच्छिकता को सीधे प्रभावित करता है, जिससे यह Generative AI सिस्टम, विशेष रूप से Large language model में एक महत्वपूर्ण नियंत्रण घुंडी बन जाता है।
यह अवधारणा सांख्यिकीय यांत्रिकी से उत्पन्न हुई है, जहां तापमान कण प्रणालियों की यादृच्छिकता को नियंत्रित करता है, और 2010 के दशक की शुरुआत में इसे तंत्रिका नेटवर्क में अनुकूलित किया गया था। व्यवहार में, तापमान स्केलिंग अनुमान (प्रशिक्षण नहीं) के दौरान लागू की जाती है और यह अन्य कैलिब्रेशन विधियों से अलग है, हालांकि इसका उपयोग कभी-कभी कैलिब्रेशन के लिए भी किया जाता है। इसका प्राथमिक उपयोग निर्धारित, उच्च-आत्मविश्वास वाले आउटपुट और विविध, खोजपूर्ण आउटपुट के बीच समझौता करना है।
तंत्र और गणितीय सूत्रीकरण
तंत्रिका नेटवर्क में, अंतिम परत प्रत्येक वर्ग या टोकन के लिए लॉगिट्स z_i उत्पन्न करती है। सॉफ्टमैक्स फ़ंक्शन इन्हें संभावनाओं में परिवर्तित करता है: p_i = exp(z_i / T) / sum_j exp(z_j / T)। तापमान T एक धनात्मक स्केलर है। जब T = 1, सॉफ्टमैक्स अपरिवर्तित रहता है। जब T < 1, लॉगिट्स प्रवर्धित होते हैं, जिससे वितरण अधिक शिखरयुक्त हो जाता है; मॉडल अधिक आत्मविश्वासी और निर्धारित हो जाता है। जब T > 1, लॉगिट्स कम हो जाते हैं, वितरण चापलूस हो जाता है और यादृच्छिकता बढ़ जाती है।
उदाहरण के लिए, Transformer (architecture)-आधारित भाषा मॉडल में, 0.1 का तापमान समान प्रॉम्प्ट के लिए लगभग समान आउटपुट उत्पन्न कर सकता है, जबकि 1.5 का तापमान अधिक विविध और कभी-कभी आश्चर्यजनक प्रतिक्रियाएँ देता है। T का चयन अक्सर कार्य-निर्भर होता है: तथ्यात्मक प्रश्न-उत्तर के लिए कम तापमान, रचनात्मक लेखन या विचार-मंथन के लिए उच्च तापमान।
बड़े भाषा मॉडल में भूमिका
Large language model में, तापमान स्केलिंग एक मानक सैंपलिंग पैरामीटर है जो उपयोगकर्ताओं को उजागर होता है। OpenAI, Anthropic और Google DeepMind जैसी कंपनियाँ अपने API इंटरफेस में तापमान शामिल करती हैं। उदाहरण के लिए, OpenAI का GPT-4 API 0 से 2 के बीच तापमान मानों की अनुमति देता है, जिसमें 0.7 एक सामान्य डिफ़ॉल्ट है। Anthropic के Claude मॉडल समान रूप से तापमान समायोजन का समर्थन करते हैं। Google के Gemini मॉडल भी तापमान नियंत्रण प्रदान करते हैं।
यह तकनीक टोकन निर्माण चरण में लागू की जाती है। मॉडल अगले टोकन के लिए लॉगिट्स उत्पन्न करने के बाद, तापमान लागू किया जाता है, और फिर एक सैंपलिंग विधि (जैसे top-k या nucleus सैंपलिंग) टोकन का चयन करती है। तापमान इन सैंपलिंग रणनीतियों के साथ संवाद करता है: उच्च तापमान top-p सैंपलिंग के साथ संयुक्त होने पर विविध फिर भी सुसंगत पाठ उत्पन्न कर सकता है।
मॉडल कैलिब्रेशन से संबंध
तापमान स्केलिंग एक प्रसिद्ध कैलिब्रेशन तकनीक भी है। वर्गीकरण कार्यों में, किसी मॉडल की भविष्यवाणी की गई संभावनाएँ अक्सर आत्मविश्वास को अधिक आंकती हैं। सत्यापन सेट पर एक एकल तापमान पैरामीटर सीखकर (क्रॉस-एन्ट्रॉपी लॉस का उपयोग करके), संभावनाओं को वास्तविक सटीकता को बेहतर ढंग से प्रतिबिंबित करने के लिए पुन: कैलिब्रेट किया जा सकता है। यह उपयोग Guo et al. (2017) द्वारा उनके पेपर "On Calibration of Modern Neural Networks" में लोकप्रिय किया गया था। हालाँकि, जनरेटिव संदर्भों में, तापमान आमतौर पर सीखा जाने के बजाय अनुमानात्मक रूप से निर्धारित किया जाता है।
व्यावहारिक मार्गदर्शन और डिफ़ॉल्ट
चिकित्सक अक्सर वांछित आउटपुट विशेषताओं के आधार पर तापमान को ट्यून करते हैं। कोड उत्पादन या गणित समस्याओं जैसे कार्यों के लिए, कम तापमान (0.1-0.3) त्रुटियों को कम करता है। संवाद या रचनात्मक लेखन के लिए, 0.7-1.0 के आसपास तापमान सामान्य है। कुछ सिस्टम गतिशील तापमान शेड्यूलिंग का उपयोग करते हैं, जहां तापमान निर्माण के दौरान बदलता है (उदाहरण के लिए, विविधता के लिए शुरुआत में उच्च, सुसंगतता के लिए अंत के पास कम)।
शोध से पता चला है कि इष्टतम तापमान मॉडल आकार और प्रशिक्षण डेटा के साथ भिन्न होता है। उदाहरण के लिए, छोटे मॉडलों को दोहराए जाने वाले आउटपुट से बचने के लिए उच्च तापमान की आवश्यकता हो सकती है, जबकि बड़े मॉडल अत्यधिक निर्धारित हुए बिना कम तापमान संभाल सकते हैं।
सीमाएँ और विकल्प
तापमान स्केलिंग की सीमाएँ हैं। यह अंतर्निहित मॉडल के ज्ञान या तर्क को नहीं बदलता है; यह केवल सैंपलिंग यादृच्छिकता को प्रभावित करता है। अत्यधिक उच्च तापमान बकवास या भ्रम उत्पन्न कर सकता है, जबकि अत्यधिक कम तापमान दोहराए जाने वाले या उबाऊ आउटपुट का कारण बन सकता है। विकल्पों में top-k सैंपलिंग, nucleus (top-p) सैंपलिंग और min-p सैंपलिंग शामिल हैं, जो वितरण को आकार देने के बजाय छोटा करते हैं। इन विधियों का उपयोग अक्सर तापमान के साथ संयोजन में किया जाता है।
एक और सीमा यह है कि तापमान एक वैश्विक पैरामीटर है जो सभी टोकनों पर समान रूप से लागू होता है; यह संदर्भ के अनुकूल नहीं होता है। कुछ हालिया दृष्टिकोण, जैसे contrastive decoding या typical sampling, अधिक सूक्ष्म नियंत्रण प्रदान करते हैं लेकिन कम व्यापक रूप से अपनाए जाते हैं।
ऐतिहासिक संदर्भ और अपनाना
तंत्रिका नेटवर्क में तापमान का उपयोग 1980 के दशक में बोल्ट्ज़मैन मशीनों के संदर्भ में हुआ, जहां तापमान न्यूरॉन सक्रियण की स्टोकेस्टिकता को नियंत्रित करता था। आधुनिक गहन शिक्षण में, यह तकनीक Hinton et al. द्वारा 2015 के पेपर "Distilling the Knowledge in a Neural Network" द्वारा लोकप्रिय हुई, जिसने ज्ञान आसवन में तापमान का उपयोग किया। तब से, यह TensorFlow, PyTorch और JAX सहित हर प्रमुख AI ढांचे में एक मानक उपकरण बन गया है।
Artificial intelligence उद्योग में, तापमान स्केलिंग को क्लाउड प्लेटफार्मों में अनुमान इंजनों में लागू किया जाता है। उदाहरण के लिए, Amazon Web Services Bedrock, Microsoft Azure OpenAI Service और Google Cloud Vertex AI सभी तापमान को एक पैरामीटर के रूप में उजागर करते हैं। NVIDIA और AMD जैसे हार्डवेयर प्रदाता अपने चिप्स को अतिरिक्त गणना को कुशलता से संभालने के लिए अनुकूलित करते हैं, हालांकि तापमान स्केलिंग स्वयं कम्प्यूटेशनल रूप से तुच्छ है।
भविष्य की दिशाएँ
जैसे-जैसे Generative AI विकसित होता है, तापमान स्केलिंग एक सरल फिर भी शक्तिशाली उपकरण बना रहता है। शोधकर्ता अनुकूली तापमान विधियों की खोज कर रहे हैं जो टोकन-स्तरीय अनिश्चितता या कार्य कठिनाई के आधार पर समायोजित होते हैं। AI21 Labs और Inflection AI जैसे कुछ मॉडल अपने इंटरफेस में तापमान-जैसे नियंत्रण शामिल करते हैं। यह तकनीक मानव प्रतिक्रिया से सुदृढीकरण सीखने (RLHF) में भी प्रासंगिक है, जहां तापमान प्रशिक्षण के दौरान अन्वेषण-दोहन व्यापार-बंद को प्रभावित करता है।
संक्षेप में, तापमान स्केलिंग आधुनिक AI में एक बहुमुखी और आवश्यक तकनीक है, जो उत्पन्न सामग्री की रचनात्मकता और निर्धारण पर सूक्ष्म-नियंत्रण सक्षम करती है। इसकी सरलता और प्रभावशीलता अनुसंधान और उत्पादन प्रणालियों में इसके निरंतर उपयोग को सुनिश्चित करती है।