अंग्रेज़ी से अनुवादित

तापमान भाषा मॉडलों में एक सैंपलिंग पैरामीटर है जो सॉफ्टमैक्स से पहले लॉगिट्स को स्केल करके आउटपुट की यादृच्छिकता को नियंत्रित करता है, जिसमें कम मान निर्धारित पाठ उत्पन्न करते हैं और उच्च मान विविधता बढ़ाते हैं। इसका उपयोग अक्सर [[top-k]] और [[top-p]] सैंपलिंग के साथ किया जाता है।

बड़े भाषा मॉडल के संदर्भ में, तापमान एक हाइपरपैरामीटर है जो उत्पन्न पाठ की यादृच्छिकता को नियंत्रित करता है। इसे डिकोडिंग चरण के दौरान लागू किया जाता है, जब मॉडल अगले संभावित टोकन पर संभाव्यता वितरण की गणना करता है, लेकिन अंतिम टोकन चुने जाने से पहले। लॉगिट्स (कच्चे, असंसाधित स्कोर) को सॉफ्टमैक्स फ़ंक्शन से गुजारने से पहले स्केल करके, तापमान संभाव्यता वितरण को पुनः आकार देता है, जिससे यह या तो अधिक शिखरयुक्त (नियतात्मक) या अधिक समतल (विविध) हो जाता है। यह पैरामीटर आमतौर पर एक सकारात्मक फ्लोटिंग-पॉइंट संख्या होती है, जिसका डिफ़ॉल्ट मान 1.0 मॉडल के मूल वितरण का प्रतिनिधित्व करता है। 1.0 से नीचे के मान वितरण को तेज करते हैं, उच्च-संभाव्यता वाले टोकन का पक्ष लेते हैं, जबकि 1.0 से ऊपर के मान इसे समतल करते हैं, जिससे कम-संभाव्यता वाले टोकन को चुने जाने का अधिक अवसर मिलता है। तापमान जनरेटिव AI प्रणालियों में एक मुख्य नियंत्रण है, जिसका व्यापक रूप से OpenAI, Anthropic, और Google DeepMind जैसे प्रदाताओं के API में रचनात्मक बनाम तथ्यात्मक आउटपुट को ट्यून करने के लिए उपयोग किया जाता है।

तापमान अवधारणात्मक रूप से अन्य सैंपलिंग रणनीतियों से अलग है, हालांकि इसे अक्सर उनके साथ जोड़ा जाता है। जबकि टॉप-के सैंपलिंग उम्मीदवार पूल को सबसे संभावित k टोकन तक सीमित करती है और टॉप-पी सैंपलिंग (जिसे न्यूक्लियस सैंपलिंग भी कहा जाता है) उस सबसे छोटे सेट से चयन करती है जिसकी संचयी संभावना एक सीमा से अधिक होती है, तापमान किसी भी छंटनी से पहले पूरे वितरण को संशोधित करता है। व्यवहार में, डेवलपर्स अक्सर रचनात्मकता और सुसंगतता को संतुलित करने के लिए तापमान को टॉप-पी के साथ सेट करते हैं। उदाहरण के लिए, सारांश जैसे तथ्यात्मक कार्यों के लिए कम तापमान (जैसे, 0.2) मध्यम टॉप-पी (जैसे, 0.9) के साथ सामान्य है, जबकि रचनात्मक लेखन या विचार-मंथन के लिए उच्च तापमान (जैसे, 0.8) उच्च टॉप-पी (जैसे, 0.95) के साथ उपयोग किया जाता है।

गणितीय सूत्रीकरण

तापमान का प्रभाव लॉगिट्स पर एक स्केलिंग ऑपरेशन के माध्यम से परिभाषित किया गया है। शब्दावली में प्रत्येक टोकन \( i \) के लिए मॉडल के लॉगिट्स \( z_i \) दिए जाने पर, तापमान-स्केल की गई संभावना \( p_i \) की गणना इस प्रकार की जाती है:

\[ p_i = \frac{\exp(z_i / T)}{\sum_j \exp(z_j / T)} \]

जहाँ \( T \) तापमान मान है। जब \( T = 1 \), अभिव्यक्ति मानक सॉफ्टमैक्स में कम हो जाती है। जैसे-जैसे \( T \) 0 की ओर बढ़ता है, वितरण उच्चतम लॉगिट वाले टोकन पर एक बिंदु द्रव्यमान में परिवर्तित हो जाता है, जिससे मॉडल प्रभावी रूप से लालची और नियतात्मक बन जाता है। जैसे-जैसे \( T \) अनंत की ओर बढ़ता है, वितरण सभी टोकन पर एक समान वितरण की ओर अग्रसर होता है, जिससे अधिकतम यादृच्छिक आउटपुट मिलते हैं। व्यवहार में, तापमान शायद ही कभी 2.0 से ऊपर सेट किया जाता है क्योंकि चरम मान बकवास उत्पन्न करते हैं, और 0.1 से नीचे के मानों को अक्सर लालची डिकोडिंग के समकक्ष माना जाता है। स्केलिंग किसी भी सैंपलिंग विधि से पहले लागू की जाती है, इसलिए अंतिम चयन अभी भी संशोधित वितरण से स्टोकेस्टिक सैंपलिंग का उपयोग कर सकता है।

ऐतिहासिक उत्पत्ति

संभाव्य मॉडलों में तापमान की अवधारणा आधुनिक डीप लर्निंग से पहले की है। इसे सांख्यिकीय भौतिकी में पेश किया गया था, जहाँ तापमान बोल्ट्ज़मैन वितरण की तीक्ष्णता को नियंत्रित करता है। मशीन लर्निंग में, तापमान स्केलिंग को तंत्रिका नेटवर्क के संदर्भ में आत्मविश्वास स्कोर को कैलिब्रेट करने के लिए लोकप्रिय बनाया गया था, विशेष रूप से चुआन गुओ और सहयोगियों द्वारा 2017 के पेपर "ऑन कैलिब्रेशन ऑफ मॉडर्न न्यूरल नेटवर्क्स" में, जिसने बेहतर अनिश्चितता अनुमानों के लिए लॉगिट्स को पुनः स्केल करने के लिए एकल तापमान पैरामीटर का उपयोग किया। यह विचार जल्दी से अनुक्रम निर्माण में अपनाया गया, विशेष रूप से अनुक्रम-से-अनुक्रम मॉडल और ट्रांसफॉर्मर के लिए, आउटपुट परिवर्तनशीलता को नियंत्रित करने के लिए एक व्यावहारिक घुंडी के रूप में। मशीन लर्निंग पुस्तकालयों, जैसे TensorFlow और PyTorch, में प्रारंभिक अपनाने ने तापमान को सैंपलिंग फ़ंक्शनों में एक मानक तर्क बना दिया, और यह कई AI पाठ निर्माण इंटरफेस में एक डिफ़ॉल्ट पैरामीटर बन गया।

भाषा मॉडल अनुमान में भूमिका

अनुमान के दौरान, एक भाषा मॉडल आउटपुट अनुक्रम में प्रत्येक स्थिति के लिए अपनी शब्दावली पर एक संभाव्यता वितरण उत्पन्न करता है। तापमान के बिना, मॉडल हमेशा सबसे संभावित टोकन चुनता, जिससे दोहराव वाला और अक्सर नीरस पाठ होता। तापमान स्टोकेस्टिकता पेश करता है, जो विविधता की आवश्यकता वाले कार्यों के लिए आवश्यक है, जैसे संवाद, कहानी निर्माण, या कोड पूर्णता जहाँ कई वैध निरंतरताएँ मौजूद हैं। डीप लर्निंग फ्रेमवर्क में, तापमान डिकोडिंग चरण में लागू किया जाता है, प्रशिक्षण के दौरान नहीं, जिसका अर्थ है कि यह मॉडल के सीखे गए वजन को प्रभावित नहीं करता है। यह इसे एक हल्का, रनटाइम-केवल समायोजन बनाता है जिसे पुनः प्रशिक्षण के बिना प्रति अनुरोध बदला जा सकता है।

उदाहरण के लिए, OpenAI API में, temperature पैरामीटर 0 से 2 तक मान स्वीकार करता है, जिसका डिफ़ॉल्ट 1.0 है। 0 का मान मॉडल को नियतात्मक बनाता है, हमेशा उच्चतम-संभाव्यता वाला टोकन चुनता है, जबकि उच्च मान विविधता बढ़ाते हैं। इसी तरह, Anthropic के Claude मॉडल अपने API में तापमान उजागर करते हैं, और Google DeepMind के Gemini मॉडल इसे एक निर्माण पैरामीटर के रूप में शामिल करते हैं। ये प्रदाता यह भी दस्तावेज करते हैं कि तापमान अन्य सैंपलिंग पैरामीटर, जैसे टॉप-पी और टॉप-के के साथ परस्पर क्रिया करता है, और उन्हें अलगाव में नहीं बल्कि एक साथ समायोजित करने की सलाह देते हैं।

अन्य सैंपलिंग विधियों से संबंध

तापमान आउटपुट वितरण को आकार देने के लिए उपयोग की जाने वाली कई तकनीकों में से एक है। टॉप-के सैंपलिंग अगले टोकन को सबसे संभावित k विकल्पों तक सीमित करती है, जो उच्च तापमान पर भी बहुत कम-संभाव्यता वाले टोकन को चुने जाने से रोकती है। टॉप-पी सैंपलिंग गतिशील रूप से उन टोकन का सबसे छोटा सेट चुनती है जिनकी संचयी संभावना एक सीमा p से अधिक होती है, जो निश्चित k की तुलना में अधिक अनुकूली छंटनी प्रदान करती है। तापमान इन छंटनी विधियों से ऑर्थोगोनल है: यह वितरण के आकार को बदलता है, जबकि टॉप-के और टॉप-पी समर्थन को बदलते हैं। व्यवहार में, इन्हें अक्सर एक साथ उपयोग किया जाता है। उदाहरण के लिए, रचनात्मक कार्यों के लिए एक सामान्य नुस्खा तापमान 0.7 टॉप-पी 0.9 के साथ है, जबकि कोड निर्माण के लिए, त्रुटियों को कम करने के लिए तापमान 0.2 टॉप-पी 0.1 के साथ विशिष्ट है।

एक और संबंधित अवधारणा मॉडल कैलिब्रेशन के संदर्भ में तापमान स्केलिंग है, जहाँ आत्मविश्वास अनुमानों को बेहतर बनाने के लिए एक सत्यापन सेट पर एक एकल तापमान सीखा जाता है। यह निर्माण समय पर उपयोग किए जाने वाले सैंपलिंग तापमान से अलग है, हालांकि दोनों एक ही गणितीय ऑपरेशन साझा करते हैं। कैलिब्रेशन तापमान आमतौर पर 1.0 के करीब होता है और प्रशिक्षण के बाद स्थिर होता है, जबकि सैंपलिंग तापमान एक उपयोगकर्ता-नियंत्रित हाइपरपैरामीटर है।

व्यावहारिक दिशानिर्देश और व्यापार-नापसंद

सही तापमान चुनना अनुप्रयोग पर निर्भर करता है। तथ्यात्मक सटीकता की आवश्यकता वाले कार्यों, जैसे प्रश्न उत्तर, सारांश, या डेटा निष्कर्षण के लिए, भ्रम को कम करने और सुसंगत आउटपुट उत्पन्न करने के लिए कम तापमान (0.1 से 0.3) की सिफारिश की जाती है। रचनात्मक लेखन, विचार-मंथन, या कई उम्मीदवार समाधान उत्पन्न करने के लिए, उच्च तापमान (0.7 से 1.0) नवीनता और भिन्नता को प्रोत्साहित करता है। अत्यधिक उच्च तापमान (1.5 से ऊपर) अक्सर असंगत पाठ की ओर ले जाता है, क्योंकि मॉडल व्याकरणिक संरचना और अर्थ संबंधी सुसंगतता खो देता है। डेवलपर्स को यह भी विचार करना होगा कि तापमान प्रतिलिपि प्रस्तुत करने योग्यता को प्रभावित करता है: तापमान 0 पर सेट करने से नियतात्मक आउटपुट मिलते हैं, जो परीक्षण और डिबगिंग के लिए उपयोगी है, लेकिन उच्च तापमान पर स्टोकेस्टिक सैंपलिंग का मतलब है कि एक ही प्रॉम्प्ट विभिन्न रनों में अलग-अलग परिणाम उत्पन्न कर सकता है, जो स्थिर आउटपुट की आवश्यकता वाली उत्पादन प्रणालियों में अवांछनीय हो सकता है।

तापमान मॉडल के प्रशिक्षण वितरण के साथ भी परस्पर क्रिया करता है। विविध डेटा पर प्रशिक्षित मॉडल संकीर्ण डोमेन पर प्रशिक्षित मॉडल की तुलना में उच्च तापमान को बेहतर सहन कर सकते हैं। उदाहरण के लिए, कानूनी दस्तावेजों पर फाइन-ट्यून किया गया मॉडल तापमान 1.0 पर बकवास पाठ उत्पन्न कर सकता है, जबकि एक सामान्य-उद्देश्य मॉडल इसे सुचारू रूप से संभालता है। 2020 के दशक की शुरुआत तक, अधिकांश प्रमुख भाषा मॉडल प्रदाताओं ने तापमान को एक मानक API पैरामीटर के रूप में अपनाया है, और यह Hugging Face के Transformers जैसे ओपन-सोर्स पुस्तकालयों में भी लागू किया गया है, जहाँ इसे generate() जैसे निर्माण फ़ंक्शनों में पारित किया जाता है।

सॉफ्टवेयर में कार्यान्वयन

व्यवहार में, तापमान एक भाषा मॉडल के डिकोडिंग लूप में लागू किया जाता है। मॉडल फॉरवर्ड पास लॉगिट्स उत्पन्न करने के बाद, कोड उन्हें तापमान मान से विभाजित करता है, सॉफ्टमैक्स लागू करता है, और फिर परिणामी वितरण से सैंपल करता है। कई फ्रेमवर्क एक do_sample फ्लैग भी समर्थन करते हैं, जो True पर सेट होने पर तापमान के साथ स्टोकेस्टिक सैंपलिंग सक्षम करता है; False होने पर, मॉडल तापमान की परवाह किए बिना लालची डिकोडिंग का उपयोग करता है। Hugging Face Transformers पुस्तकालय में, उदाहरण के लिए, temperature तर्क केवल तब उपयोग किया जाता है जब do_sample=True होता है। यह डिज़ाइन डेवलपर्स को नियतात्मक और स्टोकेस्टिक मोड के बीच आसानी से स्विच करने की अनुमति देता है।

AWS Trainium और Groq जैसे हार्डवेयर त्वरक अक्सर अनुकूलित अनुमान पथ प्रदान करते हैं, लेकिन तापमान स्केलिंग एक सरल अंकगणितीय ऑपरेशन है जो नगण्य ओवरहेड जोड़ता है। मुख्य कम्प्यूटेशनल लागत मॉडल का फॉरवर्ड पास रहता है, सैंपलिंग चरण नहीं। नतीजतन, तापमान को महत्वपूर्ण विलंबता प्रभाव के बिना मक्खी पर समायोजित किया जा सकता है, जिससे यह इंटरैक्टिव अनुप्रयोगों के लिए एक व्यावहारिक उपकरण बन जाता है।

सीमाएँ और आलोचनाएँ

तापमान आउटपुट गुणवत्ता को नियंत्रित करने के लिए एक कुंद उपकरण है। यह सुसंगतता या तथ्यात्मक शुद्धता की गारंटी नहीं देता है; यह केवल संभाव्यता वितरण को बदलता है। उच्च तापमान रचनात्मक लेकिन गलत कथन उत्पन्न कर सकता है, जबकि कम तापमान दोहराव वाला या अत्यधिक रूढ़िवादी पाठ उत्पन्न कर सकता है। शोधकर्ताओं ने नोट किया है कि तापमान बीम खोज या बाधित डिकोडिंग जैसी बेहतर डिकोडिंग रणनीतियों का विकल्प नहीं है, जो संरचनात्मक बाधाओं को लागू करती हैं। इसके अतिरिक्त, तापमान एक वैश्विक पैरामीटर है जो सभी टोकन पर समान रूप से लागू होता है, लेकिन कुछ संदर्भों में यादृच्छिकता के विभिन्न स्तरों की आवश्यकता हो सकती है - उदाहरण के लिए, कोड सिंटैक्स के लिए नियतात्मक होना लेकिन टिप्पणियों के लिए रचनात्मक होना। 2020 के दशक के मध्य तक, कंट्रास्टिव खोज या गतिशील तापमान समायोजन जैसी अधिक उन्नत विधियाँ प्रस्तावित की गई हैं, लेकिन किसी ने भी वाणिज्यिक API में डिफ़ॉल्ट नियंत्रण के रूप में तापमान को प्रतिस्थापित नहीं किया है।

भविष्य की दिशाएँ

अनुकूली तापमान योजनाओं पर शोध जारी है जो टोकन की अनुमानित अनिश्चितता या हाथ में कार्य के आधार पर मान को समायोजित करते हैं। कुछ कार्यों ने प्रशिक्षण के दौरान तापमान अनुसूची सीखने की खोज की है, हालांकि यह अभी तक मानक नहीं है। जनरेटिव AI के व्यापक क्षेत्र में, तापमान एक प्रमुख उपयोगकर्ता-सामना करने वाला पैरामीटर बना हुआ है, और इसकी सरलता इसकी ताकत और कमजोरी दोनों है। जैसे-जैसे मॉडल बड़े और अधिक सक्षम होते जाते हैं, बारीक-नियंत्रण की आवश्यकता नए पैरामीटर की ओर ले जा सकती है, लेकिन तापमान भाषा मॉडल अनुमान में एक मौलिक अवधारणा के रूप में बने रहने की संभावना है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:language-model·sampling·hyperparameter·generation
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास