अंग्रेज़ी से अनुवादित

मॉडल द्वारा प्रतिक्रिया उत्पन्न करते समय खर्च की गई गणना, प्रशिक्षण के दौरान की तुलना में; इसे बढ़ाना, यानी मॉडल को अनुमान के समय अधिक समय तक तर्क करने देना, 2024 से आगे क्षमता लाभ का एक प्रमुख चालक बन गया।

टेस्ट-टाइम कंप्यूट का तात्पर्य उस गणना की मात्रा से है जो एक मॉडल उत्तर उत्पन्न करते समय करता है, जो प्रशिक्षण के दौरान खर्च की गई गणना से अलग है। डीप लर्निंग युग के अधिकांश समय में, क्षमता में वृद्धि लगभग पूरी तरह से प्रशिक्षण को बढ़ाने से आई: अधिक पैरामीटर, अधिक डेटा, अधिक प्रशिक्षण कंप्यूट, जैसा कि स्केलिंग-लॉ में वर्णित है। टेस्ट-टाइम कंप्यूट अनुमान को ही दूसरे लीवर के रूप में मानता है। एक मॉडल को लंबे समय तक सोचने, अधिक उम्मीदवार उत्तरों का पता लगाने, या प्रतिक्रिया देने से पहले अपने काम की जांच करने के लिए बनाया जा सकता है, और इनमें से प्रत्येक पर उपयोग के समय अतिरिक्त कंप्यूट खर्च होता है, न कि प्रशिक्षण के समय।

यह दृष्टिकोण ओपनएआई-ओ1 के साथ मुख्यधारा में आया, जिसे ओपनएआई ने सितंबर 2024 में जारी किया था। पहले के चैटबॉट्स के विपरीत, जो एक ही पास में जल्दी उत्तर देने के लिए अनुकूलित थे, ओ1 को अंतिम उत्तर देने से पहले एक विस्तृत, काफी हद तक छिपी हुई आंतरिक तर्क श्रृंखला उत्पन्न करने के लिए प्रशिक्षित किया गया था, और गणित, कोडिंग और तर्क बेंचमार्क पर इसकी सटीकता में सुधार हुआ, जैसे-जैसे अधिक तर्क टोकन की अनुमति दी गई। इसने तर्क-मॉडल को बड़े-भाषा-मॉडल की एक अलग श्रेणी के रूप में स्थापित किया, और डीपसीक-आर1 और Google के जेमिनी "थिंकिंग" वेरिएंट सहित प्रतिस्पर्धियों ने लगभग एक वर्ष के भीतर इसका अनुसरण किया।

तंत्र

टेस्ट-टाइम कंप्यूट को कई तरीकों से खर्च किया जा सकता है। सबसे सरल है लंबी चेन-ऑफ-थॉट पीढ़ी: मॉडल उत्तर देने से पहले मध्यवर्ती तर्क चरणों को पाठ टोकन के रूप में लिखता है, और अधिक टोकन की अनुमति देने से आम तौर पर स्पष्ट सही उत्तर वाले कार्यों, जैसे अंकगणित या कोड शुद्धता, पर प्रदर्शन में सुधार होता है। तकनीकों का दूसरा परिवार कई स्वतंत्र उत्तरों का नमूना लेता है और सर्वोत्तम का चयन करता है, या तो बहुमत वोट (स्व-संगति) द्वारा या एक अलग सत्यापनकर्ता या पुरस्कार मॉडल के साथ उम्मीदवारों को स्कोर करके, कभी-कभी आंशिक समाधानों पर वृक्ष खोज के रूप में आयोजित किया जाता है। तीसरा दृष्टिकोण संशोधन है: मॉडल एक ड्राफ्ट तैयार करता है, उसकी आलोचना करता है, और पुनः उत्पन्न करता है, पहले आउटपुट के लिए प्रतिबद्ध होने के बजाय त्रुटियों को पकड़ने के लिए अतिरिक्त पास खर्च करता है।

ये विधियाँ पहले की इन-कॉन्टेक्स्ट-लर्निंग और प्रॉम्प्टिंग तकनीकों से मुख्य रूप से इस मामले में भिन्न हैं कि अतिरिक्त कंप्यूट को कौन नियंत्रित करता है। फ्यू-शॉट-लर्निंग उदाहरणों जैसी प्रॉम्प्टिंग तकनीकें मॉडल से अपने मौजूदा वज़न को अधिक प्रभावी ढंग से उपयोग करने के लिए कहती हैं; टेस्ट-टाइम कंप्यूट विधियाँ, विशेष रूप से सत्यापन योग्य पुरस्कारों पर रीइन्फोर्समेंट-लर्निंग के साथ प्रशिक्षित मॉडलों में, मॉडल को स्वयं यह तय करने देती हैं कि किसी समस्या के लिए कितना आंतरिक विचार-विमर्श आवश्यक है, सिद्धांत रूप में आसान प्रश्नों पर कम कंप्यूट और कठिन प्रश्नों पर अधिक खर्च करती हैं।

अर्थशास्त्र और व्यापार-नापसंद

क्योंकि तर्क मॉडल एक मानक चैट मॉडल की तुलना में प्रति उत्तर कई गुना अधिक टोकन उपभोग कर सकते हैं, टेस्ट-टाइम कंप्यूट एक लागत और विलंबता व्यापार-नापसंद को फिर से पेश करता है जिसे प्रीट्रेनिंग स्केल ने अधिकांशतः एक तरफ धकेल दिया था: प्रयोगशालाएँ और उपयोगकर्ता अब अधिक सोच के लिए भुगतान करके, अनुमान समय पर सीधे सटीकता खरीद सकते हैं। इसके उत्पाद डिज़ाइन के लिए व्यावहारिक परिणाम हैं, क्योंकि एक तर्क मॉडल पर निर्मित कोडिंग एजेंट या शोध सहायक को कठिन प्रश्न का उत्तर देने में दसियों सेकंड या मिनट लग सकते हैं, और इन मॉडलों के लिए API मूल्य निर्धारण आम तौर पर आउटपुट लंबाई और प्रति टोकन प्रीमियम दोनों को दर्शाता है।

स्वागत और खुले प्रश्न

शोधकर्ताओं ने बहस की है कि टेस्ट-टाइम कंप्यूट वास्तविक तर्क से कैसे संबंधित है बनाम पैटर्न मिलान का एक अधिक महंगा रूप, और आर्क-एजीआई जैसे बेंचमार्क पर परिणाम इस तर्क के दोनों पक्षों पर उपयोग किए गए हैं: तर्क मॉडल ने पिछली पीढ़ियों की तुलना में स्कोर में काफी सुधार किया, लेकिन प्रदर्शन अभी भी उन समस्याओं पर घटता है जिनके लिए प्रशिक्षण डेटा में अच्छी तरह से प्रतिनिधित्व नहीं किए गए तर्क पैटर्न की आवश्यकता होती है। कुछ प्रयोगशालाएँ टेस्ट-टाइम कंप्यूट स्केलिंग को मूल स्केलिंग कानूनों के बराबर महत्व की एक नई धुरी के रूप में वर्णित करती हैं, इस उम्मीद के साथ कि आगे के लाभ अधिक कुशल खोज और सत्यापन से आएंगे, न कि केवल लंबी तर्क श्रृंखलाओं से। अन्य ध्यान देते हैं कि अतिरिक्त अनुमान कंप्यूट से लाभ एक बिंदु के बाद घटते रिटर्न दिखाते हैं, और यह तकनीक प्रीट्रेनिंग स्केल और फाइन-ट्यूनिंग के पूरक के रूप में सबसे अच्छी तरह से समझी जाती है, न कि प्रतिस्थापन के रूप में। 2025 तक, टेस्ट-टाइम कंप्यूट आर्टिफिशियल-जनरल-इंटेलिजेंस समयरेखाओं के बारे में प्रतिस्पर्धी दावों का केंद्र बन गया था, क्योंकि "लंबे समय तक सोचने" से समस्या-विशिष्ट सटीकता लाभ ने प्रयोगशालाओं को पैरामीटर गिनती से अलग एक नया, आसानी से विपणन योग्य क्षमता डायल दिया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reasoning·inference·scaling
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास