टेस्ट-टाइम कंप्यूट का तात्पर्य उस गणना की मात्रा से है जो एक मॉडल उत्तर उत्पन्न करते समय करता है, जो प्रशिक्षण के दौरान खर्च की गई गणना से अलग है। डीप लर्निंग युग के अधिकांश समय में, क्षमता में वृद्धि लगभग पूरी तरह से प्रशिक्षण को बढ़ाने से आई: अधिक पैरामीटर, अधिक डेटा, अधिक प्रशिक्षण कंप्यूट, जैसा कि स्केलिंग-लॉ में वर्णित है। टेस्ट-टाइम कंप्यूट अनुमान को ही दूसरे लीवर के रूप में मानता है। एक मॉडल को लंबे समय तक सोचने, अधिक उम्मीदवार उत्तरों का पता लगाने, या प्रतिक्रिया देने से पहले अपने काम की जांच करने के लिए बनाया जा सकता है, और इनमें से प्रत्येक पर उपयोग के समय अतिरिक्त कंप्यूट खर्च होता है, न कि प्रशिक्षण के समय।
यह दृष्टिकोण ओपनएआई-ओ1 के साथ मुख्यधारा में आया, जिसे ओपनएआई ने सितंबर 2024 में जारी किया था। पहले के चैटबॉट्स के विपरीत, जो एक ही पास में जल्दी उत्तर देने के लिए अनुकूलित थे, ओ1 को अंतिम उत्तर देने से पहले एक विस्तृत, काफी हद तक छिपी हुई आंतरिक तर्क श्रृंखला उत्पन्न करने के लिए प्रशिक्षित किया गया था, और गणित, कोडिंग और तर्क बेंचमार्क पर इसकी सटीकता में सुधार हुआ, जैसे-जैसे अधिक तर्क टोकन की अनुमति दी गई। इसने तर्क-मॉडल को बड़े-भाषा-मॉडल की एक अलग श्रेणी के रूप में स्थापित किया, और डीपसीक-आर1 और Google के जेमिनी "थिंकिंग" वेरिएंट सहित प्रतिस्पर्धियों ने लगभग एक वर्ष के भीतर इसका अनुसरण किया।
तंत्र
टेस्ट-टाइम कंप्यूट को कई तरीकों से खर्च किया जा सकता है। सबसे सरल है लंबी चेन-ऑफ-थॉट पीढ़ी: मॉडल उत्तर देने से पहले मध्यवर्ती तर्क चरणों को पाठ टोकन के रूप में लिखता है, और अधिक टोकन की अनुमति देने से आम तौर पर स्पष्ट सही उत्तर वाले कार्यों, जैसे अंकगणित या कोड शुद्धता, पर प्रदर्शन में सुधार होता है। तकनीकों का दूसरा परिवार कई स्वतंत्र उत्तरों का नमूना लेता है और सर्वोत्तम का चयन करता है, या तो बहुमत वोट (स्व-संगति) द्वारा या एक अलग सत्यापनकर्ता या पुरस्कार मॉडल के साथ उम्मीदवारों को स्कोर करके, कभी-कभी आंशिक समाधानों पर वृक्ष खोज के रूप में आयोजित किया जाता है। तीसरा दृष्टिकोण संशोधन है: मॉडल एक ड्राफ्ट तैयार करता है, उसकी आलोचना करता है, और पुनः उत्पन्न करता है, पहले आउटपुट के लिए प्रतिबद्ध होने के बजाय त्रुटियों को पकड़ने के लिए अतिरिक्त पास खर्च करता है।
ये विधियाँ पहले की इन-कॉन्टेक्स्ट-लर्निंग और प्रॉम्प्टिंग तकनीकों से मुख्य रूप से इस मामले में भिन्न हैं कि अतिरिक्त कंप्यूट को कौन नियंत्रित करता है। फ्यू-शॉट-लर्निंग उदाहरणों जैसी प्रॉम्प्टिंग तकनीकें मॉडल से अपने मौजूदा वज़न को अधिक प्रभावी ढंग से उपयोग करने के लिए कहती हैं; टेस्ट-टाइम कंप्यूट विधियाँ, विशेष रूप से सत्यापन योग्य पुरस्कारों पर रीइन्फोर्समेंट-लर्निंग के साथ प्रशिक्षित मॉडलों में, मॉडल को स्वयं यह तय करने देती हैं कि किसी समस्या के लिए कितना आंतरिक विचार-विमर्श आवश्यक है, सिद्धांत रूप में आसान प्रश्नों पर कम कंप्यूट और कठिन प्रश्नों पर अधिक खर्च करती हैं।
अर्थशास्त्र और व्यापार-नापसंद
क्योंकि तर्क मॉडल एक मानक चैट मॉडल की तुलना में प्रति उत्तर कई गुना अधिक टोकन उपभोग कर सकते हैं, टेस्ट-टाइम कंप्यूट एक लागत और विलंबता व्यापार-नापसंद को फिर से पेश करता है जिसे प्रीट्रेनिंग स्केल ने अधिकांशतः एक तरफ धकेल दिया था: प्रयोगशालाएँ और उपयोगकर्ता अब अधिक सोच के लिए भुगतान करके, अनुमान समय पर सीधे सटीकता खरीद सकते हैं। इसके उत्पाद डिज़ाइन के लिए व्यावहारिक परिणाम हैं, क्योंकि एक तर्क मॉडल पर निर्मित कोडिंग एजेंट या शोध सहायक को कठिन प्रश्न का उत्तर देने में दसियों सेकंड या मिनट लग सकते हैं, और इन मॉडलों के लिए API मूल्य निर्धारण आम तौर पर आउटपुट लंबाई और प्रति टोकन प्रीमियम दोनों को दर्शाता है।
स्वागत और खुले प्रश्न
शोधकर्ताओं ने बहस की है कि टेस्ट-टाइम कंप्यूट वास्तविक तर्क से कैसे संबंधित है बनाम पैटर्न मिलान का एक अधिक महंगा रूप, और आर्क-एजीआई जैसे बेंचमार्क पर परिणाम इस तर्क के दोनों पक्षों पर उपयोग किए गए हैं: तर्क मॉडल ने पिछली पीढ़ियों की तुलना में स्कोर में काफी सुधार किया, लेकिन प्रदर्शन अभी भी उन समस्याओं पर घटता है जिनके लिए प्रशिक्षण डेटा में अच्छी तरह से प्रतिनिधित्व नहीं किए गए तर्क पैटर्न की आवश्यकता होती है। कुछ प्रयोगशालाएँ टेस्ट-टाइम कंप्यूट स्केलिंग को मूल स्केलिंग कानूनों के बराबर महत्व की एक नई धुरी के रूप में वर्णित करती हैं, इस उम्मीद के साथ कि आगे के लाभ अधिक कुशल खोज और सत्यापन से आएंगे, न कि केवल लंबी तर्क श्रृंखलाओं से। अन्य ध्यान देते हैं कि अतिरिक्त अनुमान कंप्यूट से लाभ एक बिंदु के बाद घटते रिटर्न दिखाते हैं, और यह तकनीक प्रीट्रेनिंग स्केल और फाइन-ट्यूनिंग के पूरक के रूप में सबसे अच्छी तरह से समझी जाती है, न कि प्रतिस्थापन के रूप में। 2025 तक, टेस्ट-टाइम कंप्यूट आर्टिफिशियल-जनरल-इंटेलिजेंस समयरेखाओं के बारे में प्रतिस्पर्धी दावों का केंद्र बन गया था, क्योंकि "लंबे समय तक सोचने" से समस्या-विशिष्ट सटीकता लाभ ने प्रयोगशालाओं को पैरामीटर गिनती से अलग एक नया, आसानी से विपणन योग्य क्षमता डायल दिया।