अनुमान (इन्फरेंस), कृत्रिम बुद्धिमत्ता में, एक प्रशिक्षित मॉडल को नए इनपुट पर चलाकर आउटपुट उत्पन्न करने की प्रक्रिया है, जो प्रशिक्षण से भिन्न है - प्रशिक्षण वह प्रारंभिक चरण है जिसमें मॉडल के पैरामीटर डेटा से सीखे जाते हैं। एक बड़ा भाषा मॉडल जो उपयोगकर्ता के प्रश्न का उत्तर देता है, एक छवि वर्गीकारक जो फोटो को लेबल करता है, और एक डिफ्यूज़न मॉडल जो टेक्स्ट प्रॉम्प्ट से छवि उत्पन्न करता है - ये सभी अनुमान कर रहे हैं। एक बार प्रशिक्षण समाप्त हो जाने और मॉडल के वेट्स निर्धारित हो जाने के बाद, उस मॉडल का प्रत्येक बाद का उपयोग एक अनुमान कॉल है।
लागत और हार्डवेयर
अनुमान की कम्प्यूटेशनल माँगें प्रशिक्षण से भिन्न होती हैं। एक बड़े मॉडल को प्रशिक्षित करने के लिए कई पासों में विशाल डेटासेट को संसाधित करना आवश्यक होता है और यह आमतौर पर GPU या TPU के बड़े क्लस्टरों पर हफ्तों या महीनों तक चलता है। इसके बजाय, अनुमान लगातार चलता है, अक्सर लाखों व्यक्तिगत अनुरोधों की सेवा करता है, और इसकी लागत संरचना किसी एकल कार्य द्वारा उपभोग की गई कुल कंप्यूट शक्ति की तुलना में विलंबता (एकल प्रतिक्रिया उत्पन्न करने का समय) और थ्रूपुट (प्रति हार्डवेयर इकाई सिस्टम द्वारा सेवा किए जा सकने वाले अनुरोधों की संख्या) पर अधिक निर्भर करती है। चूँकि भाषा मॉडल एक समय में एक टोकन उत्पन्न करते हैं, और प्रत्येक नया टोकन पिछले सभी टोकनों पर निर्भर करता है, ऑटोरेग्रेसिव मॉडल के लिए अनुमान तुलनात्मक रूप से धीमा और कंप्यूट-बाउंड के बजाय मेमोरी-बाउंड होता है, जिसने प्रशिक्षण-केंद्रित शोध से अलग विशेष अनुमान इंजीनियरिंग की एक लहर को जन्म दिया है। NVIDIA और अन्य चिप निर्माताओं ने विशेष रूप से अनुमान कार्यभार के लिए अनुकूलित हार्डवेयर जारी किया है, और क्लाउड प्रदाता अनुमान और प्रशिक्षण क्षमता के लिए अलग-अलग मूल्य निर्धारित करते हैं।
अनुकूलन तकनीकें
चूँकि अनुमान की लागत सीधे उपयोग के साथ बढ़ती है, यह अनुकूलन का एक प्रमुख लक्ष्य है। क्वांटाइज़ेशन मॉडल के वेट्स की संख्यात्मक परिशुद्धता को कम करता है, जिससे मेमोरी उपयोग घटता है और अक्सर मामूली सटीकता समझौते के साथ गणना तेज होती है। नॉलेज डिस्टिलेशन एक छोटे मॉडल को बड़े मॉडल की नकल करने के लिए प्रशिक्षित करता है, जिससे अनुमान समय पर चलाने के लिए सस्ता मॉडल तैयार होता है। स्पेक्युलेटिव डिकोडिंग एक छोटे, तेज़ ड्राफ्ट मॉडल का उपयोग करके एक साथ कई टोकन प्रस्तावित करती है, जिन्हें बाद में एक बड़ा मॉडल समानांतर में सत्यापित करता है, जिससे लंबे आउटपुट उत्पन्न करने के लिए आवश्यक धीमे अनुक्रमिक चरणों की संख्या कम हो जाती है। कई उपयोगकर्ताओं के अनुरोधों को एक साथ बैच करना, पहले से गणना किए गए मध्यवर्ती परिणामों जैसे कि अटेंशन की-वैल्यू कैश को कैश करना, और सरल प्रश्नों को छोटे मॉडलों पर रूट करना, बड़े पैमाने पर मॉडल की सेवा की लागत कम करने की अतिरिक्त सामान्य तकनीकें हैं।
टेस्ट-टाइम कंप्यूट
अनुमान को पारंपरिक रूप से प्रशिक्षण की तुलना में एक निश्चित, हल्का कदम माना जाता था, लेकिन रीज़निंग मॉडल के उदय ने, जो उत्तर देने से पहले विस्तारित आंतरिक तर्क उत्पन्न करते हैं, एक नया आयाम पेश किया: अनुमान समय पर अधिक कंप्यूट खर्च करना, एक दृष्टिकोण जिसे टेस्ट-टाइम कंप्यूट के रूप में जाना जाता है, कठिन समस्याओं पर आउटपुट गुणवत्ता में काफी सुधार कर सकता है। इसने पुरानी धारणा को धुंधला कर दिया कि केवल प्रशिक्षण-समय कंप्यूट ही क्षमता के लिए मायने रखता है, क्योंकि एक मॉडल अब किसी दी गई समस्या पर "अधिक सोचकर" अनुमान लागत को सटीकता के लिए व्यापार कर सकता है - एक ऐसा समझौता जो पहले की पीढ़ियों के मॉडलों के लिए उसी तरह मौजूद नहीं था, जो कार्य की कठिनाई की परवाह किए बिना निश्चित मात्रा में आउटपुट उत्पन्न करते थे।
अर्थशास्त्र
चूँकि व्यापक रूप से उपयोग किए जाने वाले AI उत्पाद लगातार अनुमान अनुरोधों की सेवा करते हैं, अनुमान लागत, प्रशिक्षण लागत नहीं, एक तैनात मॉडल चलाने के दीर्घकालिक अर्थशास्त्र पर हावी होती है, और AI बुनियादी ढांचे के खर्च पर उद्योग की चर्चा तेजी से अनुमान क्षमता पर केंद्रित हो रही है क्योंकि उपयोग बढ़ता है, साथ ही प्रीट्रेनिंग में बड़े मॉडलों पर चल रहे निवेश के साथ।