प्रीट्रेनिंग एक आधुनिक AI मॉडल को प्रशिक्षित करने का पहला और आमतौर पर सबसे अधिक कम्प्यूटेशनल रूप से महंगा चरण है, जिसमें मॉडल एक बड़े, सामान्य कॉर्पस से एक सामान्य प्रशिक्षण उद्देश्य का उपयोग करके व्यापक सांख्यिकीय पैटर्न सीखता है, इससे पहले कि किसी विशिष्ट डाउनस्ट्रीम कार्य के लिए कोई अनुकूलन होता है। बड़े भाषा मॉडल के लिए, प्रीट्रेनिंग लगभग हमेशा स्व-पर्यवेक्षित शिक्षण का अर्थ रखती है: मॉडल को पाठ की विशाल मात्रा दी जाती है और उसे उसके आस-पास के संदर्भ के आधार पर एक टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, सबसे आम तौर पर अनुक्रम में अगला टोकन, एक उद्देश्य जिसके लिए मानव-प्रदत्त लेबल की आवश्यकता नहीं होती है क्योंकि "उत्तर" केवल मौजूदा पाठ में अगला शब्द होता है।
प्रीट्रेनिंग क्यों काम करती है
प्रीट्रेनिंग के पीछे की अंतर्दृष्टि यह है कि एक विशाल और विविध कॉर्पस में अगले टोकन की सटीक भविष्यवाणी करना मॉडल को व्याकरण, तथ्यों, तर्क पैटर्न और यहां तक कि कुछ प्रारंभिक दुनिया का ज्ञान अंतर्निहित रूप से सीखने के लिए मजबूर करता है, क्योंकि ये सभी भविष्यवाणी त्रुटि को कम करने के लिए उपयोगी होते हैं। इस तरह से प्रशिक्षित मॉडल को बेस या फाउंडेशन मॉडल कहा जाता है और, किसी भी आगे के अनुकूलन से पहले, यह काफी हद तक एक अत्यधिक सक्षम पाठ-पूर्ति इंजन के रूप में व्यवहार करता है, न कि एक सहायक के रूप में जो निर्देशों का पालन करता है। फाउंडेशन मॉडल शब्दावली, जिसे 2021 में स्टैनफोर्ड शोधकर्ताओं द्वारा गढ़ा गया था, इस तथ्य को दर्शाती है कि एक एकल प्रीट्रेन्ड मॉडल फाइन-ट्यूनिंग या इन-कॉन्टेक्स्ट लर्निंग के माध्यम से कई अलग-अलग डाउनस्ट्रीम अनुप्रयोगों के लिए शुरुआती बिंदु के रूप में काम कर सकता है।
पैमाना और लागत
प्रीट्रेनिंग स्केलिंग-लॉ द्वारा प्रभावित होती है, अनुभवजन्य संबंध जो दिखाते हैं कि मॉडल की हानि प्रशिक्षण कंप्यूट, डेटा और पैरामीटर की मात्रा एक साथ बढ़ने पर अनुमानित रूप से घटती है, जो 2020 में ओपनएआई के शोधकर्ताओं द्वारा स्थापित ढांचे का पालन करती है और 2022 में डीपमाइंड के चिंचिला पेपर द्वारा परिष्कृत की गई, जिसने तर्क दिया कि कई पहले के मॉडल अपने आकार के सापेक्ष कम प्रशिक्षित थे और डेटा और पैरामीटर को एक साथ बढ़ाना चाहिए। सबसे बड़े फ्रंटियर मॉडल के लिए प्रीट्रेनिंग रन हजारों GPU या TPU के क्रम में उपभोग करते हैं जो हफ्तों या महीनों तक चलते हैं, लागत दसियों या सैकड़ों मिलियन डॉलर तक बताई जाती है, और कॉमन-क्रॉल और लाइसेंस प्राप्त या मालिकाना डेटासेट जैसे स्रोतों से निर्मित प्रशिक्षण कॉर्पस की आवश्यकता होती है।
प्रीट्रेनिंग से उपयोग योग्य सहायक तक
एक नया प्रीट्रेन्ड बेस मॉडल अभी तक एक संवादी सहायक के रूप में उपयुक्त नहीं है: यह एक प्रॉम्प्ट को किसी भी शैली में जारी रखेगा जो सांख्यिकीय रूप से संभावित लगता है, बजाय सीधे सवाल का जवाब देने या असुरक्षित अनुरोध को अस्वीकार करने के। एक बेस मॉडल को चैटजीपीटी या क्लॉड जैसे उत्पाद में बदलने के लिए अतिरिक्त पोस्ट-ट्रेनिंग चरणों की आवश्यकता होती है, आमतौर पर क्यूरेटेड इंस्ट्रक्शन-रिस्पॉन्स जोड़ों पर पर्यवेक्षित फाइन-ट्यूनिंग के बाद आरएलएचएफ या डायरेक्ट-प्रेफरेंस-ऑप्टिमाइज़ेशन जैसा प्राथमिकता-संरेखण चरण होता है। फिर भी प्रीट्रेनिंग मॉडल के कच्चे ज्ञान और क्षमता का बड़ा हिस्सा प्रदान करती है; पोस्ट-ट्रेनिंग ज्यादातर आकार देती है कि उस क्षमता को कैसे व्यक्त और नियंत्रित किया जाता है।
रुझान और खुले प्रश्न
क्योंकि प्रीट्रेनिंग तेजी से बड़ी मात्रा में पाठ पर निर्भर करती है, शोधकर्ताओं ने आगामी "डेटा दीवार" के बारे में चिंताएं उठाई हैं, वह बिंदु जिस पर उच्च-गुणवत्ता, मानव-निर्मित पाठ की आपूर्ति समाप्त हो जाती है जो स्केलिंग कानूनों की मांग के सापेक्ष है, जिससे सिंथेटिक-डेटा में रुचि बढ़ी है जो मॉडल द्वारा स्वयं उत्पन्न होता है और मल्टीमॉडल प्रीट्रेनिंग में जो पाठ के साथ छवियों, ऑडियो और वीडियो को शामिल करता है। प्रीट्रेनिंग उद्देश्य भी सरल अगले-टोकन भविष्यवाणी से परे विविध हो गए हैं, कुछ दृष्टिकोणों में डीनॉइज़िंग, मास्क्ड-टोकन भविष्यवाणी जैसा कि BERT द्वारा उपयोग किया जाता है, या CLIP के समान मल्टीमॉडल कंट्रास्टिव उद्देश्य शामिल हैं। इन विविधताओं के बावजूद, वेब-स्केल पाठ पर अगले-टोकन भविष्यवाणी 2020 के दशक के मध्य तक तैनात अधिकांश बड़े भाषा मॉडल के पीछे प्रमुख प्रीट्रेनिंग नुस्खा बनी हुई है।