आधारभूत मॉडल ([[foundation model|फाउंडेशन मॉडल]])

अंग्रेज़ी से अनुवादित

फाउंडेशन मॉडल एक बड़ा मशीन लर्निंग मॉडल है जिसे व्यापक डेटा पर बड़े पैमाने पर प्रशिक्षित किया जाता है, और इसे फाइन-ट्यूनिंग या प्रॉम्प्टिंग के माध्यम से कई तरह के डाउनस्ट्रीम कार्यों के लिए अनुकूलित किया जा सकता है; यह शब्द 2021 में स्टैनफोर्ड के शोधकर्ताओं द्वारा गढ़ा गया था।

एक फाउंडेशन मॉडल एक मशीन लर्निंग मॉडल है जिसे व्यापक, अक्सर वेब-स्केल, डेटा पर प्रशिक्षित किया जाता है और इसे कई डाउनस्ट्रीम कार्यों के लिए अनुकूलित किया जा सकता है, बजाय एक ही संकीर्ण उद्देश्य के लिए बनाए जाने के। यह शब्द 2021 में स्टैनफोर्ड के सेंटर फॉर रिसर्च ऑन फाउंडेशन मॉडल्स (CRFM) की एक रिपोर्ट में गढ़ा गया था, जिसका नेतृत्व पर्सी लियांग जैसे शोधकर्ताओं ने किया था, जिन्होंने तर्क दिया कि GPT-3 और BERT जैसे मॉडल एक नए प्रतिमान का प्रतिनिधित्व करते हैं: एक एकल मॉडल, एक बार प्रीट्रेन्ड होने के बाद, फाइन-ट्यूनिंग, इन-कॉन्टेक्स्ट लर्निंग, या प्रॉम्प्टिंग के माध्यम से कई अनुप्रयोगों के लिए आधार के रूप में कार्य करता है, बजाय प्रत्येक कार्य के लिए शुरू से प्रशिक्षित मॉडल की आवश्यकता के।

उत्पत्ति और परिभाषा

CRFM रिपोर्ट ने फाउंडेशन मॉडल्स को उनके पैरामीटर, डेटा, और कंप्यूट में स्केल के संयोजन, सेल्फ-सुपरवाइज्ड प्रीट्रेनिंग जैसे अनलेबल्ड डेटा पर व्यापक प्रशिक्षण उद्देश्यों, और सामान्यता द्वारा प्रतिष्ठित किया, जिसका अर्थ है कि एक एकल मॉडल की सीखी गई प्रतिनिधित्व कई डाउनस्ट्रीम कार्यों में अपेक्षाकृत हल्के अनुकूलन के साथ स्थानांतरित होती है। यह ढांचा ट्रांसफर-लर्निंग के पहले के विचार पर बनाया और विस्तारित किया गया, जहां एक मॉडल एक कार्य या डेटासेट पर प्रीट्रेन्ड होता है और फिर, आमतौर पर फाइन-ट्यूनिंग के बाद, एक संबंधित कार्य पर पुनः उपयोग किया जाता है।

उदाहरण

फाउंडेशन मॉडल मोडैलिटीज़ में फैले हुए हैं: टेक्स्ट-केंद्रित मॉडल जैसे GPT श्रृंखला, क्लॉड, जेमिनी, और लामा; CLIP-शैली प्रीट्रेनिंग पर निर्मित विज़न-भाषा प्रणालियाँ; छवि निर्माण मॉडल जैसे स्टेबल डिफ्यूज़न; और भाषण मॉडल जैसे व्हिस्पर। अधिकांश बड़े भाषा मॉडल इस अर्थ में फाउंडेशन मॉडल हैं, हालांकि यह शब्द LLM से पहले का है और व्यापक है, क्योंकि यह गैर-टेक्स्ट और मल्टीमॉडल प्रणालियों को भी शामिल करता है।

शब्द का उपयोग क्यों किया जाता है

यह लेबल आंशिक रूप से AI प्रणालियों के निर्माण और तैनाती के तरीके में बदलाव को पकड़ने के लिए उभरा: बजाय एक शोध समूह के प्रति कार्य के लिए एक विशेष मॉडल प्रशिक्षित करने के, एक ओपन-वेट्स या मालिकाना फाउंडेशन मॉडल एक बार जारी किया जाता है और फिर कई डाउनस्ट्रीम उपयोगकर्ताओं द्वारा अनुकूलित किया जाता है, जिससे नए AI अनुप्रयोगों के निर्माण की लागत नाटकीय रूप से कम हो जाती है। इसने एक पारिस्थितिकी तंत्र को जन्म दिया, जैसे हगिंग फेस जैसे प्लेटफार्मों द्वारा उदाहरणित, जो फाउंडेशन मॉडल्स को साझा करने, फाइन-ट्यूनिंग, और तैनात करने पर केंद्रित है, बजाय शुरू से प्रशिक्षण के। यह शब्द नीति चर्चाओं में भी उपयोगी साबित हुआ, क्योंकि EU AI अधिनियम जैसे नियमों ने सामान्य-उद्देश्य या फाउंडेशन मॉडल के प्रदाताओं के लिए विशिष्ट दायित्व बनाए, जो उन डेवलपर्स से अलग हैं जो केवल उनके ऊपर अनुप्रयोग बनाते हैं।

आलोचना और सावधानियाँ

CRFM रिपोर्ट ने स्वयं जोखिम स्वीकार किए: फाउंडेशन मॉडल क्षमता और प्रभाव को उन कुछ संगठनों के हाथों में केंद्रित करते हैं जो उन्हें प्रशिक्षित करने में सक्षम हैं, उनके व्यापक प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को उन पर निर्मित हर डाउनस्ट्रीम अनुप्रयोग में फैलाते हैं, और अपने प्रशिक्षण डेटा के वितरण के बाहर अप्रत्याशित व्यवहार कर सकते हैं। आलोचकों, जिनमें कुछ शामिल हैं जो अन्यथा इस ढांचे का स्वागत करते थे, ने नोट किया कि "फाउंडेशन" एक स्थिरता और विश्वसनीयता का संकेत देता है जो प्रारंभिक बड़े मॉडलों में हमेशा नहीं थी, और यह शब्द मॉडलों के बीच सार्थक अंतरों को अस्पष्ट कर सकता है, जैसे कि वे खुले या बंद हैं, या विभिन्न एलाइनमेंट तकनीकों के साथ प्रशिक्षित हैं। इसके बावजूद, फाउंडेशन मॉडल अपने परिचय के कुछ वर्षों के भीतर अनुसंधान पत्रों और नियमन दोनों में मानक शब्दावली बन गया।

अन्य शब्दों से संबंध

फाउंडेशन मॉडल फ्रंटियर मॉडल के साथ काफी हद तक ओवरलैप करता है, लेकिन समान नहीं है, जो विशेष रूप से किसी दिए गए समय पर सबसे सक्षम मॉडलों को दर्शाता है, और LLM के साथ भी, जो टेक्स्ट के लिए विशिष्ट है। एक फाउंडेशन मॉडल को क्षमता के फ्रंटियर पर होने की आवश्यकता नहीं है, और सभी फाउंडेशन मॉडल भाषा मॉडल नहीं हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·ai-governance·industry
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास