अंग्रेज़ी से अनुवादित

गोफर ट्रांसफॉर्मर-आधारित बड़े भाषा मॉडलों का एक परिवार है, जिसे गूगल डीपमाइंड द्वारा विकसित किया गया है, जिसमें सबसे बड़े वेरिएंट में 280 अरब पैरामीटर शामिल हैं। इसे भाषा मॉडलों के लिए स्केलिंग कानूनों की जांच करने के लिए डिज़ाइन किया गया था और यह चिंचिला मॉडल परिवार का पूर्ववर्ती था।

Gopher बड़े भाषा मॉडल का एक परिवार है, जिसे Google DeepMind की शोध टीम द्वारा विकसित किया गया है। इस परिवार में छह ट्रांसफॉर्मर-आधारित मॉडल शामिल हैं, जिनका आकार 44 मिलियन पैरामीटर से लेकर 280 बिलियन पैरामीटर तक बढ़ता है, और सबसे बड़े मॉडल को डिफ़ॉल्ट रूप से "Gopher" कहा जाता है। Gopher को 2021 के अंत में प्रस्तुत किया गया था और इसे बड़े भाषा मॉडल के स्केलिंग नियमों की जांच के लिए प्रशिक्षित किया गया था, जो मार्च 2022 में पेश किए गए बाद के Chinchilla मॉडल परिवार का आधार बना।

Gopher परिवार को इस व्यापक शोध प्रयास के हिस्से के रूप में डिज़ाइन किया गया था कि मॉडल का प्रदर्शन पैरामीटर और प्रशिक्षण डेटा के साथ कैसे स्केल होता है। मॉडल अनिवार्य रूप से GPT-2 के समान आर्किटेक्चर हैं, जिनमें मामूली संशोधन हैं, जिनमें LayerNorm के बजाय RMSNorm का उपयोग और पूर्ण स्थितीय एन्कोडिंग के बजाय सापेक्ष स्थितीय एन्कोडिंग शामिल है। सबसे बड़ा Gopher मॉडल, जिसमें 280 बिलियन पैरामीटर हैं, को लगभग 300 बिलियन टोकन पर प्रशिक्षित किया गया था।

स्केलिंग नियम और प्रशिक्षण

Gopher का विकास इस प्रश्न से प्रेरित था कि बड़े भाषा मॉडल को प्रशिक्षित करते समय कंप्यूट संसाधनों का इष्टतम आवंटन कैसे किया जाए। Gopher से पहले, OpenAI के GPT-3 सहित कई मॉडलों को प्रशिक्षण डेटा को अपेक्षाकृत स्थिर रखते हुए मॉडल आकार बढ़ाने पर ध्यान केंद्रित करके प्रशिक्षित किया गया था। हालांकि, Gopher शोध टीम ने अनुभवजन्य अध्ययनों के माध्यम से पाया कि किसी दिए गए कंप्यूट बजट के लिए, इष्टतम मॉडल आकार और प्रशिक्षण टोकन की संख्या एक विशिष्ट संबंध का पालन करती है: यदि मॉडल आकार दोगुना किया जाता है, तो प्रशिक्षण टोकन की संख्या भी दोगुनी होनी चाहिए। यह निष्कर्ष, जिसे बाद में Chinchilla पेपर में औपचारिक रूप दिया गया, ने सुझाव दिया कि कई मौजूदा मॉडल अपर्याप्त रूप से प्रशिक्षित थे।

Gopher का प्रशिक्षण पाठ डेटा के एक बड़े संग्रह का उपयोग करके किया गया था, और मॉडल ने विभिन्न प्राकृतिक भाषा प्रसंस्करण बेंचमार्क पर मजबूत प्रदर्शन दिखाया। हालांकि, Measuring Massive Multitask Language Understanding (MMLU) बेंचमार्क पर इसका प्रदर्शन 60.5% औसत सटीकता था, एक आंकड़ा जिसे बाद में इसके उत्तराधिकारी Chinchilla ने पार कर लिया।

आर्किटेक्चर और वेरिएंट

Gopher परिवार में छह मॉडल शामिल हैं, जिनमें पैरामीटर की संख्या 44 मिलियन, 117 मिलियन, 417 मिलियन, 1.4 बिलियन, 7.1 बिलियन और 280 बिलियन है। सभी मॉडल ट्रांसफॉर्मर आर्किटेक्चर पर आधारित समान मूल आर्किटेक्चर साझा करते हैं, विशेष रूप से GPT-2 के समान लेकिन उल्लिखित संशोधनों के साथ। RMSNorm का उपयोग, जो लेयर नॉर्मलाइज़ेशन का एक कम्प्यूटेशनल रूप से अधिक कुशल संस्करण है, और सापेक्ष स्थितीय एन्कोडिंग, जो लंबे अनुक्रमों के लिए सामान्यीकरण में सुधार कर सकती है, पहले के ट्रांसफॉर्मर मॉडल से प्रमुख अंतर थे।

सबसे बड़े Gopher मॉडल को वितरित प्रशिक्षण सेटअप का उपयोग करके प्रशिक्षित किया गया था, जिसमें हजारों एक्सेलेरेटर का लाभ उठाया गया था। प्रशिक्षण प्रक्रिया संसाधन-गहन थी, और मॉडल को अनुमान और फाइन-ट्यूनिंग दोनों के लिए महत्वपूर्ण कम्प्यूटेशनल शक्ति की आवश्यकता थी, एक सीमा जिसने बाद में Chinchilla के विकास को प्रेरित किया।

प्रदर्शन और मूल्यांकन

Gopher का मूल्यांकन विभिन्न बेंचमार्क पर किया गया था, जिसमें भाषा मॉडलिंग, पठन समझ और प्रश्न उत्तर शामिल हैं। इसने कई क्षेत्रों में मजबूत क्षमताएं दिखाईं, लेकिन इसका प्रदर्शन सभी कार्यों पर छोटे मॉडलों से समान रूप से बेहतर नहीं था। उदाहरण के लिए, कुछ तर्क और ज्ञान-गहन कार्यों पर, Gopher ने अच्छा प्रदर्शन किया, लेकिन इसने तथ्यात्मक स्थिरता और सामान्य ज्ञान तर्क जैसे क्षेत्रों में भी सीमाएं प्रदर्शित कीं।

GPT-3 की तुलना में, Gopher ने कई बेंचमार्क पर प्रतिस्पर्धी या बेहतर परिणाम प्राप्त किए, लेकिन अंतर हमेशा नाटकीय नहीं थे। शोध टीम ने नोट किया कि मॉडल आकार में बड़ी वृद्धि के सापेक्ष Gopher के प्रदर्शन लाभ अक्सर मामूली थे, जिसने प्रशिक्षण डेटा स्केलिंग के महत्व को और उजागर किया।

विरासत और उत्तराधिकारी

Gopher की प्राथमिक विरासत भाषा मॉडल में स्केलिंग नियमों को समझने में इसका योगदान है। Gopher को प्रशिक्षित करने से प्राप्त अंतर्दृष्टि ने सीधे Chinchilla के डिज़ाइन को सूचित किया, एक मॉडल परिवार जिसमें 70 बिलियन पैरामीटर हैं और 1.4 ट्रिलियन टोकन पर प्रशिक्षित किया गया है। Chinchilla, जिसे मार्च 2022 में प्रस्तुत किया गया था, ने समान कंप्यूट बजट का उपयोग करते हुए Gopher की तुलना में उच्च औसत सटीकता (MMLU पर 67.5%) हासिल की, जो दर्शाता है कि स्केलिंग कानून की सिफारिशें प्रभावी थीं।

Chinchilla परिवार Gopher के समान आर्किटेक्चर साझा करता है लेकिन Adam के बजाय AdamW ऑप्टिमाइज़र के साथ प्रशिक्षित किया गया था। Gopher ने अन्य मॉडलों के लिए भी एक आधार के रूप में कार्य किया, जैसे कि Flamingo विज़न-भाषा मॉडल, जिसने Gopher परिवार के घटकों का उपयोग किया। जनवरी 2023 तक, Chinchilla अभी भी परीक्षण चरण में था, जबकि Gopher को इसके अधिक कुशल उत्तराधिकारी द्वारा प्रतिस्थापित किया जा चुका था।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·google-deepmind·transformer-models·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास