अंग्रेज़ी से अनुवादित

चिंचिला 70B गूगल डीपमाइंड द्वारा विकसित एक 70-अरब-पैरामीटर वाला बड़ा भाषा मॉडल है, जिसे 2022 में चिंचिला परिवार के हिस्से के रूप में पेश किया गया था ताकि कंप्यूट-अनुकूलित प्रशिक्षण स्केलिंग नियमों का प्रदर्शन किया जा सके।

चिंचिला 70B एक बड़ा भाषा मॉडल है जिसे गूगल डीपमाइंड द्वारा विकसित किया गया था, जिसे 2022 में पेश किया गया था। यह चिंचिला परिवार के मॉडलों का 70-बिलियन-पैरामीटर संस्करण है, जिन्हें कंप्यूट-कुशल तंत्रिका नेटवर्क के प्रशिक्षण के लिए स्केलिंग कानूनों का परीक्षण और सत्यापन करने के लिए डिज़ाइन किया गया था। यह मॉडल एक शोध पत्र में एक केंद्रीय घटक था जिसने मॉडल आकार और प्रशिक्षण डेटा के बीच उस समय सामान्य संतुलन से भिन्न संतुलन की वकालत की, जिसने बड़े भाषा मॉडल और मशीन लर्निंग अनुसंधान में बाद के कार्यों को प्रभावित किया।

चिंचिला परियोजना इस अवलोकन से प्रेरित थी कि कई समकालीन बड़े भाषा मॉडल, जिनमें ओपनएआई का GPT-3 भी शामिल है, को उनके पैरामीटर गणनाओं को देखते हुए इष्टतम से कहीं कम टोकन के साथ प्रशिक्षित किया गया था। शोधकर्ताओं ने प्रस्तावित किया कि एक निश्चित कंप्यूट बजट के लिए, सर्वोत्तम प्रदर्शन मॉडल आकार और प्रशिक्षण डेटा को लगभग समान रूप से बढ़ाने से आता है, न कि एक को दूसरे पर वरीयता देने से। चिंचिला 70B को लगभग 1.4 ट्रिलियन टोकन के साथ प्रशिक्षित किया गया था, जो इसके आकार के सापेक्ष कई पूर्ववर्तियों की तुलना में काफी बड़ा डेटासेट है, और इसने कई बेंचमार्क पर बहुत बड़े मॉडलों से बेहतर प्रदर्शन किया।

आर्किटेक्चर और प्रशिक्षण

चिंचिला 70B एक मानक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है, जो अपने युग के अन्य बड़े भाषा मॉडलों के समान है। यह मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग का उपयोग करता है, जिसमें डिकोडर-ओनली संरचना होती है। मॉडल को एडम ऑप्टिमाइज़र के साथ लर्निंग रेट शेड्यूल का उपयोग करके प्रशिक्षित किया गया था जिसमें वार्मअप और कोसाइन डिके शामिल थे। प्रशिक्षण को स्थिर करने के लिए ग्रेडिएंट क्लिपिंग लागू की गई थी।

प्रशिक्षण डेटासेट में सार्वजनिक वेब टेक्स्ट, पुस्तकों और अन्य स्रोतों का एक फ़िल्टर किया हुआ और डीडुप्लिकेट किया हुआ उपसमुच्चय शामिल था, जो कुल मिलाकर लगभग 1.4 ट्रिलियन टोकन था। यह इस परिकल्पना का परीक्षण करने के लिए एक जानबूझकर किया गया विकल्प था कि अधिक पैरामीटर के बजाय अधिक डेटा, दिए गए कंप्यूट बजट के लिए बेहतर प्रदर्शन दे सकता है। प्रशिक्षण में टीपीयू का एक बड़ा क्लस्टर इस्तेमाल किया गया, जो गूगल क्लाउड बुनियादी ढांचे का लाभ उठाता था।

स्केलिंग कानून और महत्व

चिंचिला 70B का प्राथमिक योगदान कंप्यूट-इष्टतम स्केलिंग कानूनों के लिए अनुभवजन्य साक्ष्य था। शोध टीम, जिसमें जॉर्डन हॉफमैन और अन्य शामिल थे, ने मॉडल आकार, डेटासेट आकार और कंप्यूट बजट के बीच संबंध का विश्लेषण किया। उन्होंने पाया कि दिए गए कंप्यूट बजट के लिए, इष्टतम मॉडल आकार पहले की तुलना में बहुत छोटा है, और इष्टतम प्रशिक्षण टोकन की संख्या बहुत बड़ी है। यह परिणाम, जिसे अक्सर "चिंचिला स्केलिंग कानून" कहा जाता है, ने सुझाव दिया कि कई मौजूदा मॉडल अति-पैरामीटराइज़्ड और कम-प्रशिक्षित थे।

चिंचिला 70B, GPT-3 (175B) और गोफर (280B) जैसे मॉडलों की तुलना में कम पैरामीटर होने के बावजूद, कई कृत्रिम बुद्धिमत्ता बेंचमार्क पर बेहतर प्रदर्शन हासिल किया, जिसमें भाषा मॉडलिंग, पठन समझ और तर्क कार्य शामिल हैं। इसने प्रदर्शित किया कि प्रशिक्षण दक्षता कच्चे पैरामीटर गणना से अधिक महत्वपूर्ण हो सकती है।

प्रदर्शन और बेंचमार्क

मानक बेंचमार्क के एक सेट पर, चिंचिला 70B ने अधिकांश कार्यों पर गोफर (280B पैरामीटर) और GPT-3 (175B पैरामीटर) से बेहतर प्रदर्शन किया। उदाहरण के लिए, इसने MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) पर उच्च सटीकता हासिल की और प्रश्न उत्तर देने और सामान्य ज्ञान तर्क डेटासेट पर बेहतर परिणाम दिए। मॉडल ने गणितीय और वैज्ञानिक तर्क कार्यों पर भी मजबूत प्रदर्शन दिखाया, हालांकि इसमें उस समय के भाषा मॉडलों की सामान्य सीमाएं थीं, जैसे तथ्यात्मक त्रुटियां और प्रॉम्प्ट वाक्यांश के प्रति संवेदनशीलता।

मॉडल का प्रदर्शन जनरेटिव एआई विकास के संदर्भ में विशेष रूप से उल्लेखनीय था, क्योंकि इसने दिखाया कि छोटे, बेहतर प्रशिक्षित मॉडल अधिक व्यावहारिक और लागत प्रभावी हो सकते हैं। इसने एंथ्रोपिक, ओपनएआई और अन्य संगठनों में बाद के मॉडल विकास को प्रभावित किया, जिन्होंने प्रशिक्षण डेटा की मात्रा पर अधिक ध्यान देना शुरू किया।

प्रभाव और विरासत

चिंचिला स्केलिंग कानूनों का डीप लर्निंग के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। उन्होंने शोधकर्ताओं और कंपनियों के कंप्यूट संसाधनों को आवंटित करने के तरीके में बदलाव को प्रेरित किया, जिसमें बड़े, उच्च-गुणवत्ता वाले डेटासेट के महत्व पर जोर दिया गया। निष्कर्षों ने बाद के मॉडलों, जैसे LLaMA और अन्य में मॉडल आर्किटेक्चर और प्रशिक्षण बजट के बारे में निर्णयों को भी सूचित किया, जिन्होंने समान डेटा-से-पैरामीटर अनुपात अपनाए।

चिंचिला 70B को स्वयं एक ओपन-वेट मॉडल के रूप में जारी नहीं किया गया था, लेकिन इसके शोध निष्कर्ष व्यापक रूप से प्रसारित किए गए और बाद के ओपन-सोर्स प्रयासों को प्रभावित किया। मॉडल का आर्किटेक्चर और प्रशिक्षण दृष्टिकोण शैक्षणिक और औद्योगिक अनुसंधान के लिए एक संदर्भ बिंदु बन गया, और स्केलिंग कानून विश्लेषण क्षेत्र में एक मौलिक संदर्भ बना हुआ है।

स्वागत और आलोचना

जबकि चिंचिला परिणामों की व्यापक रूप से प्रशंसा की गई, कुछ शोधकर्ताओं ने नोट किया कि स्केलिंग कानून विश्लेषण मॉडल आकार और कंप्यूट बजट के एक सीमित सेट पर आधारित था, और इष्टतम अनुपात विभिन्न आर्किटेक्चर या डेटा वितरण के साथ भिन्न हो सकता है। बाद के कार्यों ने इन कानूनों को परिष्कृत किया है, लेकिन मूल अंतर्दृष्टि - कि प्रशिक्षण डेटा की मात्रा मॉडल आकार के समान ही महत्वपूर्ण है - व्यापक रूप से स्वीकार की गई है।

कुछ ने यह भी बताया कि कंप्यूट-इष्टतम दृष्टिकोण आवश्यक रूप से दिए गए अनुमान बजट के लिए सर्वोत्तम प्रदर्शन की ओर नहीं ले जाता है, क्योंकि बड़े मॉडल अनुमान पर अधिक कुशल हो सकते हैं, भले ही वे प्रशिक्षण के लिए कम कुशल हों। इस बारीकी ने मॉडल स्केलिंग की निरंतर खोज को जन्म दिया, जिसमें मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर और अन्य दक्षता तकनीकें शामिल हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·google-deepmind·artificial-intelligence·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास