चिंचिला बड़े भाषा मॉडल (LLMs) का एक परिवार है, जिसे गूगल डीपमाइंड की शोध टीम ने विकसित किया था और मार्च 2022 में प्रस्तुत किया गया। यह परिवार भाषा मॉडलों के स्केलिंग नियमों की जांच के लिए डिज़ाइन किया गया था, जो गोफर मॉडल परिवार के साथ पिछले काम पर आधारित था। चिंचिला मॉडल ट्रांसफॉर्मर-आधारित हैं और इन्हें निश्चित कंप्यूट बजट के तहत बेहतर प्रदर्शन प्राप्त करने के लिए प्रशिक्षित किया गया था, जिससे बड़े मॉडलों को कुशलतापूर्वक प्रशिक्षित करने के लिए व्यापक रूप से उद्धृत सिफारिश सामने आई।
"चिंचिला" नाम पिछले गोफर मॉडल परिवार पर आगे के विकास के रूप में इसकी भूमिका को दर्शाता है। दोनों परिवारों को यह पता लगाने के लिए प्रशिक्षित किया गया था कि मॉडल आकार और प्रशिक्षण डेटा की मात्रा कैसे परस्पर क्रिया करते हैं। चिंचिला ने काफी कम पैरामीटर का उपयोग करते हुए GPT-3 से बेहतर प्रदर्शन करने का दावा किया, जिससे अनुमान और फाइन-ट्यूनिंग के लिए कम कंप्यूटेशनल शक्ति की आवश्यकता होने के कारण डाउनस्ट्रीम उपयोग सरल हो गया।
स्केलिंग नियम और प्रशिक्षण
चिंचिला शोध का केंद्रीय निष्कर्ष यह था कि एक निश्चित कंप्यूट बजट के लिए, मॉडल आकार और प्रशिक्षण टोकन को आनुपातिक रूप से स्केल किया जाना चाहिए। विशेष रूप से, यदि मॉडल आकार दोगुना किया जाता है, तो प्रशिक्षण टोकन की संख्या भी दोगुनी होनी चाहिए। यह सिद्धांत पहले उपयोग किए गए भाषा मॉडलों के प्रशिक्षण का विश्लेषण करके प्राप्त किया गया था। डीपमाइंड ने इस परिकल्पना का उपयोग चिंचिला को प्रशिक्षित करने के लिए किया, जिसमें 70 बिलियन पैरामीटर हैं और इसे 1.4 ट्रिलियन टोकन पर प्रशिक्षित किया गया, जो गोफर के 300 बिलियन टोकन से चार गुना अधिक डेटा है, समान समग्र कंप्यूट लागत पर।
यह कंप्यूट-इष्टतम दृष्टिकोण पहले की प्रथाओं के विपरीत है, जो अक्सर अकेले मॉडल पैरामीटर बढ़ाने को प्राथमिकता देते थे। चिंचिला टीम ने सिफारिश की कि बड़े, उच्च-गुणवत्ता वाले प्रशिक्षण डेटासेट का उपयोग डाउनस्ट्रीम कार्यों पर बेहतर परिणाम दे सकता है, भले ही मॉडल आकार न बढ़ाया जाए। इन निष्कर्षों ने एआई अनुसंधान के क्षेत्र में बाद की प्रशिक्षण पद्धतियों को प्रभावित किया है।
प्रदर्शन और बेंचमार्क
चिंचिला ने मेजरिंग मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (MMLU) बेंचमार्क पर 67.5% की औसत सटीकता हासिल की, जो गोफर के प्रदर्शन से 7% अधिक है। यह सुधार उल्लेखनीय था क्योंकि गोफर में 280 बिलियन पैरामीटर थे, जो चिंचिला से चार गुना अधिक थे। मॉडल की दक्षता ने इसे अनुप्रयोगों की एक व्यापक श्रेणी के लिए व्यावहारिक बना दिया, क्योंकि अनुमान और फाइन-ट्यूनिंग दोनों के लिए कम कंप्यूट की आवश्यकता थी।
12 जनवरी 2023 तक, चिंचिला अभी भी परीक्षण चरण में था, जो दर्शाता है कि इसकी पूर्ण क्षमताओं और सीमाओं का मूल्यांकन किया जा रहा था। MMLU जैसे बेंचमार्क पर मॉडल की सफलता ने प्रदर्शित किया कि कंप्यूट-इष्टतम प्रशिक्षण कम डेटा के साथ प्रशिक्षित बड़े मॉडलों की तुलना में प्रतिस्पर्धी या बेहतर परिणाम दे सकता है।
आर्किटेक्चर
गोफर और चिंचिला दोनों परिवार ट्रांसफॉर्मर मॉडल के परिवार हैं। वे अनिवार्य रूप से GPT-2 के समान हैं, विभिन्न आकारों और मामूली संशोधनों के साथ। गोफर परिवार LayerNorm के बजाय RMSNorm और पूर्ण स्थितीय एन्कोडिंग के बजाय सापेक्ष स्थितीय एन्कोडिंग का उपयोग करता है। चिंचिला परिवार गोफर परिवार के समान है, लेकिन Adam अनुकूलक के बजाय AdamW अनुकूलक के साथ प्रशिक्षित किया जाता है।
गोफर परिवार में छह मॉडल हैं जो आकार में बढ़ते हैं, 44 मिलियन पैरामीटर से 280 बिलियन पैरामीटर तक, जिसमें सबसे बड़े को डिफ़ॉल्ट रूप से "गोफर" कहा जाता है। समान नामकरण परंपराएं चिंचिला परिवार पर लागू होती हैं, जिसमें विभिन्न आकारों के मॉडल शामिल हैं, जिसमें 70-बिलियन-पैरामीटर संस्करण सबसे प्रमुख है। मूल पेपर की तालिका 1 पूरे गोफर परिवार का विवरण देती है, जबकि तालिका 4 70-बिलियन-पैरामीटर चिंचिला की तुलना गोफर 280B से करती है।
अनुप्रयोग और प्रभाव
चिंचिला का उपयोग अन्य मॉडलों के लिए आधार के रूप में किया गया है, जिसमें फ्लेमिंगो विज़न-भाषा मॉडल शामिल है, जो दृश्य और पाठ्य समझ को एकीकृत करता है। चिंचिला द्वारा स्थापित स्केलिंग नियम मशीन लर्निंग के क्षेत्र में एक मानक संदर्भ बन गए हैं, जो बाद के LLM विकास में मॉडल आकार और डेटासेट आकार के बारे में निर्णयों का मार्गदर्शन करते हैं।
शोध ने सीमित कंप्यूट संसाधनों के साथ बड़े ऑटोरेग्रेसिव भाषा मॉडलों के लिए एक प्रभावी प्रशिक्षण प्रतिमान विकसित करने में योगदान दिया। यह प्रदर्शित करके कि डेटा की मात्रा मॉडल आकार के समान महत्वपूर्ण है, चिंचिला ने डेटासेट गुणवत्ता और क्यूरेशन पर ध्यान केंद्रित किया। इसका ओपनएआई और एंथ्रोपिक जैसे संगठनों के मॉडल प्रशिक्षण के दृष्टिकोण पर स्थायी प्रभाव पड़ा है, हालांकि उनकी आंतरिक प्रथाओं के विशिष्ट विवरण हमेशा सार्वजनिक नहीं होते हैं।
यह भी देखें
- गोफर
- स्केलिंग नियम
- डीप लर्निंग