चिंचिला 70B एक बड़ा भाषा मॉडल है जिसे गूगल डीपमाइंड द्वारा विकसित किया गया था, जिसे 2022 में पेश किया गया था। यह चिंचिला परिवार के मॉडलों का 70-बिलियन-पैरामीटर संस्करण है, जिन्हें कंप्यूट-कुशल तंत्रिका नेटवर्क के प्रशिक्षण के लिए स्केलिंग कानूनों का परीक्षण और सत्यापन करने के लिए डिज़ाइन किया गया था। यह मॉडल एक शोध पत्र में एक केंद्रीय घटक था जिसने मॉडल आकार और प्रशिक्षण डेटा के बीच उस समय सामान्य संतुलन से भिन्न संतुलन की वकालत की, जिसने बड़े भाषा मॉडल और मशीन लर्निंग अनुसंधान में बाद के कार्यों को प्रभावित किया।
चिंचिला परियोजना इस अवलोकन से प्रेरित थी कि कई समकालीन बड़े भाषा मॉडल, जिनमें ओपनएआई का GPT-3 भी शामिल है, को उनके पैरामीटर गणनाओं को देखते हुए इष्टतम से कहीं कम टोकन के साथ प्रशिक्षित किया गया था। शोधकर्ताओं ने प्रस्तावित किया कि एक निश्चित कंप्यूट बजट के लिए, सर्वोत्तम प्रदर्शन मॉडल आकार और प्रशिक्षण डेटा को लगभग समान रूप से बढ़ाने से आता है, न कि एक को दूसरे पर वरीयता देने से। चिंचिला 70B को लगभग 1.4 ट्रिलियन टोकन के साथ प्रशिक्षित किया गया था, जो इसके आकार के सापेक्ष कई पूर्ववर्तियों की तुलना में काफी बड़ा डेटासेट है, और इसने कई बेंचमार्क पर बहुत बड़े मॉडलों से बेहतर प्रदर्शन किया।
आर्किटेक्चर और प्रशिक्षण
चिंचिला 70B एक मानक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है, जो अपने युग के अन्य बड़े भाषा मॉडलों के समान है। यह मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग का उपयोग करता है, जिसमें डिकोडर-ओनली संरचना होती है। मॉडल को एडम ऑप्टिमाइज़र के साथ लर्निंग रेट शेड्यूल का उपयोग करके प्रशिक्षित किया गया था जिसमें वार्मअप और कोसाइन डिके शामिल थे। प्रशिक्षण को स्थिर करने के लिए ग्रेडिएंट क्लिपिंग लागू की गई थी।
प्रशिक्षण डेटासेट में सार्वजनिक वेब टेक्स्ट, पुस्तकों और अन्य स्रोतों का एक फ़िल्टर किया हुआ और डीडुप्लिकेट किया हुआ उपसमुच्चय शामिल था, जो कुल मिलाकर लगभग 1.4 ट्रिलियन टोकन था। यह इस परिकल्पना का परीक्षण करने के लिए एक जानबूझकर किया गया विकल्प था कि अधिक पैरामीटर के बजाय अधिक डेटा, दिए गए कंप्यूट बजट के लिए बेहतर प्रदर्शन दे सकता है। प्रशिक्षण में टीपीयू का एक बड़ा क्लस्टर इस्तेमाल किया गया, जो गूगल क्लाउड बुनियादी ढांचे का लाभ उठाता था।
स्केलिंग कानून और महत्व
चिंचिला 70B का प्राथमिक योगदान कंप्यूट-इष्टतम स्केलिंग कानूनों के लिए अनुभवजन्य साक्ष्य था। शोध टीम, जिसमें जॉर्डन हॉफमैन और अन्य शामिल थे, ने मॉडल आकार, डेटासेट आकार और कंप्यूट बजट के बीच संबंध का विश्लेषण किया। उन्होंने पाया कि दिए गए कंप्यूट बजट के लिए, इष्टतम मॉडल आकार पहले की तुलना में बहुत छोटा है, और इष्टतम प्रशिक्षण टोकन की संख्या बहुत बड़ी है। यह परिणाम, जिसे अक्सर "चिंचिला स्केलिंग कानून" कहा जाता है, ने सुझाव दिया कि कई मौजूदा मॉडल अति-पैरामीटराइज़्ड और कम-प्रशिक्षित थे।
चिंचिला 70B, GPT-3 (175B) और गोफर (280B) जैसे मॉडलों की तुलना में कम पैरामीटर होने के बावजूद, कई कृत्रिम बुद्धिमत्ता बेंचमार्क पर बेहतर प्रदर्शन हासिल किया, जिसमें भाषा मॉडलिंग, पठन समझ और तर्क कार्य शामिल हैं। इसने प्रदर्शित किया कि प्रशिक्षण दक्षता कच्चे पैरामीटर गणना से अधिक महत्वपूर्ण हो सकती है।
प्रदर्शन और बेंचमार्क
मानक बेंचमार्क के एक सेट पर, चिंचिला 70B ने अधिकांश कार्यों पर गोफर (280B पैरामीटर) और GPT-3 (175B पैरामीटर) से बेहतर प्रदर्शन किया। उदाहरण के लिए, इसने MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) पर उच्च सटीकता हासिल की और प्रश्न उत्तर देने और सामान्य ज्ञान तर्क डेटासेट पर बेहतर परिणाम दिए। मॉडल ने गणितीय और वैज्ञानिक तर्क कार्यों पर भी मजबूत प्रदर्शन दिखाया, हालांकि इसमें उस समय के भाषा मॉडलों की सामान्य सीमाएं थीं, जैसे तथ्यात्मक त्रुटियां और प्रॉम्प्ट वाक्यांश के प्रति संवेदनशीलता।
मॉडल का प्रदर्शन जनरेटिव एआई विकास के संदर्भ में विशेष रूप से उल्लेखनीय था, क्योंकि इसने दिखाया कि छोटे, बेहतर प्रशिक्षित मॉडल अधिक व्यावहारिक और लागत प्रभावी हो सकते हैं। इसने एंथ्रोपिक, ओपनएआई और अन्य संगठनों में बाद के मॉडल विकास को प्रभावित किया, जिन्होंने प्रशिक्षण डेटा की मात्रा पर अधिक ध्यान देना शुरू किया।
प्रभाव और विरासत
चिंचिला स्केलिंग कानूनों का डीप लर्निंग के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। उन्होंने शोधकर्ताओं और कंपनियों के कंप्यूट संसाधनों को आवंटित करने के तरीके में बदलाव को प्रेरित किया, जिसमें बड़े, उच्च-गुणवत्ता वाले डेटासेट के महत्व पर जोर दिया गया। निष्कर्षों ने बाद के मॉडलों, जैसे LLaMA और अन्य में मॉडल आर्किटेक्चर और प्रशिक्षण बजट के बारे में निर्णयों को भी सूचित किया, जिन्होंने समान डेटा-से-पैरामीटर अनुपात अपनाए।
चिंचिला 70B को स्वयं एक ओपन-वेट मॉडल के रूप में जारी नहीं किया गया था, लेकिन इसके शोध निष्कर्ष व्यापक रूप से प्रसारित किए गए और बाद के ओपन-सोर्स प्रयासों को प्रभावित किया। मॉडल का आर्किटेक्चर और प्रशिक्षण दृष्टिकोण शैक्षणिक और औद्योगिक अनुसंधान के लिए एक संदर्भ बिंदु बन गया, और स्केलिंग कानून विश्लेषण क्षेत्र में एक मौलिक संदर्भ बना हुआ है।
स्वागत और आलोचना
जबकि चिंचिला परिणामों की व्यापक रूप से प्रशंसा की गई, कुछ शोधकर्ताओं ने नोट किया कि स्केलिंग कानून विश्लेषण मॉडल आकार और कंप्यूट बजट के एक सीमित सेट पर आधारित था, और इष्टतम अनुपात विभिन्न आर्किटेक्चर या डेटा वितरण के साथ भिन्न हो सकता है। बाद के कार्यों ने इन कानूनों को परिष्कृत किया है, लेकिन मूल अंतर्दृष्टि - कि प्रशिक्षण डेटा की मात्रा मॉडल आकार के समान ही महत्वपूर्ण है - व्यापक रूप से स्वीकार की गई है।
कुछ ने यह भी बताया कि कंप्यूट-इष्टतम दृष्टिकोण आवश्यक रूप से दिए गए अनुमान बजट के लिए सर्वोत्तम प्रदर्शन की ओर नहीं ले जाता है, क्योंकि बड़े मॉडल अनुमान पर अधिक कुशल हो सकते हैं, भले ही वे प्रशिक्षण के लिए कम कुशल हों। इस बारीकी ने मॉडल स्केलिंग की निरंतर खोज को जन्म दिया, जिसमें मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर और अन्य दक्षता तकनीकें शामिल हैं।