PaLM 2 एक बड़ा भाषा मॉडल (LLM) है जिसे Google द्वारा विकसित किया गया है और मई 2023 में वार्षिक Google I/O मुख्य भाषण में इसकी घोषणा की गई थी। यह Pathways Language Model (PaLM) का उत्तराधिकारी है, जो Google AI द्वारा विकसित 540 बिलियन पैरामीटर वाला सघन डिकोडर-ओनली ट्रांसफॉर्मर-आधारित LLM है। PaLM 2 को 340 बिलियन पैरामीटर वाला मॉडल बताया गया है, जिसे 3.6 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो अपने पूर्ववर्ती की तुलना में पैमाने और क्षमता में महत्वपूर्ण प्रगति दर्शाता है।
यह मॉडल Generative AI और Large language model अनुसंधान में Google के व्यापक प्रयासों का हिस्सा है, जो आधुनिक Deep learning प्रणालियों को रेखांकित करने वाले ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है। PaLM 2 को Google DeepMind के साथ मिलकर विकसित किया गया था, जो Google के AI अनुसंधान प्रभागों के एकीकरण को दर्शाता है।
आर्किटेक्चर और क्षमताएँ
PaLM 2 अपने पूर्ववर्ती द्वारा स्थापित डिकोडर-ओनली ट्रांसफॉर्मर डिज़ाइन का पालन करता है, जो अनुक्रमिक डेटा को संसाधित करने के लिए Multi-Head Attention तंत्र और Positional Encoding का उपयोग करता है। यह मॉडल कई प्रकार के कार्यों में सक्षम है, जिसमें सामान्य ज्ञान तर्क, अंकगणितीय तर्क, चुटकुलों की व्याख्या, कोड निर्माण और अनुवाद शामिल हैं। जब चेन-ऑफ-थॉट प्रॉम्प्टिंग के साथ जोड़ा जाता है, तो PaLM 2 बहु-चरणीय तर्क की आवश्यकता वाले डेटासेट, जैसे शब्द समस्याओं और तर्क-आधारित प्रश्नों पर काफी बेहतर प्रदर्शन प्राप्त करता है।
मॉडल का 3.6 ट्रिलियन टोकन पर प्रशिक्षण - जो मूल PaLM के लिए उपयोग किए गए 780 बिलियन टोकन से काफी अधिक है - विभिन्न डोमेन में बेहतर प्रदर्शन को सक्षम बनाता है। इस प्रशिक्षण कोष में फ़िल्टर की गई वेबसाइटें, पुस्तकें, विकिपीडिया लेख, समाचार लेख, ओपन सोर्स रिपॉजिटरी से सोर्स कोड और सोशल मीडिया वार्तालाप शामिल हैं, जिसमें सोशल मीडिया भाग को संवादात्मक क्षमताओं का समर्थन करने के लिए कोष का 50% बनाया गया है।
प्रशिक्षण अवसंरचना
मूल PaLM 540B को दो TPU v4 पॉड्स पर प्रशिक्षित किया गया था, जिसमें प्रत्येक पॉड में 3,072 TPU v4 चिप्स 768 होस्ट से जुड़े थे, जो मॉडल और डेटा समानता के संयोजन का उपयोग करते थे। यह कॉन्फ़िगरेशन, कुल 6,144 चिप्स के साथ, उस पैमाने पर LLM के लिए प्राप्त उच्चतम प्रशिक्षण दक्षता का रिकॉर्ड था, जिसमें हार्डवेयर FLOPs उपयोग 57.8% था। PaLM 2 की प्रशिक्षण अवसंरचना समान सिद्धांतों का पालन करती है, हालाँकि इसके हार्डवेयर कॉन्फ़िगरेशन के बारे में विशिष्ट विवरण पूरी तरह से सार्वजनिक नहीं किए गए हैं।
संबंधित मॉडल और अनुप्रयोग
Google ने कई विशेष संस्करण बनाने के लिए PaLM आर्किटेक्चर का विस्तार किया। Med-PaLM, चिकित्सा डेटा पर फाइन-ट्यून किया गया एक संस्करण, चिकित्सा प्रश्न-उत्तर बेंचमार्क पर पिछले मॉडलों से बेहतर प्रदर्शन करता है और अमेरिकी चिकित्सा लाइसेंसिंग प्रश्नों पर उत्तीर्ण अंक प्राप्त करने वाला पहला था। यह तर्क प्रदान करता है और बहुविकल्पीय और ओपन-एंडेड प्रश्नों का सटीक उत्तर देने के अलावा अपने स्वयं के उत्तरों का मूल्यांकन भी कर सकता है।
PaLM-E, विज़न ट्रांसफॉर्मर का उपयोग करने वाला एक और विस्तार, पुनः प्रशिक्षण या फाइन-ट्यूनिंग की आवश्यकता के बिना रोबोटिक हेरफेर के लिए एक विज़न-भाषा मॉडल के रूप में कार्य करता है। जून 2023 में, Google ने भाषण-से-भाषण अनुवाद के लिए AudioPaLM की घोषणा की, जो PaLM-2 आर्किटेक्चर और प्रारंभिकरण का उपयोग करता है।
उपलब्धता और प्रभाव
मूल PaLM की घोषणा पहली बार अप्रैल 2022 में की गई थी और यह मार्च 2023 तक निजी रहा, जब Google ने एक API लॉन्च किया जो शुरू में प्रतीक्षा सूची के माध्यम से सीमित संख्या में डेवलपर्स के लिए उपलब्ध था। मई 2023 में Google I/O में PaLM 2 की घोषणा ने तेजी से विकसित हो रहे Artificial intelligence परिदृश्य में OpenAI और Anthropic जैसे अन्य प्रमुख खिलाड़ियों के साथ प्रतिस्पर्धा करने की Google की प्रतिबद्धता का संकेत दिया। मॉडल की क्षमताओं का Google Cloud सेवाओं और व्यापक उद्यम अनुप्रयोगों पर प्रभाव पड़ता है, जो उन्नत Machine learning प्रणालियों के विकास में Google को एक महत्वपूर्ण शक्ति के रूप में स्थापित करता है।