Google PaLM 2 एक बड़ा भाषा मॉडल (LLM) है जिसे Google AI द्वारा विकसित किया गया है, और मई 2023 में वार्षिक Google I/O मुख्य भाषण में इसकी घोषणा की गई थी। यह Pathways Language Model (PaLM) का उत्तराधिकारी है, जो 540 बिलियन पैरामीटर वाला घना डिकोडर-केवल ट्रांसफॉर्मर-आधारित मॉडल है, जिसे पहली बार अप्रैल 2022 में पेश किया गया था। PaLM 2 को 340 बिलियन पैरामीटर वाला मॉडल बताया गया है, जिसे 3.6 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो अपने पूर्ववर्ती के 780 बिलियन टोकन से एक महत्वपूर्ण वृद्धि है। यह मॉडल Google की संवादात्मक AI सेवा Bard और अन्य Google AI उत्पादों को शक्ति प्रदान करता है, जिसमें बेहतर बहुभाषी क्षमताएं, बेहतर तर्क और बेहतर कोडिंग दक्षता शामिल है।
PaLM 2, PaLM की वास्तुकला की नींव पर आधारित है, जिसे घने डिकोडर-केवल ट्रांसफॉर्मर के रूप में डिज़ाइन किया गया था। मूल PaLM मॉडल ने सामान्य ज्ञान तर्क, अंकगणितीय तर्क, चुटकुलों की व्याख्या, कोड निर्माण और अनुवाद जैसे कार्यों में मजबूत प्रदर्शन दिखाया। जब चेन-ऑफ-थॉट प्रॉम्प्टिंग के साथ जोड़ा गया, तो PaLM ने बहु-चरणीय तर्क की आवश्यकता वाले डेटासेट पर काफी बेहतर परिणाम प्राप्त किए, जिसमें शब्द समस्याएं और तर्क-आधारित प्रश्न शामिल हैं। PaLM 2 इन क्षमताओं का विस्तार करता है, विशेष रूप से बहुभाषी संदर्भों में, जिससे यह अधिक सटीकता के साथ भाषाओं की एक व्यापक श्रेणी में पाठ को समझने और उत्पन्न करने में सक्षम होता है।
विकास और घोषणा
मूल PaLM मॉडल की घोषणा पहली बार अप्रैल 2022 में की गई थी, लेकिन यह मार्च 2023 तक निजी रहा, जब Google ने PaLM और कई अन्य तकनीकों के लिए एक API लॉन्च किया। API शुरू में सीमित संख्या में डेवलपर्स के लिए उपलब्ध था, जिन्होंने इसे जनता के लिए जारी करने से पहले एक प्रतीक्षा सूची में शामिल हो गए। PaLM 2 को मई 2023 में Google I/O में अनावरण किया गया, जो Google के Generative AI प्रयासों में एक प्रमुख मील का पत्थर साबित हुआ। घोषणा में PaLM 2 की अपने पूर्ववर्ती की तुलना में बेहतर दक्षता और प्रदर्शन पर प्रकाश डाला गया, जिसमें Google के उत्पाद पारिस्थितिकी तंत्र में व्यावहारिक अनुप्रयोगों पर ध्यान केंद्रित किया गया।
Google और DeepMind ने PaLM के विशेष संस्करण भी विकसित किए। Med-PaLM, PaLM 540B का एक संस्करण जो चिकित्सा डेटा पर फाइन-ट्यून किया गया था, ने चिकित्सा प्रश्न-उत्तर बेंचमार्क पर पिछले मॉडलों से बेहतर प्रदर्शन किया। यह पहला मॉडल था जिसने अमेरिकी चिकित्सा लाइसेंसिंग प्रश्नों पर उत्तीर्ण अंक प्राप्त किया, जो सटीक उत्तरों के साथ तर्क और आत्म-मूल्यांकन प्रदान करता है। एक अन्य संस्करण, PaLM-E, ने रोबोटिक हेरफेर के लिए एक विज़न-भाषा मॉडल बनाने के लिए विज़न ट्रांसफॉर्मर का उपयोग करके PaLM का विस्तार किया, बिना पुनः प्रशिक्षण या फाइन-ट्यूनिंग के। जून 2023 में, Google ने भाषण-से-भाषण अनुवाद के लिए AudioPaLM की घोषणा की, जो PaLM-2 वास्तुकला और आरंभीकरण का उपयोग करता है।
वास्तुकला और प्रशिक्षण
PaLM 2 एक घना डिकोडर-केवल Transformer (architecture) मॉडल है, जो अपने पूर्ववर्ती के समान है, लेकिन एक बड़े प्रशिक्षण कोरपस के साथ। मूल PaLM को 780 बिलियन टोकन के उच्च-गुणवत्ता वाले कोरपस पर पूर्व-प्रशिक्षित किया गया था, जिसमें फ़िल्टर किए गए वेबपेज, किताबें, विकिपीडिया लेख, समाचार लेख, GitHub पर ओपन-सोर्स रिपॉजिटरी से स्रोत कोड और सोशल मीडिया वार्तालाप शामिल हैं। सोशल मीडिया वार्तालाप भाग ने कोरपस का 50% बनाया, जिससे संवादात्मक क्षमताओं में सहायता मिली। PaLM 2 का प्रशिक्षण डेटा 3.6 ट्रिलियन टोकन तक विस्तारित हुआ, जिससे बेहतर सामान्यीकरण और बहुभाषी प्रदर्शन संभव हुआ।
मूल PaLM 540B को दो TPU v4 पॉड्स पर प्रशिक्षित किया गया था, प्रत्येक में 768 होस्ट से जुड़े 3,072 TPU v4 चिप्स थे, जिसमें मॉडल और डेटा समानांतरता का संयोजन उपयोग किया गया था। यह कॉन्फ़िगरेशन, कुल 6,144 चिप्स, उस पैमाने पर LLM के लिए प्राप्त उच्चतम प्रशिक्षण दक्षता के लिए एक रिकॉर्ड था, जिसमें हार्डवेयर FLOPs उपयोग 57.8% था। PaLM 2 के प्रशिक्षण विवरण सार्वजनिक रूप से कम प्रलेखित हैं, लेकिन इसने संभवतः समान बुनियादी ढांचे का उपयोग किया, जो Google Cloud और विशेष हार्डवेयर में Google के निवेश को दर्शाता है।
क्षमताएं और अनुप्रयोग
PaLM 2 को बहुभाषी कार्यों, तर्क और कोडिंग में उत्कृष्टता प्राप्त करने के लिए डिज़ाइन किया गया है। यह Google के संवादात्मक AI Bard को शक्ति प्रदान करता है, और Google Workspace और Google Cloud की AI सेवाओं जैसे अन्य उत्पादों में एकीकृत है। मॉडल की बेहतर बहुभाषी क्षमताएं इसे पहले के मॉडलों की तुलना में भाषाओं में अनुवाद, सारांशीकरण और प्रश्न-उत्तर को अधिक प्रभावी ढंग से संभालने की अनुमति देती हैं। इसकी तर्क क्षमताओं को चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकों के माध्यम से बढ़ाया गया है, जिससे बहु-चरणीय समस्या-समाधान संभव होता है।
कोडिंग में, PaLM 2 कई प्रोग्रामिंग भाषाओं में कोड निर्माण और डिबगिंग का समर्थन करता है, जिससे यह डेवलपर्स के लिए एक उपकरण बन जाता है। मॉडल की बहुमुखी प्रतिभा Machine learning अनुसंधान से लेकर उद्यम समाधानों तक के अनुप्रयोगों में प्रदर्शित होती है। Google ने PaLM 2 को अपने AI पारिस्थितिकी तंत्र के लिए एक आधारभूत मॉडल के रूप में स्थापित किया है, जो OpenAI और Anthropic की पेशकशों के साथ प्रतिस्पर्धा करता है।
अन्य मॉडलों के साथ तुलना
PaLM 2 के 340 बिलियन पैरामीटर इसे Large language model के ऊपरी स्तर में रखते हैं, हालांकि यह OpenAI के GPT-4 जैसे कुछ प्रतिस्पर्धियों से छोटा है, जिसके बारे में बताया गया है कि इसमें मिश्रण-ऑफ-विशेषज्ञ वास्तुकला में एक ट्रिलियन से अधिक पैरामीटर हैं। हालांकि, PaLM 2 का 3.6 ट्रिलियन टोकन पर प्रशिक्षण और दक्षता पर इसका ध्यान इसे बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करने की अनुमति देता है। मॉडल की वास्तुकला, Transformer (architecture) ढांचे पर आधारित, अन्य LLM के समान है, लेकिन Google की मालिकाना प्रशिक्षण तकनीकें और बुनियादी ढांचा इसे स्केलेबिलिटी में विशिष्ट लाभ देते हैं।
अपने पूर्ववर्ती PaLM की तुलना में, PaLM 2 बहुभाषी समझ और तर्क में महत्वपूर्ण सुधार प्रदान करता है, साथ ही अनुमान के लिए कम कम्प्यूटेशनल आवश्यकताएं भी प्रदान करता है। यह इसे वास्तविक दुनिया के अनुप्रयोगों में तैनाती के लिए अधिक सुलभ बनाता है। Bard और Google Cloud के Vertex AI जैसे उत्पादों में PaLM 2 का एकीकरण इसकी पहुंच को व्यापक बनाता है, जिससे यह Artificial intelligence परिदृश्य में एक प्रमुख खिलाड़ी बन जाता है।
प्रभाव और स्वागत
मई 2023 में PaLM 2 के लॉन्च को AI समुदाय और उद्योग पर्यवेक्षकों से ध्यान मिला। इसने Deep learning और Neural network प्रौद्योगिकियों को आगे बढ़ाने के लिए Google की प्रतिबद्धता प्रदर्शित की, विशेष रूप से जनरेटिव AI के प्रतिस्पर्धी क्षेत्र में। मॉडल की बेहतर बहुभाषी क्षमताओं को AI को गैर-अंग्रेजी बोलने वालों के लिए सुलभ बनाने में एक कदम आगे के रूप में देखा गया, और इसकी कोडिंग क्षमताओं ने डेवलपर्स को आकर्षित किया।
हालांकि, PaLM 2 ने बड़े मॉडलों के प्रशिक्षण के पर्यावरणीय प्रभाव के बारे में भी प्रश्न उठाए, हालांकि Google ने दक्षता सुधारों पर जोर दिया है। Bard में मॉडल के एकीकरण ने AI की नैतिकता के बारे में चर्चाओं को जन्म दिया, जिसमें पूर्वाग्रह और गलत सूचना के मुद्दे शामिल हैं, जो Generative AI प्रणालियों के लिए सामान्य चिंताएं हैं। Google ने सुरक्षा उपायों को लागू किया है, लेकिन व्यापक निहितार्थ बहस का विषय बने हुए हैं।
भविष्य की दिशाएं
PaLM 2 के बाद, Google ने अपने AI मॉडलों का विकास जारी रखा। 2023 के अंत में, Google ने Gemini की घोषणा की, जो PaLM 2 का उत्तराधिकारी है, जो मल्टीमॉडल क्षमताओं को एकीकृत करता है और अधिक शक्तिशाली और बहुमुखी होने के लिए डिज़ाइन किया गया है। PaLM 2 की वास्तुकला और प्रशिक्षण विधियों ने बाद के विकासों को प्रभावित किया है, जिसमें Multi-Head Attention और Positional Encoding तकनीकों में सुधार शामिल हैं। मॉडल की विरासत Artificial intelligence की सीमाओं को आगे बढ़ाने के Google के चल रहे प्रयासों में स्पष्ट है, जिसमें स्वास्थ्य सेवा से लेकर रोबोटिक्स तक के क्षेत्रों में अनुप्रयोग शामिल हैं।
2025 तक, PaLM 2 LLM के इतिहास में एक महत्वपूर्ण मील का पत्थर बना हुआ है, जो LaMDA जैसे पहले के मॉडलों और Gemini जैसी अधिक उन्नत प्रणालियों के बीच एक पुल का प्रतिनिधित्व करता है। बहुभाषी AI और कुशल प्रशिक्षण में इसके योगदान ने क्षेत्र पर स्थायी प्रभाव डाला है, और इसके सिद्धांत Google DeepMind और उससे आगे के अनुसंधान को सूचित करना जारी रखते हैं।
यह भी देखें
- LaMDA, PaLM का पूर्ववर्ती
- Gemini, PaLM का उत्तराधिकारी
- Chinchilla, एक संबंधित LLM
- Transformer (architecture), अंतर्निहित वास्तुकला
- Google Cloud, प्रशिक्षण के लिए बुनियादी ढांचा
संदर्भ
- Google AI ब्लॉग, मई 2023, PaLM 2 घोषणा
- विकिपीडिया, PaLM (Pathways Language Model), 2025 में एक्सेस किया गया
- Google Research, PaLM: Scaling Language Modeling with Pathways, 2022