CPM-2 बीजिंग एकेडमी ऑफ आर्टिफिशियल इंटेलिजेंस (BAAI) द्वारा विकसित एक बड़े पैमाने का प्रीट्रेंड भाषा मॉडल है। 2021 में जारी, यह CPM-1 का उत्तराधिकारी है और अपने 198 बिलियन पैरामीटरों के लिए उल्लेखनीय है, जो इसे उस समय के सबसे बड़े चीनी-भाषा मॉडलों में से एक बनाता है। CPM-2 को पाठ निर्माण, समझ और संवाद सहित प्राकृतिक भाषा प्रसंस्करण कार्यों की एक विस्तृत श्रृंखला को संभालने के लिए डिज़ाइन किया गया है, जिसमें चीनी भाषा पर ध्यान केंद्रित किया गया है।
कई मॉडलों के विपरीत जो केवल एकल वास्तुकला पर निर्भर करते हैं, CPM-2 एक Transformer (architecture) ढांचे के भीतर विशेषज्ञों के मिश्रण (MoE) दृष्टिकोण का उपयोग करता है। यह डिज़ाइन मॉडल को प्रत्येक इनपुट के लिए अपने पैरामीटरों के केवल एक उपसमुच्चय को सक्रिय करने की अनुमति देता है, जिससे उच्च प्रदर्शन बनाए रखते हुए कम्प्यूटेशनल दक्षता में सुधार होता है। मॉडल को चीनी पाठ के विविध कोरपस पर प्रशिक्षित किया गया था, जिसमें वेब पेज, पुस्तकें और अन्य स्रोत शामिल हैं, और इसने CLUE (चीनी भाषा समझ मूल्यांकन) जैसे बेंचमार्क पर मजबूत परिणाम प्रदर्शित किए।
वास्तुकला और प्रशिक्षण
CPM-2 एक Transformer (architecture) वास्तुकला पर बनाया गया है, विशेष रूप से जनरेटिव कार्यों के लिए एक डिकोडर-केवल संरचना का उपयोग करता है। इसके 198 बिलियन पैरामीटर कई विशेषज्ञ परतों में व्यवस्थित हैं, जहां प्रत्येक टोकन को कुछ विशेषज्ञों के लिए रूट किया जाता है, जिससे प्रति अनुमान प्रभावी कम्प्यूटेशनल लागत कम हो जाती है। मॉडल चीनी सबवर्ड इकाइयों की शब्दावली का उपयोग करता है और प्रशिक्षण को स्थिर करने के लिए Positional Encoding और Layer Normalization जैसी तकनीकों को शामिल करता है।
प्रशिक्षण प्रक्रिया में दो-चरणीय दृष्टिकोण शामिल था: पहले, एक बड़े कोरपस पर घने प्रीट्रेनिंग चरण, उसके बाद MoE संरचना का उपयोग करके एक विरल फाइन-ट्यूनिंग चरण। इस विधि ने BAAI को मॉडल को उस स्तर से परे स्केल करने की अनुमति दी जो अकेले घने वास्तुकला के साथ संभव होता। प्रशिक्षण डेटा में 200 गीगाबाइट से अधिक चीनी पाठ शामिल था, और मॉडल को GPU के क्लस्टर पर प्रशिक्षित किया गया था, हालांकि विशिष्ट हार्डवेयर विवरण सार्वजनिक रूप से प्रकट नहीं किए गए हैं।
क्षमताएं और अनुप्रयोग
CPM-2 विभिन्न Large language model कार्यों में उत्कृष्ट है, जिसमें पाठ पूर्णता, सारांशीकरण, प्रश्न उत्तर और संवाद निर्माण शामिल हैं। मूल्यांकन में, इसने कई चीनी बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए, जैसे कि CLUE लीडरबोर्ड, कुछ चीनी-विशिष्ट कार्यों में GPT-3 जैसे पिछले मॉडलों को पीछे छोड़ दिया। लंबे संदर्भों को संभालने और सुसंगत, संदर्भ-प्रासंगिक पाठ उत्पन्न करने की मॉडल की क्षमता ने इसे सामग्री निर्माण, ग्राहक सेवा और शैक्षिक उपकरणों में अनुप्रयोगों के लिए उपयुक्त बना दिया।
एक उल्लेखनीय विशेषता इसकी द्विभाषी क्षमता है, क्योंकि CPM-2 अंग्रेजी पाठ भी संसाधित कर सकता है, हालांकि इसका प्राथमिक ध्यान चीनी पर है। यह बहुमुखी प्रतिभा इसके प्रशिक्षण कोरपस में अंग्रेजी डेटा के समावेश से उत्पन्न होती है, जिससे क्रॉस-लिंगुअल ट्रांसफर की अनुमति मिलती है। मॉडल दो संस्करणों में उपलब्ध है: एक पूर्ण 198B पैरामीटर संस्करण और एक छोटा 11B पैरामीटर संस्करण, बाद वाला अनुसंधान और तैनाती के लिए अधिक सुलभ है।
प्रभाव और स्वागत
CPM-2 को एक ओपन-सोर्स मॉडल के रूप में जारी किया गया था, जिसमें इसके वजन और कोड शोध समुदाय के लिए उपलब्ध कराए गए थे। इस खुलेपन ने शैक्षणिक और औद्योगिक सेटिंग्स में इसके अपनाने में योगदान दिया, विशेष रूप से चीन में, जहां यह डोमेन-विशिष्ट कार्यों पर आगे फाइन-ट्यूनिंग के लिए एक आधार के रूप में कार्य करता था। मॉडल की रिलीज़ ने बड़े मॉडलों के प्रशिक्षण की पर्यावरणीय और कम्प्यूटेशनल लागतों के साथ-साथ कुशल अनुमान विधियों की आवश्यकता के बारे में चर्चाओं को भी जन्म दिया।
OpenAI के GPT-3 जैसे समकालीन मॉडलों की तुलना में, CPM-2 ने प्रदर्शित किया कि एक विशिष्ट भाषा पर ध्यान केंद्रित करके और अधिक कुशल MoE वास्तुकला के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त किया जा सकता है। इसकी सफलता ने विरल मॉडलों में आगे के अनुसंधान को प्रोत्साहित किया और CPM श्रृंखला में बाद के मॉडलों के विकास में योगदान दिया, जैसे कि CPM-3।
सीमाएं और नैतिक विचार
अन्य बड़े भाषा मॉडलों की तरह, CPM-2 की सीमाएं हैं, जिनमें इसके प्रशिक्षण डेटा में संभावित पूर्वाग्रह शामिल हैं, जो पक्षपाती आउटपुट का कारण बन सकते हैं। यह गलत या अर्थहीन प्रतिक्रियाएं भी उत्पन्न कर सकता है, विशेष रूप से विशिष्ट विषयों में। मॉडल का बड़ा आकार तैनाती के लिए चुनौतियां पेश करता है, जिसके लिए अनुमान के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता होती है, जो संसाधन-सीमित वातावरण में इसके उपयोग को सीमित करता है।
BAAI ने इन मुद्दों को स्वीकार किया है और संवेदनशील अनुप्रयोगों में मॉडल को तैनात करने से पहले सावधानीपूर्वक मूल्यांकन की सिफारिश की है। संगठन जिम्मेदार उपयोग पर भी जोर देता है, शोधकर्ताओं को उत्पन्न सामग्री के नैतिक निहितार्थों पर विचार करने के लिए प्रोत्साहित करता है। 2024 तक, CPM-2 चीनी-भाषा AI के विकास में एक संदर्भ बिंदु बना हुआ है, हालांकि इसे और भी बड़े पैरामीटर गणनाओं और बेहतर क्षमताओं वाले अधिक उन्नत मॉडलों द्वारा प्रतिस्थापित किया गया है।
विरासत और भविष्य की दिशाएं
CPM-2 की रिलीज़ ने Artificial intelligence के क्षेत्र में एक मील का पत्थर चिह्नित किया, विशेष रूप से गैर-अंग्रेजी भाषा मॉडलों के लिए। इसने प्रदर्शित किया कि बड़े पैमाने पर प्रीट्रेनिंग को अंग्रेजी के अलावा अन्य भाषाओं में प्रभावी ढंग से लागू किया जा सकता है, जिससे अन्य भाषाओं में समान प्रयासों का मार्ग प्रशस्त हुआ। CPM-2 में उपयोग की गई MoE वास्तुकला ने बाद के मॉडल डिजाइनों को प्रभावित किया है, जिसमें Alibaba DAMO Academy और अन्य चीनी AI अनुसंधान संस्थानों के मॉडल शामिल हैं।
CPM श्रृंखला के भविष्य के पुनरावृत्तियों ने CPM-2 की नींव पर निर्माण किया है, जिसमें मानव प्रतिक्रिया से सुदृढीकरण सीखने (Reinforcement Learning from AI Feedback (RLAIF)) और अधिक कुशल प्रशिक्षण विधियों जैसी नई तकनीकों को शामिल किया गया है। CPM-2 की विरासत पश्चिमी तकनीकी पारिस्थितिकी तंत्र के बाहर स्केलेबल, ओपन-सोर्स AI विकास के प्रदर्शन में निहित है, जो एक अधिक विविध वैश्विक AI परिदृश्य में योगदान करती है।