अंग्रेज़ी से अनुवादित

CPM-2是一个拥有1980亿参数的中文预训练语言模型,由北京智源人工智能研究院(BAAI)开发,于2021年发布,作为CPM-1的继任者,专注于大规模生成和理解任务。

CPM-2 बीजिंग एकेडमी ऑफ आर्टिफिशियल इंटेलिजेंस (BAAI) द्वारा विकसित एक बड़े पैमाने का प्रीट्रेंड भाषा मॉडल है। 2021 में जारी, यह CPM-1 का उत्तराधिकारी है और अपने 198 बिलियन पैरामीटरों के लिए उल्लेखनीय है, जो इसे उस समय के सबसे बड़े चीनी-भाषा मॉडलों में से एक बनाता है। CPM-2 को पाठ निर्माण, समझ और संवाद सहित प्राकृतिक भाषा प्रसंस्करण कार्यों की एक विस्तृत श्रृंखला को संभालने के लिए डिज़ाइन किया गया है, जिसमें चीनी भाषा पर ध्यान केंद्रित किया गया है।

कई मॉडलों के विपरीत जो केवल एकल वास्तुकला पर निर्भर करते हैं, CPM-2 एक Transformer (architecture) ढांचे के भीतर विशेषज्ञों के मिश्रण (MoE) दृष्टिकोण का उपयोग करता है। यह डिज़ाइन मॉडल को प्रत्येक इनपुट के लिए अपने पैरामीटरों के केवल एक उपसमुच्चय को सक्रिय करने की अनुमति देता है, जिससे उच्च प्रदर्शन बनाए रखते हुए कम्प्यूटेशनल दक्षता में सुधार होता है। मॉडल को चीनी पाठ के विविध कोरपस पर प्रशिक्षित किया गया था, जिसमें वेब पेज, पुस्तकें और अन्य स्रोत शामिल हैं, और इसने CLUE (चीनी भाषा समझ मूल्यांकन) जैसे बेंचमार्क पर मजबूत परिणाम प्रदर्शित किए।

वास्तुकला और प्रशिक्षण

CPM-2 एक Transformer (architecture) वास्तुकला पर बनाया गया है, विशेष रूप से जनरेटिव कार्यों के लिए एक डिकोडर-केवल संरचना का उपयोग करता है। इसके 198 बिलियन पैरामीटर कई विशेषज्ञ परतों में व्यवस्थित हैं, जहां प्रत्येक टोकन को कुछ विशेषज्ञों के लिए रूट किया जाता है, जिससे प्रति अनुमान प्रभावी कम्प्यूटेशनल लागत कम हो जाती है। मॉडल चीनी सबवर्ड इकाइयों की शब्दावली का उपयोग करता है और प्रशिक्षण को स्थिर करने के लिए Positional Encoding और Layer Normalization जैसी तकनीकों को शामिल करता है।

प्रशिक्षण प्रक्रिया में दो-चरणीय दृष्टिकोण शामिल था: पहले, एक बड़े कोरपस पर घने प्रीट्रेनिंग चरण, उसके बाद MoE संरचना का उपयोग करके एक विरल फाइन-ट्यूनिंग चरण। इस विधि ने BAAI को मॉडल को उस स्तर से परे स्केल करने की अनुमति दी जो अकेले घने वास्तुकला के साथ संभव होता। प्रशिक्षण डेटा में 200 गीगाबाइट से अधिक चीनी पाठ शामिल था, और मॉडल को GPU के क्लस्टर पर प्रशिक्षित किया गया था, हालांकि विशिष्ट हार्डवेयर विवरण सार्वजनिक रूप से प्रकट नहीं किए गए हैं।

क्षमताएं और अनुप्रयोग

CPM-2 विभिन्न Large language model कार्यों में उत्कृष्ट है, जिसमें पाठ पूर्णता, सारांशीकरण, प्रश्न उत्तर और संवाद निर्माण शामिल हैं। मूल्यांकन में, इसने कई चीनी बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए, जैसे कि CLUE लीडरबोर्ड, कुछ चीनी-विशिष्ट कार्यों में GPT-3 जैसे पिछले मॉडलों को पीछे छोड़ दिया। लंबे संदर्भों को संभालने और सुसंगत, संदर्भ-प्रासंगिक पाठ उत्पन्न करने की मॉडल की क्षमता ने इसे सामग्री निर्माण, ग्राहक सेवा और शैक्षिक उपकरणों में अनुप्रयोगों के लिए उपयुक्त बना दिया।

एक उल्लेखनीय विशेषता इसकी द्विभाषी क्षमता है, क्योंकि CPM-2 अंग्रेजी पाठ भी संसाधित कर सकता है, हालांकि इसका प्राथमिक ध्यान चीनी पर है। यह बहुमुखी प्रतिभा इसके प्रशिक्षण कोरपस में अंग्रेजी डेटा के समावेश से उत्पन्न होती है, जिससे क्रॉस-लिंगुअल ट्रांसफर की अनुमति मिलती है। मॉडल दो संस्करणों में उपलब्ध है: एक पूर्ण 198B पैरामीटर संस्करण और एक छोटा 11B पैरामीटर संस्करण, बाद वाला अनुसंधान और तैनाती के लिए अधिक सुलभ है।

प्रभाव और स्वागत

CPM-2 को एक ओपन-सोर्स मॉडल के रूप में जारी किया गया था, जिसमें इसके वजन और कोड शोध समुदाय के लिए उपलब्ध कराए गए थे। इस खुलेपन ने शैक्षणिक और औद्योगिक सेटिंग्स में इसके अपनाने में योगदान दिया, विशेष रूप से चीन में, जहां यह डोमेन-विशिष्ट कार्यों पर आगे फाइन-ट्यूनिंग के लिए एक आधार के रूप में कार्य करता था। मॉडल की रिलीज़ ने बड़े मॉडलों के प्रशिक्षण की पर्यावरणीय और कम्प्यूटेशनल लागतों के साथ-साथ कुशल अनुमान विधियों की आवश्यकता के बारे में चर्चाओं को भी जन्म दिया।

OpenAI के GPT-3 जैसे समकालीन मॉडलों की तुलना में, CPM-2 ने प्रदर्शित किया कि एक विशिष्ट भाषा पर ध्यान केंद्रित करके और अधिक कुशल MoE वास्तुकला के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त किया जा सकता है। इसकी सफलता ने विरल मॉडलों में आगे के अनुसंधान को प्रोत्साहित किया और CPM श्रृंखला में बाद के मॉडलों के विकास में योगदान दिया, जैसे कि CPM-3।

सीमाएं और नैतिक विचार

अन्य बड़े भाषा मॉडलों की तरह, CPM-2 की सीमाएं हैं, जिनमें इसके प्रशिक्षण डेटा में संभावित पूर्वाग्रह शामिल हैं, जो पक्षपाती आउटपुट का कारण बन सकते हैं। यह गलत या अर्थहीन प्रतिक्रियाएं भी उत्पन्न कर सकता है, विशेष रूप से विशिष्ट विषयों में। मॉडल का बड़ा आकार तैनाती के लिए चुनौतियां पेश करता है, जिसके लिए अनुमान के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता होती है, जो संसाधन-सीमित वातावरण में इसके उपयोग को सीमित करता है।

BAAI ने इन मुद्दों को स्वीकार किया है और संवेदनशील अनुप्रयोगों में मॉडल को तैनात करने से पहले सावधानीपूर्वक मूल्यांकन की सिफारिश की है। संगठन जिम्मेदार उपयोग पर भी जोर देता है, शोधकर्ताओं को उत्पन्न सामग्री के नैतिक निहितार्थों पर विचार करने के लिए प्रोत्साहित करता है। 2024 तक, CPM-2 चीनी-भाषा AI के विकास में एक संदर्भ बिंदु बना हुआ है, हालांकि इसे और भी बड़े पैरामीटर गणनाओं और बेहतर क्षमताओं वाले अधिक उन्नत मॉडलों द्वारा प्रतिस्थापित किया गया है।

विरासत और भविष्य की दिशाएं

CPM-2 की रिलीज़ ने Artificial intelligence के क्षेत्र में एक मील का पत्थर चिह्नित किया, विशेष रूप से गैर-अंग्रेजी भाषा मॉडलों के लिए। इसने प्रदर्शित किया कि बड़े पैमाने पर प्रीट्रेनिंग को अंग्रेजी के अलावा अन्य भाषाओं में प्रभावी ढंग से लागू किया जा सकता है, जिससे अन्य भाषाओं में समान प्रयासों का मार्ग प्रशस्त हुआ। CPM-2 में उपयोग की गई MoE वास्तुकला ने बाद के मॉडल डिजाइनों को प्रभावित किया है, जिसमें Alibaba DAMO Academy और अन्य चीनी AI अनुसंधान संस्थानों के मॉडल शामिल हैं।

CPM श्रृंखला के भविष्य के पुनरावृत्तियों ने CPM-2 की नींव पर निर्माण किया है, जिसमें मानव प्रतिक्रिया से सुदृढीकरण सीखने (Reinforcement Learning from AI Feedback (RLAIF)) और अधिक कुशल प्रशिक्षण विधियों जैसी नई तकनीकों को शामिल किया गया है। CPM-2 की विरासत पश्चिमी तकनीकी पारिस्थितिकी तंत्र के बाहर स्केलेबल, ओपन-सोर्स AI विकास के प्रदर्शन में निहित है, जो एक अधिक विविध वैश्विक AI परिदृश्य में योगदान करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·chinese-ai·transformer·open-source
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास