हुआवेई पैनगु बड़े भाषा मॉडल का एक परिवार है जिसे चीनी प्रौद्योगिकी कंपनी हुआवेई (सूची में कोई लिंक उपलब्ध नहीं) द्वारा विकसित किया गया है। यह श्रृंखला अप्रैल 2021 में पैनगु-α के रिलीज़ के साथ शुरू की गई थी, जो 200 अरब मापदंडों वाला एक मॉडल है, जो उस समय के सबसे बड़े भाषा मॉडल में से एक बन गया। पैनगु मॉडल ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके बनाए गए हैं और चीनी और अंग्रेजी पाठ के बड़े कोषों पर प्रशिक्षित हैं। इन्हें हुआवेई क्लाउड के माध्यम से इसकी एआई सेवाओं के भाग के रूप में तैनात किया जाता है, जिसमें प्राकृतिक भाषा समझ, पीढ़ी, संवाद और कोड पूर्णता में अनुप्रयोग शामिल हैं।
आर्किटेक्चर और प्रशिक्षण
पैनगु श्रृंखला में कई मॉडल प्रकार शामिल हैं, जैसे पैनगु-α, पैनगु-कोडर, और पैनगु-Σ। पैनगु-α, मूल मॉडल, एक सघन ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है और 2.6 टेराबाइट कोष पर प्रशिक्षित किया गया था। पैनगु-कोडर, 2022 में जारी, कोड पीढ़ी के लिए एक विशेष मॉडल है, जो ओपन-सोर्स कोड भंडारों पर प्रशिक्षित है। पैनगु-Σ, 2023 में पेश किया गया, एक विरल ट्रांसफॉर्मर मॉडल है जिसमें सैकड़ों अरब मापदंड हैं, और यह कंप्यूटेशनल लागत को कम करने के लिए एक पदानुक्रमित आर्किटेक्चर पर बनाया गया है। प्रशिक्षण हुआवेई के Ascend 910 एआई चिप्स पर किया जाता है और स्थिरता के लिए अवशिष्ट कनेक्शन और लेयर सामान्यीकरण का लाभ उठाता है।
क्षमताएं और अनुप्रयोग
पैनगु मॉडल पाठ सारांश, मशीन अनुवाद, प्रश्न उत्तर, और संवाद पीढ़ी जैसे कार्यों का समर्थन करते हैं। 2021 के मूल्यांकन में, पैनगु-α को कई चीनी प्राकृतिक भाषा समझ कार्यों पर बेंचमार्क किया गया था और रिपोर्ट के अनुसार कई डेटासेट पर शून्य-शॉट और कुछ-शॉट सेटिंग्स में ओपनएआई के GPT-3 से बेहतर प्रदर्शन किया। हुआवेई ने पैनगु मॉडल को अपनी क्लाउड सेवा पेशकशों में एकीकृत किया है, जिसमें पैनगु पैनगुस्टूडियो प्लेटफ़ॉर्म शामिल है, जो उद्यमों को कस्टम एआई अनुप्रयोग बनाने के लिए लो-कोड और नो-कोड उपकरण प्रदान करता है। मॉडल का उपयोग वित्त, स्वास्थ्य सेवा, और विनिर्माण जैसे उद्योगों में किया गया है, जिसमें साझेदार कंपनियों जैसे टॉमटॉम, इंट्यूटिव सर्जिकल, और कम्योर में डोमेन-विशिष्ट कार्यों के लिए तैनाती की रिपोर्ट है, हालांकि विवरण व्यापक रूप से सार्वजनिक नहीं हैं।
आर्किटेक्चर में सुधार
दक्षता में सुधार के लिए, पैनगु-Σ में "वेट लिफ्टिंग" नामक विधि और "समानांतर ध्यान" तंत्र जैसे नवाचार शामिल हैं। प्रशिक्षण प्रक्रिया में पैरामीटर ब्लोट को कम करने के लिए प्रूनिंग और डेटा संवर्धन तकनीकों का उपयोग किया जाता है। बाद के संस्करणों में उपयोगकर्ता प्राथमिकताओं के साथ आउटपुट को संरेखित करने के लिए आरएलएआईएफ (एआई फीडबैक से सुदृढीकरण सीखना) अपनाया गया है। मॉडल परतों में मल्टी-हेड अटेंशन और क्रॉस-अटेंशन ब्लॉक भी नियोजित करते हैं।
रिलीज़ इतिहास और पारिस्थितिकी तंत्र
पैनगु-α पहली बार 2021 में जारी किया गया था। 2022 में, हुआवेई ने विज़न के लिए पैनगु-कोडर और पैनगु-सीवी जारी किया। 2023 में, पैनगु-Σ को 700 अरब मापदंडों के दावे के साथ जारी किया गया। 2024 में, हुआवेई ने अपने क्लाउड पर पैनगु स्टूडियो और पैनगु फाउंडेशन मॉडल सेवाएं लॉन्च कीं, साथ ही HarmonyOS ऑपरेटिंग सिस्टम में एकीकरण भी किया। मॉडल हुआवेई के क्लाउड प्लेटफ़ॉर्म समकक्षों के माध्यम से सुलभ हैं, हालांकि वे सीधे हुआवेई क्लाउड के माध्यम से भी पेश किए जाते हैं। अलीबाबा क्लाउड और अन्य प्रदाताओं के साथ साझेदारी सार्वजनिक नहीं है।
स्वागत और विवाद
2021 में, शुरुआती आलोचकों ने आकार डेटासेट और संभावित प्रशिक्षण डेटा रिसाव के बारे में चिंताएं उठाईं। हुआवेई ने बेंचमार्क परिणाम प्रकाशित किए जिनमें दावा किया गया कि पैनगु-α ने कुछ चीनी बेंचमार्क पर GPT-3 से बेहतर प्रदर्शन किया, लेकिन स्वतंत्र सत्यापन सीमित था। मॉडल की रिलीज़ ने भाषा मॉडल बेंचमार्क और परिणामों की पुनरुत्पादन क्षमता पर बहस को जन्म दिया, जो डीपमाइंड और अन्य प्रयोगशालाओं के आसपास समान बहस को दर्शाता है। पैनगु घरेलू एआई क्षमताओं और विदेशी लेखकों पर निर्भरता कम करने के लिए चीन के प्रयास का भी हिस्सा है। 2024 तक, मॉडल सक्रिय बना हुआ है, और हुआवेई जीपीटी-4 और एंथ्रोपिक (कोई लिंक उपलब्ध नहीं) जैसे अन्य एलएलएम के साथ प्रतिस्पर्धा करने के लिए निरंतर विकास में निवेश कर रहा है।