HKChat एक बड़ा भाषा मॉडल (LLM) है जिसे हांगकांग स्थित एक सहयोगी शोध पहल द्वारा विकसित किया गया है। 2024 में जारी, इसे मुख्यधारा की जनरेटिव AI प्रणालियों में कैंटोनीज़ और हांगकांग अंग्रेजी के कम प्रतिनिधित्व को संबोधित करने के लिए डिज़ाइन किया गया था। यह मॉडल ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है, जो क्षेत्रीय भाषाई बारीकियों, जिसमें बोलचाल के भाव और हांगकांग में आम कोड-मिक्सिंग पैटर्न शामिल हैं, पर ध्यान केंद्रित करते हुए पाठ को संसाधित और उत्पन्न करने के लिए गहन शिक्षण तकनीकों का लाभ उठाता है।
HKChat को लगभग 120 बिलियन टोकनों के एक क्यूरेटेड डेटासेट पर प्रशिक्षित किया गया था, जिसमें सार्वजनिक वेब कॉर्पोरा, कैंटोनीज़-भाषा फ़ोरम, उपशीर्षक और स्थानीय रूप से प्राप्त समाचार लेख शामिल हैं। प्रशिक्षण प्रक्रिया में दो-चरणीय दृष्टिकोण अपनाया गया: विविध बहुभाषी कॉर्पस पर प्रारंभिक प्रीट्रेनिंग, उसके बाद संवाद और प्रश्न-उत्तर जैसे कार्य-विशिष्ट डेटा पर पर्यवेक्षित फाइन-ट्यूनिंग। मॉडल में 13 बिलियन पैरामीटर हैं, जो इसे उपभोक्ता-ग्रेड GPU सहित मामूली हार्डवेयर पर तैनाती के लिए उपयुक्त एक मध्यम आकार का LLM बनाता है।
विकास और आर्किटेक्चर
HKChat का विकास 2023 की शुरुआत में शुरू हुआ, जिसका नेतृत्व कई हांगकांग विश्वविद्यालयों के शोधकर्ताओं ने किया और स्थानीय प्रौद्योगिकी इनक्यूबेटरों द्वारा समर्थित किया गया। परियोजना का उद्देश्य बड़े मालिकाना मॉडलों के लिए एक ओपन-सोर्स विकल्प बनाना था, जो सीमित प्रशिक्षण डेटा के कारण कैंटोनीज़ पर अक्सर खराब प्रदर्शन करते हैं। आर्किचेक्चर एक मानक डिकोडर-ओनली ट्रांसफॉर्मर का अनुसरण करता है, जिसमें मल्टी-हेड अटेंशन और पोजिशनल एन्कोडिंग शामिल है। प्रमुख डिज़ाइन विकल्पों में 50,000 टोकनों का शब्दावली आकार शामिल है, जो चीनी वर्णों और कैंटोनीज़ ध्वन्यात्मक रोमनकरण के लिए अनुकूलित है, और 4,096 टोकनों की संदर्भ विंडो शामिल है।
प्रशिक्षण में क्षेत्रीय क्लाउड सेवा प्रदाता के साथ साझेदारी के माध्यम से प्रदान किए गए 64 NVIDIA A100 GPU के एक क्लस्टर का उपयोग किया गया। टीम ने प्रशिक्षण को स्थिर करने के लिए ग्रेडिएंट क्लिपिंग और लर्निंग-रेट शेड्यूलिंग जैसी तकनीकों को नियोजित किया, जो लगभग 45 दिनों तक चला। ओवरफिटिंग को कम करने के लिए, उन्होंने ड्रॉपआउट और वेट-इनिशियलाइज़ेशन रणनीतियों को लागू किया, और सीमित कैंटोनीज़ पाठ स्रोतों का विस्तार करने के लिए डेटा ऑगमेंटेशन का उपयोग किया।
क्षमताएं और बेंचमार्क
HKChat अपने लक्षित भाषाओं के अनुरूप कई बेंचमार्क पर मजबूत प्रदर्शन प्रदर्शित करता है। CantoneseQA डेटासेट पर, जिसमें स्थानीय संस्कृति, इतिहास और दैनिक जीवन को कवर करने वाले 10,000 प्रश्नों का संग्रह है, HKChat ने 78.4% की सटीकता हासिल की, जो 7B-पैरामीटर बहुभाषी बेसलाइन जैसे तुलनीय मॉडलों से 12 अंक बेहतर है। अंग्रेजी कार्यों में, यह MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) जैसे मानक बेंचमार्क पर प्रतिस्पर्धात्मक रूप से स्कोर करता है, 62.1% तक पहुंचता है, जो बड़े मॉडलों से कम है लेकिन इसके आकार के लिए सम्मानजनक है।
मॉडल कोड-मिश्रित पाठ में उत्कृष्ट है, जहां कैंटोनीज़ और अंग्रेजी आपस में जुड़े होते हैं, जो हांगकांग के ऑनलाइन संचार में एक सामान्य घटना है। 50 देशी वक्ताओं से जुड़े एक मानव मूल्यांकन में, HKChat को 67% परीक्षण मामलों में दो प्रमुख वाणिज्यिक मॉडलों की तुलना में अधिक प्राकृतिक और संदर्भ-उपयुक्त दर्जा दिया गया। हालांकि, यह औपचारिक लिखित चीनी और दुर्लभ तकनीकी शब्दजाल के साथ संघर्ष करता है, जो इसके क्षेत्रीय फोकस को दर्शाता है।
रिलीज़ और पहुंच
HKChat को नवंबर 2024 में एक ओपन-सोर्स लाइसेंस के तहत जारी किया गया था, जिसमें मॉडल वेट और अनुमान कोड एक सार्वजनिक रिपॉजिटरी पर उपलब्ध कराए गए थे। रिलीज़ में एक हल्का संस्करण, HKChat-Lite शामिल था, जिसमें 2 बिलियन पैरामीटर थे, जो मोबाइल उपकरणों के लिए अनुकूलित था। परियोजना ने एक विस्तृत तकनीकी रिपोर्ट भी प्रकाशित की, जिसमें प्रशिक्षण डेटा स्रोतों और मूल्यांकन पद्धति का दस्तावेजीकरण किया गया, ताकि पुनरुत्पादन को प्रोत्साहित किया जा सके।
अपनी रिलीज़ के बाद से, HKChat को 50,000 से अधिक बार डाउनलोड किया गया है, जिसमें स्थानीय स्टार्टअप और शैक्षणिक शोधकर्ताओं के बीच अपनाया गया है। इसे कैंटोनीज़ भाषा सीखने के लिए कई शैक्षिक उपकरणों में एकीकृत किया गया है और हांगकांग सोशल मीडिया की भावना विश्लेषण पर प्रारंभिक अध्ययनों में उपयोग किया गया है। डेवलपर्स एक सक्रिय सामुदायिक फोरम बनाए रखते हैं, जहां उपयोगकर्ता फाइन-ट्यूनिंग डेटासेट में योगदान करते हैं और प्रदर्शन मुद्दों की रिपोर्ट करते हैं।
सीमाएं और भविष्य का कार्य
अपनी ताकत के बावजूद, HKChat की उल्लेखनीय सीमाएं हैं। इसका प्रशिक्षण डेटा, हालांकि पर्याप्त है, प्रमुख वैश्विक मॉडलों की तुलना में छोटा है, जिसके परिणामस्वरूप सामान्य ज्ञान और तर्क कार्यों पर कमजोर प्रदर्शन होता है। मॉडल अपने स्रोत कॉर्पोरा में मौजूद पूर्वाग्रहों को भी प्रदर्शित कर सकता है, विशेष रूप से राजनीतिक विषयों के संबंध में, जिसे टीम ने स्वीकार किया है और फ़िल्टरिंग और संरेखण तकनीकों के माध्यम से कम करने का प्रयास किया है।
भविष्य की योजनाओं में प्रशिक्षण डेटासेट को 300 बिलियन टोकनों तक विस्तारित करना शामिल है, जिसमें पॉडकास्ट और सरकारी प्रकाशनों जैसे अधिक विविध स्रोतों को शामिल किया जाएगा। टीम प्रतिक्रिया गुणवत्ता और सुरक्षा में सुधार के लिए मानव प्रतिक्रिया से सुदृढ़ीकरण सीखने (RLHF) की भी खोज कर रही है। एक उत्तराधिकारी मॉडल, जो अनंतिम रूप से 2025 के लिए निर्धारित है, का लक्ष्य पैरामीटर संख्या को 30 बिलियन तक बढ़ाना और संदर्भ विंडो को 8,192 टोकनों तक विस्तारित करना है, जबकि क्षेत्रीय फोकस को बनाए रखना है जो HKChat को परिभाषित करता है।
संबंधित परियोजनाएं
HKChat क्षेत्र-विशिष्ट LLM विकसित करने के व्यापक आंदोलन का हिस्सा है, जो चीनी बोलियों के लिए Alibaba DAMO Academy और हिब्रू और अरबी के लिए AI21 Labs जैसे प्रयासों के समान है। यह Large language model अनुसंधान के साथ तकनीकी नींव साझा करता है, Transformer (architecture) आर्किटेक्चर और Deep learning में प्रगति पर आधारित है। परियोजना क्रॉस-लिंगुअल ट्रांसफर लर्निंग पर University of Toronto शोधकर्ताओं के साथ भी सहयोग करती है, जिसका उद्देश्य कैंटोनीज़ से परे कम-संसाधन भाषाओं पर प्रदर्शन में सुधार करना है।