GLUE-ZH एक बेंचमार्क सूट है जिसे चीनी पाठ पर मॉडलों की सामान्य-उद्देश्य भाषा समझ क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह अंग्रेजी GLUE (सामान्य भाषा समझ मूल्यांकन) बेंचमार्क की संरचना का अनुसरण करता है, इसके कार्यों और मूल्यांकन पद्धति को चीनी भाषा के अनुकूल बनाता है। बेंचमार्क एक एकल समग्र स्कोर प्रदान करता है जो मौलिक एनएलपी कार्यों की एक श्रृंखला में एक मॉडल के प्रदर्शन को दर्शाता है, जिससे चीनी प्राकृतिक भाषा प्रसंस्करण में विभिन्न दृष्टिकोणों की सीधी तुलना संभव होती है।
यह बेंचमार्क 2010 के दशक के अंत में डीप लर्निंग और बड़े भाषा मॉडल के तेजी से उन्नत क्षेत्र के लिए बहुभाषी मूल्यांकन मानकों को बनाने के व्यापक प्रयास के हिस्से के रूप में पेश किया गया था। जबकि मूल GLUE बेंचमार्क 2018 में न्यूयॉर्क विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा जारी किया गया था, GLUE-ZH मानकीकृत चीनी एनएलपी मूल्यांकन की बढ़ती आवश्यकता को संबोधित करने के लिए एक समुदाय-संचालित अनुकूलन के रूप में उभरा। इसे शैक्षणिक और औद्योगिक अनुसंधान समूहों के एक संघ द्वारा विकसित किया गया था, हालांकि कोई एकल आधिकारिक रिलीज़ तिथि या पेपर सार्वभौमिक रूप से मान्यता प्राप्त नहीं है, और बेंचमार्क की सटीक संरचना विभिन्न कार्यान्वयनों में भिन्न रही है।
कार्य संरचना
GLUE-ZH में आमतौर पर कार्यों का एक सेट शामिल होता है जो अंग्रेजी GLUE सूट को दर्शाता है लेकिन चीनी डेटासेट का उपयोग करता है। सामान्य कार्यों में शामिल हैं:
- वाक्य-स्तरीय वर्गीकरण: भावना विश्लेषण (जैसे, चीनी ChnSentiCorp डेटासेट का उपयोग करके) और प्रश्न-उत्तर प्राकृतिक भाषा अनुमान (जैसे, CMNLI डेटासेट, जो MultiNLI कॉर्पस का चीनी संस्करण है) जैसे कार्य।
- पाठ्य समानता: चीनी सिमेंटिक टेक्स्टुअल समानता (STS-B) जैसे कार्य, जो मापते हैं कि दो वाक्य 0 से 5 के पैमाने पर कितने शब्दार्थ रूप से समान हैं।
- एकल-वाक्य टैगिंग: चीनी शब्द विभाजन और भाषण-भाग टैगिंग जैसे कार्य, जो शब्दों के बीच रिक्त स्थान की कमी के कारण चीनी एनएलपी के लिए आवश्यक हैं।
- पठन समझ: CMRC2018 (चीनी मशीन रीडिंग कॉम्प्रिहेंशन) जैसे कार्य, जिनके लिए मॉडलों को दिए गए अंशों के आधार पर प्रश्नों के उत्तर देने की आवश्यकता होती है।
GLUE-ZH में कार्यों की सटीक संख्या संस्करणों के बीच भिन्न रही है, कुछ कार्यान्वयनों में केवल पांच कार्य शामिल हैं और अन्य नौ या अधिक तक विस्तारित हैं। सबसे अधिक उद्धृत कॉन्फ़िगरेशन में सात कार्य शामिल हैं, जो वर्गीकरण, समानता और अनुमान को कवर करते हैं।
मूल्यांकन पद्धति
GLUE-ZH अंग्रेजी GLUE बेंचमार्क के समान स्कोरिंग प्रणाली का उपयोग करता है। प्रत्येक कार्य में एक विशिष्ट मीट्रिक होता है (जैसे, वर्गीकरण कार्यों के लिए सटीकता, समानता कार्यों के लिए पियर्सन सहसंबंध), और अंतिम GLUE-ZH स्कोर सभी कार्य-विशिष्ट स्कोर का औसत होता है। यह समग्र स्कोर मॉडल प्रदर्शन की एकल-संख्या तुलना की अनुमति देता है, जिससे मूल्यांकन प्रक्रिया सरल हो जाती है।
मॉडलों का मूल्यांकन आमतौर पर शून्य-शॉट या फाइन-ट्यून्ड सेटिंग में किया जाता है। शून्य-शॉट सेटिंग में, मॉडलों को बिना किसी कार्य-विशिष्ट प्रशिक्षण के GLUE-ZH कार्यों पर परीक्षण किया जाता है, जो उनकी सामान्य भाषा समझ क्षमताओं को मापता है। फाइन-ट्यून्ड सेटिंग में, मूल्यांकन से पहले मॉडलों को प्रत्येक कार्य के प्रशिक्षण डेटा पर प्रशिक्षित किया जाता है, जो विशिष्ट डाउनस्ट्रीम कार्यों के लिए उनकी अनुकूलन क्षमता को मापता है।
ऐतिहासिक संदर्भ और उपयोग
GLUE-ZH ने 2010 के दशक के अंत और 2020 के दशक की शुरुआत में ट्रांसफॉर्मर-आधारित मॉडलों के उदय के दौरान प्रमुखता प्राप्त की। इसका उपयोग कई शोध पत्रों और तकनीकी रिपोर्टों में एक बेंचमार्क के रूप में किया गया था, विशेष रूप से उन पर ध्यान केंद्रित करते हुए जो चीनी पूर्व-प्रशिक्षित मॉडल जैसे BERT-आधारित वेरिएंट (जैसे, BERT-wwm, RoBERTa-wwm) और ERNIE पर केंद्रित थे। इन मॉडलों ने लगातार GLUE-ZH पर उच्च स्कोर प्राप्त किए, 2021 तक सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल 80% से अधिक के समग्र स्कोर तक पहुंच गए।
बेंचमार्क को इसके सीमित दायरे के लिए आलोचना का सामना करना पड़ा है, क्योंकि यह मुख्य रूप से वाक्य-स्तरीय कार्यों पर केंद्रित है और संवाद निर्माण या दस्तावेज़-स्तरीय समझ जैसे अधिक जटिल कार्यों को शामिल नहीं करता है। इसके अतिरिक्त, एक एकल आधिकारिक संस्करण की कमी ने विभिन्न अध्ययनों में रिपोर्ट किए गए परिणामों में असंगतियां पैदा की हैं, जिससे सीधी तुलना कठिन हो गई है।
अन्य बेंचमार्क से संबंध
GLUE-ZH बहुभाषी बेंचमार्क के एक परिवार का हिस्सा है जिसमें SuperGLUE (अंग्रेजी में GLUE का उत्तराधिकारी) और XTREME (एक क्रॉस-भाषाई बेंचमार्क) शामिल हैं। जबकि XTREME में चीनी कई भाषाओं में से एक के रूप में शामिल है, GLUE-ZH विशेष रूप से चीनी के लिए गहन मूल्यांकन प्रदान करता है। यह चीनी SuperGLUE (CLUE) बेंचमार्क से भी संबंधित है, जो 2020 में जारी किया गया था और चीनी एनएलपी के लिए एक अधिक व्यापक और मानकीकृत मूल्यांकन सूट प्रदान करता है। CLUE ने अपने बड़े कार्य सेट और आधिकारिक लीडरबोर्ड के कारण अनुसंधान उपयोग में GLUE-ZH को काफी हद तक प्रतिस्थापित कर दिया है।
वर्तमान स्थिति
2020 के दशक के मध्य तक, GLUE-ZH का उपयोग अत्याधुनिक अनुसंधान में कम बार किया जाता है, इसे CLUE और चीनी संस्करण SuperGLUE जैसे अधिक व्यापक बेंचमार्क द्वारा प्रतिस्थापित किया गया है। हालांकि, यह चीनी एनएलपी मूल्यांकन के विकास को समझने के लिए एक उपयोगी संदर्भ बना हुआ है और अभी भी कुछ शैक्षिक सामग्रियों और ऐतिहासिक विश्लेषणों में उद्धृत किया जाता है। बेंचमार्क का प्रभाव नए मूल्यांकन सूटों के डिजाइन में बना हुआ है, जो अक्सर समान कार्य प्रकारों और स्कोरिंग पद्धतियों को शामिल करते हैं।