अंग्रेज़ी से अनुवादित

GLUE-ZH एक चीनी-भाषा बेंचमार्क सुइट है जो सामान्य-उद्देश्य भाषा समझ मॉडल का मूल्यांकन करने के लिए है, जो अंग्रेजी GLUE बेंचमार्क से प्रेरित है। यह विभिन्न भाषाई क्षमताओं में मॉडल के प्रदर्शन को मापने के लिए कई चीनी NLP कार्यों को एक एकल स्कोर में एकत्रित करता है।

GLUE-ZH एक बेंचमार्क सूट है जिसे चीनी पाठ पर मॉडलों की सामान्य-उद्देश्य भाषा समझ क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह अंग्रेजी GLUE (सामान्य भाषा समझ मूल्यांकन) बेंचमार्क की संरचना का अनुसरण करता है, इसके कार्यों और मूल्यांकन पद्धति को चीनी भाषा के अनुकूल बनाता है। बेंचमार्क एक एकल समग्र स्कोर प्रदान करता है जो मौलिक एनएलपी कार्यों की एक श्रृंखला में एक मॉडल के प्रदर्शन को दर्शाता है, जिससे चीनी प्राकृतिक भाषा प्रसंस्करण में विभिन्न दृष्टिकोणों की सीधी तुलना संभव होती है।

यह बेंचमार्क 2010 के दशक के अंत में डीप लर्निंग और बड़े भाषा मॉडल के तेजी से उन्नत क्षेत्र के लिए बहुभाषी मूल्यांकन मानकों को बनाने के व्यापक प्रयास के हिस्से के रूप में पेश किया गया था। जबकि मूल GLUE बेंचमार्क 2018 में न्यूयॉर्क विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा जारी किया गया था, GLUE-ZH मानकीकृत चीनी एनएलपी मूल्यांकन की बढ़ती आवश्यकता को संबोधित करने के लिए एक समुदाय-संचालित अनुकूलन के रूप में उभरा। इसे शैक्षणिक और औद्योगिक अनुसंधान समूहों के एक संघ द्वारा विकसित किया गया था, हालांकि कोई एकल आधिकारिक रिलीज़ तिथि या पेपर सार्वभौमिक रूप से मान्यता प्राप्त नहीं है, और बेंचमार्क की सटीक संरचना विभिन्न कार्यान्वयनों में भिन्न रही है।

कार्य संरचना

GLUE-ZH में आमतौर पर कार्यों का एक सेट शामिल होता है जो अंग्रेजी GLUE सूट को दर्शाता है लेकिन चीनी डेटासेट का उपयोग करता है। सामान्य कार्यों में शामिल हैं:

  • वाक्य-स्तरीय वर्गीकरण: भावना विश्लेषण (जैसे, चीनी ChnSentiCorp डेटासेट का उपयोग करके) और प्रश्न-उत्तर प्राकृतिक भाषा अनुमान (जैसे, CMNLI डेटासेट, जो MultiNLI कॉर्पस का चीनी संस्करण है) जैसे कार्य।
  • पाठ्य समानता: चीनी सिमेंटिक टेक्स्टुअल समानता (STS-B) जैसे कार्य, जो मापते हैं कि दो वाक्य 0 से 5 के पैमाने पर कितने शब्दार्थ रूप से समान हैं।
  • एकल-वाक्य टैगिंग: चीनी शब्द विभाजन और भाषण-भाग टैगिंग जैसे कार्य, जो शब्दों के बीच रिक्त स्थान की कमी के कारण चीनी एनएलपी के लिए आवश्यक हैं।
  • पठन समझ: CMRC2018 (चीनी मशीन रीडिंग कॉम्प्रिहेंशन) जैसे कार्य, जिनके लिए मॉडलों को दिए गए अंशों के आधार पर प्रश्नों के उत्तर देने की आवश्यकता होती है।

GLUE-ZH में कार्यों की सटीक संख्या संस्करणों के बीच भिन्न रही है, कुछ कार्यान्वयनों में केवल पांच कार्य शामिल हैं और अन्य नौ या अधिक तक विस्तारित हैं। सबसे अधिक उद्धृत कॉन्फ़िगरेशन में सात कार्य शामिल हैं, जो वर्गीकरण, समानता और अनुमान को कवर करते हैं।

मूल्यांकन पद्धति

GLUE-ZH अंग्रेजी GLUE बेंचमार्क के समान स्कोरिंग प्रणाली का उपयोग करता है। प्रत्येक कार्य में एक विशिष्ट मीट्रिक होता है (जैसे, वर्गीकरण कार्यों के लिए सटीकता, समानता कार्यों के लिए पियर्सन सहसंबंध), और अंतिम GLUE-ZH स्कोर सभी कार्य-विशिष्ट स्कोर का औसत होता है। यह समग्र स्कोर मॉडल प्रदर्शन की एकल-संख्या तुलना की अनुमति देता है, जिससे मूल्यांकन प्रक्रिया सरल हो जाती है।

मॉडलों का मूल्यांकन आमतौर पर शून्य-शॉट या फाइन-ट्यून्ड सेटिंग में किया जाता है। शून्य-शॉट सेटिंग में, मॉडलों को बिना किसी कार्य-विशिष्ट प्रशिक्षण के GLUE-ZH कार्यों पर परीक्षण किया जाता है, जो उनकी सामान्य भाषा समझ क्षमताओं को मापता है। फाइन-ट्यून्ड सेटिंग में, मूल्यांकन से पहले मॉडलों को प्रत्येक कार्य के प्रशिक्षण डेटा पर प्रशिक्षित किया जाता है, जो विशिष्ट डाउनस्ट्रीम कार्यों के लिए उनकी अनुकूलन क्षमता को मापता है।

ऐतिहासिक संदर्भ और उपयोग

GLUE-ZH ने 2010 के दशक के अंत और 2020 के दशक की शुरुआत में ट्रांसफॉर्मर-आधारित मॉडलों के उदय के दौरान प्रमुखता प्राप्त की। इसका उपयोग कई शोध पत्रों और तकनीकी रिपोर्टों में एक बेंचमार्क के रूप में किया गया था, विशेष रूप से उन पर ध्यान केंद्रित करते हुए जो चीनी पूर्व-प्रशिक्षित मॉडल जैसे BERT-आधारित वेरिएंट (जैसे, BERT-wwm, RoBERTa-wwm) और ERNIE पर केंद्रित थे। इन मॉडलों ने लगातार GLUE-ZH पर उच्च स्कोर प्राप्त किए, 2021 तक सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल 80% से अधिक के समग्र स्कोर तक पहुंच गए।

बेंचमार्क को इसके सीमित दायरे के लिए आलोचना का सामना करना पड़ा है, क्योंकि यह मुख्य रूप से वाक्य-स्तरीय कार्यों पर केंद्रित है और संवाद निर्माण या दस्तावेज़-स्तरीय समझ जैसे अधिक जटिल कार्यों को शामिल नहीं करता है। इसके अतिरिक्त, एक एकल आधिकारिक संस्करण की कमी ने विभिन्न अध्ययनों में रिपोर्ट किए गए परिणामों में असंगतियां पैदा की हैं, जिससे सीधी तुलना कठिन हो गई है।

अन्य बेंचमार्क से संबंध

GLUE-ZH बहुभाषी बेंचमार्क के एक परिवार का हिस्सा है जिसमें SuperGLUE (अंग्रेजी में GLUE का उत्तराधिकारी) और XTREME (एक क्रॉस-भाषाई बेंचमार्क) शामिल हैं। जबकि XTREME में चीनी कई भाषाओं में से एक के रूप में शामिल है, GLUE-ZH विशेष रूप से चीनी के लिए गहन मूल्यांकन प्रदान करता है। यह चीनी SuperGLUE (CLUE) बेंचमार्क से भी संबंधित है, जो 2020 में जारी किया गया था और चीनी एनएलपी के लिए एक अधिक व्यापक और मानकीकृत मूल्यांकन सूट प्रदान करता है। CLUE ने अपने बड़े कार्य सेट और आधिकारिक लीडरबोर्ड के कारण अनुसंधान उपयोग में GLUE-ZH को काफी हद तक प्रतिस्थापित कर दिया है।

वर्तमान स्थिति

2020 के दशक के मध्य तक, GLUE-ZH का उपयोग अत्याधुनिक अनुसंधान में कम बार किया जाता है, इसे CLUE और चीनी संस्करण SuperGLUE जैसे अधिक व्यापक बेंचमार्क द्वारा प्रतिस्थापित किया गया है। हालांकि, यह चीनी एनएलपी मूल्यांकन के विकास को समझने के लिए एक उपयोगी संदर्भ बना हुआ है और अभी भी कुछ शैक्षिक सामग्रियों और ऐतिहासिक विश्लेषणों में उद्धृत किया जाता है। बेंचमार्क का प्रभाव नए मूल्यांकन सूटों के डिजाइन में बना हुआ है, जो अक्सर समान कार्य प्रकारों और स्कोरिंग पद्धतियों को शामिल करते हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·chinese-nlp·evaluation·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास