GLUE (जनरल लैंग्वेज अंडरस्टैंडिंग इवैलुएशन) एक बेंचमार्क सूट है जिसे 2018 में न्यूयॉर्क विश्वविद्यालय, वाशिंगटन विश्वविद्यालय और DeepMind के शोधकर्ताओं द्वारा पेश किया गया था। इसे प्राकृतिक भाषा समझ (NLU) कार्यों के विविध सेट पर मशीन लर्निंग मॉडल का मूल्यांकन और तुलना करने के लिए डिज़ाइन किया गया था, जिसका लक्ष्य सामान्य-उद्देश्य वाले मॉडलों के विकास को प्रोत्साहित करना था जो कार्य-विशिष्ट इंजीनियरिंग के बिना कई कार्यों को संभाल सकें। यह बेंचमार्क जल्दी ही Artificial intelligence और मशीन लर्निंग के क्षेत्र में एक मानक संदर्भ बिंदु बन गया, विशेष रूप से डीप लर्निंग और न्यूरल नेटवर्क अनुसंधान के लिए।
बेंचमार्क में नौ कार्य शामिल हैं जो तीन मुख्य श्रेणियों को कवर करते हैं: एकल-वाक्य कार्य, समानता और पैराफ्रेज़ कार्य, और अनुमान कार्य। एकल-वाक्य कार्यों में CoLA (कॉर्पस ऑफ़ लिंग्विस्टिक एक्सेप्टेबिलिटी) शामिल है, जो व्याकरणिक स्वीकार्यता का परीक्षण करता है, और SST-2 (स्टैनफोर्ड सेंटिमेंट ट्रीबैंक), जो भावना विश्लेषण का परीक्षण करता है। समानता और पैराफ्रेज़ कार्यों में MRPC (माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस), QQP (क्वोरा क्वेश्चन पेयर्स), और STS-B (सिमेंटिक टेक्स्टुअल सिमिलैरिटी बेंचमार्क) शामिल हैं। अनुमान कार्यों में MNLI (मल्टी-जेनर नेचुरल लैंग्वेज इन्फरेंस), QNLI (क्वेश्चन नेचुरल लैंग्वेज इन्फरेंस), RTE (रिकग्नाइज़िंग टेक्स्टुअल एंटेलमेंट), और WNLI (विनोग्राड नेचुरल लैंग्वेज इन्फरेंस) शामिल हैं। प्रत्येक कार्य का अपना मूल्यांकन मीट्रिक होता है, जैसे सटीकता, F1 स्कोर, या पियर्सन सहसंबंध, और समग्र GLUE स्कोर सभी कार्यों में इन मीट्रिक का औसत है।
इतिहास और प्रेरणा
GLUE को 2018 के एक पेपर "GLUE: ए मल्टी-टास्क बेंचमार्क एंड एनालिसिस प्लेटफॉर्म फॉर नेचुरल लैंग्वेज अंडरस्टैंडिंग" में एलेक्स वांग, अमनप्रीत सिंह, जूलियन माइकल, फेलिक्स हिल, ओमर लेवी और सैमुअल आर. बोमन द्वारा पेश किया गया था। लेखकों ने तर्क दिया कि मौजूदा बेंचमार्क अक्सर बहुत संकीर्ण थे और मॉडल को विशिष्ट डेटासेट पर ओवरफिट करने की अनुमति देते थे। GLUE का उद्देश्य ऐसे कार्यों को शामिल करके अधिक व्यापक मूल्यांकन प्रदान करना था जिनके लिए विभिन्न प्रकार के भाषाई ज्ञान की आवश्यकता होती है, जैसे वाक्यविन्यास, अर्थ विज्ञान और सामान्य ज्ञान। बेंचमार्क में एक सार्वजनिक लीडरबोर्ड भी शामिल था, जो शोधकर्ताओं को अपने मॉडल की पारदर्शी रूप से तुलना करने की अनुमति देता था।
GLUE की शुरुआत बड़े भाषा मॉडल में तेजी से प्रगति की अवधि के साथ हुई। इसके जारी होने के तुरंत बाद, Transformer (architecture) आर्किटेक्चर पर आधारित मॉडल, जैसे Google का BERT (बिडायरेक्शनल एनकोडर रिप्रेजेंटेशन्स फ्रॉम ट्रांसफॉर्मर्स), लीडरबोर्ड पर हावी होने लगे। GLUE पर BERT की सफलता ने प्रीट्रेनिंग और फाइन-ट्यूनिंग प्रतिमान को लोकप्रिय बनाने में मदद की, जहां एक मॉडल को पहले पाठ के एक बड़े कॉर्पस पर प्रशिक्षित किया जाता है और फिर विशिष्ट कार्यों के लिए अनुकूलित किया जाता है। यह दृष्टिकोण OpenAI, Anthropic, और Google DeepMind जैसे संगठनों द्वारा विकसित बाद के मॉडलों के लिए आधारभूत बन गया।
कार्य और मूल्यांकन
GLUE के नौ कार्यों को कठिनाई और भाषाई घटनाओं की एक श्रृंखला को कवर करने के लिए चुना गया था। उदाहरण के लिए, CoLA के लिए मॉडल को यह निर्णय करने की आवश्यकता होती है कि कोई वाक्य व्याकरणिक रूप से स्वीकार्य है या नहीं, जो वाक्यविन्यास ज्ञान का परीक्षण करता है। SST-2 में फिल्म समीक्षाओं से बाइनरी भावना वर्गीकरण शामिल है। MRPC और QQP पैराफ्रेज़ डिटेक्शन कार्य हैं, जहां मॉडल को यह निर्धारित करना होता है कि दो वाक्यों का एक ही अर्थ है या नहीं। STS-B एक प्रतिगमन कार्य है जो 0 से 5 के पैमाने पर अर्थ संबंधी समानता को स्कोर करता है।
अनुमान कार्यों के लिए, MNLI सबसे बड़ा है, जिसमें कई शैलियों में 400,000 से अधिक वाक्य जोड़े हैं, जिसके लिए मॉडल को प्रवेश, विरोधाभास या तटस्थता को वर्गीकृत करने की आवश्यकता होती है। QNLI एक प्रश्न-उत्तर कार्य है जिसे प्रवेश के रूप में सुधारा गया है, जहां मॉडल को यह निर्धारित करना होता है कि किसी वाक्य में किसी प्रश्न का उत्तर है या नहीं। RTE समाचार और विकिपीडिया से प्राप्त एक छोटा प्रवेश कार्य है। WNLI विनोग्राड स्कीमा चैलेंज पर आधारित एक सर्वनाम समाधान कार्य है, लेकिन बाद में डेटा लीकेज मुद्दे के कारण इसे त्रुटिपूर्ण पाया गया, और कई मॉडलों ने इस पर केवल यादृच्छिक प्रदर्शन हासिल किया।
मूल्यांकन मीट्रिक अलग-अलग होते हैं: CoLA मैथ्यूज सहसंबंध का उपयोग करता है, SST-2 और QNLI सटीकता का उपयोग करते हैं, MRPC और QQP F1 स्कोर का उपयोग करते हैं, STS-B पियर्सन और स्पीयरमैन सहसंबंधों का उपयोग करता है, और MNLI, RTE, और WNLI सटीकता का उपयोग करते हैं। अंतिम GLUE स्कोर इन मीट्रिक का औसत है, जिसमें प्रत्येक कार्य को समान रूप से भारित किया जाता है।
प्रभाव और सीमाएं
GLUE का मॉडल की तुलना के लिए एक सामान्य बेंचमार्क प्रदान करके क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। इसने Natural language processing अनुसंधान में सुधार लाने में मदद की, और इसका लीडरबोर्ड शैक्षणिक और औद्योगिक प्रयोगशालाओं दोनों के लिए एक प्रतिस्पर्धी क्षेत्र बन गया। बेंचमार्क ने मल्टी-टास्क लर्निंग दृष्टिकोण के विकास को भी सुविधाजनक बनाया और NLP में ट्रांसफर लर्निंग के उदय में योगदान दिया।
हालांकि, GLUE को आलोचना का भी सामना करना पड़ा। कुछ शोधकर्ताओं ने नोट किया कि बेंचमार्क को उन मॉडलों द्वारा खेला जा सकता है जो वास्तव में भाषा को समझने के बजाय प्रशिक्षण डेटा में पैटर्न को याद करते हैं। WNLI कार्य विशेष रूप से समस्याग्रस्त था, क्योंकि बाद में पता चला कि परीक्षण सेट में ऐसे उदाहरण शामिल थे जो प्रशिक्षण डेटा के साथ ठीक से संरेखित नहीं थे, जिससे मॉडल के लिए अच्छा प्रदर्शन करना लगभग असंभव हो गया। इसके जवाब में, GLUE टीम ने 2019 में SuperGLUE नामक एक संशोधित संस्करण जारी किया, जिसमें कठिन कार्य शामिल थे और इनमें से कुछ मुद्दों को संबोधित किया गया।
विरासत और उत्तराधिकारी
अपनी सीमाओं के बावजूद, GLUE एक व्यापक रूप से उद्धृत बेंचमार्क बना हुआ है और अक्सर नए मॉडल का मूल्यांकन करने के लिए आधार रेखा के रूप में उपयोग किया जाता है। इसका उत्तराधिकारी, SuperGLUE, ऐसे कार्यों को पेश करता है जिनके लिए अधिक जटिल तर्क की आवश्यकता होती है, जैसे बहु-वाक्य अनुमान और पठन समझ। दोनों बेंचमार्क जनरेटिव AI प्रणालियों के मूल्यांकन को आकार देने में प्रभावशाली रहे हैं, हालांकि MMLU और HELM जैसे नए बेंचमार्क व्यापक क्षमताओं को संबोधित करने के लिए उभरे हैं।
GLUE के डिज़ाइन ने अन्य डोमेन में समान बेंचमार्क को भी प्रेरित किया, जैसे क्रॉस-लिंगुअल समझ के लिए XGLUE और चीनी के लिए CLUE। बेंचमार्क का मल्टी-टास्क मूल्यांकन पर जोर क्षेत्र में एक मानक अभ्यास बन गया है, और इसका सार्वजनिक लीडरबोर्ड मॉडल कई बाद के प्रयासों द्वारा अपनाया गया है।
यह भी देखें
संदर्भ
- Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., & Bowman, S. R. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv preprint arXiv:1804.07461.
- Wang, A., Pruksachatkun, Y., Nangia, N., Singh, A., Michael, J., Hill, F., ... & Bowman, S. R. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv preprint arXiv:1905.00537.