GLUE बेंचमार्क (जनरल लैंग्वेज अंडरस्टैंडिंग इवैल्यूएशन) नौ प्राकृतिक भाषा समझ कार्यों का एक संग्रह है, जिसे 2018 में मशीन लर्निंग मॉडल के प्रदर्शन का मूल्यांकन और तुलना करने के लिए पेश किया गया था। इसे भाषाई घटनाओं की एक श्रृंखला में एक मॉडल की भाषा समझने की क्षमता का आकलन करने के लिए एक एकल, मानकीकृत मीट्रिक प्रदान करने के लिए डिज़ाइन किया गया था, जिसमें एकल-वाक्य कार्य, समानता और व्याख्या कार्य, और अनुमान कार्य शामिल हैं। यह बेंचमार्क जल्दी ही Artificial intelligence के क्षेत्र में एक मानक संदर्भ बिंदु बन गया, जिसने Neural network आर्किटेक्चर और Large language model के विकास में तेजी से प्रगति को बढ़ावा दिया।
यह बेंचमार्क शैक्षणिक और उद्योग शोधकर्ताओं के एक संघ द्वारा बनाया गया था, जिसमें न्यू-यॉर्क-यूनिवर्सिटी, वाशिंगटन विश्वविद्यालय और DeepMind सहित संस्थानों का योगदान था। इसका प्राथमिक लक्ष्य प्राकृतिक भाषा प्रसंस्करण में मूल्यांकन विधियों के विखंडन को संबोधित करना था, जहां मॉडल का परीक्षण अक्सर असंगत मीट्रिक वाले व्यक्तिगत डेटासेट पर किया जाता था। नौ अलग-अलग कार्यों को एक ही लीडरबोर्ड में एकत्रित करके, GLUE ने मॉडल क्षमताओं की सीधी तुलना को सक्षम किया और उन क्षेत्रों को उजागर किया जहां मौजूदा दृष्टिकोण मानव प्रदर्शन से कम थे।
कार्य और संरचना
GLUE में नौ कार्य शामिल हैं जो तीन व्यापक श्रेणियों में फैले हुए हैं। एकल-वाक्य कार्यों में लिंग्विस्टिक एक्सेप्टेबिलिटी का कॉर्पस (CoLA) शामिल है, जो व्याकरणिक स्वीकार्यता का परीक्षण करता है, और स्टैनफोर्ड सेंटिमेंट ट्रीबैंक (SST-2), जो बाइनरी भावना वर्गीकरण को मापता है। समानता और व्याख्या कार्यों में माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस (MRPC), क्वोरा क्वेश्चन पेयर्स (QQP) डेटासेट, और सिमेंटिक टेक्स्टुअल सिमिलैरिटी बेंचमार्क (STS-B) शामिल हैं, ये सभी एक मॉडल की यह निर्धारित करने की क्षमता का आकलन करते हैं कि क्या दो वाक्य एक ही अर्थ व्यक्त करते हैं। अनुमान कार्यों में मल्टी-जॉनर नेचुरल लैंग्वेज इन्फ्रेंस कॉर्पस (MNLI), क्वेश्चन-आंसरिंग NLI (QNLI), रिकग्नाइज़िंग टेक्स्टुअल एन्टेलमेंट (RTE) डेटासेट, और विनोग्राड NLI (WNLI) कार्य शामिल हैं, जो कोरफेरेंस रेज़ोल्यूशन और सामान्य ज्ञान तर्क का परीक्षण करता है।
प्रत्येक कार्य का अपना मूल्यांकन मीट्रिक होता है, जैसे सटीकता, F1 स्कोर, या पियर्सन सहसंबंध, और समग्र GLUE स्कोर सभी कार्यों में इन मीट्रिक का औसत है। बेंचमार्क में एक डायग्नोस्टिक डेटासेट भी शामिल है जिसे मुख्य कार्यों से स्वतंत्र, शाब्दिक शब्दार्थ, तर्क, और विधेय-तर्क संरचना जैसी विशिष्ट भाषाई क्षमताओं की जांच करने के लिए डिज़ाइन किया गया है। यह डायग्नोस्टिक घटक कुल स्कोर से परे मॉडल की ताकत और कमजोरियों में सूक्ष्म अंतर्दृष्टि प्रदान करने के लिए था।
मॉडल विकास पर प्रभाव
GLUE की शुरुआत Deep learning और Transformer (architecture) आर्किटेक्चर में तेजी से नवाचार की अवधि के साथ हुई। लीडरबोर्ड पर शुरुआती सबमिशन, जो आवर्तक और कन्वोल्यूशनल नेटवर्क पर आधारित थे, ने 60-70% की सीमा में स्कोर हासिल किए, जो अनुमानित मानव आधार रेखा 87.1 से काफी नीचे थे। 2018 के अंत में Transformer (architecture)-आधारित BERT मॉडल की रिलीज़ ने एक महत्वपूर्ण मोड़ चिह्नित किया, क्योंकि यह बेंचमार्क पर 80% से अधिक हो गया और बड़े टेक्स्ट कॉर्पोरा पर प्री-ट्रेनिंग के बाद विशिष्ट कार्यों पर फाइन-ट्यूनिंग की प्रभावशीलता का प्रदर्शन किया। यह दृष्टिकोण, जिसे ट्रांसफर लर्निंग के रूप में जाना जाता है, प्राकृतिक भाषा प्रसंस्करण में प्रमुख प्रतिमान बन गया।
बाद के मॉडल, जिनमें RoBERTa, XLNet, और ALBERT शामिल हैं, ने प्रशिक्षण उद्देश्यों, मॉडल आकार और डेटा दक्षता में नवाचारों के माध्यम से GLUE स्कोर को और अधिक बढ़ाया। 2020 तक, कई मॉडलों ने कुल स्कोर पर मानव आधार रेखा को पार कर लिया था, हालांकि व्यक्तिगत कार्यों, विशेष रूप से WNLI पर प्रदर्शन चुनौतीपूर्ण बना रहा। बेंचमार्क की लोकप्रियता ने 2019 में SuperGLUE बेंचमार्क के विकास को भी प्रेरित किया, जिसने मूल GLUE लीडरबोर्ड की संतृप्ति को संबोधित करने के लिए अधिक कठिन कार्य पेश किए।
आलोचनाएं और सीमाएं
व्यापक रूप से अपनाए जाने के बावजूद, GLUE को शोधकर्ताओं से आलोचना का सामना करना पड़ा है। एक प्रमुख चिंता यह है कि बेंचमार्क के कार्य अपेक्षाकृत संकीर्ण हैं और वास्तविक दुनिया की भाषा समझ की पूरी जटिलता को नहीं पकड़ते हैं, जैसे कि लंबी-रूप तर्क, संवाद, या मल्टीमॉडल समझ। विशेष रूप से WNLI कार्य डेटा लीकेज मुद्दे के कारण त्रुटिपूर्ण पाया गया, जिससे कई टीमों ने इसे लगभग असंभव चुनौती के रूप में माना और अपने प्रयासों को अन्य आठ कार्यों पर केंद्रित किया। इसके अतिरिक्त, कुल स्कोर कार्यों में प्रदर्शन असमानताओं को अस्पष्ट कर सकता है, और GLUE पर उत्कृष्ट प्रदर्शन करने वाले मॉडल अभी भी वितरण से बाहर के इनपुट या विरोधी उदाहरणों के साथ संघर्ष कर सकते हैं।
एक और सीमा सार्वजनिक लीडरबोर्ड के लिए ओवरफिटिंग की संभावना है, जहां मॉडल को विशिष्ट परीक्षण सेटों पर स्कोर को अधिकतम करने के लिए ट्यून किया जाता है। इसे कम करने के लिए, GLUE आयोजकों ने एक निजी परीक्षण सेट पेश किया जिसके लिए लीडरबोर्ड के माध्यम से सबमिशन की आवश्यकता होती है, लेकिन यह बेंचमार्क-विशिष्ट अनुकूलन के जोखिम को पूरी तरह से समाप्त नहीं करता है। इन चिंताओं ने अधिक व्यापक और गतिशील मूल्यांकन ढांचे के विकास को प्रेरित किया है, जैसे कि SuperGLUE और बाद में MMLU और HELM जैसे बेंचमार्क, जिनका उद्देश्य व्यापक क्षमताओं और मजबूती का आकलन करना है।
विरासत और निरंतर प्रासंगिकता
GLUE ने शोधकर्ताओं के लिए एक स्पष्ट, मात्रात्मक लक्ष्य प्रदान करके Machine learning और Generative AI की उन्नति में महत्वपूर्ण भूमिका निभाई। इसने प्री-ट्रेनिंग और फाइन-ट्यूनिंग प्रतिमान को लोकप्रिय बनाने में मदद की जो आधुनिक Large language model को रेखांकित करता है, जिसमें OpenAI और Google DeepMind जैसे संगठनों द्वारा विकसित मॉडल शामिल हैं। बेंचमार्क ने वाणिज्यिक AI उत्पादों के लिए मूल्यांकन सुइट्स के डिजाइन को भी प्रभावित किया, क्योंकि कंपनियों ने मानकीकृत मीट्रिक का उपयोग करके अपने मॉडल की भाषा समझ क्षमताओं का प्रदर्शन करने की मांग की।
हालांकि मूल GLUE लीडरबोर्ड अब अत्याधुनिक मॉडलों के लिए प्राथमिक बेंचमार्क नहीं है, इसकी पद्धति और कार्य अभी भी शैक्षणिक अनुसंधान और मॉडल विकास में व्यापक रूप से उपयोग किए जाते हैं। डेटासेट प्रशिक्षण और मूल्यांकन संसाधनों के रूप में काम करना जारी रखते हैं, और बेंचमार्क का बहु-कार्य मूल्यांकन पर जोर बाद की पहलों द्वारा विभिन्न रूपों में अपनाया गया है। 2025 तक, GLUE को अभी भी कई पेपरों और तकनीकी रिपोर्टों में नए आर्किटेक्चर और प्रशिक्षण तकनीकों की तुलना के लिए आधार रेखा के रूप में संदर्भित किया जाता है, जो प्राकृतिक भाषा प्रसंस्करण के क्षेत्र पर इसके स्थायी प्रभाव को रेखांकित करता है।