SuperGLUE एक बेंचमार्क सूट है जिसे 2019 में Google, DeepMind और न्यूयॉर्क विश्वविद्यालय के शोधकर्ताओं द्वारा प्राकृतिक भाषा समझ (NLU) प्रणालियों की क्षमताओं का मूल्यांकन करने के लिए पेश किया गया था। इसे पहले के GLUE (सामान्य भाषा समझ मूल्यांकन) बेंचमार्क के अधिक चुनौतीपूर्ण उत्तराधिकारी के रूप में डिज़ाइन किया गया था, जो उच्च-प्रदर्शन वाले मॉडलों द्वारा संतृप्त हो गया था। SuperGLUE में आठ विविध कार्य शामिल हैं जो एक प्रणाली की सहसंदर्भ समाधान, प्रश्न उत्तर, पाठ्य आशय और कई वाक्यों पर तर्क करने की क्षमता का परीक्षण करते हैं, जिसमें उन कार्यों पर ध्यान केंद्रित किया गया है जिनके लिए गहरी भाषाई समझ और सामान्य ज्ञान की आवश्यकता होती है।
यह बेंचमार्क Machine learning और Deep learning मॉडलों में तेजी से प्रगति के जवाब में बनाया गया था, विशेष रूप से Transformer (architecture) वास्तुकला पर आधारित, जिन्होंने GLUE पर लगभग मानव-स्तरीय प्रदर्शन हासिल किया था। SuperGLUE उन कार्यों को शामिल करके मानक बढ़ाता है जो मशीनों के लिए अधिक कठिन हैं, जैसे कि बहु-वाक्य आधारों के साथ पाठ्य आशय को पहचानना और बहु-चरणीय तर्क की आवश्यकता वाले प्रश्नों का उत्तर देना। यह सूट एक एकल स्कोर प्रदान करता है जो सभी कार्यों में प्रदर्शन को एकत्रित करता है, जिससे विभिन्न मॉडलों और दृष्टिकोणों की सीधी तुलना संभव होती है।
कार्य संरचना
SuperGLUE में आठ कार्य शामिल हैं, जिनमें से प्रत्येक भाषा समझ के एक अलग पहलू को लक्षित करता है। ये कार्य हैं: BoolQ (हाँ/नहीं उत्तर वाले बूलियन प्रश्न), CB (प्रतिबद्धता बैंक, एक पाठ्य आशय कार्य), COPA (संभावित विकल्पों का चयन, एक कारण तर्क कार्य), MultiRC (बहु-वाक्य पठन समझ), ReCoRD (सामान्य ज्ञान तर्क के साथ पठन समझ), RTE (पाठ्य आशय को पहचानना), WiC (संदर्भ में शब्द, एक शाब्दिक अस्पष्टता समाधान कार्य), और WSC (विनोग्राद स्कीमा चुनौती, एक सर्वनाम समाधान कार्य)। प्रत्येक कार्य उन मॉडलों के लिए चुनौतीपूर्ण होने के लिए डिज़ाइन किया गया है जो सतही-स्तर के पैटर्न पर निर्भर करते हैं, इसके बजाय वाक्यविन्यास, अर्थ विज्ञान और विश्व ज्ञान की समझ की आवश्यकता होती है।
GLUE के विपरीत, जिसमें भावना विश्लेषण जैसे एकल-वाक्य कार्य शामिल थे, SuperGLUE उन कार्यों पर जोर देता है जिनमें कई वाक्य और जटिल तर्क शामिल होते हैं। उदाहरण के लिए, WSC कार्य के लिए एक मॉडल को सूक्ष्म संदर्भ संकेतों के आधार पर सर्वनामों को हल करने की आवश्यकता होती है, जबकि COPA यह पूछकर कारण तर्क का परीक्षण करता है कि किसी आधार को देखते हुए दो विकल्पों में से कौन सा अधिक प्रशंसनीय है। ये कार्य मौजूदा डेटासेट से लिए गए हैं, लेकिन SuperGLUE मानकीकृत प्रशिक्षण, सत्यापन और परीक्षण विभाजन के साथ एक एकीकृत मूल्यांकन ढांचा प्रदान करता है।
स्कोरिंग और मूल्यांकन
SuperGLUE एक एकल समग्र स्कोर का उपयोग करता है, जिसकी गणना प्रत्येक कार्य के मीट्रिक के औसत के रूप में की जाती है। अधिकांश कार्यों के लिए, मीट्रिक सटीकता है, लेकिन MultiRC और ReCoRD के लिए, यह बहु-उत्तर सेटिंग्स में आंशिक क्रेडिट के लिए F1 स्कोर का उपयोग करता है। बेंचमार्क में एक मानव प्रदर्शन आधार रेखा भी शामिल है, जो मानव एनोटेटरों द्वारा मॉडलों के समान परिस्थितियों में कार्यों को पूरा करने के द्वारा स्थापित की गई थी। यह आधार रेखा प्रगति को मापने के लिए एक संदर्भ बिंदु के रूप में कार्य करती है।
ओवरफिटिंग को रोकने के लिए, परीक्षण सेट को अलग रखा जाता है, और सबमिशन का मूल्यांकन SuperGLUE वेबसाइट पर होस्ट किए गए लीडरबोर्ड के माध्यम से किया जाता है। मॉडलों को अतिरिक्त प्रशिक्षण डेटा का उपयोग करने की अनुमति है, लेकिन बेंचमार्क बाहरी डेटा के साथ और बिना परिणामों की रिपोर्ट करके निष्पक्ष तुलना को प्रोत्साहित करता है। मूल्यांकन प्रोटोकॉल में एक नैदानिक सेट भी शामिल है, जो निषेध, परिमाणीकरण और सहसंदर्भ जैसी भाषाई घटनाओं में मॉडल क्षमताओं का सूक्ष्म-स्तरीय विश्लेषण प्रदान करता है।
AI अनुसंधान पर प्रभाव
SuperGLUE का Artificial intelligence के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा है, जिससे अधिक मजबूत भाषा मॉडलों के विकास को बढ़ावा मिला है। इसके जारी होने के तुरंत बाद, BERT और इसके उत्तराधिकारियों जैसे मॉडलों को SuperGLUE के खिलाफ बेंचमार्क किया गया, जिससे प्रदर्शन अंतराल का पता चला जिसने वास्तुकला सुधारों को प्रेरित किया। उदाहरण के लिए, Large language model जैसे GPT-2 और बाद में GPT-3 की शुरुआत ने प्रदर्शित किया कि मॉडल आकार और प्रशिक्षण डेटा को बढ़ाने से SuperGLUE कार्यों पर पर्याप्त लाभ हो सकते हैं, हालांकि शुरुआत में सबसे बड़े मॉडल भी कई कार्यों पर मानव प्रदर्शन से कम रहे।
बेंचमार्क ने नए प्रशिक्षण उद्देश्यों और मॉडल वास्तुकलाओं के डिजाइन को भी प्रभावित किया। Google DeepMind और OpenAI जैसे संस्थानों के शोधकर्ताओं ने बहु-कार्य सीखने, प्रतिकूल प्रशिक्षण और बाहरी ज्ञान के समावेश जैसे नवाचारों का मूल्यांकन करने के लिए SuperGLUE का उपयोग किया। 2021 तक, T5 और DeBERTa सहित कई मॉडलों ने मानव आधार रेखा से अधिक स्कोर हासिल किए, जो दर्शाता है कि बेंचमार्क संतृप्त हो गया था। इससे और भी कठिन बेंचमार्कों का विकास हुआ, जैसे कि SuperGLUE का उत्तराधिकारी, जो अधिक जटिल तर्क और उत्पादन कार्यों पर केंद्रित है।
सीमाएँ और आलोचनाएँ
अपनी सफलता के बावजूद, SuperGLUE को आलोचनाओं का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क के कार्य, चुनौतीपूर्ण होते हुए भी, वास्तविक दुनिया की भाषा समझ को पूरी तरह से कैप्चर नहीं करते हैं, क्योंकि वे मुख्य रूप से बहुविकल्पीय या वर्गीकरण समस्याएँ हैं। प्राथमिक मीट्रिक के रूप में सटीकता पर निर्भरता मॉडल व्यवहार में अंतर को भी अस्पष्ट कर सकती है, जैसे कि कैलिब्रेशन या प्रतिकूल इनपुट के प्रति मजबूती। इसके अतिरिक्त, बेंचमार्क का केवल अंग्रेजी-केंद्रित फोकस बहुभाषी सेटिंग्स में इसकी प्रयोज्यता को सीमित करता है, एक अंतर जिसे बाद के बेंचमार्क जैसे XGLUE ने संबोधित करने का लक्ष्य रखा।
एक और चिंता डेटासेट कलाकृतियों या पूर्वाग्रहों का शोषण करने की मॉडलों की क्षमता है, जिससे फुलाए गए स्कोर होते हैं जो वास्तविक समझ को प्रतिबिंबित नहीं करते हैं। उदाहरण के लिए, SuperGLUE में कुछ कार्यों में स्पूरियस सहसंबंध पाए गए जिनका मॉडल इच्छित तर्क किए बिना लाभ उठा सकते थे। इसने अधिक कठोर मूल्यांकन प्रोटोकॉल और विशिष्ट क्षमताओं की जांच करने वाले नैदानिक डेटासेट के विकास के लिए आह्वान किया है।
विरासत और उत्तराधिकारी
SuperGLUE natural language processing समुदाय में व्यापक रूप से उद्धृत बेंचमार्क बना हुआ है, जो NLU प्रणालियों के मूल्यांकन के लिए एक मानक संदर्भ के रूप में कार्य करता है। इसके डिजाइन सिद्धांत, जैसे कि विविध कार्यों का उपयोग और एक अलग रखा गया परीक्षण सेट, ने बाद के बेंचमार्कों को प्रभावित किया है, जैसे कि GLUE का उत्तराधिकारी, SuperGLUE का अपना उत्तराधिकारी, और बहु-कार्य मूल्यांकन सूट की ओर व्यापक प्रवृत्ति। बेंचमार्क ने मॉडल स्केलिंग की व्यापक समझ में भी योगदान दिया, जैसा कि मॉडल आकार और SuperGLUE कार्यों पर प्रदर्शन के बीच सहसंबंध से प्रमाणित होता है।
2023 तक, SuperGLUE को एक परिपक्व बेंचमार्क माना जाता है, जिसमें कई अत्याधुनिक मॉडल मानव प्रदर्शन से अधिक हैं। इसकी विरासत Neural network अनुसंधान को आगे बढ़ाने के लिए चुनौतीपूर्ण मूल्यांकन सूट के महत्व को प्रदर्शित करने और मॉडल क्षमताओं के साथ विकसित होने वाले बेंचमार्क की आवश्यकता को उजागर करने में निहित है। भविष्य के बेंचमार्क में अधिक उत्पादक कार्य, बहुभाषी डेटा और इंटरैक्टिव सेटिंग्स शामिल होने की संभावना है, जो SuperGLUE द्वारा रखी गई नींव पर निर्माण करेंगे।