अंग्रेज़ी से अनुवादित

SuperGLUE 2019 में आठ चुनौतीपूर्ण प्राकृतिक भाषा समझ कार्यों का एक बेंचमार्क सूट है, जिसे GLUE बेंचमार्क को बदलने और सामान्य-उद्देश्य भाषा समझ प्रणालियों में प्रगति को बेहतर ढंग से मापने के लिए डिज़ाइन किया गया था। इसे न्यूयॉर्क विश्वविद्यालय, DeepMind और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था।

SuperGLUE एक बेंचमार्क सूट है जो प्राकृतिक भाषा समझ (NLU) मॉडल के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किया जाता है। 2019 में जारी, इसे पहले के GLUE (सामान्य भाषा समझ मूल्यांकन) बेंचमार्क को सफल बनाने के लिए डिज़ाइन किया गया था, जो संतृप्त हो गया था क्योंकि मॉडल अपने कार्यों पर मानव-स्तरीय प्रदर्शन के करीब या उससे अधिक पहुंच गए थे। SuperGLUE आठ कार्यों का एक अधिक कठिन सेट प्रस्तुत करता है जिनके लिए तर्क, सामान्य ज्ञान, और बहु-वाक्य समझ की आवश्यकता होती है, जिसका उद्देश्य मॉडल की सामान्य भाषा क्षमताओं का अधिक मजबूत माप प्रदान करना है।

बेंचमार्क को "SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems" शीर्षक वाले एक पेपर में पेश किया गया था, जिसे एलेक्स वांग, यादा प्रुक्साचत्कुन, निकिता नांगिया, अमनप्रीत सिंह, जूलियन माइकल, फेलिक्स हिल, ओमर लेवी, और सैमुअल आर. बोमन द्वारा लिखा गया था। यह कार्य न्यूयॉर्क विश्वविद्यालय, डीपमाइंड, और वाशिंगटन विश्वविद्यालय के बीच एक सहयोग था। यह नाम चिपकने वाले ब्रांड सुपर ग्लू पर एक नाटक है, जो मॉडलों के लिए हल करने में कठिन "चिपचिपा" बेंचमार्क होने के अपने उद्देश्य को दर्शाता है।

कार्य और मूल्यांकन

SuperGLUE में आठ कार्य शामिल हैं, जिनमें से प्रत्येक भाषा समझ के एक अलग पहलू को लक्षित करता है:

  • BoolQ (बूलियन प्रश्न): एक छोटे अनुच्छेद को देखते हुए हाँ/नहीं प्रश्नों का उत्तर देना।
  • CB (कमिटमेंटबैंक): यह निर्धारित करना कि कोई आधार एक परिकल्पना को शामिल करता है, उसका खंडन करता है, या उसके प्रति तटस्थ है।
  • COPA (संभावित विकल्पों का चयन): एक आधार को देखते हुए दो विकल्पों में से अधिक संभावित कारण या प्रभाव का चयन करना।
  • MultiRC (बहु-वाक्य पठन समझ): एक अनुच्छेद के बारे में कई प्रश्नों का उत्तर देना, जिसमें प्रत्येक प्रश्न के कई संभावित उत्तर होते हैं।
  • ReCoRD (सामान्य ज्ञान तर्क के साथ पठन समझ): सामान्य ज्ञान तर्क का उपयोग करके एक समाचार लेख में एक छिपी हुई इकाई को भरना।
  • RTE (पाठ्य निहितार्थ की पहचान): कई पहले के डेटासेट को मिलाकर एक द्विआधारी निहितार्थ कार्य।
  • WiC (शब्द-इन-संदर्भ): यह निर्धारित करना कि क्या एक शब्द दो अलग-अलग वाक्यों में समान अर्थ के साथ प्रयोग किया गया है।
  • WSC (विनोग्राड स्कीमा चैलेंज): सरल सांख्यिकीय मॉडल के लिए अस्पष्ट होने के लिए डिज़ाइन किए गए वाक्यों में सर्वनाम संदर्भों को हल करना।

प्रत्येक कार्य का एक विशिष्ट मीट्रिक है: BoolQ, CB, COPA, RTE, और WSC के लिए सटीकता; MultiRC और ReCOORD के लिए F1 स्कोर; और WiC के लिए सटीकता। समग्र SuperGLUE स्कोर व्यक्तिगत कार्य स्कोर का औसत है, जिसमें प्रत्येक कार्य को समान रूप से भारित किया जाता है।

प्रेरणा और डिज़ाइन

GLUE बेंचमार्क, 2018 में जारी, सामान्य-उद्देश्य भाषा मॉडल के मूल्यांकन के लिए एक मानक बन गया था। हालांकि, 2019 की शुरुआत तक, BERT और इसके वेरिएंट जैसे मॉडल GLUE पर अनुमानित मानव आधार रेखा के करीब या उससे अधिक स्कोर प्राप्त कर रहे थे, जिससे मॉडलों के बीच अंतर करना मुश्किल हो गया। SuperGLUE को इस संतृप्ति को संबोधित करने के लिए बनाया गया था, जिसमें अधिक चुनौतीपूर्ण कार्य शामिल हैं जिनके लिए गहन तर्क की आवश्यकता होती है, जैसे कि विनोग्राड स्कीमा चैलेंज और COPA, जिसमें सामान्य ज्ञान और कारणात्मक तर्क शामिल हैं।

कार्यों को मौजूदा डेटासेट से चुना गया था जो उस समय समकालीन मॉडल के लिए बहुत कठिन माने जाते थे। लेखकों ने एक नया डेटासेट, ReCoRD भी पेश किया, जो विशेष रूप से बेंचमार्क के लिए बनाया गया था। मूल्यांकन ढांचे में एक सार्वजनिक लीडरबोर्ड शामिल है, जो शोधकर्ताओं को मानक मीट्रिक के सेट और मानव प्रदर्शन आधार रेखा के खिलाफ अपने मॉडल की तुलना करने की अनुमति देता है।

प्रभाव और स्वीकृति

SuperGLUE जल्दी से Natural language processing समुदाय में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया। इसे प्रमुख शोध समूहों और कंपनियों, जिनमें OpenAI, Google DeepMind, और Microsoft (AI) शामिल हैं, द्वारा नए आर्किटेक्चर और प्रशिक्षण विधियों के लिए एक मानक परीक्षण मंच के रूप में अपनाया गया। बेंचमार्क ने Transformer (architecture)-आधारित मॉडल के विकास में महत्वपूर्ण भूमिका निभाई, विशेष रूप से Large language model के युग में।

2019 में, इसके जारी होने के तुरंत बाद, BERT-large और XLNet जैसे मॉडल ने उच्च 70 के दशक में स्कोर प्राप्त किए, जबकि मानव आधार रेखा 89.8 अनुमानित थी। 2021 तक, T5 और DeBERTa जैसे मॉडल ने मानव आधार रेखा को पार कर लिया, जिसमें DeBERTa ने जनवरी 2021 में 90.8 का स्कोर हासिल किया। इस तीव्र प्रगति ने बेंचमार्क को कई लोगों द्वारा "हल" माना जाने लगा, जिससे और भी कठिन बेंचमार्क बनाने की प्रेरणा मिली, जैसे कि SuperGLUE के उत्तराधिकारी, BIG-bench, और बाद में HELM बेंचमार्क।

अपनी सफलता के बावजूद, SuperGLUE को आलोचना का भी सामना करना पड़ा। कुछ शोधकर्ताओं ने तर्क दिया कि कार्य, हालांकि चुनौतीपूर्ण हैं, फिर भी वास्तविक दुनिया की भाषा समझ की जटिलता को पूरी तरह से पकड़ नहीं पाते हैं, और बेंचमार्क पर उच्च स्कोर आवश्यक रूप से व्यावहारिक अनुप्रयोगों में मजबूत प्रदर्शन में अनुवाद नहीं करते हैं। अन्य ने नोट किया कि बेंचमार्क का अंग्रेजी-केवल कार्यों पर ध्यान बहुभाषी सेटिंग्स में इसकी प्रयोज्यता को सीमित करता है।

विरासत और उत्तराधिकारी

SuperGLUE की विरासत दोहरी है। पहला, इसने Artificial intelligence में अनुसंधान को चलाने के लिए प्रगतिशील रूप से कठिन बेंचमार्क बनाने के मूल्य का प्रदर्शन किया। दूसरा, इसने Machine learning में प्रगति की तीव्र गति को उजागर किया, क्योंकि मॉडल सिर्फ दो वर्षों में मानव-से-नीचे से मानव-से-ऊपर प्रदर्शन तक पहुंच गए। बेंचमार्क के डिज़ाइन सिद्धांत - विविध कार्यों, स्पष्ट मीट्रिक, और सार्वजनिक लीडरबोर्ड का उपयोग - बाद के बेंचमार्क जैसे GLUE के उत्तराधिकारी, SuperGLUE के अपने उत्तराधिकारी, और व्यापक मूल्यांकन पारिस्थितिकी तंत्र द्वारा अपनाए गए हैं।

मूल GLUE बेंचमार्क 2021 में सेवानिवृत्त हो गया था, और SuperGLUE का लीडरबोर्ड 2022 में स्थिर कर दिया गया था, क्योंकि मॉडल में सुधार जारी रहा। हालांकि, कार्य और डेटासेट अनुसंधान और विकास के लिए उपयोग में बने हुए हैं, और बेंचमार्क अभी भी शैक्षणिक पेपर और उद्योग रिपोर्ट में भाषा मॉडल के मूल्यांकन में एक ऐतिहासिक मील के पत्थर के रूप में संदर्भित किया जाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·benchmark·evaluation·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास