अंग्रेज़ी से अनुवादित

CommonsenseQA एक बहुविकल्पीय प्रश्न-उत्तर डेटासेट है, जिसे 2019 में पेश किया गया था ताकि AI प्रणालियों की रोज़मर्रा के सामान्य ज्ञान के साथ तर्क करने की क्षमता का मूल्यांकन किया जा सके। इसमें 12,247 प्रश्न शामिल हैं, जो [[conceptnet|ConceptNet]] से प्राप्त किए गए हैं।

CommonsenseQA कृत्रिम बुद्धिमत्ता प्रणालियों की सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क डेटासेट है। इसे 2019 में वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा जारी किया गया था। इसमें 12,247 बहुविकल्पीय प्रश्न शामिल हैं, जिनमें से प्रत्येक का एक सही उत्तर और चार गलत विकल्प हैं। डेटासेट को मौजूदा प्राकृतिक भाषा प्रसंस्करण बेंचमार्क में एक अंतर को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर तथ्यात्मक स्मरण या वाक्यविन्यास समझ पर केंद्रित थे, लेकिन किसी मॉडल की दुनिया के बारे में रोजमर्रा के ज्ञान को लागू करने की क्षमता का पर्याप्त परीक्षण नहीं करते थे।

CommonsenseQA के प्रश्न ConceptNet ज्ञान ग्राफ से उत्पन्न होते हैं, जो एक बड़ा शब्दार्थ नेटवर्क है जो रोजमर्रा की अवधारणाओं के बीच संबंधों को एन्कोड करता है। प्रत्येक प्रश्न ConceptNet के एक ट्रिपल पर आधारित है, जैसे 'एक कुत्ता एक जानवर है' या 'बारिश होने पर आप छाता उपयोग करते हैं'। डेटासेट निर्माताओं ने इन ट्रिपल को प्राकृतिक भाषा के प्रश्नों में बदलने और प्रशंसनीय लेकिन गलत उत्तर विकल्प उत्पन्न करने के लिए क्राउडसोर्स किए गए श्रमिकों का उपयोग किया। यह प्रक्रिया सुनिश्चित करती है कि प्रश्नों के लिए सरल पैटर्न मिलान या स्मरण के बजाय वास्तविक सामान्य ज्ञान तर्क की आवश्यकता होती है।

निर्माण और डिज़ाइन

CommonsenseQA के निर्माण में एक बहु-चरणीय पाइपलाइन शामिल थी। पहले, शोधकर्ताओं ने ConceptNet ट्रिपल का एक सेट चुना जिसमें सामान्य, रोजमर्रा की अवधारणाएं शामिल थीं। फिर उन्होंने अमेज़न मैकेनिकल तुर्क का उपयोग करके श्रमिकों से ऐसे प्रश्न लिखवाए जो यह परीक्षण करेंगे कि क्या कोई प्रणाली ट्रिपल से सही संबंध का अनुमान लगा सकती है। प्रत्येक प्रश्न के लिए, श्रमिकों ने चार गलत उत्तर भी उत्पन्न किए जो सही उत्तर से शब्दार्थ रूप से संबंधित थे लेकिन प्रश्न के संदर्भ में गलत थे। यह प्रतिकूल डिज़ाइन बेंचमार्क को चुनौतीपूर्ण बनाता है, क्योंकि गलत विकल्प अक्सर प्रशंसनीय लेकिन गलत होते हैं।

अंतिम डेटासेट को प्रशिक्षण, विकास और परीक्षण सेट में विभाजित किया गया था। प्रशिक्षण सेट में 9,741 प्रश्न हैं, विकास सेट में 1,221 प्रश्न हैं, और परीक्षण सेट में 1,241 प्रश्न हैं। परीक्षण सेट सार्वजनिक रूप से जारी नहीं किया गया है, और शोधकर्ताओं को उस पर परिणाम प्राप्त करने के लिए अपने मॉडल को एक मूल्यांकन सर्वर पर जमा करना होगा, जो ओवरफिटिंग को रोकने में मदद करता है।

मूल्यांकन और प्रभाव

CommonsenseQA जल्दी ही बड़े भाषा मॉडल और अन्य AI प्रणालियों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया। शुरुआती परिणामों से पता चला कि उस समय के सबसे उन्नत मॉडल, जैसे BERT और GPT-2, ने भी केवल यादृच्छिक अनुमान से थोड़ा बेहतर प्रदर्शन किया, जो पांच-विकल्प बहुविकल्पीय कार्य के लिए 20% सटीकता है। इसने AI प्रणालियों के लिए सामान्य ज्ञान तर्क की कठिनाई को उजागर किया।

बाद के कार्यों ने प्रदर्शन में काफी सुधार किया। जिन मॉडलों ने बाहरी ज्ञान को शामिल किया, जैसे कि प्रासंगिक ConceptNet ट्रिपल प्राप्त करने वाले या ग्राफ तंत्रिका नेटवर्क का उपयोग करने वाले, ने उच्च सटीकता प्राप्त की। GPT-3 और बाद के मॉडल सहित बड़े पूर्व-प्रशिक्षित मॉडलों की शुरूआत ने भी महत्वपूर्ण लाभ दिए। 2021 तक, कुछ मॉडल विकास सेट पर लगभग 80% सटीकता तक पहुंच रहे थे, हालांकि मानव प्रदर्शन लगभग 91% अनुमानित है।

अन्य बेंचमार्क से संबंध

CommonsenseQA सामान्य ज्ञान तर्क बेंचमार्क के व्यापक परिवार का हिस्सा है, जिसमें विनोग्राद स्कीमा चैलेंज, SWAG और HellaSwag शामिल हैं। इन बेंचमार्क के विपरीत, जो सर्वनाम समाधान या वाक्य पूर्णता पर केंद्रित हैं, CommonsenseQA स्पष्ट रूप से विविध रोजमर्रा के परिदृश्यों के साथ बहुविकल्पीय प्रश्न उत्तर का परीक्षण करता है। इसका उपयोग सामान्य-उद्देश्य AI प्रणालियों का मूल्यांकन करने के लिए अन्य डेटासेट के साथ संयोजन में किया गया है, जिसमें OpenAI, Anthropic और Google DeepMind जैसी कंपनियों द्वारा विकसित प्रणालियां शामिल हैं।

डेटासेट को विस्तारित और अनुकूलित भी किया गया है। उदाहरण के लिए, CommonsenseQA 2.0 नामक एक संस्करण 2021 में जारी किया गया था, जो जनरेटिव मॉडल पर आधारित एक अलग प्रश्न निर्माण दृष्टिकोण का उपयोग करता है। इसके अतिरिक्त, शोधकर्ताओं ने मॉडल मजबूती का परीक्षण करने के लिए CommonsenseQA के प्रतिकूल विभाजन बनाए हैं, जहां प्रश्नों को उन मॉडलों के लिए कठिन बनाने के लिए संशोधित किया जाता है जो सतही संकेतों पर निर्भर करते हैं।

सीमाएं और आलोचनाएं

अपनी लोकप्रियता के बावजूद, CommonsenseQA को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं ने नोट किया है कि डेटासेट में पूर्वाग्रह हैं, जैसे कि कुछ उत्तर विकल्पों के अधिक बार होने की प्रवृत्ति या सही उत्तर के लंबे या अधिक विशिष्ट होने की प्रवृत्ति। मॉडल वास्तविक तर्क किए बिना इन सांख्यिकीय नियमितताओं का फायदा उठा सकते हैं। इसके अतिरिक्त, सभी प्रश्न अंग्रेजी में हैं और सामान्य ज्ञान के पश्चिमी-केंद्रित दृष्टिकोण को दर्शाते हैं, जो अन्य संस्कृतियों और भाषाओं में इसकी प्रयोज्यता को सीमित करता है।

एक और सीमा यह है कि डेटासेट स्थिर है, जिसका अर्थ है कि यह सामान्य ज्ञान की विकसित प्रकृति को कैप्चर नहीं करता है। जैसे-जैसे दुनिया बदलती है, जो सामान्य ज्ञान माना जाता है वह बदल सकता है, लेकिन बेंचमार्क स्थिर रहता है। इसने कुछ शोधकर्ताओं को अधिक गतिशील और विविध मूल्यांकन विधियों का आह्वान करने के लिए प्रेरित किया है।

वर्तमान उपयोग

2020 के दशक के मध्य तक, CommonsenseQA Artificial intelligence और Machine learning अनुसंधान समुदाय में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बना हुआ है। इसे अक्सर MMLU और BIG-bench जैसे अन्य बेंचमार्क के साथ, बड़े भाषा मॉडल के मूल्यांकन सुइट्स में शामिल किया जाता है। डेटासेट अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है और हगिंग फेस जैसे प्लेटफार्मों पर होस्ट किया गया है, जिससे शोधकर्ताओं के लिए इसे एक्सेस करना और उपयोग करना आसान हो जाता है।

CommonsenseQA का उपयोग मॉडलों की तर्क क्षमताओं का अधिक विस्तार से अध्ययन करने के लिए भी किया गया है। उदाहरण के लिए, शोधकर्ताओं ने विश्लेषण किया है कि किस प्रकार का सामान्य ज्ञान (जैसे, स्थानिक, लौकिक, सामाजिक) मॉडल के लिए सबसे चुनौतीपूर्ण है, और Transformer (architecture)-आधारित मॉडल के आंतरिक प्रतिनिधित्व की जांच करने के लिए डेटासेट का उपयोग किया है। यह चल रहा शोध अधिक मजबूत और सक्षम AI प्रणालियों के विकास को सूचित करना जारी रखता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·commonsense-reasoning·nlp·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास