अंग्रेज़ी से अनुवादित

SciQ 13,679 बहुविकल्पीय विज्ञान परीक्षा प्रश्नों का एक डेटासेट है, जिसमें उत्तर स्पष्टीकरण शामिल हैं, और इसका उपयोग कृत्रिम बुद्धिमत्ता प्रणालियों, विशेष रूप से बड़े भाषा मॉडलों की तर्क क्षमताओं का मूल्यांकन और सुधार करने के लिए किया जाता है।

SciQ 13,679 बहुविकल्पीय विज्ञान प्रश्नों का एक डेटासेट है, जिसे कृत्रिम बुद्धिमत्ता प्रणालियों के प्रशिक्षण और मूल्यांकन के लिए डिज़ाइन किया गया है। प्रत्येक प्रश्न के साथ एक सही उत्तर और एक सहायक व्याख्या दी गई है, जो इसे मशीन रीडिंग कॉम्प्रिहेंशन और वैज्ञानिक तर्क में अनुसंधान के लिए एक मूल्यवान संसाधन बनाता है। यह डेटासेट एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा बनाया गया था और 2017 में जारी किया गया था, और तब से यह एआई अनुसंधान के क्षेत्र में एक मानक बेंचमार्क बन गया है।

SciQ के प्रश्न जूनियर हाई और हाई स्कूल के विज्ञान पाठ्यक्रम से लिए गए हैं, जिनमें भौतिकी, रसायन विज्ञान, जीव विज्ञान और पृथ्वी विज्ञान जैसे विषय शामिल हैं। डेटासेट का निर्माण ऑनलाइन शैक्षिक संसाधनों से प्रश्नों को खनन करके और फिर गुणवत्ता सुनिश्चित करने के लिए उन्हें फ़िल्टर और साफ करके किया गया था। प्रत्येक उत्तर के लिए दी गई व्याख्याएँ आम तौर पर एक या दो वाक्यों की होती हैं, जो चुने गए विकल्प के सही होने का संक्षिप्त तर्क प्रदान करती हैं। यह विशेषता SciQ को कई अन्य प्रश्न-उत्तर डेटासेट से अलग करती है, जो अक्सर बिना किसी औचित्य के केवल सही उत्तर प्रदान करते हैं।

निर्माण और संरचना

SciQ डेटासेट स्वचालित और मैन्युअल प्रक्रियाओं के संयोजन का उपयोग करके बनाया गया था। प्रश्नों का प्रारंभिक समूह सार्वजनिक रूप से उपलब्ध विज्ञान परीक्षा भंडारों और शैक्षिक वेबसाइटों से एकत्र किया गया था। शोधकर्ताओं ने फिर विकृत या अस्पष्ट प्रश्नों को हटाने के लिए फ़िल्टर की एक श्रृंखला लागू की, जिसके परिणामस्वरूप 13,679 आइटमों का अंतिम सेट प्राप्त हुआ। प्रत्येक प्रश्न में चार उत्तर विकल्प होते हैं, जिनमें से ठीक एक सही विकल्प होता है। डेटासेट को प्रशिक्षण (11,679 प्रश्न), सत्यापन (1,000 प्रश्न) और परीक्षण (1,000 प्रश्न) सेटों में विभाजित किया गया है, जो विभिन्न मॉडलों में सुसंगत मूल्यांकन की अनुमति देता है।

SciQ का एक उल्लेखनीय पहलू यह है कि इसमें प्रत्येक प्रश्न के लिए एक व्याख्या शामिल है, यहाँ तक कि प्रशिक्षण सेट में भी। यह डिज़ाइन विकल्प डेटासेट के उपयोग को सरल उत्तर भविष्यवाणी से परे कार्यों, जैसे व्याख्या निर्माण और बहु-कार्य सीखने के लिए सक्षम बनाता है। व्याख्याएँ आम तौर पर छोटी और तथ्यात्मक होती हैं, जो प्रश्न को हल करने के लिए आवश्यक प्रमुख वैज्ञानिक सिद्धांत प्रदान करती हैं।

एआई अनुसंधान में उपयोग

SciQ को मशीन लर्निंग मॉडलों की तर्क क्षमताओं के मूल्यांकन के लिए एक बेंचमार्क के रूप में व्यापक रूप से अपनाया गया है, विशेष रूप से डीप लर्निंग और न्यूरल नेटवर्क के संदर्भ में। SciQ पर परीक्षण किए गए प्रारंभिक मॉडलों में मेमोरी-ऑगमेंटेड नेटवर्क और अटेंशन-आधारित आर्किटेक्चर शामिल थे, जिन्होंने मानव प्रदर्शन की तुलना में मामूली सटीकता हासिल की। डेटासेट का उपयोग बड़े भाषा मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए भी किया गया है, जिन्होंने मॉडलों के आकार और परिष्कार में वृद्धि के साथ प्रदर्शन में महत्वपूर्ण सुधार दिखाया है।

SciQ द्वारा उत्पन्न प्रमुख चुनौतियों में से एक यह है कि इसके लिए मॉडलों को न केवल तथ्यात्मक ज्ञान प्राप्त करने की आवश्यकता होती है, बल्कि विकर्षकों के बीच सही उत्तर चुनने के लिए तार्किक तर्क लागू करने की भी आवश्यकता होती है। व्याख्याएँ मॉडलों को तर्क उत्पन्न करने के लिए प्रशिक्षित करने के लिए एक उपयोगी संकेत प्रदान करती हैं, जो एआई प्रणालियों में व्याख्यात्मकता और विश्वास में सुधार कर सकती हैं। शोधकर्ताओं ने प्रश्न-उत्तर प्रदर्शन पर प्रशिक्षण डेटा आकार, मॉडल आर्किटेक्चर और फाइन-ट्यूनिंग रणनीतियों के प्रभाव का अध्ययन करने के लिए भी SciQ का उपयोग किया है।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, SciQ की कई सीमाएँ हैं। प्रश्न अपेक्षाकृत सरल हैं और जटिल बहु-चरणीय तर्क के बजाय तथ्यात्मक स्मरण पर केंद्रित हैं। परिणामस्वरूप, अत्याधुनिक मॉडलों ने परीक्षण सेट पर लगभग पूर्ण सटीकता हासिल की है, जिससे कुछ शोधकर्ताओं ने तर्क दिया है कि बेंचमार्क संतृप्त हो गया है। इसके अतिरिक्त, डेटासेट अंग्रेजी भाषा और विज्ञान विषयों की एक संकीर्ण सीमा तक सीमित है, जो अन्य डोमेन या भाषाओं में सामान्यीकृत नहीं हो सकता है।

एक और आलोचना यह है कि व्याख्याएँ, हालांकि सहायक हैं, हमेशा एक मॉडल के लिए मजबूत तर्क सीखने के लिए पर्याप्त नहीं होती हैं। कुछ प्रश्नों का उत्तर अंतर्निहित विज्ञान की गहरी समझ के बिना, प्रश्न और उत्तर विकल्पों की भाषा पर पैटर्न मिलान द्वारा सही ढंग से दिया जा सकता है। इसने अधिक चुनौतीपूर्ण बेंचमार्क के विकास को प्रेरित किया है, जैसे कि मल्टी-हॉप तर्क या बाहरी ज्ञान के एकीकरण की आवश्यकता वाले।

संबंधित डेटासेट और बेंचमार्क

SciQ एआई समुदाय में प्रश्न-उत्तर डेटासेट के व्यापक परिवार का हिस्सा है। इसकी तुलना अक्सर ARC (AI2 Reasoning Challenge) जैसे अन्य विज्ञान-केंद्रित डेटासेट से की जाती है, जिसमें अधिक जटिल तर्क की आवश्यकता वाले कठिन प्रश्न होते हैं। जबकि ARC को अधिक चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया है, SciQ को इसके बड़े आकार और व्याख्याओं की उपस्थिति के लिए महत्व दिया जाता है। अन्य संबंधित बेंचमार्क में OpenBookQA शामिल है, जो विज्ञान के बारे में सामान्य ज्ञान का परीक्षण करता है, और QASC, जो कई वाक्यों से तथ्यों के संयोजन पर केंद्रित है।

SciQ की उपलब्धता ने जनरेटिव एआई प्रणालियों के विकास में योगदान दिया है जो प्रश्नों का उत्तर दे सकती हैं और व्याख्याएँ प्रदान कर सकती हैं। इसका उपयोग शैक्षिक प्रौद्योगिकी अनुप्रयोगों में भी किया गया है, जैसे स्वचालित ट्यूटरिंग सिस्टम जो छात्रों को चरण-दर-चरण समाधान प्रदान करके विज्ञान सीखने में मदद करते हैं।

प्रभाव और विरासत

अपनी रिलीज़ के बाद से, SciQ को सैकड़ों शोध पत्रों में उद्धृत किया गया है और यह प्राकृतिक भाषा प्रसंस्करण समुदाय में एआई मॉडल के मूल्यांकन के लिए एक मानक उपकरण बन गया है। इसका सरल प्रारूप और स्पष्ट मूल्यांकन प्रोटोकॉल इसे सीमित कम्प्यूटेशनल संसाधनों वाले शोधकर्ताओं के लिए सुलभ बनाता है। डेटासेट को SuperGLUE और MMLU जैसे कई बड़े बेंचमार्क में भी शामिल किया गया है, जो मॉडल क्षमताओं का अधिक व्यापक मूल्यांकन प्रदान करने के लिए कई कार्यों को एकत्रित करते हैं।

SciQ की सफलता ने चिकित्सा और कानून जैसे अन्य डोमेन में समान डेटासेट के निर्माण को प्रेरित किया है, जहाँ व्याख्याएँ समान रूप से महत्वपूर्ण हैं। इसने प्रशिक्षण डेटा में मानव-पठनीय औचित्य शामिल करने के मूल्य को भी उजागर किया है, एक प्रथा जिसे कई आधुनिक एआई प्रणालियों में अपनाया गया है। 2025 तक, SciQ शैक्षिक उद्देश्यों और नए मॉडलों के प्रारंभिक मूल्यांकन के लिए एक उपयोगी संसाधन बना हुआ है, भले ही अधिक चुनौतीपूर्ण बेंचमार्क उभरते रहें।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·question-answering·science·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास