अंग्रेज़ी से अनुवादित

ScienceQA एक बड़े पैमाने पर मल्टीमॉडल बेंचमार्क है जो विज्ञान प्रश्न उत्तर देने के लिए है, जिसमें 21,000 से अधिक बहुविकल्पीय प्रश्न शामिल हैं, जिनमें आरेख और संदर्भ होते हैं, और इसका उपयोग विभिन्न विज्ञान विषयों में AI प्रणालियों की तर्क क्षमता का मूल्यांकन करने के लिए किया जाता है।

ScienceQA एक बड़े पैमाने पर बेंचमार्क डेटासेट है जिसे विज्ञान प्रश्नों के उत्तर देने में कृत्रिम बुद्धिमत्ता प्रणालियों की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2022 में कैलिफोर्निया विश्वविद्यालय, लॉस एंजिल्स और अन्य संस्थानों के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था। डेटासेट में 21,000 से अधिक बहुविकल्पीय प्रश्न शामिल हैं, जो भौतिकी, रसायन विज्ञान, जीव विज्ञान और पृथ्वी विज्ञान जैसे विषयों को कवर करते हैं, और प्रत्येक प्रश्न के साथ एक छवि या आरेख और प्रासंगिक जानकारी होती है। ScienceQA अपनी मल्टीमॉडल प्रकृति के लिए उल्लेखनीय है, जिसके लिए मॉडलों को सही उत्तरों तक पहुंचने के लिए पाठ्य और दृश्य समझ को एकीकृत करने की आवश्यकता होती है।

बेंचमार्क को पहले के प्रश्न-उत्तर डेटासेट की सीमाओं को संबोधित करने के लिए बनाया गया था, जो अक्सर केवल पाठ-आधारित या केवल छवि-आधारित कार्यों पर केंद्रित होते थे। ScienceQA एक अधिक यथार्थवादी और चुनौतीपूर्ण सेटिंग प्रदान करता है, क्योंकि विज्ञान प्रश्नों में अक्सर आरेख, चार्ट और प्रयोगात्मक सेटअप की व्याख्या शामिल होती है। प्रश्न प्राथमिक और माध्यमिक विद्यालय के विज्ञान पाठ्यक्रम से लिए गए हैं, जिससे वे एआई मॉडल की एक विस्तृत श्रृंखला के लिए सुलभ हो जाते हैं, जबकि अभी भी वास्तविक तर्क कौशल की आवश्यकता होती है। प्रत्येक प्रश्न को बहुविकल्पीय विकल्पों, सही उत्तर और मानव-पठनीय स्पष्टीकरण के साथ एनोटेट किया गया है, जिससे मॉडल तर्क का मूल्यांकन और विश्लेषण दोनों संभव हो सके।

डेटासेट संरचना और एनोटेशन

ScienceQA में 21,208 प्रश्न हैं, जो प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित हैं। प्रशिक्षण सेट में 12,726 प्रश्न शामिल हैं, सत्यापन सेट में 4,241 प्रश्न हैं, और परीक्षण सेट में 4,241 प्रश्न हैं। प्रत्येक प्रश्न एक विषय, एक विषयवस्तु, एक ग्रेड स्तर और एक श्रेणी (जैसे, "प्राकृतिक विज्ञान" या "सामाजिक विज्ञान") से जुड़ा है। एनोटेशन में एक पाठ्य संदर्भ भी शामिल है जो पृष्ठभूमि जानकारी प्रदान करता है, और प्रासंगिक होने पर एक आरेख या छवि भी। सही उत्तर प्रदान किया जाता है, साथ ही मानव एनोटेटर द्वारा लिखा गया एक संक्षिप्त स्पष्टीकरण भी दिया जाता है, जो मॉडल-जनित स्पष्टीकरण की गुणवत्ता का मूल्यांकन करने के लिए एक संदर्भ के रूप में कार्य करता है।

डेटासेट विज्ञान विषयों की एक विस्तृत श्रृंखला को कवर करता है, जिसमें भौतिकी (जैसे, बल, ऊर्जा), रसायन विज्ञान (जैसे, रासायनिक प्रतिक्रियाएं, पदार्थ की अवस्थाएं), जीव विज्ञान (जैसे, पौधे और जानवरों की कोशिकाएं, पारिस्थितिकी तंत्र) और पृथ्वी विज्ञान (जैसे, मौसम, भूवैज्ञानिक प्रक्रियाएं) शामिल हैं। प्रश्न केवल तथ्यात्मक स्मरण का परीक्षण करने के लिए नहीं, बल्कि तर्क कौशल का भी परीक्षण करने के लिए डिज़ाइन किए गए हैं, जैसे कि अवधारणाओं को नई स्थितियों में लागू करना, ग्राफ़ से डेटा की व्याख्या करना और दृश्य प्रतिनिधित्व से अनुमान लगाना।

मूल्यांकन और बेसलाइन मॉडल

ScienceQA को विभिन्न मशीन लर्निंग मॉडल का उपयोग करके बेसलाइन प्रयोगों के एक सेट के साथ पेश किया गया था। लेखकों ने पारंपरिक दृष्टि-भाषा मॉडल और अधिक हाल के ट्रांसफॉर्मर-आधारित आर्किटेक्चर सहित कई दृष्टिकोणों का मूल्यांकन किया। प्रमुख निष्कर्षों में से एक यह था कि कई मौजूदा मॉडलों ने ScienceQA पर खराब प्रदर्शन किया, परीक्षण सेट पर सटीकता दर अक्सर 50% से कम थी, जो बेंचमार्क की कठिनाई को उजागर करती है। उस समय सबसे अच्छा प्रदर्शन करने वाले बेसलाइन ने एक मल्टीमॉडल ट्रांसफॉर्मर का उपयोग किया जिसने छवि सुविधाओं को पाठ्य एम्बेडिंग के साथ जोड़ा, परीक्षण सेट पर लगभग 89% की सटीकता प्राप्त की, लेकिन यह अभी भी मानव प्रदर्शन से कम था, जिसका अनुमान 90% से अधिक था।

तब से बेंचमार्क मल्टीमॉडल तर्क और प्रश्न उत्तर में अनुसंधान के लिए एक मानक मूल्यांकन उपकरण बन गया है। इसका उपयोग बड़े भाषा मॉडल और दृष्टि-भाषा मॉडल की क्षमताओं का आकलन करने के लिए किया गया है, जिसमें OpenAI और Google DeepMind जैसे संगठनों द्वारा विकसित मॉडल शामिल हैं। उदाहरण के लिए, GPT-4 और Gemini जैसे मॉडलों का ScienceQA पर परीक्षण किया गया है, कुछ ने 90% से अधिक सटीकता दर हासिल की है, जो एआई तर्क में महत्वपूर्ण प्रगति दर्शाता है।

एआई अनुसंधान में भूमिका

ScienceQA ने कृत्रिम बुद्धिमत्ता के कई क्षेत्रों में अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। इसका उपयोग चेन-ऑफ-थॉट प्रॉम्प्टिंग की प्रभावशीलता का अध्ययन करने के लिए किया गया है, जहां मॉडलों को उत्तर देने से पहले मध्यवर्ती तर्क चरण उत्पन्न करने के लिए प्रोत्साहित किया जाता है। शोध से पता चला है कि ऐसी प्रॉम्प्टिंग तकनीकें ScienceQA पर प्रदर्शन में सुधार कर सकती हैं, विशेष रूप से बड़े भाषा मॉडल के लिए। डेटासेट का उपयोग दृश्य और पाठ्य जानकारी के एकीकरण की जांच के लिए भी किया गया है, जिससे नए आर्किटेक्चर का विकास हुआ है जो छवि और भाषा प्रतिनिधित्व को बेहतर ढंग से संरेखित करते हैं।

इसके अलावा, ScienceQA का उपयोग एआई में व्याख्यात्मकता की अवधारणा का पता लगाने के लिए किया गया है। चूंकि प्रत्येक प्रश्न में एक मानव-लिखित स्पष्टीकरण शामिल है, शोधकर्ता मॉडल-जनित स्पष्टीकरणों की तुलना इन संदर्भों से कर सकते हैं ताकि यह आकलन किया जा सके कि मॉडल अपने उत्तरों को कितनी अच्छी तरह सही ठहराते हैं। इसका विश्वसनीय एआई सिस्टम बनाने के लिए निहितार्थ हैं, क्योंकि सुसंगत स्पष्टीकरण प्रदान करने की क्षमता शिक्षा और वैज्ञानिक अनुसंधान में अनुप्रयोगों के लिए महत्वपूर्ण है।

सीमाएं और भविष्य की दिशाएं

अपनी ताकत के बावजूद, ScienceQA की कुछ सीमाएं हैं। प्रश्न स्कूल-स्तरीय पाठ्यक्रम पर आधारित हैं, जो उन्नत वैज्ञानिक तर्क की जटिलता को पकड़ नहीं सकते हैं। इसके अतिरिक्त, बहुविकल्पीय प्रारूप कभी-कभी मॉडलों को गहरी समझ के बिना सही अनुमान लगाने की अनुमति दे सकता है, हालांकि स्पष्टीकरण इस मुद्दे को कम करने में मदद करते हैं। डेटासेट स्थिर भी है, जिसका अर्थ है कि यह हाल की वैज्ञानिक खोजों या पाठ्यक्रम में बदलावों को प्रतिबिंबित नहीं करता है।

भविष्य के काम में ScienceQA का विस्तार करके अधिक खुले-अंत वाले प्रश्नों को शामिल करना, उच्च-स्तरीय विषयों को कवर करना और इंटरैक्टिव सिमुलेशन जैसे गतिशील तत्वों को शामिल करना शामिल हो सकता है। शोधकर्ता continual learning के लिए एक बेंचमार्क के रूप में ScienceQA का उपयोग करने के तरीकों की भी खोज कर रहे हैं, जहां मॉडलों को समय के साथ नए प्रकार के प्रश्नों के अनुकूल होना चाहिए। जैसे-जैसे एआई सिस्टम में सुधार होता रहेगा, ScienceQA जैसे बेंचमार्क प्रगति को मापने और उन क्षेत्रों की पहचान करने के लिए आवश्यक बने रहेंगे जिनमें आगे शोध की आवश्यकता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·question-answering·multimodal·science-education
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास