अंग्रेज़ी से अनुवादित

ARC-Easy, AI2 रीज़निंग चैलेंज का एक उपसमुच्चय है, जिसमें प्राथमिक विद्यालय स्तर के विज्ञान प्रश्न शामिल हैं जो चैलेंज सेट की तुलना में आसान हैं, और इसका उपयोग AI प्रणालियों की तर्क क्षमता और ज्ञान का मूल्यांकन करने के लिए किया जाता है।

ARC-Easy, AI2 रीज़निंग चैलेंज (ARC) का एक बेंचमार्क उपसमूह है, जो प्राथमिक स्तर के बहुविकल्पीय विज्ञान प्रश्नों का एक डेटासेट है। इसे 2018 में एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस (AI2) द्वारा पेश किया गया था। ARC डेटासेट को चैलेंज सेट और ईज़ी सेट में विभाजित किया गया है; ARC-Easy में वे प्रश्न शामिल हैं जिन्हें एक रिट्रीवल-आधारित एल्गोरिदम ने सही उत्तर दिया था, जिससे वे चैलेंज सेट की तुलना में कम कठिन होते हैं। ARC-Easy का व्यापक रूप से कृत्रिम बुद्धिमत्ता प्रणालियों, जिसमें बड़े भाषा मॉडल शामिल हैं, की तर्क और ज्ञान क्षमताओं का मूल्यांकन करने के लिए उपयोग किया जाता है।

AI2 रीज़निंग चैलेंज को मौजूदा प्रश्न-उत्तर बेंचमार्क की सीमाओं को संबोधित करने के लिए बनाया गया था, जो अक्सर सरल पैटर्न मिलान पर निर्भर करते थे। डेटासेट में 7,787 वास्तविक प्राथमिक स्तर के विज्ञान प्रश्न हैं, जिनमें प्रशिक्षण सेट में 3,787, विकास सेट में 1,196, और परीक्षण सेट में 2,804 प्रश्न शामिल हैं। ईज़ी सेट में इन प्रश्नों का एक उपसमूह शामिल है जिसे एक सरल सूचना पुनर्प्राप्ति प्रणाली सही उत्तर दे सकती है, जबकि चैलेंज सेट में ऐसे प्रश्न शामिल हैं जिन्हें ऐसी प्रणाली हल नहीं कर सकी। यह अंतर शोधकर्ताओं को सीधे और अधिक जटिल तर्क कार्यों दोनों पर प्रगति मापने की अनुमति देता है।

संरचना और विशेषताएँ

ARC-Easy प्रश्न पूर्ण ARC डेटासेट के समान स्रोत से प्राप्त होते हैं: कक्षा 3 से 9 के विज्ञान परीक्षाएँ। प्रत्येक प्रश्न चार उत्तर विकल्पों वाला एक बहुविकल्पीय आइटम है, और सही उत्तर प्रदान किया गया है। प्रश्न भौतिक विज्ञान, जीवन विज्ञान, और पृथ्वी एवं अंतरिक्ष विज्ञान के विषयों को कवर करते हैं। चूंकि ईज़ी सेट एक बेसलाइन एल्गोरिदम के प्रदर्शन के आधार पर चुना गया था, इसमें आमतौर पर ऐसे प्रश्न शामिल होते हैं जो पाठ्य ज्ञान से अधिक सीधे उत्तर देने योग्य होते हैं, जिनमें बहु-चरणीय तर्क या सामान्य ज्ञान अनुमान की कम आवश्यकता होती है।

ईज़ी सेट चैलेंज सेट से छोटा है; उदाहरण के लिए, ARC-Easy के परीक्षण सेट में 2,376 प्रश्न हैं, जबकि चैलेंज सेट में 1,172 हैं। विकास सेट में 570 प्रश्न हैं, और प्रशिक्षण सेट में 2,251 प्रश्न हैं। यह वितरण ARC-Easy को त्वरित मूल्यांकन के लिए एक सुविधाजनक बेंचमार्क बनाता है, क्योंकि यह सांख्यिकीय महत्व के लिए बड़ी संख्या में उदाहरण प्रदान करता है, साथ ही एक सार्थक तर्क चुनौती भी प्रस्तुत करता है।

AI अनुसंधान में उपयोग

ARC-Easy कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर बड़े भाषा मॉडल (LLM) और अन्य प्रश्न-उत्तर प्रणालियों के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। उदाहरण के लिए, GPT-3 और बाद के संस्करणों जैसे मॉडलों का परीक्षण ARC-Easy पर उनकी वैज्ञानिक तर्क क्षमताओं को मापने के लिए किया गया है। यह बेंचमार्क ओपन LLM लीडरबोर्ड जैसे व्यापक मूल्यांकन सुइट्स में भी शामिल है, जहाँ यह मॉडल क्षमताओं का आकलन करने के लिए कई कार्यों में से एक के रूप में कार्य करता है।

शोधकर्ता अक्सर अधिक चुनौतीपूर्ण ARC-Challenge के साथ ARC-Easy पर सटीकता की रिपोर्ट करते हैं। जबकि अत्याधुनिक मॉडल ARC-Easy पर उच्च स्कोर प्राप्त करते हैं, चैलेंज सेट अधिक कठिन बना रहता है, जो सरल पुनर्प्राप्ति और गहन तर्क के बीच अंतर को उजागर करता है। ARC-Easy का उपयोग तंत्रिका नेटवर्क, ट्रांसफॉर्मर, और डीप लर्निंग आर्किटेक्चर के अध्ययन में भी किया जाता है, क्योंकि यह ज्ञान एकीकरण और तर्क का परीक्षण करने के लिए एक नियंत्रित वातावरण प्रदान करता है।

अन्य बेंचमार्क से संबंध

ARC-Easy तर्क बेंचमार्क के एक परिवार का हिस्सा है जिसमें ARC-Challenge, CommonsenseQA, और OpenBookQA शामिल हैं। ये बेंचमार्क तथ्यात्मक स्मरण से लेकर सामान्य ज्ञान अनुमान तक, AI तर्क के विभिन्न पहलुओं का परीक्षण करने के लिए डिज़ाइन किए गए हैं। ARC-Easy को अक्सर ARC-Challenge के साथ जोड़ा जाता है ताकि कठिनाई का एक स्पेक्ट्रम प्रदान किया जा सके; ईज़ी सेट डिबगिंग और तीव्र पुनरावृत्ति के लिए उपयोगी है, जबकि चैलेंज सेट वर्तमान मॉडलों की सीमाओं को धकेलता है।

इस बेंचमार्क का उपयोग प्रशिक्षण डेटा और मॉडल आकार के प्रभाव का मूल्यांकन करने के लिए भी किया गया है। उदाहरण के लिए, अध्ययनों ने दिखाया है कि बड़े मॉडल ARC-Easy पर बेहतर प्रदर्शन करते हैं, लेकिन चैलेंज सेट पर लाभ कम अनुमानित होते हैं। इससे AI में तर्क की प्रकृति और स्मरण बनाम सामान्यीकरण की भूमिका पर चर्चाएँ हुई हैं।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, ARC-Easy की सीमाएँ हैं। प्रश्न प्राथमिक स्तर की परीक्षाओं से प्राप्त होते हैं, जो वास्तविक दुनिया की वैज्ञानिक तर्क की जटिलता को नहीं पकड़ सकते हैं। इसके अतिरिक्त, चूंकि ईज़ी सेट को एक बेसलाइन एल्गोरिदम के प्रदर्शन द्वारा परिभाषित किया गया था, यह मानव कठिनाई के लिए पूरी तरह से कैलिब्रेटेड नहीं हो सकता है। कुछ आलोचकों का तर्क है कि ARC-Easy पर उच्च प्रदर्शन उथले पैटर्न मिलान के माध्यम से प्राप्त किया जा सकता है, और यह बेंचमार्क गहन समझ का पर्याप्त परीक्षण नहीं करता है। हालाँकि, यह AI अनुसंधान में प्रगति को ट्रैक करने के लिए एक उपयोगी उपकरण बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·question-answering·reasoning·ai-evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास