अंग्रेज़ी से अनुवादित

ARC (AI2 Reasoning Challenge) एक बेंचमार्क डेटासेट है जिसमें प्राथमिक विद्यालय स्तर के विज्ञान प्रश्न शामिल हैं, जो Easy और Challenge सेटों में विभाजित है, और इसका उपयोग कृत्रिम बुद्धिमत्ता प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए किया जाता है।

AI2 Reasoning Challenge (ARC) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस (AI2) द्वारा निर्मित, ARC में प्राथमिक विद्यालय स्तर के मानकीकृत परीक्षणों के स्तर पर बहुविकल्पीय विज्ञान प्रश्न शामिल हैं। डेटासेट को दो उपसमुच्चयों में विभाजित किया गया है: एक आसान सेट और एक चुनौती सेट, जिसमें बाद वाले में ऐसे प्रश्न शामिल हैं जो मौजूदा AI मॉडलों के लिए सही उत्तर देने में विशेष रूप से कठिन हैं। ARC मशीन समझ और तर्क में प्रगति को मापने के लिए कृत्रिम बुद्धिमत्ता के क्षेत्र में एक मानक संदर्भ बिंदु बन गया है।

ARC को 2018 में AI2 के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिसमें पीटर क्लार्क, आइजैक काउहे, ओरेन एत्ज़ियोनी, तुषार खोट, आशीष सभरवाल, कैरिसा शोएनिक और ओयविंड टैफजॉर्ड शामिल थे। बेंचमार्क को पहले के डेटासेट की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर मॉडलों को वास्तविक तर्क के बजाय सांख्यिकीय संकेतों का शोषण करने की अनुमति देते थे। प्रश्न प्राथमिक विद्यालय के विज्ञान परीक्षाओं से लिए गए हैं और भौतिकी, रसायन विज्ञान, जीव विज्ञान और पृथ्वी विज्ञान जैसे विषयों को कवर करते हैं। प्रत्येक प्रश्न में चार उत्तर विकल्प शामिल हैं, और सही उत्तर प्रशिक्षण और मूल्यांकन उद्देश्यों के लिए डेटासेट में प्रदान किया गया है।

चुनौती सेट बेंचमार्क का प्राथमिक फोकस है। इसमें ऐसे प्रश्न शामिल हैं जिन्हें सरल पुनर्प्राप्ति या पैटर्न मिलान द्वारा आसानी से उत्तर नहीं दिया जा सकता है, जिसके लिए वैज्ञानिक अवधारणाओं की गहरी अनुमान और समझ की आवश्यकता होती है। मूल पेपर में, लेखकों ने बताया कि ट्रांसफॉर्मर वास्तुकला पर आधारित एक मजबूत तंत्रिका मॉडल ने चुनौती सेट पर केवल लगभग 53% सटीकता हासिल की, जबकि आसान सेट पर 80% से अधिक थी। इस अंतर ने चुनौती सेट की कठिनाई को उजागर किया और मशीन लर्निंग और डीप लर्निंग में बाद के शोध को प्रेरित किया।

डेटासेट संरचना और निर्माण

ARC में कुल 7,787 विज्ञान प्रश्न हैं, जिनमें आसान सेट में 4,787 और चुनौती सेट में 3,000 शामिल हैं। प्रश्न सार्वजनिक रूप से उपलब्ध प्राथमिक विद्यालय के विज्ञान परीक्षाओं से प्राप्त किए गए हैं, जिनमें न्यूयॉर्क राज्य रीजेंट्स परीक्षा और अन्य मानकीकृत परीक्षण शामिल हैं। डेटासेट में प्रश्न पाठ और चार उत्तर विकल्प, साथ ही सही उत्तर शामिल हैं। प्रश्नों को बाहरी ज्ञान के बिना उत्तर देने योग्य बनाने के लिए डिज़ाइन किया गया है, जो आमतौर पर प्राथमिक और मध्य विद्यालय की विज्ञान कक्षाओं में पढ़ाया जाता है।

निर्माण प्रक्रिया में उन प्रश्नों को फ़िल्टर करना शामिल था जिन्हें सरल शब्द मिलान या पुनर्प्राप्ति द्वारा उत्तर दिया जा सकता था, जिन्हें आसान सेट में सौंपा गया था। शेष प्रश्न, जिनके लिए अधिक जटिल तर्क की आवश्यकता थी, चुनौती सेट का गठन करते थे। लेखकों ने कुछ प्रश्नों के लिए "सहायक तथ्यों" का एक सेट भी प्रदान किया, जो प्रासंगिक पृष्ठभूमि ज्ञान प्रदान करने वाले छोटे कथन हैं, लेकिन ये प्रश्न का सही उत्तर देने के लिए हमेशा पर्याप्त नहीं होते हैं।

मूल्यांकन और प्रभाव

ARC को AI प्रणालियों के मूल्यांकन के लिए एक बेंचमार्क के रूप में व्यापक रूप से अपनाया गया है, विशेष रूप से प्रश्न उत्तर और तर्क के क्षेत्रों में। इसका उपयोग अक्सर SQuAD और GLUE जैसे अन्य बेंचमार्क के साथ बड़े भाषा मॉडल की क्षमताओं का आकलन करने के लिए किया जाता है। चुनौती सेट एक कठिन परीक्षण साबित हुआ है: यहां तक कि अत्याधुनिक मॉडल, जिनमें तंत्रिका नेटवर्क वास्तुकला और ट्रांसफॉर्मर पर आधारित शामिल हैं, मानव प्रदर्शन को पार करने में संघर्ष कर रहे हैं, जो लगभग 90% सटीकता पर अनुमानित है। 2024 तक, चुनौती सेट पर सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियों ने उच्च 80 के दशक में सटीकता हासिल की है, लेकिन बेंचमार्क शोध का एक सक्रिय क्षेत्र बना हुआ है।

ARC ने मशीन लर्निंग में नई तकनीकों के विकास को भी प्रभावित किया है, जैसे पाठ्यक्रम-आधारित लर्निंग और तर्क में सुधार के लिए डेटा-वृद्धि का उपयोग। बेंचमार्क का उपयोग प्रमुख AI अनुसंधान संगठनों, जिनमें ओपनएआई, एंथ्रोपिक और गूगल-डीपमाइंड शामिल हैं, के मॉडलों का मूल्यांकन करने के लिए किया गया है, और जनरेटिव एआई प्रणालियों के विकास में एक प्रमुख मीट्रिक रहा है।

सीमाएं और आलोचनाएं

अपनी लोकप्रियता के बावजूद, ARC को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि डेटासेट बहुत संकीर्ण है, केवल प्राथमिक विद्यालय के विज्ञान पर केंद्रित है, और अन्य डोमेन में सामान्यीकृत नहीं हो सकता है। अन्य लोगों ने नोट किया है कि चुनौती सेट को उत्तर विकल्पों में सांख्यिकीय नियमितताओं का शोषण करने वाले मॉडलों द्वारा "गेम" किया जा सकता है, हालांकि डेटासेट को ऐसे शॉर्टकट को कम करने के लिए डिज़ाइन किया गया था। इसके अतिरिक्त, कुछ प्रश्नों के लिए प्रदान किए गए सहायक तथ्य हमेशा पूर्ण नहीं होते हैं, जिससे यह मूल्यांकन करना मुश्किल हो सकता है कि कोई मॉडल वास्तव में तर्क कर रहा है या केवल पैटर्न याद कर रहा है।

एक और सीमा यह है कि ARC को प्रश्न पाठ से परे बहु-चरणीय तर्क या बाहरी ज्ञान के एकीकरण की आवश्यकता नहीं होती है, जो अधिक उन्नत तर्क क्षमताओं को मापने की इसकी क्षमता को सीमित करता है। परिणामस्वरूप, कुछ शोधकर्ताओं ने अधिक चुनौतीपूर्ण बेंचमार्क प्रस्तावित किए हैं, जैसे MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) डेटासेट, जो विषयों और कठिनाई स्तरों की एक व्यापक श्रृंखला को कवर करता है।

भविष्य की दिशाएं

ARC AI अनुसंधान समुदाय के लिए एक मूल्यवान उपकरण बना हुआ है, और इसका उपयोग नए मॉडलों और तकनीकों के मूल्यांकन के लिए आधार रेखा के रूप में जारी रहने की संभावना है। भविष्य के काम में अधिक विविध प्रश्न प्रकारों को शामिल करने के लिए डेटासेट का विस्तार करना या तर्क का बेहतर आकलन करने के लिए उत्तरों के लिए स्पष्टीकरण शामिल करना शामिल हो सकता है। बेंचमार्क मानव और मशीन तर्क के बीच की खाई की याद दिलाता है, जो कृत्रिम बुद्धिमत्ता में उस खाई को बंद करने के लिए चल रहे प्रयासों को प्रेरित करता है।

संक्षेप में, ARC AI अनुसंधान में एक मौलिक बेंचमार्क है, जो तर्क क्षमताओं के लिए एक चुनौतीपूर्ण परीक्षण प्रदान करता है। इसके आसान और चुनौती सेट मॉडल प्रदर्शन का एक सूक्ष्म दृष्टिकोण प्रदान करते हैं, और इसका प्रभाव क्षेत्र में नए एल्गोरिदम और वास्तुकला के विकास तक फैला हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·reasoning·question-answering·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास