AI2 Reasoning Challenge (ARC) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस (AI2) द्वारा निर्मित, ARC में प्राथमिक विद्यालय स्तर के मानकीकृत परीक्षणों के स्तर पर बहुविकल्पीय विज्ञान प्रश्न शामिल हैं। डेटासेट को दो उपसमुच्चयों में विभाजित किया गया है: एक आसान सेट और एक चुनौती सेट, जिसमें बाद वाले में ऐसे प्रश्न शामिल हैं जो मौजूदा AI मॉडलों के लिए सही उत्तर देने में विशेष रूप से कठिन हैं। ARC मशीन समझ और तर्क में प्रगति को मापने के लिए कृत्रिम बुद्धिमत्ता के क्षेत्र में एक मानक संदर्भ बिंदु बन गया है।
ARC को 2018 में AI2 के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिसमें पीटर क्लार्क, आइजैक काउहे, ओरेन एत्ज़ियोनी, तुषार खोट, आशीष सभरवाल, कैरिसा शोएनिक और ओयविंड टैफजॉर्ड शामिल थे। बेंचमार्क को पहले के डेटासेट की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर मॉडलों को वास्तविक तर्क के बजाय सांख्यिकीय संकेतों का शोषण करने की अनुमति देते थे। प्रश्न प्राथमिक विद्यालय के विज्ञान परीक्षाओं से लिए गए हैं और भौतिकी, रसायन विज्ञान, जीव विज्ञान और पृथ्वी विज्ञान जैसे विषयों को कवर करते हैं। प्रत्येक प्रश्न में चार उत्तर विकल्प शामिल हैं, और सही उत्तर प्रशिक्षण और मूल्यांकन उद्देश्यों के लिए डेटासेट में प्रदान किया गया है।
चुनौती सेट बेंचमार्क का प्राथमिक फोकस है। इसमें ऐसे प्रश्न शामिल हैं जिन्हें सरल पुनर्प्राप्ति या पैटर्न मिलान द्वारा आसानी से उत्तर नहीं दिया जा सकता है, जिसके लिए वैज्ञानिक अवधारणाओं की गहरी अनुमान और समझ की आवश्यकता होती है। मूल पेपर में, लेखकों ने बताया कि ट्रांसफॉर्मर वास्तुकला पर आधारित एक मजबूत तंत्रिका मॉडल ने चुनौती सेट पर केवल लगभग 53% सटीकता हासिल की, जबकि आसान सेट पर 80% से अधिक थी। इस अंतर ने चुनौती सेट की कठिनाई को उजागर किया और मशीन लर्निंग और डीप लर्निंग में बाद के शोध को प्रेरित किया।
डेटासेट संरचना और निर्माण
ARC में कुल 7,787 विज्ञान प्रश्न हैं, जिनमें आसान सेट में 4,787 और चुनौती सेट में 3,000 शामिल हैं। प्रश्न सार्वजनिक रूप से उपलब्ध प्राथमिक विद्यालय के विज्ञान परीक्षाओं से प्राप्त किए गए हैं, जिनमें न्यूयॉर्क राज्य रीजेंट्स परीक्षा और अन्य मानकीकृत परीक्षण शामिल हैं। डेटासेट में प्रश्न पाठ और चार उत्तर विकल्प, साथ ही सही उत्तर शामिल हैं। प्रश्नों को बाहरी ज्ञान के बिना उत्तर देने योग्य बनाने के लिए डिज़ाइन किया गया है, जो आमतौर पर प्राथमिक और मध्य विद्यालय की विज्ञान कक्षाओं में पढ़ाया जाता है।
निर्माण प्रक्रिया में उन प्रश्नों को फ़िल्टर करना शामिल था जिन्हें सरल शब्द मिलान या पुनर्प्राप्ति द्वारा उत्तर दिया जा सकता था, जिन्हें आसान सेट में सौंपा गया था। शेष प्रश्न, जिनके लिए अधिक जटिल तर्क की आवश्यकता थी, चुनौती सेट का गठन करते थे। लेखकों ने कुछ प्रश्नों के लिए "सहायक तथ्यों" का एक सेट भी प्रदान किया, जो प्रासंगिक पृष्ठभूमि ज्ञान प्रदान करने वाले छोटे कथन हैं, लेकिन ये प्रश्न का सही उत्तर देने के लिए हमेशा पर्याप्त नहीं होते हैं।
मूल्यांकन और प्रभाव
ARC को AI प्रणालियों के मूल्यांकन के लिए एक बेंचमार्क के रूप में व्यापक रूप से अपनाया गया है, विशेष रूप से प्रश्न उत्तर और तर्क के क्षेत्रों में। इसका उपयोग अक्सर SQuAD और GLUE जैसे अन्य बेंचमार्क के साथ बड़े भाषा मॉडल की क्षमताओं का आकलन करने के लिए किया जाता है। चुनौती सेट एक कठिन परीक्षण साबित हुआ है: यहां तक कि अत्याधुनिक मॉडल, जिनमें तंत्रिका नेटवर्क वास्तुकला और ट्रांसफॉर्मर पर आधारित शामिल हैं, मानव प्रदर्शन को पार करने में संघर्ष कर रहे हैं, जो लगभग 90% सटीकता पर अनुमानित है। 2024 तक, चुनौती सेट पर सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियों ने उच्च 80 के दशक में सटीकता हासिल की है, लेकिन बेंचमार्क शोध का एक सक्रिय क्षेत्र बना हुआ है।
ARC ने मशीन लर्निंग में नई तकनीकों के विकास को भी प्रभावित किया है, जैसे पाठ्यक्रम-आधारित लर्निंग और तर्क में सुधार के लिए डेटा-वृद्धि का उपयोग। बेंचमार्क का उपयोग प्रमुख AI अनुसंधान संगठनों, जिनमें ओपनएआई, एंथ्रोपिक और गूगल-डीपमाइंड शामिल हैं, के मॉडलों का मूल्यांकन करने के लिए किया गया है, और जनरेटिव एआई प्रणालियों के विकास में एक प्रमुख मीट्रिक रहा है।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, ARC को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि डेटासेट बहुत संकीर्ण है, केवल प्राथमिक विद्यालय के विज्ञान पर केंद्रित है, और अन्य डोमेन में सामान्यीकृत नहीं हो सकता है। अन्य लोगों ने नोट किया है कि चुनौती सेट को उत्तर विकल्पों में सांख्यिकीय नियमितताओं का शोषण करने वाले मॉडलों द्वारा "गेम" किया जा सकता है, हालांकि डेटासेट को ऐसे शॉर्टकट को कम करने के लिए डिज़ाइन किया गया था। इसके अतिरिक्त, कुछ प्रश्नों के लिए प्रदान किए गए सहायक तथ्य हमेशा पूर्ण नहीं होते हैं, जिससे यह मूल्यांकन करना मुश्किल हो सकता है कि कोई मॉडल वास्तव में तर्क कर रहा है या केवल पैटर्न याद कर रहा है।
एक और सीमा यह है कि ARC को प्रश्न पाठ से परे बहु-चरणीय तर्क या बाहरी ज्ञान के एकीकरण की आवश्यकता नहीं होती है, जो अधिक उन्नत तर्क क्षमताओं को मापने की इसकी क्षमता को सीमित करता है। परिणामस्वरूप, कुछ शोधकर्ताओं ने अधिक चुनौतीपूर्ण बेंचमार्क प्रस्तावित किए हैं, जैसे MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) डेटासेट, जो विषयों और कठिनाई स्तरों की एक व्यापक श्रृंखला को कवर करता है।
भविष्य की दिशाएं
ARC AI अनुसंधान समुदाय के लिए एक मूल्यवान उपकरण बना हुआ है, और इसका उपयोग नए मॉडलों और तकनीकों के मूल्यांकन के लिए आधार रेखा के रूप में जारी रहने की संभावना है। भविष्य के काम में अधिक विविध प्रश्न प्रकारों को शामिल करने के लिए डेटासेट का विस्तार करना या तर्क का बेहतर आकलन करने के लिए उत्तरों के लिए स्पष्टीकरण शामिल करना शामिल हो सकता है। बेंचमार्क मानव और मशीन तर्क के बीच की खाई की याद दिलाता है, जो कृत्रिम बुद्धिमत्ता में उस खाई को बंद करने के लिए चल रहे प्रयासों को प्रेरित करता है।
संक्षेप में, ARC AI अनुसंधान में एक मौलिक बेंचमार्क है, जो तर्क क्षमताओं के लिए एक चुनौतीपूर्ण परीक्षण प्रदान करता है। इसके आसान और चुनौती सेट मॉडल प्रदर्शन का एक सूक्ष्म दृष्टिकोण प्रदान करते हैं, और इसका प्रभाव क्षेत्र में नए एल्गोरिदम और वास्तुकला के विकास तक फैला हुआ है।