अंग्रेज़ी से अनुवादित

ARC चैलेंज सेट, AI2 रीज़निंग चैलेंज बेंचमार्क का एक कठिन उपसमुच्चय है, जिसे जटिल तर्क के साथ वैज्ञानिक प्रश्न-उत्तर का परीक्षण करने के लिए डिज़ाइन किया गया है। इसमें ऐसे प्रश्न शामिल हैं जिनके लिए सरल पुनर्प्राप्ति से परे गहन अनुमान की आवश्यकता होती है, अक्सर ऐसे उत्तर विकल्पों के साथ जो सभी प्रशंसनीय होते हैं।

ARC चैलेंज सेट, AI2 रीज़निंग चैलेंज (ARC) बेंचमार्क का एक चुनिंदा उपसमुच्चय है, जिसे 2018 में एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस द्वारा पेश किया गया था। इसमें कक्षा 3 से 9 तक के मानकीकृत परीक्षणों के स्तर पर बहुविकल्पीय विज्ञान प्रश्न शामिल हैं। चैलेंज सेट को विशेष रूप से कृत्रिम बुद्धिमत्ता प्रणालियों के लिए कठिन बनाने के लिए डिज़ाइन किया गया है, क्योंकि यह उन प्रश्नों को बाहर करता है जिन्हें सरल पुनर्प्राप्ति या पैटर्न मिलान के माध्यम से हल किया जा सकता है, और इसके बजाय उन पर ध्यान केंद्रित करता है जिनके लिए बहु-चरणीय तर्क और वैज्ञानिक अवधारणाओं की गहरी समझ की आवश्यकता होती है।

ARC ईज़ी सेट के विपरीत, जिसमें ऐसे प्रश्न शामिल हैं जो अधिक सीधे होते हैं और अक्सर सूचना पुनर्प्राप्ति द्वारा हल किए जा सकते हैं, चैलेंज सेट में ऐसे प्रश्न शामिल हैं जहाँ सभी उत्तर विकल्प प्रशंसनीय होते हैं, जिससे यह मशीन लर्निंग मॉडल के लिए एक कठोर परीक्षण बन जाता है। यह बेंचमार्क AI प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए बनाया गया था, विशेष रूप से प्राकृतिक भाषा समझ और वैज्ञानिक ज्ञान अनुप्रयोग के क्षेत्र में।

बेंचमार्क संरचना

ARC चैलेंज सेट में 2,590 प्रश्न शामिल हैं, जिनमें से प्रत्येक में चार उत्तर विकल्प और एक सही उत्तर होता है। प्रश्न विभिन्न विज्ञान विषयों से लिए गए हैं, जिनमें भौतिकी, रसायन विज्ञान, जीव विज्ञान और पृथ्वी विज्ञान शामिल हैं। डेटासेट को एक प्रशिक्षण सेट, एक विकास सेट और एक परीक्षण सेट में विभाजित किया गया है, जिसमें परीक्षण सेट में 1,172 प्रश्न शामिल हैं। प्रश्नों को सामान्य ज्ञान तर्क और वैज्ञानिक सिद्धांतों के अनुप्रयोग की आवश्यकता के लिए डिज़ाइन किया गया है, न कि तथ्यों को याद करने की।

मूल्यांकन और प्रदर्शन

जब बेंचमार्क जारी किया गया था, उस समय के अत्याधुनिक मॉडल, जिनमें ट्रांसफॉर्मर आर्किटेक्चर पर आधारित मॉडल शामिल थे, ने चैलेंज सेट पर 60% से कम सटीकता स्कोर हासिल किया। यह मानव प्रदर्शन से काफी कम था, जो 90% से अधिक अनुमानित है। चैलेंज सेट की कठिनाई ने इसे बड़े भाषा मॉडल अनुसंधान में प्रगति मापने के लिए एक मानक बेंचमार्क बना दिया है। बाद के मॉडल, जैसे कि ओपनएआई, एंथ्रोपिक और गूगल डीपमाइंड द्वारा विकसित, ने प्रदर्शन में सुधार किया है, लेकिन चैलेंज सेट उन्नत तर्क कार्यों के लिए एक चुनौतीपूर्ण बेंचमार्क बना हुआ है।

AI अनुसंधान में महत्व

ARC चैलेंज सेट गहन शिक्षण और तंत्रिका नेटवर्क अनुसंधान के क्षेत्र में व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन उपकरण बन गया है। इसका अक्सर शैक्षणिक पत्रों में उल्लेख किया जाता है और विभिन्न मॉडलों की तर्क क्षमताओं की तुलना करने के लिए एक बेंचमार्क के रूप में उपयोग किया जाता है। बेंचमार्क ने अधिक जटिल तर्क कार्यों के विकास को भी प्रेरित किया है और पाठ्यक्रम-शिक्षण और डेटा-वृद्धि जैसी तकनीकों की उन्नति में योगदान दिया है। शोधकर्ता वर्तमान AI प्रणालियों की सीमाओं की पहचान करने के लिए चैलेंज सेट का उपयोग करते हैं, विशेष रूप से मल्टी-हेड अटेंशन और क्रॉस-अटेंशन तंत्र जैसे क्षेत्रों में, जो जटिल प्रश्न-उत्तर कार्यों को संभालने के लिए महत्वपूर्ण हैं।

सीमाएँ और आलोचनाएँ

कुछ शोधकर्ताओं ने नोट किया है कि ARC चैलेंज सेट, हालांकि कठिन है, मानव तर्क की व्यापकता को पूरी तरह से पकड़ नहीं सकता है। प्रश्न प्राथमिक और मध्य विद्यालय विज्ञान तक सीमित हैं, और प्रारूप बहुविकल्पीय तक सीमित है। इसके अतिरिक्त, बेंचमार्क की आलोचना की गई है कि समान प्रश्न प्रकारों पर प्रशिक्षित मॉडलों द्वारा इसे ओवरफिट किए जाने की संभावना है। इन सीमाओं के बावजूद, चैलेंज सेट AI तर्क क्षमताओं के मूल्यांकन के लिए एक मूल्यवान संसाधन बना हुआ है और मॉडल प्रदर्शन का व्यापक मूल्यांकन प्रदान करने के लिए अक्सर अन्य बेंचमार्क के साथ संयोजन में उपयोग किया जाता है।

भविष्य की दिशाएँ

जैसे-जैसे AI अनुसंधान विकसित होता जा रहा है, ARC चैलेंज सेट तर्क क्षमताओं के परीक्षण के लिए एक प्रासंगिक बेंचमार्क बने रहने की संभावना है। जनरेटिव एआई और आरएलएआईएफ तकनीकों पर आधारित नए मॉडलों का मूल्यांकन इस बेंचमार्क के खिलाफ किया जा रहा है ताकि AI प्रणालियाँ जो हासिल कर सकती हैं उसकी सीमाओं को आगे बढ़ाया जा सके। चैलेंज सेट से प्राप्त अंतर्दृष्टि अधिक मजबूत और व्याख्या योग्य AI प्रणालियों के विकास को भी सूचित कर रही है, जिनमें शिक्षा, वैज्ञानिक अनुसंधान और अन्य क्षेत्रों में संभावित अनुप्रयोग हैं जहाँ जटिल तर्क की आवश्यकता होती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-benchmark·reasoning·question-answering·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास