अंग्रेज़ी से अनुवादित

ARC-AGI (Abstraction and Reasoning Corpus) फ्रांकोइस चोलेट द्वारा बनाया गया एक बेंचमार्क है, जो एआई प्रणालियों में अमूर्त तर्क और सामान्यीकरण का परीक्षण करने के लिए नए दृश्य पहेलियों के माध्यम से किया जाता है, जिन्हें स्मृति-आधारित समाधानों का विरोध करने के लिए डिज़ाइन किया गया है।

ARC-AGI, जिसका पूर्ण रूप Abstraction and Reasoning Corpus for Artificial General Intelligence है, एक बेंचमार्क है जिसे François Chollet द्वारा बनाया गया था, जो Keras डीप लर्निंग फ्रेमवर्क के निर्माता हैं, और पहली बार 2019 में जारी किया गया था। इसमें दृश्य ग्रिड पहेलियाँ शामिल हैं, जिनमें एक समाधानकर्ता को इनपुट-आउटपुट ग्रिड जोड़ों के कुछ उदाहरणों से एक अमूर्त परिवर्तन नियम का अनुमान लगाना होता है और फिर उस नियम को एक नए परीक्षण ग्रिड पर सही ढंग से लागू करना होता है।

उद्देश्य

ARC-AGI को स्पष्ट रूप से इस अवलोकन के जवाब में डिज़ाइन किया गया था कि कई AI बेंचमार्क, चाहे वे कितने भी कठिन हों, वास्तविक तर्क या सामान्यीकरण के बजाय बड़े पैमाने पर पैटर्न मिलान या रटने से काफी हद तक हल किए जा सकते हैं। Chollet ने अपने साथ के पेपर "On the Measure of Intelligence" में तर्क दिया कि बुद्धिमत्ता को किसी निश्चित, सीखने योग्य कौशल पर कच्चे प्रदर्शन के बजाय नए कार्यों पर कौशल अर्जन की दक्षता से मापा जाना चाहिए, और ARC-AGI की पहेलियों को इस तरह डिज़ाइन किया कि प्रत्येक के लिए एक अलग, सामान्यीकरण योग्य अमूर्तता की आवश्यकता हो, जो मनुष्यों द्वारा जल्दी अर्जित की जाने वाली अवधारणाओं जैसे समरूपता, गिनती, समावेशन और वस्तु स्थायित्व पर आधारित हों, और जानबूझकर ऐसी चुनी गई हों जिन्हें रटे हुए पैटर्न से शॉर्टकट करना कठिन हो।

AI प्रणालियों के लिए कठिनाई

अपनी रिलीज़ के वर्षों बाद भी, ARC-AGI शास्त्रीय मशीन लर्निंग और शुरुआती बड़े भाषा मॉडल दोनों के लिए उल्लेखनीय रूप से प्रतिरोधी साबित हुआ, यहाँ तक कि सक्षम GPT-4-श्रेणी के मॉडल भी सार्वजनिक मूल्यांकन सेट का केवल एक छोटा सा हिस्सा हल कर पाए, जबकि अधिकांश मनुष्य, जिनमें बच्चे भी शामिल हैं, बिना विशेष प्रशिक्षण के अधिकांश पहेलियाँ हल कर लेते हैं। पारंपरिक बेंचमार्क जैसे MMLU पर मजबूत प्रदर्शन और ARC-AGI पर कमजोर प्रदर्शन के बीच यह अंतर अक्सर इस बात के प्रमाण के रूप में उद्धृत किया जाता था कि गुणात्मक रूप से भिन्न तर्क क्षमता के बिना, अकेले स्केलिंग मानव-समान सामान्यीकरण तक पहुँचने के लिए पर्याप्त नहीं थी।

तर्क मॉडल के साथ प्रगति

यह अंतर तर्क मॉडल के उद्भव के साथ काफी कम हो गया, जो विस्तारित परीक्षण-समय कम्प्यूट और चेन-ऑफ-थॉट-शैली खोज का उपयोग करते हैं, विशेष रूप से OpenAI के o1 और इसके उत्तराधिकारियों ने, जिन्होंने पिछले गैर-तर्क मॉडल की तुलना में काफी अधिक ARC-AGI स्कोर प्राप्त किए, हालाँकि अक्सर प्रति पहेली काफी अधिक अनुमान लागत पर। इस प्रगति को कुछ लोगों ने इस बात के प्रमाण के रूप में लिया कि प्रीट्रेनिंग स्केल अकेले नहीं, बल्कि अनुमान समय पर खोज और विचार-विमर्श, अधिक सामान्य तर्क की ओर एक सार्थक मार्ग था, जबकि अन्य ने चेतावनी दी कि यह लाभ आंशिक रूप से मॉडलों द्वारा सार्वजनिक लीडरबोर्ड डेटा से ARC-AGI-जैसे पहेली पैटर्न सीखने को दर्शाता है, न कि पूरी तरह से सामान्य तर्क सुधार को।

प्रारूप और पुरस्कार

ARC-AGI पहेलियों को जानबूझकर आंशिक रूप से निजी रखा जाता है, जिसमें एक गैर-प्रकाशित होल्ड-आउट मूल्यांकन सेट होता है, विशेष रूप से उन प्रशिक्षण-डेटा संदूषण]] समस्याओं को सीमित करने के लिए जिन्होंने पहले के स्थिर बेंचमार्क को कमजोर किया था। एक संबद्ध सार्वजनिक प्रतियोगिता, ARC Prize, होल्ड-आउट सेट पर मजबूत प्रदर्शन हासिल करने वाली प्रणालियों के लिए नकद पुरस्कार प्रदान करती है, जो शैक्षणिक और उद्योग दोनों प्रतिभागियों को आकर्षित करती है और समय-समय पर कठिन उत्तराधिकारी संस्करण जारी करती है, जिनमें ARC-AGI-2 भी शामिल है, क्योंकि पहले के संस्करण संतृप्ति के करीब पहुँच गए थे।

महत्व

ARC-AGI का उपयोग अक्सर AGI समयरेखा और इस बारे में बहसों में किया जाता है कि क्या वर्तमान डीप लर्निंग दृष्टिकोण सामान्य बुद्धिमत्ता तक पहुँचने के लिए पर्याप्त हैं, ठीक इसलिए क्योंकि इसका डिज़ाइन लक्ष्य, रटने का विरोध करना जबकि मनुष्यों के लिए आसान रहना, इसे एक दुर्लभ बेंचमार्क बनाता है जहाँ मानव और AI प्रदर्शन के बीच बड़े अंतर अत्यधिक सक्षम बड़े भाषा मॉडल के युग में भी बने रहे। यह वास्तविक तर्क प्रगति के सबसे बारीकी से देखे जाने वाले संकेतकों में से एक बना हुआ है, जो उन बेंचमार्क से अलग है जो अकेले स्केल और डेटा के प्रति अधिक संवेदनशील हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-evaluation·artificial-general-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास