अंग्रेज़ी से अनुवादित

SVAMP एक बेंचमार्क डेटासेट है जो AI प्रणालियों में गणित शब्द समस्या समाधान का मूल्यांकन करने के लिए है, जिसमें 1,000 प्राथमिक-स्तरीय समस्याएं शामिल हैं, जिनमें नियंत्रित विविधताएं हैं ताकि सतही संकेतों के प्रति मजबूती का परीक्षण किया जा सके।

SVAMP (सरल विविधताएँ अंकगणितीय गणित शब्द समस्याओं पर) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की प्रारंभिक अंकगणितीय शब्द समस्याओं को हल करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2020 में अर्किल पटेल, सतविक भट्टमिश्रा और नवीन गोयल सहित शोधकर्ताओं द्वारा पेश किया गया, इस डेटासेट में मौजूदा गणित शब्द समस्या डेटासेट से प्राप्त 1,000 समस्याएँ शामिल हैं, जिनमें प्रत्येक समस्या को ऐसी विविधताएँ बनाने के लिए संशोधित किया गया है जो किसी मॉडल की वास्तविक गणितीय तर्क क्षमता का परीक्षण करती हैं, न कि सांख्यिकीय पैटर्न का दोहन करने की उसकी क्षमता का। यह बेंचमार्क Machine learning और Natural language processing के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया है, विशेष रूप से गणितीय कार्यों पर Large language model प्रदर्शन का आकलन करने के लिए।

SVAMP के पीछे प्राथमिक प्रेरणा पहले के गणित शब्द समस्या बेंचमार्क में एक महत्वपूर्ण दोष को संबोधित करना था: मॉडल अक्सर वास्तविक अंकगणितीय तर्क करने के बजाय कुछ संख्याओं या कीवर्ड की उपस्थिति जैसे सतही संकेतों पर भरोसा करके उच्च सटीकता प्राप्त करते थे। SVAMP मूल समस्याओं में नियंत्रित परिवर्तन पेश करता है, जैसे वाक्यों के क्रम को बदलना, विषय या वस्तु को बदलना, या अंतर्निहित गणितीय संरचना को संरक्षित करते हुए संख्याओं को संशोधित करना। यह मॉडलों को समस्या की शब्दार्थ सामग्री से जुड़ने के लिए मजबूर करता है, जिससे बेंचमार्क तर्क क्षमता का अधिक विश्वसनीय संकेतक बन जाता है।

Dataset Construction

SVAMP को चार मौजूदा डेटासेट से समस्याएँ लेकर बनाया गया था: MAWPS, ASDiv-A, और Math23k डेटासेट के दो उपसमूह। निर्माताओं ने 1,000 अद्वितीय समस्याएँ उत्पन्न करने के लिए परिवर्तनों की एक श्रृंखला लागू की, जिनमें से प्रत्येक का एक या दो संक्रियाओं (जोड़, घटाव, गुणा या भाग) से जुड़ा एक अंकगणितीय समाधान है। परिवर्तनों को शब्दार्थ रूप से तटस्थ बनाने के लिए डिज़ाइन किया गया था, जिसका अर्थ है कि वे आवश्यक गणितीय संक्रियाओं को बदले बिना सतही रूप बदलते हैं। उदाहरण के लिए, सेब के बारे में एक समस्या को संतरे शामिल करने के लिए फिर से लिखा जा सकता है, या समस्या का वर्णन करने वाले दो वाक्यों के क्रम को बदला जा सकता है। डेटासेट में 100 समस्याओं का एक सत्यापन विभाजन और 900 समस्याओं का एक परीक्षण विभाजन शामिल है, जिसमें परीक्षण सेट में मूल और संशोधित समस्याओं के बीच कोई ओवरलैप नहीं है।

Evaluation Methodology

SVAMP पर मानक मूल्यांकन किसी मॉडल के अंतिम उत्तर की सटीकता को मापता है, जो एक एकल संख्यात्मक मान है। मॉडलों को आमतौर पर इनपुट के रूप में समस्या पाठ दिया जाता है और उनसे सही संख्या आउटपुट करने की अपेक्षा की जाती है। बेंचमार्क को पैटर्न मिलान पर भरोसा करने वाले मॉडलों के लिए चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया है, क्योंकि विविधताएँ सुनिश्चित करती हैं कि कोई सरल अनुमानी लगातार सही उत्तर नहीं दे सकता। कई प्रकाशित परिणाम SVAMP पर सटीकता को एक प्रमुख मीट्रिक के रूप में रिपोर्ट करते हैं, अक्सर GSM8K और MathQA जैसे अन्य बेंचमार्क के साथ। उदाहरण के लिए, प्रारंभिक Transformer (architecture)-आधारित मॉडलों ने 20-40% की सीमा में सटीकता हासिल की, जबकि चेन-ऑफ-थॉट प्रॉम्प्टिंग वाले हाल के Large language model ने 80% से अधिक सटीकता हासिल की है, हालाँकि बेंचमार्क गणितीय तर्क में प्रगति को मापने के लिए एक संदर्भ बिंदु बना हुआ है।

Significance in AI Research

SVAMP ने अंकगणितीय तर्क के लिए Neural network दृष्टिकोणों की सीमाओं को उजागर करने में एक उल्लेखनीय भूमिका निभाई है। SVAMP का उपयोग करने वाले अध्ययनों से पता चला है कि मॉडल अक्सर तब विफल हो जाते हैं जब समस्या का शब्दांकन थोड़ा बदल दिया जाता है, भले ही गणितीय सामग्री समान हो, जो सामान्यीकरण करने के बजाय प्रशिक्षण पैटर्न को याद करने की प्रवृत्ति को प्रकट करता है। इसने अधिक मजबूत तर्क तकनीकों पर शोध को बढ़ावा दिया है, जिसमें Curriculum Learning, Data Augmentation और विशेष आर्किटेक्चर का विकास शामिल है। बेंचमार्क को अक्सर Artificial intelligence और Deep learning पर पेपरों में उद्धृत किया जाता है, और इसका उपयोग OpenAI, Google DeepMind और Anthropic जैसी प्रमुख प्रयोगशालाओं के साथ-साथ ओपन-सोर्स प्रयासों के मॉडलों का मूल्यांकन करने के लिए किया गया है।

Limitations and Criticisms

अपनी उपयोगिता के बावजूद, SVAMP की सीमाएँ हैं। डेटासेट अपेक्षाकृत छोटा है, केवल 1,000 समस्याओं के साथ, जो मूल्यांकन परिणामों में उच्च भिन्नता पैदा कर सकता है। इसके अतिरिक्त, समस्याएँ प्रारंभिक अंकगणित तक सीमित हैं, इसलिए बेंचमार्क बीजगणित या ज्यामिति जैसे अधिक जटिल गणितीय तर्क का आकलन नहीं करता है। कुछ शोधकर्ताओं ने नोट किया है कि परिवर्तन, हालांकि उपयोगी हैं, वास्तविक दुनिया की शब्द समस्याओं की विविधता को पूरी तरह से कैप्चर नहीं कर सकते हैं। परिणामस्वरूप, SVAMP का उपयोग अक्सर अधिक व्यापक मूल्यांकन प्रदान करने के लिए अन्य बेंचमार्क के साथ किया जाता है। फिर भी, नियंत्रित विविधताओं पर इसका ध्यान इसे मॉडल तर्क में विशिष्ट कमजोरियों को अलग करने के लिए एक मूल्यवान उपकरण बनाता है, और यह क्षेत्र में एक व्यापक रूप से मान्यता प्राप्त मानक बना हुआ है।

See Also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·math-word-problems·natural-language-processing·evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास