अंग्रेज़ी से अनुवादित

MATH डेटासेट AMC, AIME और अन्य प्रतियोगिताओं से 12,500 प्रतियोगिता-स्तरीय गणित समस्याओं का एक बेंचमार्क है, जिसका उपयोग बड़े भाषा मॉडल और AI प्रणालियों की गणितीय तर्क क्षमता का मूल्यांकन करने के लिए किया जाता है।

MATH डेटासेट 12,500 गणितीय समस्याओं का एक बेंचमार्क संग्रह है, जो हाई-स्कूल स्तर की प्रतियोगिताओं से लिया गया है, जिनमें अमेरिकन मैथमेटिक्स कॉम्पिटिशन (AMC), अमेरिकन इनविटेशनल मैथमेटिक्स एग्जामिनेशन (AIME), और मैथमेटिकल ओलंपियाड प्रोग्राम शामिल हैं। इसे 2021 में OpenAI के शोधकर्ताओं द्वारा बड़े भाषा मॉडल और अन्य AI प्रणालियों की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए पेश किया गया था। प्रत्येक समस्या के साथ एक चरण-दर-चरण समाधान दिया गया है, और इसे सात विषय क्षेत्रों में वर्गीकृत किया गया है: बीजगणित, गिनती और संभाव्यता, ज्यामिति, मध्यवर्ती बीजगणित, संख्या सिद्धांत, प्रारंभिक बीजगणित, और प्रारंभिक कलन। यह डेटासेट स्वचालित गणितीय समस्या समाधान में प्रगति मापने के लिए एक मानक बेंचमार्क के रूप में व्यापक रूप से उपयोग किया जाता है, विशेष रूप से ट्रांसफॉर्मर-आधारित मॉडल के लिए।

यह डेटासेट पहले के बेंचमार्क की सीमाओं को संबोधित करने के लिए बनाया गया था, जो सरल अंकगणित या पैटर्न पहचान पर केंद्रित थे। MATH डेटासेट की समस्याओं के लिए बहु-चरणीय तर्क, प्रतीकात्मक हेरफेर, और गणितीय अवधारणाओं की समझ की आवश्यकता होती है, जिससे यह AI प्रणालियों के लिए एक चुनौतीपूर्ण परीक्षण बन जाता है। समस्याएं LaTeX प्रारूप में प्रस्तुत की जाती हैं, और समाधान प्राकृतिक भाषा शैली में लिखे जाते हैं, जिससे मॉडल अंतिम उत्तर और व्याख्यात्मक तर्क दोनों उत्पन्न कर सकते हैं। यह डेटासेट सार्वजनिक रूप से उपलब्ध है और विभिन्न मॉडल आर्किटेक्चर और प्रशिक्षण दृष्टिकोणों के प्रदर्शन की तुलना करने के लिए कई शोध अध्ययनों में उपयोग किया गया है।

डिज़ाइन और संरचना

MATH डेटासेट में 12,500 समस्याएं हैं, जो 7,500 समस्याओं के प्रशिक्षण सेट और 5,000 समस्याओं के परीक्षण सेट में विभाजित हैं। प्रत्येक समस्या को 1 से 5 तक की कठिनाई स्तर के साथ टैग किया गया है, जहां स्तर 1 सबसे आसान समस्याओं का प्रतिनिधित्व करता है और स्तर 5 सबसे चुनौतीपूर्ण। डेटासेट सात अलग-अलग विषय क्षेत्रों को कवर करता है, जिसमें प्रत्येक समस्या को ठीक एक श्रेणी में सौंपा गया है। समस्याएं वास्तविक प्रतियोगिताओं से ली गई हैं, जिससे यह सुनिश्चित होता है कि वे गैर-तुच्छ हैं और वास्तविक गणितीय अंतर्दृष्टि की आवश्यकता होती है। प्रदान किए गए समाधान मानव-लिखित हैं और मॉडल आउटपुट का मूल्यांकन करने के लिए संदर्भ उत्तर के रूप में कार्य करते हैं।

डेटासेट को न केवल अंतिम उत्तर बल्कि तर्क प्रक्रिया का परीक्षण करने के लिए डिज़ाइन किया गया था। मूल्यांकन में, मॉडल को आमतौर पर एक विशिष्ट प्रारूप में अंतिम उत्तर उत्पन्न करने के लिए कहा जाता है, और उनके प्रतिक्रियाओं की तुलना ग्राउंड ट्रुथ से की जाती है। कुछ मूल्यांकन प्रोटोकॉल उत्पन्न तर्क चरणों की गुणवत्ता का भी आकलन करते हैं, हालांकि यह कम मानकीकृत है। कठिनाई स्तर शोधकर्ताओं को विभिन्न जटिलता श्रेणियों में मॉडल प्रदर्शन का विश्लेषण करने की अनुमति देते हैं, जिससे गणित के विशिष्ट क्षेत्रों में ताकत और कमजोरियां उजागर होती हैं।

मूल्यांकन और प्रदर्शन

MATH डेटासेट का उपयोग करके प्रारंभिक मूल्यांकन से पता चला कि समकालीन मॉडल खराब प्रदर्शन करते थे, पूर्ण परीक्षण सेट पर सटीकता दर 10% से कम थी। उदाहरण के लिए, OpenAI द्वारा विकसित एक बड़ा भाषा मॉडल GPT-3, डेटासेट पर केवल लगभग 5% सटीकता प्राप्त कर सका, जो समस्याओं की कठिनाई को उजागर करता है। बाद के मॉडल, जैसे कि गहन शिक्षण तकनीकों और तंत्रिका नेटवर्क आर्किटेक्चर का उपयोग करने वाले, में काफी सुधार हुआ है, लेकिन 2024 तक अत्याधुनिक प्रणालियां भी सबसे कठिन समस्याओं से जूझती हैं। यह डेटासेट क्षेत्र में एक प्रमुख बेंचमार्क बन गया है, जिसमें कई शोध पत्र गणितीय तर्क में प्रगति प्रदर्शित करने के लिए इस पर परिणाम रिपोर्ट करते हैं।

बेंचमार्क का उपयोग चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकों की प्रभावशीलता का अध्ययन करने के लिए भी किया गया है, जहां मॉडल को अंतिम उत्तर पर पहुंचने से पहले मध्यवर्ती तर्क चरण उत्पन्न करने के लिए प्रोत्साहित किया जाता है। यह दृष्टिकोण MATH डेटासेट पर प्रदर्शन में सुधार करने के लिए दिखाया गया है, विशेष रूप से बड़े मॉडल के लिए। इसके अतिरिक्त, डेटासेट का उपयोग सिंथेटिक डेटा पर प्रशिक्षण, सुदृढीकरण शिक्षण, और तर्क क्षमताओं को बढ़ाने के उद्देश्य से अन्य तरीकों के प्रभाव का मूल्यांकन करने के लिए किया गया है।

प्रभाव और उपयोग

MATH डेटासेट का गणितीय समस्या समाधान के लिए AI प्रणालियों के विकास पर महत्वपूर्ण प्रभाव पड़ा है। इसे प्रमुख शोध संगठनों द्वारा अपनाया गया है, जिनमें Google DeepMind, Anthropic, और MIT CSAIL और Stanford AI Lab जैसे शैक्षणिक संस्थान शामिल हैं। डेटासेट का उपयोग अक्सर GSM8K जैसे अन्य बेंचमार्क के साथ संयोजन में किया जाता है, ताकि गणितीय कौशल का व्यापक मूल्यांकन प्रदान किया जा सके। इसे प्रशिक्षण पाइपलाइनों में भी एकीकृत किया गया है, जहां मॉडल को गणितीय कार्यों पर उनके प्रदर्शन में सुधार करने के लिए प्रशिक्षण सेट पर फाइन-ट्यून किया जाता है।

डेटासेट ने व्युत्पन्न बेंचमार्क और एक्सटेंशन के निर्माण को प्रेरित किया है, जैसे MATH-500, तेजी से मूल्यांकन के लिए उपयोग किए जाने वाले 500 समस्याओं का एक उपसमूह, और MATH-SHEPHERD, जो मॉडल-जनित समाधानों को सत्यापित करने पर केंद्रित है। इन एक्सटेंशनों ने मूल डेटासेट की उपयोगिता को और बढ़ा दिया है। MATH डेटासेट का उपयोग शैक्षिक संदर्भों में भी किया जाता है, जहां यह AI ट्यूटरिंग सिस्टम और स्वचालित ग्रेडिंग टूल का परीक्षण करने के लिए एक संसाधन के रूप में कार्य करता है।

सीमाएं और आलोचनाएं

व्यापक उपयोग के बावजूद, MATH डेटासेट को कुछ आलोचनाओं का सामना करना पड़ा है। एक सीमा यह है कि समस्याएं विशेष रूप से पश्चिमी गणित प्रतियोगिताओं से ली गई हैं, जो सांस्कृतिक पूर्वाग्रह पेश कर सकती हैं। इसके अतिरिक्त, डेटासेट स्थिर है, जिसका अर्थ है कि मॉडल समाधानों को याद कर सकते हैं यदि उन्हें समान समस्याओं पर प्रशिक्षित किया जाता है, हालांकि समस्याओं की कठिनाई इसे कम चिंता का विषय बनाती है। कुछ शोधकर्ताओं ने नोट किया है कि डेटासेट प्रतीकात्मक हेरफेर पर केंद्रित है और गणितीय तर्क की व्यापकता को पूरी तरह से कैप्चर नहीं कर सकता है, जैसे ज्यामितीय अंतर्ज्ञान या वास्तविक दुनिया की समस्या समाधान। 2025 तक, इन सीमाओं को संबोधित करने वाले अधिक विविध और गतिशील बेंचमार्क बनाने के प्रयास चल रहे हैं।

यह भी देखें

संदर्भ

MATH डेटासेट को डैन हेंड्रिक्स और सहयोगियों द्वारा 2021 में प्रकाशित पेपर "Measuring Mathematical Problem Solving With the MATH Dataset" में पेश किया गया था। डेटासेट OpenAI GitHub रिपॉजिटरी से डाउनलोड के लिए उपलब्ध है और शोध उपयोग के लिए एक अनुमेय लाइसेंस के तहत लाइसेंस प्राप्त है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·mathematics·dataset·ai-evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास