अंग्रेज़ी से अनुवादित

MATH 2025 एक बेंचमार्क डेटासेट है जिसमें 5,000 प्रतियोगिता-स्तरीय गणित समस्याएं शामिल हैं, जिसे 2025 में बड़े भाषा मॉडलों की तर्क क्षमताओं का मूल्यांकन करने के लिए पेश किया गया था, जिसमें एक छिपा हुआ परीक्षण सेट और एक त्रैमासिक लीडरबोर्ड है।

MATH 2025 एक बेंचमार्क डेटासेट है जिसे बड़े भाषा मॉडल (LLMs) की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2025 में जारी, इसमें बीजगणित, ज्यामिति, संख्या सिद्धांत, कॉम्बिनेटरिक्स और कैलकुलस को कवर करने वाली 5,000 प्रतियोगिता-शैली की समस्याएं शामिल हैं। पहले के बेंचमार्क के विपरीत, MATH 2025 में एक छिपा हुआ परीक्षण सेट शामिल है जो सार्वजनिक रूप से सुलभ नहीं है, जिसका उद्देश्य ओवरफिटिंग को कम करना और सामान्यीकरण का अधिक मजबूत माप प्रदान करना है। बेंचमार्क को शैक्षणिक और उद्योग शोधकर्ताओं के एक संघ द्वारा बनाए रखा जाता है, जिसमें AI तर्क में प्रगति को ट्रैक करने के लिए त्रैमासिक रूप से अपडेट की जाने वाली लीडरबोर्ड होती है।

डेटासेट को 2025 की शुरुआत में मूल MATH बेंचमार्क (2021) के उत्तराधिकारी के रूप में पेश किया गया था, जिसमें 12,500 समस्याएं थीं। MATH 2025 एक छोटे लेकिन अधिक चुनौतीपूर्ण सेट पर केंद्रित है, जिसमें हाल के ओलंपियाड-शैली प्रतियोगिताओं और भाग लेने वाले संस्थानों के नए योगदान से ली गई समस्याएं शामिल हैं। प्रत्येक समस्या को चरण-दर-चरण समाधान के साथ जोड़ा गया है, जिससे विस्तृत त्रुटि विश्लेषण संभव होता है। छिपा हुआ परीक्षण सेट एक API के माध्यम से नियंत्रित किया जाता है, जो सीधे पहुंच को रोकता है और निष्पक्ष मूल्यांकन को प्रोत्साहित करता है। मॉडल को सटीक-मिलान सटीकता पर स्कोर किया जाता है, जिसमें सही मध्यवर्ती चरणों के लिए आंशिक क्रेडिट दिया जाता है।

समस्या संरचना और कठिनाई

MATH 2025 में प्रति विषय क्षेत्र में 1,000 समस्याएं शामिल हैं: बीजगणित, ज्यामिति, संख्या सिद्धांत, कॉम्बिनेटरिक्स और कैलकुलस। कठिनाई स्तर हाई-स्कूल ओलंपियाड से स्नातक स्तर तक होते हैं, जिसमें औसत समस्या के लिए कई तर्क चरणों की आवश्यकता होती है। उदाहरण के लिए, एक नमूना बीजगणित समस्या पूछती है: "समीकरण x^5 - 5x^3 + 4x = 0 के सभी वास्तविक मूलों का योग ज्ञात करें।" एक ज्यामिति समस्या में चक्रीय चतुर्भुज गुणधर्म को सिद्ध करना शामिल है। समस्याओं को स्पष्ट रूप से डिज़ाइन किया गया है, जिसमें अद्वितीय संख्यात्मक या लघु-रूप उत्तर होते हैं।

मूल्यांकन पद्धति

मॉडल का मूल्यांकन API के माध्यम से किया जाता है, जो सटीक उत्तर मिलान के आधार पर स्कोर लौटाता है। लीडरबोर्ड, जो त्रैमासिक (मार्च, जून, सितंबर, दिसंबर) अपडेट होता है, समग्र सटीकता द्वारा प्रस्तुतियों को रैंक करता है। पहली तिमाही तक, शीर्ष-प्रदर्शन करने वाले मॉडल ने 72% सटीकता हासिल की, जबकि मानव विशेषज्ञ बेसलाइन लगभग 85% स्कोर करते थे। बेंचमार्क प्रति-विषय विवरण भी रिपोर्ट करता है, जिससे पता चलता है कि ज्यामिति सबसे कठिन श्रेणी बनी हुई है, जिसकी औसत सटीकता बीजगणित से 15% कम है। डेटा संदूषण को रोकने के लिए, परीक्षण सेट हर छह महीने में घुमाया जाता है, जिसमें चल रही प्रतियोगिताओं से नई समस्याएं जोड़ी जाती हैं।

AI अनुसंधान पर प्रभाव

MATH 2025 बड़े भाषा मॉडल में तर्क का मूल्यांकन करने के लिए एक मानक संदर्भ बन गया है। इसने वर्तमान दृष्टिकोणों में सीमाओं को उजागर किया है, विशेष रूप से बहु-चरण निगमन और प्रतीकात्मक हेरफेर में। कई OpenAI और Google DeepMind मॉडल ने प्रशिक्षण को निर्देशित करने के लिए बेंचमार्क का उपयोग किया है, जिसमें पाठ्यक्रम सीखने और RLHF जैसी तकनीकों को शामिल किया गया है। बेंचमार्क ने चेन-ऑफ-थॉट प्रॉम्प्टिंग में अनुसंधान को भी प्रेरित किया है, जो जटिल समस्याओं पर सटीकता को काफी बढ़ाता है।

संबंधित बेंचमार्क और भविष्य की दिशाएं

मूल MATH 2021 बेंचमार्क व्यापक रूप से उपयोग में बना हुआ है, लेकिन MATH 2025 एक अधिक कठोर परीक्षण प्रदान करता है। अन्य संबंधित मूल्यांकनों में GSM8K ग्रेड-स्कूल गणित के लिए और Hendrycks Math प्रतियोगिता समस्याओं के लिए शामिल हैं। MATH 2025 के भविष्य के संस्करणों में अधिक खुले-अंत वाली समस्याएं और स्वचालित प्रमाण सत्यापन शामिल करने की योजना है। बेंचमार्क के पीछे का संघ, जिसमें MIT CSAIL और Stanford AI Lab के शोधकर्ता शामिल हैं, का लक्ष्य 2026 तक डेटासेट को 10,000 समस्याओं तक विस्तारित करना है, जिसमें क्रॉस-अनुशासनात्मक तर्क पर अधिक ध्यान केंद्रित किया जाएगा।

विवाद और सीमाएं

कुछ शोधकर्ताओं ने छिपे हुए परीक्षण सेट की अपारदर्शिता की आलोचना की है, जिससे मॉडल त्रुटियों का निदान करना मुश्किल हो जाता है। अन्य ध्यान देते हैं कि बेंचमार्क अभी भी अप्रत्यक्ष जोखिम के माध्यम से डेटा रिसाव के लिए संवेदनशील हो सकता है। API-नियंत्रित पहुंच भी प्रतिलिपि प्रस्तुत करने योग्यता के बारे में चिंताएं उठाती है, क्योंकि सभी शोधकर्ता बार-बार मूल्यांकन का खर्च नहीं उठा सकते। इन मुद्दों के बावजूद, MATH 2025 को AI मूल्यांकन में एक महत्वपूर्ण कदम के रूप में व्यापक रूप से माना जाता है, जो गणितीय बुद्धिमत्ता का एक चुनौतीपूर्ण और गतिशील परीक्षण प्रदान करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·machine-learning·benchmark·mathematics
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास