अंग्रेज़ी से अनुवादित

MathQA 37,000 बहुविकल्पीय गणित शब्द समस्याओं का एक बड़े पैमाने का डेटासेट है, जिसमें एनोटेटेड ऑपरेशन प्रोग्राम शामिल हैं, जिसे AI प्रणालियों की तर्क क्षमताओं का मूल्यांकन और सुधार करने के लिए डिज़ाइन किया गया है।

MathQA एक बड़े पैमाने का डेटासेट है जिसे 2019 में Amazon और University of California, Santa Barbara के शोधकर्ताओं द्वारा पेश किया गया था। इसमें 37,000 अंग्रेजी बहुविकल्पीय गणित शब्द समस्याएं शामिल हैं, जो सामान्य गणित, भौतिकी और वित्त जैसे विषयों को कवर करती हैं। प्रत्येक समस्या को एक रैखिक प्रोग्राम के साथ एनोटेट किया गया है जो सही उत्तर तक पहुंचने के लिए आवश्यक संचालन के अनुक्रम को निर्दिष्ट करता है। डेटासेट को पहले के डेटासेट जैसे MathQA के पूर्ववर्ती की सीमाओं को संबोधित करने के लिए बनाया गया था, जो सरल अंकगणित पर केंद्रित था, और कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में गणितीय तर्क के लिए अनुसंधान का समर्थन करने के लिए।

MathQA में समस्याएं AQuA डेटासेट से ली गई हैं, लेकिन अधिक विस्तृत और सुसंगत संचालन कार्यक्रमों के साथ पुनः एनोटेट की गई हैं। एनोटेशन में एक पाठ्य व्याख्या, एक औपचारिक रैखिक प्रोग्राम और अंतिम उत्तर शामिल हैं। रैखिक प्रोग्राम एक डोमेन-विशिष्ट भाषा में व्यक्त किए गए हैं जिसमें जोड़, घटाव, गुणा, भाग और तुलना जैसे संचालन शामिल हैं। यह संरचना मॉडल को न केवल अंतिम उत्तर बल्कि मध्यवर्ती तर्क चरणों को भी सीखने की अनुमति देती है।

डेटासेट संरचना

MathQA में प्रत्येक प्रविष्टि में एक समस्या कथन, बहुविकल्पीय विकल्प, सही उत्तर और एक रैखिक प्रोग्राम शामिल होता है। रैखिक प्रोग्राम चरणों का एक अनुक्रम है, जिसमें प्रत्येक चरण में एक ऑपरेटर और उसके तर्क शामिल होते हैं। उदाहरण के लिए, साधारण ब्याज की गणना करने वाली समस्या में ऐसे चरण हो सकते हैं जो मूलधन को दर से और फिर समय से गुणा करते हैं। डेटासेट को प्रशिक्षण (29,837 समस्याएं), सत्यापन (4,469 समस्याएं) और परीक्षण (2,985 समस्याएं) सेट में विभाजित किया गया है। समस्याओं को 33 अलग-अलग प्रकारों में वर्गीकृत किया गया है, जैसे "ब्याज दर" या "भौतिकी" समस्याएं, जो विभिन्न तर्क डोमेन में मॉडल प्रदर्शन का विश्लेषण करने में मदद करती हैं।

रैखिक प्रोग्राम निष्पादन योग्य होने के लिए डिज़ाइन किए गए हैं, जिसका अर्थ है कि एक प्रोग्राम इंटरप्रेटर दिए गए संख्याओं से उत्तर की गणना कर सकता है। यह गुण मॉडल प्रशिक्षण और मूल्यांकन में प्रोग्राम संश्लेषण और निष्पादन तकनीकों के उपयोग को सक्षम बनाता है। डेटासेट में अर्ध-पर्यवेक्षित शिक्षण के लिए 50,000 अलेबल रहित समस्याएं भी शामिल हैं, हालांकि प्राथमिक बेंचमार्क लेबल किए गए विभाजन का उपयोग करता है।

मूल्यांकन और बेंचमार्क

MathQA का उपयोग आमतौर पर AI मॉडल की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क के रूप में किया जाता है। मानक मूल्यांकन मीट्रिक परीक्षण सेट पर सटीकता है, जहां एक मॉडल को सही उत्तर विकल्प आउटपुट करना होता है। अनुक्रम-से-अनुक्रम मॉडल और मेमोरी-संवर्धित तंत्रिका नेटवर्क का उपयोग करने वाले प्रारंभिक बेसलाइन ने लगभग 30-40% की सटीकता हासिल की। हाल के दृष्टिकोण, जिनमें Transformer (architecture) आर्किटेक्चर और बड़े भाषा मॉडल पर आधारित शामिल हैं, ने प्रदर्शन में काफी सुधार किया है। उदाहरण के लिए, GPT-3 जैसे मॉडल के फाइन-ट्यून किए गए संस्करणों ने परीक्षण सेट पर 80% से अधिक सटीकता हासिल की है।

डेटासेट का उपयोग मॉडल की व्याख्या योग्य तर्क चरण उत्पन्न करने की क्षमता का मूल्यांकन करने के लिए भी किया जाता है। चूंकि रैखिक प्रोग्राम प्रदान किए जाते हैं, शोधकर्ता न केवल यह माप सकते हैं कि अंतिम उत्तर सही है या नहीं, बल्कि यह भी कि अनुमानित प्रोग्राम ग्राउंड ट्रुथ से मेल खाता है या नहीं। इससे ऐसे मॉडलों का विकास हुआ है जो प्रोग्राम निर्माण को निष्पादन के साथ जोड़ते हैं, जिससे सटीकता और व्याख्या योग्यता दोनों में सुधार होता है।

संबंधित डेटासेट और कार्य

MathQA गणित शब्द समस्या डेटासेट के व्यापक परिवार का हिस्सा है, जिसमें MAWPS, ASDiv और GSM8K शामिल हैं। इनकी तुलना में, MathQA बड़ी संख्या में समस्याएं और अधिक जटिल तर्क आवश्यकताएं प्रदान करता है, क्योंकि कई समस्याओं में कई चरण और गणितीय संचालन की व्यापक श्रेणी शामिल होती है। डेटासेट का उपयोग अक्सर प्राकृतिक भाषा प्रसंस्करण और गहन शिक्षण के लिए मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए अन्य संसाधनों के साथ किया जाता है।

गणित शब्द समस्याओं को हल करने का कार्य मशीन समझ और तर्क का एक चुनौतीपूर्ण परीक्षण माना जाता है। इसके लिए पाठ्य विवरण को समझना, प्रासंगिक मात्राओं को निकालना और उपयुक्त अंकगणितीय या बीजगणितीय संचालन लागू करना आवश्यक है। MathQA की एनोटेशन योजना, स्पष्ट संचालन कार्यक्रमों के साथ, इस कार्य को करने का एक संरचित तरीका प्रदान करती है और बाद के डेटासेट डिजाइनों को प्रभावित किया है।

सीमाएं और विवाद

MathQA की एक उल्लेखनीय सीमा यह है कि कुछ एनोटेट कार्यक्रमों में त्रुटियां या असंगतताएं होती हैं, जो प्रशिक्षण के दौरान मॉडल को गुमराह कर सकती हैं। शोधकर्ताओं ने गलत ऑपरेटर उपयोग या लापता चरणों जैसे मुद्दों की पहचान की है। इसके अतिरिक्त, डेटासेट का बहुविकल्पीय प्रारूप मॉडल को वास्तव में तर्क करने के बजाय उत्तर पैटर्न का शोषण करने की अनुमति दे सकता है। कुछ अध्ययनों से पता चला है कि मॉडल विकल्पों की लंबाई या कुछ संख्याओं की उपस्थिति जैसे सतही संकेतों का उपयोग करके संयोग से ऊपर की सटीकता प्राप्त कर सकते हैं।

एक और आलोचना यह है कि समस्याएं दायरे में अपेक्षाकृत संकीर्ण हैं, अंकगणित और सरल बीजगणित पर केंद्रित हैं, और गणितीय तर्क की विविधता को पूरी तरह से कैप्चर नहीं कर सकती हैं। इन मुद्दों के बावजूद, MathQA गणितीय समस्या-समाधान क्षमताओं वाले AI सिस्टम का मूल्यांकन और विकास करने के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बना हुआ है।

यह भी देखें

संदर्भ

  • Amini, A., Gabriel, S., Lin, S., Koncel-Kedziorski, R., Choi, Y., & Hajishirzi, H. (2019). MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms. In Proceedings of NAACL-HLT.
  • MathQA डेटासेट https://math-qa.github.io/ पर उपलब्ध है (2025 में एक्सेस किया गया)।
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:datasets·natural-language-processing·mathematical-reasoning·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास