अंग्रेज़ी से अनुवादित

MathVista एक बेंचमार्क है जो दृश्य संदर्भों में गणितीय तर्क का मूल्यांकन करने के लिए है, जो एआई मॉडलों को उन समस्याओं पर परीक्षण करता है जिनमें दृश्य समझ को गणितीय गणना के साथ संयोजित करने की आवश्यकता होती है। इसे 2023 में पेश किया गया था ताकि मौजूदा दृश्य प्रश्न-उत्तर और गणित तर्क बेंचमार्क में अंतराल को संबोधित किया जा सके।

MathVista एक बेंचमार्क डेटासेट है, जिसे दृश्य जानकारी पर लागू होने पर कृत्रिम बुद्धिमत्ता प्रणालियों की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2023 में शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, ताकि मौजूदा मूल्यांकन उपकरणों में एक अंतर को संबोधित किया जा सके, जो आम तौर पर दृश्य समझ या गणितीय समस्या-समाधान का अलग-अलग मूल्यांकन करते थे। इस बेंचमार्क में समस्याओं का एक विविध संग्रह शामिल है, जिसके लिए मॉडलों को छवियों, आरेखों, चार्टों या ज्यामितीय आकृतियों की व्याख्या करनी होती है और फिर सही उत्तर तक पहुँचने के लिए गणितीय संक्रियाएँ या तार्किक तर्क करना होता है।

MathVista का प्राथमिक उद्देश्य बड़े भाषा मॉडलों और मल्टीमॉडल प्रणालियों, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित, के लिए एक मानकीकृत परीक्षण प्रदान करना है। पारंपरिक दृश्य प्रश्नोत्तर (VQA) डेटासेट के विपरीत, जो वस्तु पहचान या दृश्य विवरण पर केंद्रित होते हैं, MathVista उन कार्यों पर जोर देता है जहाँ दृश्य सामग्री गणितीय समाधान के लिए आवश्यक होती है। इसमें ज्यामिति, फलन, सांख्यिकी और अंकगणित से जुड़ी समस्याएँ शामिल हैं, जो अक्सर सिंथेटिक आरेखों, वास्तविक-विश्व तस्वीरों या डेटा विज़ुअलाइज़ेशन के रूप में प्रस्तुत की जाती हैं।

इस बेंचमार्क में 6,000 से अधिक प्रश्न शामिल हैं, जिनमें से प्रत्येक एक छवि और बहुविकल्पीय या मुक्त-रूप उत्तर प्रारूप के साथ जोड़ा गया है। प्रश्नों को कई कार्य प्रकारों में वर्गीकृत किया गया है, जैसे आकृति प्रश्नोत्तर, ज्यामिति समस्या समाधान, और चार्ट-आधारित तर्क। यह संरचना शोधकर्ताओं को मॉडल प्रदर्शन में विशिष्ट ताकत और कमजोरियों की पहचान करने की अनुमति देती है, जो कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में भविष्य के विकास का मार्गदर्शन करती है।

डिज़ाइन और संरचना

MathVista को मौजूदा डेटासेट से समस्याओं को एकत्र करके और नई समस्याएँ बनाकर तैयार किया गया था, जिससे कठिनाई और दृश्य संदर्भों की एक विस्तृत श्रृंखला सुनिश्चित होती है। छवियाँ पाठ्यपुस्तकों, ऑनलाइन शैक्षिक सामग्री और सिंथेटिक जनरेशन जैसे स्रोतों से आती हैं। प्रत्येक प्रश्न एक सही उत्तर और कई मामलों में एक तर्क स्पष्टीकरण के साथ एनोटेट किया गया है। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट को ओवरफिटिंग रोकने के लिए निजी रखा गया है।

कार्य प्रकारों को विशिष्ट संज्ञानात्मक कौशल को कवर करने के लिए परिभाषित किया गया है: दृश्य धारणा (संख्याओं या आकृतियों को निकालना), गणितीय तर्क (सूत्रों या तर्क को लागू करना), और रचनात्मक समझ (कई चरणों को संयोजित करना)। उदाहरण के लिए, एक प्रश्न एक बार चार्ट दिखा सकता है और दो बारों के बीच प्रतिशत वृद्धि पूछ सकता है, जिसके लिए चार्ट का सटीक पठन और अंकगणितीय गणना दोनों की आवश्यकता होती है।

मूल्यांकन पद्धति

मॉडलों का मूल्यांकन सटीकता के आधार पर किया जाता है, जिसे सही उत्तर दिए गए प्रश्नों के प्रतिशत के रूप में मापा जाता है। मुक्त-रूप उत्तरों के लिए, स्वचालित स्कोरिंग स्ट्रिंग मिलान या शब्दार्थ समानता का उपयोग करती है, जबकि बहुविकल्पीय प्रश्नों को सीधे स्कोर किया जाता है। यह बेंचमार्क विभिन्न कार्य श्रेणियों में प्रदर्शन भी रिपोर्ट करता है, जिससे सूक्ष्म-विश्लेषण सक्षम होता है। अपनी रिलीज़ के बाद से, MathVista क्षेत्र में एक मानक संदर्भ बन गया है, और कई बड़े भाषा मॉडल डेवलपर्स इसका उपयोग अपने सिस्टम की प्रतिस्पर्धियों के साथ तुलना करने के लिए करते हैं।

MathVista पर परिणामों ने दिखाया है कि उन्नत मॉडल भी कुछ दृश्य-गणितीय कार्यों में संघर्ष करते हैं, विशेष रूप से उन्हें जिनमें स्थानिक तर्क या बहु-चरणीय गणनाएँ शामिल होती हैं। इसने तंत्रिका नेटवर्क के भीतर दृश्य एनकोडर और तर्क तंत्रों में सुधार के लिए अनुसंधान को प्रेरित किया है।

प्रभाव और स्वीकृति

MathVista की शुरुआत ने बाद के बेंचमार्क और मॉडल प्रशिक्षण रणनीतियों के विकास को प्रभावित किया है। इसने मल्टीमॉडल मॉडलों की आवश्यकता को उजागर किया जो दृश्य और पाठ्य जानकारी को सहजता से एकीकृत कर सकते हैं, एक चुनौती जो गहन शिक्षण के क्षेत्र में सक्रिय बनी हुई है। शोधकर्ताओं ने मॉडलों को फाइन-ट्यून करने के लिए MathVista का उपयोग किया है, जिससे चार्ट समझ और ज्यामितीय समस्या समाधान जैसे संबंधित कार्यों में सुधार हुआ है।

यह बेंचमार्क सार्वजनिक रूप से उपलब्ध है, और इसका लीडरबोर्ड अकादमिक और औद्योगिक प्रयोगशालाओं, जिनमें प्रमुख प्रौद्योगिकी कंपनियों से जुड़े लोग शामिल हैं, के सबमिशन के साथ नियमित रूप से अपडेट किया जाता है। यह पारदर्शिता स्वस्थ प्रतिस्पर्धा को बढ़ावा देती है और कृत्रिम बुद्धिमत्ता अनुसंधान में प्रगति को तेज करती है।

सीमाएँ और भविष्य की दिशाएँ

जबकि MathVista एक मजबूत मूल्यांकन प्रदान करता है, इसकी सीमाएँ हैं। प्रश्न मुख्य रूप से अंग्रेजी में हैं और मानक गणितीय विषयों पर केंद्रित हैं, जो सभी सांस्कृतिक या उन्नत गणितीय संदर्भों को कवर नहीं कर सकते हैं। इसके अतिरिक्त, बेंचमार्क स्थिर छवियों पर निर्भर करता है, जबकि वास्तविक-विश्व अनुप्रयोगों में अक्सर गतिशील या इंटरैक्टिव दृश्य डेटा शामिल होता है। भविष्य के पुनरावृत्तियों में वीडियो या 3D दृश्यों के साथ-साथ अधिक विविध समस्या प्रकारों को शामिल किया जा सकता है।

इन बाधाओं के बावजूद, MathVista AI प्रणालियों के विकास का आकलन और मार्गदर्शन करने के लिए एक मूल्यवान उपकरण बना हुआ है। दृश्य गणितीय तर्क पर इसका जोर शिक्षा, वैज्ञानिक अनुसंधान और डेटा विश्लेषण में सहायता करने वाले मॉडल बनाने में बढ़ती रुचि के साथ संरेखित है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·mathematical-reasoning·visual-question-answering·multimodal-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास