MathVista एक बेंचमार्क डेटासेट है, जिसे दृश्य जानकारी पर लागू होने पर कृत्रिम बुद्धिमत्ता प्रणालियों की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2023 में शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, ताकि मौजूदा मूल्यांकन उपकरणों में एक अंतर को संबोधित किया जा सके, जो आम तौर पर दृश्य समझ या गणितीय समस्या-समाधान का अलग-अलग मूल्यांकन करते थे। इस बेंचमार्क में समस्याओं का एक विविध संग्रह शामिल है, जिसके लिए मॉडलों को छवियों, आरेखों, चार्टों या ज्यामितीय आकृतियों की व्याख्या करनी होती है और फिर सही उत्तर तक पहुँचने के लिए गणितीय संक्रियाएँ या तार्किक तर्क करना होता है।
MathVista का प्राथमिक उद्देश्य बड़े भाषा मॉडलों और मल्टीमॉडल प्रणालियों, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित, के लिए एक मानकीकृत परीक्षण प्रदान करना है। पारंपरिक दृश्य प्रश्नोत्तर (VQA) डेटासेट के विपरीत, जो वस्तु पहचान या दृश्य विवरण पर केंद्रित होते हैं, MathVista उन कार्यों पर जोर देता है जहाँ दृश्य सामग्री गणितीय समाधान के लिए आवश्यक होती है। इसमें ज्यामिति, फलन, सांख्यिकी और अंकगणित से जुड़ी समस्याएँ शामिल हैं, जो अक्सर सिंथेटिक आरेखों, वास्तविक-विश्व तस्वीरों या डेटा विज़ुअलाइज़ेशन के रूप में प्रस्तुत की जाती हैं।
इस बेंचमार्क में 6,000 से अधिक प्रश्न शामिल हैं, जिनमें से प्रत्येक एक छवि और बहुविकल्पीय या मुक्त-रूप उत्तर प्रारूप के साथ जोड़ा गया है। प्रश्नों को कई कार्य प्रकारों में वर्गीकृत किया गया है, जैसे आकृति प्रश्नोत्तर, ज्यामिति समस्या समाधान, और चार्ट-आधारित तर्क। यह संरचना शोधकर्ताओं को मॉडल प्रदर्शन में विशिष्ट ताकत और कमजोरियों की पहचान करने की अनुमति देती है, जो कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में भविष्य के विकास का मार्गदर्शन करती है।
डिज़ाइन और संरचना
MathVista को मौजूदा डेटासेट से समस्याओं को एकत्र करके और नई समस्याएँ बनाकर तैयार किया गया था, जिससे कठिनाई और दृश्य संदर्भों की एक विस्तृत श्रृंखला सुनिश्चित होती है। छवियाँ पाठ्यपुस्तकों, ऑनलाइन शैक्षिक सामग्री और सिंथेटिक जनरेशन जैसे स्रोतों से आती हैं। प्रत्येक प्रश्न एक सही उत्तर और कई मामलों में एक तर्क स्पष्टीकरण के साथ एनोटेट किया गया है। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट को ओवरफिटिंग रोकने के लिए निजी रखा गया है।
कार्य प्रकारों को विशिष्ट संज्ञानात्मक कौशल को कवर करने के लिए परिभाषित किया गया है: दृश्य धारणा (संख्याओं या आकृतियों को निकालना), गणितीय तर्क (सूत्रों या तर्क को लागू करना), और रचनात्मक समझ (कई चरणों को संयोजित करना)। उदाहरण के लिए, एक प्रश्न एक बार चार्ट दिखा सकता है और दो बारों के बीच प्रतिशत वृद्धि पूछ सकता है, जिसके लिए चार्ट का सटीक पठन और अंकगणितीय गणना दोनों की आवश्यकता होती है।
मूल्यांकन पद्धति
मॉडलों का मूल्यांकन सटीकता के आधार पर किया जाता है, जिसे सही उत्तर दिए गए प्रश्नों के प्रतिशत के रूप में मापा जाता है। मुक्त-रूप उत्तरों के लिए, स्वचालित स्कोरिंग स्ट्रिंग मिलान या शब्दार्थ समानता का उपयोग करती है, जबकि बहुविकल्पीय प्रश्नों को सीधे स्कोर किया जाता है। यह बेंचमार्क विभिन्न कार्य श्रेणियों में प्रदर्शन भी रिपोर्ट करता है, जिससे सूक्ष्म-विश्लेषण सक्षम होता है। अपनी रिलीज़ के बाद से, MathVista क्षेत्र में एक मानक संदर्भ बन गया है, और कई बड़े भाषा मॉडल डेवलपर्स इसका उपयोग अपने सिस्टम की प्रतिस्पर्धियों के साथ तुलना करने के लिए करते हैं।
MathVista पर परिणामों ने दिखाया है कि उन्नत मॉडल भी कुछ दृश्य-गणितीय कार्यों में संघर्ष करते हैं, विशेष रूप से उन्हें जिनमें स्थानिक तर्क या बहु-चरणीय गणनाएँ शामिल होती हैं। इसने तंत्रिका नेटवर्क के भीतर दृश्य एनकोडर और तर्क तंत्रों में सुधार के लिए अनुसंधान को प्रेरित किया है।
प्रभाव और स्वीकृति
MathVista की शुरुआत ने बाद के बेंचमार्क और मॉडल प्रशिक्षण रणनीतियों के विकास को प्रभावित किया है। इसने मल्टीमॉडल मॉडलों की आवश्यकता को उजागर किया जो दृश्य और पाठ्य जानकारी को सहजता से एकीकृत कर सकते हैं, एक चुनौती जो गहन शिक्षण के क्षेत्र में सक्रिय बनी हुई है। शोधकर्ताओं ने मॉडलों को फाइन-ट्यून करने के लिए MathVista का उपयोग किया है, जिससे चार्ट समझ और ज्यामितीय समस्या समाधान जैसे संबंधित कार्यों में सुधार हुआ है।
यह बेंचमार्क सार्वजनिक रूप से उपलब्ध है, और इसका लीडरबोर्ड अकादमिक और औद्योगिक प्रयोगशालाओं, जिनमें प्रमुख प्रौद्योगिकी कंपनियों से जुड़े लोग शामिल हैं, के सबमिशन के साथ नियमित रूप से अपडेट किया जाता है। यह पारदर्शिता स्वस्थ प्रतिस्पर्धा को बढ़ावा देती है और कृत्रिम बुद्धिमत्ता अनुसंधान में प्रगति को तेज करती है।
सीमाएँ और भविष्य की दिशाएँ
जबकि MathVista एक मजबूत मूल्यांकन प्रदान करता है, इसकी सीमाएँ हैं। प्रश्न मुख्य रूप से अंग्रेजी में हैं और मानक गणितीय विषयों पर केंद्रित हैं, जो सभी सांस्कृतिक या उन्नत गणितीय संदर्भों को कवर नहीं कर सकते हैं। इसके अतिरिक्त, बेंचमार्क स्थिर छवियों पर निर्भर करता है, जबकि वास्तविक-विश्व अनुप्रयोगों में अक्सर गतिशील या इंटरैक्टिव दृश्य डेटा शामिल होता है। भविष्य के पुनरावृत्तियों में वीडियो या 3D दृश्यों के साथ-साथ अधिक विविध समस्या प्रकारों को शामिल किया जा सकता है।
इन बाधाओं के बावजूद, MathVista AI प्रणालियों के विकास का आकलन और मार्गदर्शन करने के लिए एक मूल्यवान उपकरण बना हुआ है। दृश्य गणितीय तर्क पर इसका जोर शिक्षा, वैज्ञानिक अनुसंधान और डेटा विश्लेषण में सहायता करने वाले मॉडल बनाने में बढ़ती रुचि के साथ संरेखित है।