अंग्रेज़ी से अनुवादित

MMMU-Val, बहु-विषयक मल्टीमॉडल समझ बेंचमार्क का सत्यापन सेट है, जिसका उपयोग कॉलेज-स्तर के ज्ञान और विभिन्न विषयों तथा मोडैलिटीज में AI मॉडलों का मूल्यांकन करने के लिए किया जाता है।

MMMU-Val, MMMU बेंचमार्क का सत्यापन उपसमुच्चय है, जो एक बड़े पैमाने का डेटासेट है जिसे कॉलेज-स्तर के ज्ञान और बहुविध तर्क की आवश्यकता वाले कार्यों पर कृत्रिम बुद्धिमत्ता प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह बेंचमार्क 2023 में शैक्षणिक और औद्योगिक शोधकर्ताओं के एक संघ द्वारा पेश किया गया था, ताकि मौजूदा मूल्यांकन सेटों की सीमाओं को संबोधित किया जा सके, जो अक्सर संकीर्ण कार्यों पर केंद्रित थे या कठोर शैक्षणिक आधार की कमी रखते थे। MMMU-Val शोधकर्ताओं के लिए एक मानकीकृत उपकरण के रूप में कार्य करता है, ताकि वे मॉडलों के प्रदर्शन की तुलना कर सकें, विशेष रूप से बड़े भाषा मॉडल और बहुविध प्रणालियों की, उन प्रश्नों पर जो दृश्य समझ और डोमेन-विशिष्ट विशेषज्ञता दोनों की मांग करते हैं।

MMMU बेंचमार्क में विश्वविद्यालय की पाठ्यपुस्तकों, व्याख्यान नोट्स, और परीक्षा सामग्री से लिए गए 11,000 से अधिक प्रश्न शामिल हैं, जो छह मुख्य विषयों में फैले हैं: कला, व्यवसाय, विज्ञान, मानविकी, सामाजिक विज्ञान, और चिकित्सा। प्रत्येक प्रश्न में पाठ के साथ चित्र, आरेख, चार्ट, या अन्य दृश्य तत्व शामिल होते हैं, जिससे मॉडलों को विधियों के पार जानकारी एकीकृत करनी पड़ती है। MMMU-Val विशेष रूप से इन प्रश्नों का एक उपसमुच्चय रखता है, आमतौर पर लगभग 900, जो मॉडल विकास के दौरान सत्यापन के लिए उपयोग किए जाते हैं। बेंचमार्क में अंतिम मूल्यांकन के लिए एक परीक्षण सेट भी शामिल है, लेकिन MMMU-Val अक्सर हाइपरपैरामीटर ट्यूनिंग, प्रारंभिक रोक, और मॉडल चयन के लिए उपयोग किया जाता है, क्योंकि इसका आकार प्रबंधनीय है और विषयों का संतुलित कवरेज है।

संरचना और संरचना

MMMU-Val को 30 अलग-अलग विषय क्षेत्रों में व्यवस्थित किया गया है, जैसे कि लेखांकन, रसायन विज्ञान, कंप्यूटर विज्ञान, इतिहास, और रेडियोलॉजी, जिसमें प्रत्येक प्रश्न को अनुशासन और कठिनाई स्तर द्वारा टैग किया गया है। प्रश्न बहुविकल्पीय हैं, प्रत्येक प्रश्न के लिए चार विकल्प हैं, और मनुष्यों और मशीनों दोनों के लिए चुनौतीपूर्ण होने के लिए डिज़ाइन किए गए हैं। दृश्य घटक सरल रेखाचित्रों से लेकर जटिल चिकित्सा स्कैन और वित्तीय चार्ट तक होते हैं, जिससे यह सुनिश्चित होता है कि मॉडल केवल पाठ्य संकेतों पर निर्भर नहीं रह सकते। सत्यापन सेट पूर्ण बेंचमार्क के समान विषयों और प्रश्न प्रकारों का वितरण बनाए रखता है, जिससे विकास के दौरान विश्वसनीय प्रदर्शन अनुमान की अनुमति मिलती है।

मूल्यांकन पद्धति

MMMU-Val पर मॉडलों का मूल्यांकन बहुविकल्पीय प्रश्नों के उत्तर उत्पन्न करके और उन्हें ग्राउंड-ट्रुथ लेबल के साथ तुलना करके किया जाता है। सटीकता प्राथमिक मीट्रिक है, जिसे सही उत्तर दिए गए प्रश्नों के प्रतिशत के रूप में रिपोर्ट किया जाता है। निष्पक्ष तुलना सुनिश्चित करने के लिए, मानकीकृत प्रॉम्प्ट और डिकोडिंग पैरामीटर की सिफारिश की जाती है, हालांकि बेंचमार्क एकल प्रोटोकॉल लागू नहीं करता है। सत्यापन सेट प्रशिक्षण के दौरान प्रगति को ट्रैक करने के लिए विशेष रूप से उपयोगी है, क्योंकि यह एक स्थिर संदर्भ बिंदु प्रदान करता है जो परीक्षण सेट पर ओवरफिट नहीं होता है। शोधकर्ता अक्सर अपने मॉडलों की ताकत और कमजोरियों की पहचान करने के लिए समग्र सटीकता और प्रति-अनुशासन विवरण दोनों की रिपोर्ट करते हैं।

एआई अनुसंधान में भूमिका

MMMU-Val बहुविध बड़े भाषा मॉडलों के विकास में एक सामान्य संदर्भ बिंदु बन गया है। कई प्रमुख एआई अनुसंधान समूह, जिनमें OpenAI, Anthropic, और Google DeepMind से जुड़े लोग शामिल हैं, ने अपनी प्रणालियों को बेंचमार्क करने के लिए MMMU-Val का उपयोग किया है। सत्यापन सेट दृश्य तर्क विफलताओं, मतिभ्रम, और अपर्याप्त डोमेन ज्ञान जैसे मुद्दों का निदान करने में मदद करता है। यह Curriculum Learning और Data Augmentation जैसी तकनीकों के लिए एक प्रशिक्षण लक्ष्य के रूप में भी कार्य करता है, जहां मॉडलों को धीरे-धीरे कठिन प्रश्नों के संपर्क में लाया जाता है। 2024 तक, अत्याधुनिक मॉडल MMMU-Val पर 60% से अधिक सटीकता प्राप्त करते हैं, जो 40% से नीचे स्कोर करने वाले प्रारंभिक आधारों से एक महत्वपूर्ण सुधार है, लेकिन बेंचमार्क चुनौतीपूर्ण बना हुआ है, जिसमें मानव विशेषज्ञ आमतौर पर 80% से ऊपर स्कोर करते हैं।

सीमाएं और विचार

जबकि MMMU-Val व्यापक रूप से उपयोग किया जाता है, इसकी सीमाएं हैं। बहुविकल्पीय प्रारूप यादृच्छिक अनुमान के माध्यम से स्कोर को बढ़ा सकता है, और प्रश्नों का निश्चित सेट मॉडलों में सुधार के रूप में संतृप्त हो सकता है। इसके अतिरिक्त, सत्यापन सेट स्थिर है, इसलिए बार-बार मूल्यांकन सावधानी से प्रबंधित न होने पर ओवरफिटिंग का कारण बन सकता है। शोधकर्ताओं को प्रोत्साहित किया जाता है कि वे मॉडल क्षमताओं का समग्र दृष्टिकोण प्राप्त करने के लिए MMMU-Val का उपयोग अन्य बेंचमार्कों के साथ करें, जैसे कि Generative AI या Neural network व्याख्यात्मकता पर केंद्रित। बेंचमार्क के निर्माताओं ने इनमें से कुछ मुद्दों को कम करने के लिए अपडेट और अतिरिक्त विभाजन भी जारी किए हैं, लेकिन MMMU-Val Artificial intelligence के क्षेत्र में बहुविध मूल्यांकन के लिए एक आधारशिला बना हुआ है।

भविष्य की दिशाएं

Deep learning और Transformer (architecture) आर्किटेक्चर का चल रहा विकास MMMU-Val पर मॉडलों की उपलब्धियों की सीमाओं को आगे बढ़ा रहा है। भविष्य के कार्यों में गतिशील प्रश्न निर्माण, अधिक सूक्ष्म मीट्रिक, और वास्तविक दुनिया के अनुप्रयोगों के साथ एकीकरण शामिल हो सकता है। जैसे-जैसे मॉडल अधिक सक्षम होते जाते हैं, बेंचमार्क को अधिक विषयों या अधिक जटिल दृश्य तर्क कार्यों को शामिल करने के लिए विस्तारित किया जा सकता है। अभी के लिए, MMMU-Val यह सुनिश्चित करने के लिए एक महत्वपूर्ण उपकरण के रूप में कार्य करता है कि एआई में प्रगति कठोर, बहु-विषयक समझ पर आधारित हो।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास