अंग्रेज़ी से अनुवादित

MMMU-Pro एक पेशेवर-स्तरीय बेंचमार्क है जो जटिल, कॉलेज-स्तरीय कार्यों पर मल्टीमॉडल AI मॉडल का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसमें मूल MMMU बेंचमार्क की तुलना में कठिन प्रश्न और अधिक कठोर मूल्यांकन प्रोटोकॉल शामिल हैं।

MMMU-Pro एक बेंचमार्क डेटासेट है जिसे मल्टीमॉडल आर्टिफिशियल इंटेलिजेंस सिस्टम की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, विशेष रूप से बड़े मल्टीमॉडल मॉडल जो दृश्य और पाठ्य दोनों जानकारी को संसाधित करते हैं। यह मूल MMMU (मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग) बेंचमार्क के एक उन्नत और अधिक चुनौतीपूर्ण उत्तराधिकारी के रूप में कार्य करता है, जो विभिन्न शैक्षणिक और तकनीकी विषयों में पेशेवर-स्तर की विशेषज्ञता को लक्षित करता है। बेंचमार्क को एक मॉडल की छवियों, आरेखों, चार्टों और संबंधित पाठ पर एकीकृत और तर्क करने की क्षमता का परीक्षण करने के लिए संरचित किया गया है, जिसमें गहन डोमेन ज्ञान की आवश्यकता होती है, न कि केवल पैटर्न पहचान की।

मूल MMMU बेंचमार्क, जो 2023 के अंत में जारी किया गया था, में छह विषयों - कला, व्यवसाय, विज्ञान, मानविकी, सामाजिक विज्ञान और प्रौद्योगिकी - में विश्वविद्यालय-स्तर की पाठ्यपुस्तकों और परीक्षाओं से लिए गए प्रश्न शामिल थे। MMMU-Pro को 2024 में मूल की सीमाओं को संबोधित करने के लिए पेश किया गया था, विशेष रूप से कुछ मॉडलों की सांख्यिकीय नियमितताओं या याद किए गए उत्तरों का शोषण करके उच्च स्कोर प्राप्त करने की प्रवृत्ति। MMMU-Pro प्रश्न की कठिनाई बढ़ाता है, अधिक जटिल दृश्य तत्वों का परिचय देता है, और एक सख्त मूल्यांकन प्रोटोकॉल लागू करता है जिसमें बड़े विकल्प सेट के साथ बहुविकल्पीय प्रश्न और एक अधिक कठोर स्कोरिंग विधि शामिल है, जिससे यादृच्छिक अनुमान का प्रभाव कम हो जाता है।

डिज़ाइन और निर्माण

MMMU-Pro को कई संस्थानों के शोधकर्ताओं की एक टीम द्वारा बनाया गया था, जिसमें शैक्षणिक प्रयोगशालाओं और उद्योग अनुसंधान समूहों के योगदान शामिल हैं। डेटासेट मूल MMMU पर आधारित है लेकिन पेशेवर-स्तर की जांच की एक परत जोड़ता है। प्रश्न व्यापक सामग्रियों से लिए गए हैं, जिनमें उन्नत पाठ्यपुस्तकें, पेशेवर प्रमाणन परीक्षाएं और शोध पत्र शामिल हैं। प्रत्येक प्रश्न एक छवि या छवियों के सेट के साथ जोड़ा जाता है जो समस्या को हल करने के लिए अभिन्न हैं, और पाठ को बहु-चरणीय तर्क की आवश्यकता के लिए तैयार किया गया है।

MMMU-Pro में एक प्रमुख डिज़ाइन विकल्प उत्तर विकल्पों का विस्तार है। जबकि मूल MMMU ने प्रति प्रश्न चार विकल्पों का उपयोग किया, MMMU-Pro आमतौर पर दस विकल्पों का उपयोग करता है। यह परिवर्तन संयोग से सही अनुमान लगाने की संभावना को काफी कम कर देता है, जिससे बेंचमार्क वास्तविक समझ का एक अधिक विश्वसनीय माप बन जाता है। इसके अतिरिक्त, बेंचमार्क में प्रश्नों का एक उपसमूह शामिल है जहां दृश्य जानकारी जानबूझकर भ्रामक है या प्रासंगिक विवरण निकालने के लिए सावधानीपूर्वक निरीक्षण की आवश्यकता होती है, जो एक मॉडल की विकर्षकों पर प्रासंगिक जानकारी पर ध्यान केंद्रित करने की क्षमता का परीक्षण करता है।

मूल्यांकन प्रोटोकॉल

MMMU-Pro पर मूल्यांकन निष्पक्षता और प्रतिलिपि प्रस्तुतिकरण सुनिश्चित करने के लिए एक सख्त प्रोटोकॉल का पालन करता है। मॉडलों को प्रश्न पाठ और संबंधित छवि प्रदान की जाती है, और उन्हें दस उत्तर विकल्पों में से एक को आउटपुट करना होता है। प्राथमिक मीट्रिक सटीकता है, लेकिन बेंचमार्क अनुशासन और प्रश्न प्रकार (जैसे, आरेख व्याख्या, चार्ट पढ़ना, या दृश्य तर्क) द्वारा विभाजित प्रदर्शन भी रिपोर्ट करता है।

अनुमान के प्रभाव को और कम करने के लिए, MMMU-Pro में एक "नो-इमेज" स्थिति शामिल है। इस स्थिति में, मॉडलों का मूल्यांकन समान प्रश्नों पर लेकिन संबंधित छवियों के बिना किया जाता है। यह एक नियंत्रण के रूप में कार्य करता है ताकि यह मापा जा सके कि एक मॉडल पाठ्य पूर्वधारणाओं बनाम दृश्य जानकारी पर कितना निर्भर करता है। एक मॉडल जो नो-इमेज स्थिति पर अच्छा प्रदर्शन करता है लेकिन पूर्ण स्थिति पर खराब प्रदर्शन करता है, वह भाषा पैटर्न पर अति-फिटिंग कर रहा हो सकता है, जबकि एक मॉडल जो दोनों पर अच्छा प्रदर्शन करता है, मजबूत मल्टीमॉडल एकीकरण प्रदर्शित करता है।

अग्रणी मॉडलों का प्रदर्शन

2024 के अंत तक, किसी भी मॉडल ने MMMU-Pro पर मानव-स्तरीय प्रदर्शन हासिल नहीं किया है। सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियाँ, जिनमें प्रमुख AI कंपनियों जैसे OpenAI, Google DeepMind, और Anthropic के स्वामित्व वाले मॉडल शामिल हैं, आमतौर पर पूर्ण बेंचमार्क पर 50-60% सटीकता सीमा में स्कोर करती हैं। यह मूल MMMU पर इन्हीं मॉडलों द्वारा प्राप्त 70-80% सटीकता से एक महत्वपूर्ण गिरावट है, जो बढ़ी हुई कठिनाई को उजागर करती है।

ओपन-सोर्स मॉडल, जैसे कि शैक्षणिक समूहों और छोटी कंपनियों द्वारा विकसित, आमतौर पर कम स्कोर करते हैं, अक्सर 30-45% सीमा में। स्वामित्व और ओपन-सोर्स मॉडल के बीच का अंतर सरल बेंचमार्क की तुलना में MMMU-Pro पर अधिक स्पष्ट है, यह सुझाव देते हुए कि आवश्यक पेशेवर-स्तरीय तर्क कई तंत्रिका नेटवर्क आर्किटेक्चर के लिए एक वर्तमान बाधा है। बेंचमार्क कृत्रिम बुद्धिमत्ता समुदाय में मल्टीमॉडल समझ में प्रगति को ट्रैक करने के लिए एक मानक संदर्भ बिंदु बन गया है, जिसमें शोधकर्ता नियमित रूप से पत्रों और तकनीकी रिपोर्टों में इस पर परिणाम रिपोर्ट करते हैं।

प्रभाव और सीमाएं

MMMU-Pro ने विशिष्ट कमजोरियों को उजागर करके मल्टीमॉडल मॉडल के विकास को प्रभावित किया है। उदाहरण के लिए, कई मॉडल उन प्रश्नों के साथ संघर्ष करते हैं जिनमें स्थानिक तर्क या जटिल वैज्ञानिक आरेखों की व्याख्या की आवश्यकता होती है, जैसे कि गहन शिक्षण शोध पत्रों में पाए जाते हैं। इसने दृश्य एनकोडर में सुधार और प्रशिक्षण तकनीकों पर काम को बढ़ावा दिया है जो याद रखने पर तर्क पर जोर देते हैं।

हालांकि, बेंचमार्क सीमाओं के बिना नहीं है। आलोचकों का कहना है कि प्रश्न, कठिन होते हुए भी, अभी भी बहुविकल्पीय हैं, जो मॉडलों को उन्मूलन रणनीतियों का उपयोग करने की अनुमति दे सकते हैं। इसके अतिरिक्त, डेटासेट स्थिर है, जिसका अर्थ है कि एक बार जब एक मॉडल को इस पर (या समान डेटा पर) प्रशिक्षित किया जाता है, तो परिणाम बढ़े हुए हो सकते हैं। MMMU-Pro के निर्माताओं ने इसे स्वीकार किया है और समय-समय पर नए प्रश्नों के साथ अद्यतन संस्करण जारी किए हैं।

एक और सीमा डेटा संदूषण की संभावना है। चूंकि बेंचमार्क सार्वजनिक रूप से उपलब्ध है, यह संभव है कि बड़े मॉडलों के लिए कुछ प्रशिक्षण डेटासेट में MMMU-Pro प्रश्न शामिल हों, जो कृत्रिम रूप से स्कोर बढ़ा सकते हैं। शोधकर्ताओं ने इस मुद्दे को कम करने के लिए प्रशिक्षण डेटा पर अधिक पारदर्शी रिपोर्टिंग का आह्वान किया है। इन चिंताओं के बावजूद, MMMU-Pro जनरेटिव AI प्रणालियों में पेशेवर-स्तरीय मल्टीमॉडल समझ का मूल्यांकन करने के लिए सबसे कठोर सार्वजनिक रूप से उपलब्ध बेंचमार्क में से एक बना हुआ है।

भविष्य की दिशाएं

MMMU-Pro का विकास AI मूल्यांकन में अधिक चुनौतीपूर्ण और पारिस्थितिक रूप से मान्य बेंचमार्क की ओर एक व्यापक प्रवृत्ति का हिस्सा है। भविष्य के पुनरावृत्तियों में खुले-अंत वाले प्रश्न, इंटरैक्टिव कार्य, या वास्तविक-विश्व समस्या-समाधान परिदृश्य शामिल हो सकते हैं जो बहुविकल्पीय प्रारूप से परे जाते हैं। बेंचमार्क का पेशेवर विशेषज्ञता पर जोर चिकित्सा, कानून और इंजीनियरिंग जैसे क्षेत्रों में AI के बढ़ते तैनाती के साथ संरेखित है, जहां त्रुटियों के महत्वपूर्ण परिणाम हो सकते हैं।

जैसे-जैसे मॉडल में सुधार जारी है, MMMU-Pro जैसे बेंचमार्क को प्रासंगिक बने रहने के लिए विकसित होने की आवश्यकता होगी। अनुसंधान समुदाय मॉडल क्षमताओं की एक अधिक पूर्ण तस्वीर प्रदान करने के लिए मानव मूल्यांकन और प्रतिकूल परीक्षण जैसे पूरक मूल्यांकन विधियों की भी खोज कर रहा है। MMMU-Pro, गहराई और कठोरता पर अपने ध्यान के साथ, मल्टीमॉडल AI में अत्याधुनिक को समझने और आगे बढ़ाने के इस चल रहे प्रयास में एक मूल्यवान उपकरण के रूप में कार्य करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास