MMMU-Pro एक बेंचमार्क डेटासेट है जिसे मल्टीमॉडल आर्टिफिशियल इंटेलिजेंस सिस्टम की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, विशेष रूप से बड़े मल्टीमॉडल मॉडल जो दृश्य और पाठ्य दोनों जानकारी को संसाधित करते हैं। यह मूल MMMU (मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग) बेंचमार्क के एक उन्नत और अधिक चुनौतीपूर्ण उत्तराधिकारी के रूप में कार्य करता है, जो विभिन्न शैक्षणिक और तकनीकी विषयों में पेशेवर-स्तर की विशेषज्ञता को लक्षित करता है। बेंचमार्क को एक मॉडल की छवियों, आरेखों, चार्टों और संबंधित पाठ पर एकीकृत और तर्क करने की क्षमता का परीक्षण करने के लिए संरचित किया गया है, जिसमें गहन डोमेन ज्ञान की आवश्यकता होती है, न कि केवल पैटर्न पहचान की।
मूल MMMU बेंचमार्क, जो 2023 के अंत में जारी किया गया था, में छह विषयों - कला, व्यवसाय, विज्ञान, मानविकी, सामाजिक विज्ञान और प्रौद्योगिकी - में विश्वविद्यालय-स्तर की पाठ्यपुस्तकों और परीक्षाओं से लिए गए प्रश्न शामिल थे। MMMU-Pro को 2024 में मूल की सीमाओं को संबोधित करने के लिए पेश किया गया था, विशेष रूप से कुछ मॉडलों की सांख्यिकीय नियमितताओं या याद किए गए उत्तरों का शोषण करके उच्च स्कोर प्राप्त करने की प्रवृत्ति। MMMU-Pro प्रश्न की कठिनाई बढ़ाता है, अधिक जटिल दृश्य तत्वों का परिचय देता है, और एक सख्त मूल्यांकन प्रोटोकॉल लागू करता है जिसमें बड़े विकल्प सेट के साथ बहुविकल्पीय प्रश्न और एक अधिक कठोर स्कोरिंग विधि शामिल है, जिससे यादृच्छिक अनुमान का प्रभाव कम हो जाता है।
डिज़ाइन और निर्माण
MMMU-Pro को कई संस्थानों के शोधकर्ताओं की एक टीम द्वारा बनाया गया था, जिसमें शैक्षणिक प्रयोगशालाओं और उद्योग अनुसंधान समूहों के योगदान शामिल हैं। डेटासेट मूल MMMU पर आधारित है लेकिन पेशेवर-स्तर की जांच की एक परत जोड़ता है। प्रश्न व्यापक सामग्रियों से लिए गए हैं, जिनमें उन्नत पाठ्यपुस्तकें, पेशेवर प्रमाणन परीक्षाएं और शोध पत्र शामिल हैं। प्रत्येक प्रश्न एक छवि या छवियों के सेट के साथ जोड़ा जाता है जो समस्या को हल करने के लिए अभिन्न हैं, और पाठ को बहु-चरणीय तर्क की आवश्यकता के लिए तैयार किया गया है।
MMMU-Pro में एक प्रमुख डिज़ाइन विकल्प उत्तर विकल्पों का विस्तार है। जबकि मूल MMMU ने प्रति प्रश्न चार विकल्पों का उपयोग किया, MMMU-Pro आमतौर पर दस विकल्पों का उपयोग करता है। यह परिवर्तन संयोग से सही अनुमान लगाने की संभावना को काफी कम कर देता है, जिससे बेंचमार्क वास्तविक समझ का एक अधिक विश्वसनीय माप बन जाता है। इसके अतिरिक्त, बेंचमार्क में प्रश्नों का एक उपसमूह शामिल है जहां दृश्य जानकारी जानबूझकर भ्रामक है या प्रासंगिक विवरण निकालने के लिए सावधानीपूर्वक निरीक्षण की आवश्यकता होती है, जो एक मॉडल की विकर्षकों पर प्रासंगिक जानकारी पर ध्यान केंद्रित करने की क्षमता का परीक्षण करता है।
मूल्यांकन प्रोटोकॉल
MMMU-Pro पर मूल्यांकन निष्पक्षता और प्रतिलिपि प्रस्तुतिकरण सुनिश्चित करने के लिए एक सख्त प्रोटोकॉल का पालन करता है। मॉडलों को प्रश्न पाठ और संबंधित छवि प्रदान की जाती है, और उन्हें दस उत्तर विकल्पों में से एक को आउटपुट करना होता है। प्राथमिक मीट्रिक सटीकता है, लेकिन बेंचमार्क अनुशासन और प्रश्न प्रकार (जैसे, आरेख व्याख्या, चार्ट पढ़ना, या दृश्य तर्क) द्वारा विभाजित प्रदर्शन भी रिपोर्ट करता है।
अनुमान के प्रभाव को और कम करने के लिए, MMMU-Pro में एक "नो-इमेज" स्थिति शामिल है। इस स्थिति में, मॉडलों का मूल्यांकन समान प्रश्नों पर लेकिन संबंधित छवियों के बिना किया जाता है। यह एक नियंत्रण के रूप में कार्य करता है ताकि यह मापा जा सके कि एक मॉडल पाठ्य पूर्वधारणाओं बनाम दृश्य जानकारी पर कितना निर्भर करता है। एक मॉडल जो नो-इमेज स्थिति पर अच्छा प्रदर्शन करता है लेकिन पूर्ण स्थिति पर खराब प्रदर्शन करता है, वह भाषा पैटर्न पर अति-फिटिंग कर रहा हो सकता है, जबकि एक मॉडल जो दोनों पर अच्छा प्रदर्शन करता है, मजबूत मल्टीमॉडल एकीकरण प्रदर्शित करता है।
अग्रणी मॉडलों का प्रदर्शन
2024 के अंत तक, किसी भी मॉडल ने MMMU-Pro पर मानव-स्तरीय प्रदर्शन हासिल नहीं किया है। सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियाँ, जिनमें प्रमुख AI कंपनियों जैसे OpenAI, Google DeepMind, और Anthropic के स्वामित्व वाले मॉडल शामिल हैं, आमतौर पर पूर्ण बेंचमार्क पर 50-60% सटीकता सीमा में स्कोर करती हैं। यह मूल MMMU पर इन्हीं मॉडलों द्वारा प्राप्त 70-80% सटीकता से एक महत्वपूर्ण गिरावट है, जो बढ़ी हुई कठिनाई को उजागर करती है।
ओपन-सोर्स मॉडल, जैसे कि शैक्षणिक समूहों और छोटी कंपनियों द्वारा विकसित, आमतौर पर कम स्कोर करते हैं, अक्सर 30-45% सीमा में। स्वामित्व और ओपन-सोर्स मॉडल के बीच का अंतर सरल बेंचमार्क की तुलना में MMMU-Pro पर अधिक स्पष्ट है, यह सुझाव देते हुए कि आवश्यक पेशेवर-स्तरीय तर्क कई तंत्रिका नेटवर्क आर्किटेक्चर के लिए एक वर्तमान बाधा है। बेंचमार्क कृत्रिम बुद्धिमत्ता समुदाय में मल्टीमॉडल समझ में प्रगति को ट्रैक करने के लिए एक मानक संदर्भ बिंदु बन गया है, जिसमें शोधकर्ता नियमित रूप से पत्रों और तकनीकी रिपोर्टों में इस पर परिणाम रिपोर्ट करते हैं।
प्रभाव और सीमाएं
MMMU-Pro ने विशिष्ट कमजोरियों को उजागर करके मल्टीमॉडल मॉडल के विकास को प्रभावित किया है। उदाहरण के लिए, कई मॉडल उन प्रश्नों के साथ संघर्ष करते हैं जिनमें स्थानिक तर्क या जटिल वैज्ञानिक आरेखों की व्याख्या की आवश्यकता होती है, जैसे कि गहन शिक्षण शोध पत्रों में पाए जाते हैं। इसने दृश्य एनकोडर में सुधार और प्रशिक्षण तकनीकों पर काम को बढ़ावा दिया है जो याद रखने पर तर्क पर जोर देते हैं।
हालांकि, बेंचमार्क सीमाओं के बिना नहीं है। आलोचकों का कहना है कि प्रश्न, कठिन होते हुए भी, अभी भी बहुविकल्पीय हैं, जो मॉडलों को उन्मूलन रणनीतियों का उपयोग करने की अनुमति दे सकते हैं। इसके अतिरिक्त, डेटासेट स्थिर है, जिसका अर्थ है कि एक बार जब एक मॉडल को इस पर (या समान डेटा पर) प्रशिक्षित किया जाता है, तो परिणाम बढ़े हुए हो सकते हैं। MMMU-Pro के निर्माताओं ने इसे स्वीकार किया है और समय-समय पर नए प्रश्नों के साथ अद्यतन संस्करण जारी किए हैं।
एक और सीमा डेटा संदूषण की संभावना है। चूंकि बेंचमार्क सार्वजनिक रूप से उपलब्ध है, यह संभव है कि बड़े मॉडलों के लिए कुछ प्रशिक्षण डेटासेट में MMMU-Pro प्रश्न शामिल हों, जो कृत्रिम रूप से स्कोर बढ़ा सकते हैं। शोधकर्ताओं ने इस मुद्दे को कम करने के लिए प्रशिक्षण डेटा पर अधिक पारदर्शी रिपोर्टिंग का आह्वान किया है। इन चिंताओं के बावजूद, MMMU-Pro जनरेटिव AI प्रणालियों में पेशेवर-स्तरीय मल्टीमॉडल समझ का मूल्यांकन करने के लिए सबसे कठोर सार्वजनिक रूप से उपलब्ध बेंचमार्क में से एक बना हुआ है।
भविष्य की दिशाएं
MMMU-Pro का विकास AI मूल्यांकन में अधिक चुनौतीपूर्ण और पारिस्थितिक रूप से मान्य बेंचमार्क की ओर एक व्यापक प्रवृत्ति का हिस्सा है। भविष्य के पुनरावृत्तियों में खुले-अंत वाले प्रश्न, इंटरैक्टिव कार्य, या वास्तविक-विश्व समस्या-समाधान परिदृश्य शामिल हो सकते हैं जो बहुविकल्पीय प्रारूप से परे जाते हैं। बेंचमार्क का पेशेवर विशेषज्ञता पर जोर चिकित्सा, कानून और इंजीनियरिंग जैसे क्षेत्रों में AI के बढ़ते तैनाती के साथ संरेखित है, जहां त्रुटियों के महत्वपूर्ण परिणाम हो सकते हैं।
जैसे-जैसे मॉडल में सुधार जारी है, MMMU-Pro जैसे बेंचमार्क को प्रासंगिक बने रहने के लिए विकसित होने की आवश्यकता होगी। अनुसंधान समुदाय मॉडल क्षमताओं की एक अधिक पूर्ण तस्वीर प्रदान करने के लिए मानव मूल्यांकन और प्रतिकूल परीक्षण जैसे पूरक मूल्यांकन विधियों की भी खोज कर रहा है। MMMU-Pro, गहराई और कठोरता पर अपने ध्यान के साथ, मल्टीमॉडल AI में अत्याधुनिक को समझने और आगे बढ़ाने के इस चल रहे प्रयास में एक मूल्यवान उपकरण के रूप में कार्य करता है।