MMMU 2025.5 मैसिव मल्टी-डिसिप्लिन मल्टीमोडल अंडरस्टैंडिंग (MMMU) बेंचमार्क का 2025 में जारी पाँचवाँ अपडेट है, जो Artificial intelligence प्रणालियों के लिए व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन सूट है। यह बेंचमार्क Large language model और संबंधित मॉडलों की उन विषयों में कॉलेज-स्तरीय तर्क करने की क्षमता का आकलन करता है जिनके लिए दृश्य और पाठ्य दोनों समझ की आवश्यकता होती है। MMMU 2025.5 बेंचमार्क की आवधिक ताज़गी की परंपरा को जारी रखता है, जिसमें प्रश्नों का एक नया सेट और संशोधित स्कोरिंग प्रक्रियाएँ शामिल हैं, जिससे संतृप्ति प्रभाव कम हो और अत्याधुनिक प्रणालियों के बीच बेहतर अंतर किया जा सके।
मूल MMMU बेंचमार्क 2023 में शैक्षणिक और औद्योगिक शोधकर्ताओं के एक संघ द्वारा पेश किया गया था, जिसमें Stanford AI Lab, Carnegie Mellon University, और University of Toronto की टीमें शामिल थीं। इसमें 30 विषयों - जिनमें कला, इंजीनियरिंग और चिकित्सा शामिल हैं - की पाठ्यपुस्तकों, व्याख्यान स्लाइड्स और परीक्षा पत्रों से लिए गए प्रश्न शामिल हैं। प्रत्येक प्रश्न एक छवि (जैसे आरेख, चार्ट या फोटोग्राफ) को बहुविकल्पीय या खुले-अंत वाले प्रॉम्प्ट के साथ जोड़ता है, जिसके लिए मॉडलों को दोनों मोडैलिटी पर Multi-Head Attention-आधारित तर्क करना आवश्यक होता है। बेंचमार्क की कठिनाई डोमेन-विशिष्ट ज्ञान और सटीक दृश्य व्याख्या की मांग में निहित है, जो इसे सरल Machine learning बेंचमार्क से अलग करती है।
MMMU 2025.5 विशेष रूप से 2025 में देखी गई तीव्र प्रगति को संबोधित करता है, जहाँ 2025 के पहले के संस्करण (MMMU 2025.1 से 2025.4) अग्रणी मॉडलों के लिए तेजी से आसान हो गए थे। यह अपडेट लगभग 1,200 नए प्रश्न जोड़ता है, जिन्हें University of Oxford और MIT CSAIL जैसे संस्थानों के 50 विशेषज्ञ एनोटेटरों की एक पैनल द्वारा तैयार किया गया है। ये प्रश्न बहु-चरणीय तर्क, प्रति-तथ्यात्मक परिदृश्यों और सूक्ष्म दृश्य अंतरों पर जोर देते हैं, जैसे समान शारीरिक संरचनाओं के बीच अंतर करना या जटिल सर्किट आरेखों की व्याख्या करना। यह अपडेट एक नया स्कोरिंग रूब्रिक भी पेश करता है जो अति-आत्मविश्वास वाले गलत उत्तरों को दंडित करता है, जिससे मॉडल आउटपुट में कैलिब्रेटेड Temperature Scaling को प्रोत्साहित किया जा सके।
बेंचमार्क डिज़ाइन और अपडेट
MMMU सूट छह व्यापक विषयों में संरचित है: कला और डिज़ाइन, व्यवसाय, विज्ञान, स्वास्थ्य और चिकित्सा, मानविकी और सामाजिक विज्ञान, तथा प्रौद्योगिकी और इंजीनियरिंग। प्रत्येक विषय में कई विषय-वस्तुएँ शामिल हैं, और प्रश्नों को मानव प्रदर्शन के आधार पर कठिनाई स्तरों (आसान, मध्यम, कठिन) के साथ टैग किया गया है। MMMU 2025.5 इस संरचना को बनाए रखता है लेकिन वितरण को पुनर्संतुलित करता है: यह कठिन प्रश्नों का अनुपात 35% से बढ़ाकर 45% करता है, जो उन मॉडलों को चुनौती देने की आवश्यकता को दर्शाता है जिन्होंने आसान आइटमों में महारत हासिल कर ली है। यह अपडेट एक नया "दृश्य व्यवधान" उपसमुच्चय भी पेश करता है, जहाँ छवियों को थोड़ा घुमाया, क्रॉप किया या रंग-स्थानांतरित किया जाता है, जिससे इनपुट विविधताओं के प्रति मजबूती का परीक्षण होता है।
MMMU 2025.5 में एक प्रमुख नवाचार "प्रतिकूल सहयोग" प्रश्नों का समावेश है, जिन्हें Google DeepMind और OpenAI शोधकर्ताओं के इनपुट के साथ विकसित किया गया है। ये प्रश्न अस्पष्ट होने या छवि में मौजूद न होने वाले बाहरी ज्ञान की आवश्यकता के लिए डिज़ाइन किए गए हैं, जिससे मॉडलों को या तो स्पष्टीकरण माँगना पड़ता है या अनिश्चितता व्यक्त करनी पड़ती है। यह Generative AI मूल्यांकन में व्यापक रुझानों के साथ संरेखित है, जहाँ बेंचमार्क तेजी से केवल सटीकता नहीं बल्कि तर्क पारदर्शिता और विफलता मोड को भी मापते हैं।
मूल्यांकन पद्धति
मॉडलों का मूल्यांकन ज़ीरो-शॉट सेटिंग में किया जाता है, जिसका अर्थ है कि उन्हें MMMU प्रश्नों के कोई पूर्व उदाहरण नहीं मिलते। बेंचमार्क एक मानकीकृत प्रॉम्प्ट प्रारूप का उपयोग करता है जिसमें छवि और एक पाठ्य निर्देश शामिल होता है, और मॉडलों को एक प्रतिक्रिया उत्पन्न करनी होती है जिसे अंतिम उत्तर के लिए पार्स किया जाता है। बहुविकल्पीय प्रश्नों के लिए, मॉडल के आउटपुट को सही विकल्प के साथ मिलान किया जाता है; खुले-अंत वाले प्रश्नों के लिए, सटीक मिलान और अर्थगत समानता (Transformer (architecture)-आधारित एम्बेडिंग का उपयोग करके) का संयोजन नियोजित किया जाता है। MMMU 2025.5 उन मॉडलों के लिए प्रदर्शन को अलग से भी रिपोर्ट करता है जो बाहरी टूल का उपयोग करते हैं, जैसे Amazon Web Services या Google Cloud API, हालाँकि तुलनीयता बनाए रखने के लिए ऐसे उपयोग को हतोत्साहित किया जाता है।
MMMU 2025.5 में स्कोरिंग एक "आत्मविश्वास-भारित सटीकता" मीट्रिक पेश करती है। प्रत्येक प्रश्न के लिए, मॉडल को एक आत्मविश्वास स्कोर (0 से 1) आउटपुट करना होता है। अंतिम स्कोर आत्मविश्वास से भारित सही उत्तरों का औसत होता है, जिसमें उच्च-आत्मविश्वास वाली त्रुटियों के लिए दंड होता है। इस मीट्रिक का उद्देश्य कैलिब्रेशन को पकड़ना है, जो Intuitive Surgical रोबोटिक्स या Waymo स्वायत्त ड्राइविंग जैसे डोमेन में वास्तविक-विश्व तैनाती के लिए महत्वपूर्ण है, जहाँ अति-आत्मविश्वास वाली गलतियाँ महंगी हो सकती हैं।
प्रदर्शन रुझान
MMMU 2025.5 की रिलीज़ के समय, Anthropic, OpenAI, और Google DeepMind के अग्रणी मॉडल 78-82% की सीमा में सटीकता प्राप्त करते हैं, जो MMMU 2025.1 पर लगभग 70% से ऊपर है। हालाँकि, नया आत्मविश्वास-भारित मीट्रिक इन स्कोरों को घटाकर 65-70% कर देता है, जो इस बात को उजागर करता है कि कई मॉडल खराब कैलिब्रेटेड हैं। Qualcomm या Arm Holdings द्वारा एज डिवाइसों के लिए अनुकूलित छोटे मॉडल आमतौर पर 20-30 अंक कम स्कोर करते हैं, जो फ्रंटियर और तैनात प्रणालियों के बीच अंतर को रेखांकित करता है।
बेंचमार्क ने स्थानिक तर्क और डोमेन-विशिष्ट शब्दावली में लगातार कमजोरियों को भी उजागर किया है। उदाहरण के लिए, मॉडल अक्सर चिकित्सा इमेजिंग में बाएँ-दाएँ अभिविन्यास को भ्रमित करते हैं और कार्बनिक रसायन विज्ञान के प्रश्नों में रासायनिक संरचनाओं की गलत पहचान करते हैं। इन निष्कर्षों ने Curriculum Learning और Data Augmentation तकनीकों में अनुसंधान को प्रेरित किया है जो विशेष रूप से इन कमियों को लक्षित करते हैं।
प्रभाव और स्वीकृति
MMMU 2025.5 को प्रमुख AI प्रयोगशालाओं द्वारा आंतरिक मूल्यांकन चेकपॉइंट के रूप में अपनाया गया है। OpenAI और Anthropic ने मॉडल रिलीज़ नोट्स में MMMU स्कोरों का सार्वजनिक रूप से उल्लेख किया है, और Google DeepMind दृश्य कार्यों के लिए Residual Network (ResNet) और U-Net आर्किटेक्चर पर प्रशिक्षण का मार्गदर्शन करने के लिए बेंचमार्क का उपयोग करता है। बेंचमार्क के अपडेट का उपयोग शैक्षणिक शोधकर्ताओं द्वारा Deep learning मॉडलों के सामान्यीकरण का अध्ययन करने के लिए भी किया जाता है, जिसमें BAIR (Berkeley AI Research) और Bhabha Atomic Research Centre के पेपर त्रुटि पैटर्न का विश्लेषण करते हैं।
आलोचकों ने नोट किया है कि MMMU की अंग्रेज़ी-भाषा, पश्चिमी-केंद्रित शैक्षिक सामग्री पर निर्भरता सांस्कृतिक पूर्वाग्रह पेश कर सकती है, यह चिंता Alibaba DAMO Academy और NEC के शोधकर्ताओं द्वारा भी व्यक्त की गई है। जवाब में, MMMU टीम ने 2025 के अंत में बहुभाषी विस्तार की योजना की घोषणा की है, हालाँकि विवरण अभी पुष्टि नहीं हुए हैं। इन सीमाओं के बावजूद, MMMU 2025.5 मल्टीमोडल तर्क के लिए एक मानक संदर्भ बना हुआ है, जो रणनीतिक सोच के लिए Chess computer मूल्यांकन जैसे अन्य बेंचमार्क को पूरक करता है।
भविष्य की दिशाएँ
Stanford AI Lab और University of Toronto के प्रमुख अन्वेषकों के नेतृत्व में MMMU टीम ने 2026 के लिए एक रोडमैप की रूपरेखा तैयार की है। नियोजित अपडेट में Generative AI मॉडलों का उपयोग करके गतिशील प्रश्न निर्माण शामिल है, जो प्रत्येक मूल्यांकन रन के लिए अद्वितीय प्रश्न बनाएगा, और वीडियो-आधारित कार्यों का एकीकरण शामिल है। टीम औद्योगिक सेटिंग्स में मल्टीमोडल प्रणालियों के लिए बेंचमार्क विकसित करने के लिए Nokia Bell Labs और Xerox PARC के साथ साझेदारी की भी खोज कर रही है, जैसे गुणवत्ता नियंत्रण और रिमोट सेंसिंग।
जैसे-जैसे Artificial intelligence प्रणालियाँ अधिक सक्षम होती जा रही हैं, MMMU 2025.5 जैसे बेंचमार्क यह सुनिश्चित करने में महत्वपूर्ण भूमिका निभाते हैं कि प्रगति मापनीय और सार्थक हो। कैलिब्रेशन और मजबूती पर अपडेट का जोर क्षेत्र की परिपक्वता को दर्शाता है, जो कच्ची सटीकता से आगे बढ़कर मॉडल व्यवहार के अधिक सूक्ष्म आकलन की ओर बढ़ता है। चिकित्सकों के लिए, MMMU 2025.5 मॉडलों की तुलना करने और विकास प्राथमिकताओं का मार्गदर्शन करने के लिए एक कठोर परीक्षण मैदान प्रदान करता है।