MMMU 2025.7 मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग (MMMU) बेंचमार्क का 2025 में जारी सातवां अपडेट है, जो कृत्रिम बुद्धिमत्ता प्रणालियों के लिए व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन सूट है। यह बेंचमार्क बड़े भाषा मॉडल और अन्य मल्टीमॉडल मॉडल की कॉलेज-स्तरीय शैक्षणिक संदर्भ में छवियों और पाठ के बारे में तर्क करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है। 2025 श्रृंखला में प्रत्येक अपडेट जनरेटिव एआई प्रणालियों के तेजी से विकास के साथ तालमेल बनाए रखने के लिए नए प्रश्न, संशोधित स्कोरिंग प्रोटोकॉल, या ताज़ा संदर्भ उत्तर पेश करता है।
MMMU बेंचमार्क मूल रूप से मूल्यांकन में एक अंतर को संबोधित करने के लिए बनाया गया था: कई मौजूदा परीक्षण या तो केवल पाठ-आधारित तर्क या सरल छवि वर्गीकरण पर केंद्रित थे। MMMU के लिए मॉडलों को दृश्य जानकारी को जटिल, डोमेन-विशिष्ट ज्ञान के साथ एकीकृत करने की आवश्यकता होती है, जिसमें कला, इंजीनियरिंग, चिकित्सा और सामाजिक विज्ञान जैसे विषय शामिल होते हैं। 2025.7 अपडेट इस परंपरा को जारी रखता है, विशेष रूप से उन प्रश्नों पर जोर देता है जो बहु-चरणीय तर्क और कई दृश्य तत्वों से जानकारी के संश्लेषण की मांग करते हैं।
बेंचमार्क संरचना
MMMU 2025.7 अपने पूर्ववर्तियों की मूल संरचना को बरकरार रखता है। इसमें विश्वविद्यालय-स्तरीय पाठ्यपुस्तकों और व्याख्यान सामग्री से लिए गए बहुविकल्पीय प्रश्न शामिल हैं। प्रत्येक प्रश्न में एक छवि या आरेख शामिल होता है जो सही उत्तर तक पहुंचने के लिए आवश्यक होता है। प्रश्नों को अनुशासन और आवश्यक तर्क के प्रकार, जैसे बुनियादी पहचान, तार्किक निगमन, या मात्रात्मक विश्लेषण द्वारा वर्गीकृत किया जाता है।
2025.7 अपडेट ने एक समीक्षा प्रक्रिया के बाद संदर्भ उत्तरों का एक संशोधित सेट पेश किया, जिसमें पहले के संस्करणों में अस्पष्टताओं की पहचान की गई थी। यह संशोधन यह सुनिश्चित करने के लिए चल रहे प्रयास का हिस्सा था कि बेंचमार्क मॉडल क्षमता का एक विश्वसनीय माप बना रहे। अपडेट ने इंजीनियरिंग और कंप्यूटर विज्ञान श्रेणियों में प्रश्नों के पूल का भी विस्तार किया, जो मल्टीमॉडल अनुसंधान में इन क्षेत्रों के बढ़ते महत्व को दर्शाता है।
मूल्यांकन पद्धति
मॉडलों का मूल्यांकन MMMU 2025.7 पर एक मानकीकृत प्रोटोकॉल का उपयोग करके किया जाता है। प्रत्येक मॉडल को प्रश्नों का पूरा सेट प्रस्तुत किया जाता है, और इसके उत्तरों की तुलना संदर्भ उत्तरों से की जाती है। प्रदर्शन आमतौर पर समग्र सटीकता स्कोर के साथ-साथ अनुशासन और तर्क प्रकार द्वारा विभाजन के रूप में रिपोर्ट किया जाता है। यह विस्तृत रिपोर्टिंग शोधकर्ताओं को मॉडल की मल्टीमॉडल समझ में विशिष्ट ताकत और कमजोरियों की पहचान करने की अनुमति देती है।
2025.7 अपडेट में, मूल्यांकन प्रोटोकॉल को उन मॉडलों को ध्यान में रखने के लिए समायोजित किया गया था जो चेन-ऑफ-थॉट तर्क का उपयोग करते हैं। स्कोरिंग अब मॉडल के अंतिम उत्तर और उसके मध्यवर्ती तर्क चरणों के बीच अंतर करती है, हालांकि केवल अंतिम उत्तर सटीकता स्कोर निर्धारित करता है। यह परिवर्तन उन मॉडलों के विकास को प्रोत्साहित करने के लिए किया गया था जो अपने तर्क को समझा सकते हैं, बिना उन लोगों को दंडित किए जो ऐसा नहीं करते हैं।
प्रदर्शन रुझान
मूल MMMU बेंचमार्क जारी होने के बाद से, अग्रणी मॉडलों का प्रदर्शन काफी सुधरा है। 2025.7 अपडेट एक ऐसे परिदृश्य को दर्शाता है जिसमें सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियाँ, जो अक्सर ट्रांसफॉर्मर आर्किटेक्चर और मल्टी-हेड अटेंशन तंत्र पर निर्मित होती हैं, सटीकता स्तर प्राप्त करती हैं जो कुछ साल पहले अप्राप्य मानी जाती थीं। हालाँकि, बेंचमार्क महत्वपूर्ण अंतराल को उजागर करना जारी रखता है, विशेष रूप से उन प्रश्नों में जिनके लिए बारीक दृश्य विवरण या विशेष डोमेन ज्ञान की आवश्यकता होती है।
MMMU 2025.7 पर उल्लेखनीय परिणाम ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड जैसे संगठनों द्वारा विकसित मॉडलों से आए हैं। ये प्रणालियाँ आमतौर पर बड़े पैमाने पर गहन शिक्षण तकनीकों का उपयोग करती हैं, जिनमें अवशिष्ट नेटवर्क घटक और उन्नत हानि फलन शामिल हैं। बेंचमार्क का उपयोग ओपन-वेट मॉडलों का मूल्यांकन करने के लिए भी किया गया है, जो पारिस्थितिकी तंत्र का एक तुलनात्मक दृश्य प्रदान करता है।
प्रभाव और आलोचना
MMMU 2025.7 मशीन लर्निंग के क्षेत्र में शोधकर्ताओं और डेवलपर्स के लिए एक संदर्भ बिंदु बन गया है। इसके परिणाम अक्सर तकनीकी रिपोर्टों और शैक्षणिक पत्रों में उद्धृत किए जाते हैं, और इसे अक्सर लीडरबोर्ड में शामिल किया जाता है जो कई बेंचमार्क में प्रगति को ट्रैक करते हैं। अपडेट का कॉलेज-स्तरीय सामग्री पर ध्यान इसे सरल, क्राउड-सोर्स्ड प्रश्नों पर निर्भर बेंचमार्क से अलग करता है।
आलोचकों ने नोट किया है कि बेंचमार्क संतृप्ति एक चिंता का विषय है। जैसे-जैसे मॉडल सुधरते हैं, प्रश्नों के एक निश्चित सेट का सीमांत मूल्य घटता जाता है। 2025.7 अपडेट नए प्रश्नों को पेश करके और मौजूदा प्रश्नों को संशोधित करके इसे संबोधित करता है, लेकिन कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क में गतिशील रूप से उत्पन्न या प्रतिकूल उदाहरणों को भी शामिल करना चाहिए। अन्य लोग बताते हैं कि MMMU पर उच्च सटीकता आवश्यक रूप से मजबूत वास्तविक दुनिया के प्रदर्शन में अनुवाद नहीं करती है, जो अधिकांश स्थिर मूल्यांकन सूटों द्वारा साझा की गई एक सीमा है।
भविष्य की दिशाएँ
MMMU बेंचमार्क श्रृंखला के विकसित होते रहने की उम्मीद है। भविष्य के अपडेट में वीडियो-आधारित प्रश्न, इंटरैक्टिव कार्य, या तर्क प्रक्रियाओं का अधिक सूक्ष्म मूल्यांकन शामिल हो सकता है। बेंचमार्क के अनुरक्षकों ने संकेत दिया है कि वे डेटा संदूषण के जोखिम को कम करने के तरीकों की खोज कर रहे हैं, जहां मॉडल को बेंचमार्क प्रश्नों पर प्रशिक्षित किया जाता है जो सार्वजनिक डेटासेट में लीक हो जाते हैं। 2025.7 अपडेट में होल्ड-आउट प्रश्नों का एक छोटा सेट शामिल है जो सार्वजनिक रूप से जारी नहीं किए गए हैं, जो संदूषण जांच के रूप में कार्य करने के लिए हैं।
जैसे-जैसे तंत्रिका नेटवर्क आर्किटेक्चर और प्रशिक्षण विधियाँ आगे बढ़ती हैं, MMMU 2025.7 जैसे बेंचमार्क प्रगति को मापने के लिए आवश्यक उपकरण बने रहेंगे। वे सिस्टम की तुलना करने और उन अगली चुनौतियों की पहचान करने के लिए एक सामान्य भाषा प्रदान करते हैं जिन्हें क्षेत्र को संबोधित करना होगा।