MMMU 2025.10 2025 में जारी MMMU (मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग) बेंचमार्क का दसवां निर्धारित अपडेट है। MMMU एक व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन सूट है, जो कृत्रिम बुद्धिमत्ता प्रणालियों के लिए है जो दृश्य और पाठ्य दोनों जानकारी संसाधित करती हैं, जैसे कि दृष्टि क्षमताओं वाले बड़े भाषा मॉडल। 2025.10 संस्करण बेंचमार्क की परंपरा को जारी रखता है, जिसमें मशीन लर्निंग और डीप लर्निंग मॉडल की प्रगति को ट्रैक करने के लिए नए प्रश्न और कार्य जोड़े जाते हैं।
यह अपडेट अक्टूबर 2025 में पेश किया गया था, जो उस वर्ष की शुरुआत में शुरू हुए मासिक रिलीज़ के पैटर्न का अनुसरण करता है। 2025 श्रृंखला में प्रत्येक अपडेट का उद्देश्य ओपनएआई, एंथ्रोपिक, और गूगल-डीपमाइंड जैसे संगठनों के मल्टीमॉडल मॉडल के तेज़ विकास के साथ बेंचमार्क को अद्यतन रखना रहा है। 2025.10 संस्करण विशेष रूप से उन क्षेत्रों में कवरेज का विस्तार करने पर केंद्रित है जहां पहले 2025 संस्करणों में कमियां दिखीं, जिनमें चार्ट और आरेखों के साथ जटिल तर्क, और वीडियो फ्रेम की समझ शामिल है।
बेंचमार्क संरचना
MMMU 2025.10 मूल MMMU बेंचमार्क की मुख्य संरचना को बनाए रखता है, जो कई शैक्षणिक विषयों में प्रश्नों को व्यवस्थित करता है। इनमें कला, व्यवसाय, विज्ञान, इंजीनियरिंग, और मानविकी शामिल हैं। प्रत्येक प्रश्न एक छवि - जैसे कि एक तस्वीर, चार्ट, या योजनाबद्ध आरेख - को एक बहुविकल्पीय प्रश्न के साथ जोड़ता है। 2025.10 अपडेट लगभग 1,500 नए प्रश्न जोड़ता है, जिससे कुल संख्या 12,000 से अधिक हो जाती है। नए आइटम बहु-चरणीय तर्क पर जोर देते हैं, जहां एक मॉडल को सही उत्तर तक पहुंचने के लिए दृश्य संकेतों को डोमेन ज्ञान के साथ जोड़ना चाहिए।
बेंचमार्क को सबसे उन्नत तंत्रिका नेटवर्क प्रणालियों के लिए भी चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया है। सरल दृश्य प्रश्न-उत्तर कार्यों के विपरीत, MMMU प्रश्नों के लिए अक्सर कॉलेज-स्तरीय विशेषज्ञता की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न एक सर्किट आरेख दिखा सकता है और इसके विद्युत गुणों के बारे में पूछ सकता है, या एक ऐतिहासिक पेंटिंग प्रदर्शित कर सकता है और इसके सांस्कृतिक संदर्भ के बारे में पूछ सकता है।
स्कोरिंग और मूल्यांकन
मॉडल का मूल्यांकन सटीकता पर किया जाता है, जिसे सही उत्तर दिए गए प्रश्नों के प्रतिशत के रूप में मापा जाता है। 2025.10 अपडेट ने एक सख्त मूल्यांकन प्रोटोकॉल पेश किया जो गलत तर्क के साथ सही उत्तर प्रदान करने वाले मॉडल को दंडित करता है। यह परिवर्तन उन चिंताओं के जवाब में किया गया था कि कुछ मॉडल वास्तविक समझ के बिना सही अनुमान लगा रहे थे। मूल्यांकन में बिना किसी एक सही उत्तर वाले प्रश्नों का एक उपसमूह भी शामिल है, जो मॉडल की अनिश्चितता को स्वीकार करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है।
2025.10 के परिणामों से पता चला कि ओपनएआई, एंथ्रोपिक, और गूगल-डीपमाइंड के प्रमुख मॉडल ने उच्च 70 से निम्न 80 प्रतिशत रेंज में सटीकता स्कोर हासिल किए, जो 2025 की शुरुआत में मध्य-60 से ऊपर थे। अलीबाबा-दामियाओ अकादमी जैसे छोटे ओपन-सोर्स मॉडल ने आमतौर पर 50 से 60 के दशक में स्कोर किया, जो सीमांत और सुलभ मॉडल के बीच अंतर को उजागर करता है।
मॉडल विकास पर प्रभाव
2025.10 अपडेट ने प्रभावित किया है कि डेवलपर्स मल्टीमॉडल सिस्टम को कैसे प्रशिक्षित और परिष्कृत करते हैं। कई टीमें विकास के दौरान कृत्रिम बुद्धिमत्ता तर्क परीक्षणों जैसे अन्य मूल्यांकनों के साथ MMMU को एक प्रमुख बेंचमार्क के रूप में उपयोग करती हैं। नए तर्क-केंद्रित प्रश्नों ने शोधकर्ताओं को चेन-ऑफ-थॉट प्रॉम्प्टिंग और आरएलएआईएफ (एआई फीडबैक से सुदृढीकरण सीखना) जैसी तकनीकों में सुधार करने के लिए प्रेरित किया है।
कई ट्रांसफॉर्मर-आधारित आर्किटेक्चर को विशेष रूप से MMMU पर अच्छा प्रदर्शन करने के लिए ट्यून किया गया है। उदाहरण के लिए, ओपनएआई के GPT-5 विज़न मॉडल और एंथ्रोपिक के Claude 4.5 दोनों ने पोस्ट-ट्रेनिंग समायोजन का मार्गदर्शन करने के लिए MMMU 2025.10 परिणामों का उपयोग करने की सूचना दी। बेंचमार्क का उपयोग एमआईटी-सीएसएआईएल और स्टैनफोर्ड-एआई-लैब जैसी शैक्षणिक प्रयोगशालाओं द्वारा पाठ्यक्रम-सीखने और डेटा-वृद्धि रणनीतियों सहित नवीन प्रशिक्षण विधियों की तुलना करने के लिए भी किया गया है।
आलोचनाएं और सीमाएं
अपनी लोकप्रियता के बावजूद, MMMU 2025.10 को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क का बहुविकल्पीय प्रारूप वास्तविक दुनिया के उपयोग को प्रतिबिंबित नहीं करता है, जहां मॉडल को खुले-अंत वाले उत्तर उत्पन्न करने चाहिए। अन्य ध्यान देते हैं कि प्रश्न बैंक को समय के साथ याद किया जा सकता है, जिससे फुलाए हुए स्कोर हो सकते हैं। 2025.10 अपडेट ने पुराने प्रश्नों को घुमाकर और एक गतिशील मूल्यांकन मोड पेश करके इसे कम करने का प्रयास किया, लेकिन चिंताएं बनी रहती हैं।
इसके अतिरिक्त, बेंचमार्क की अंग्रेजी-भाषा सामग्री और पश्चिमी शैक्षणिक पाठ्यक्रम पर भारी निर्भरता को एक सीमा के रूप में चिह्नित किया गया है। बहुभाषी और सांस्कृतिक रूप से विविध प्रश्नों को जोड़ने के प्रयास धीमे रहे हैं, 2025.10 संस्करण में केवल कुछ गैर-अंग्रेजी आइटम जोड़े गए हैं। इसने भाभा-परमाणु-अनुसंधान और सैमसंग-रिसर्च सहित कुछ संगठनों को क्षेत्रीय आवश्यकताओं के अनुरूप अपने स्वयं के आंतरिक मूल्यांकन विकसित करने के लिए प्रेरित किया है।
भविष्य की दिशाएं
MMMU टीम ने 2025.11 अपडेट की योजनाओं की घोषणा की है, जो इंटरैक्टिव और बहु-मोड़ तर्क कार्यों पर केंद्रित होगा। इसके लिए मॉडलों को स्पष्टीकरण प्रश्न पूछने या अतिरिक्त छवियों का अनुरोध करने की आवश्यकता होगी, जो स्थिर प्रश्न-उत्तर जोड़े से आगे बढ़ते हैं। टीम एएमडी और क्वालकॉम जैसे उद्योग समूहों के साथ साझेदारी भी तलाश रही है ताकि बेंचमार्क को एज डिवाइसों के लिए अनुकूलित किया जा सके, जहां कम्प्यूटेशनल बाधाएं कड़ी हैं।
2025 के अंत तक, MMMU मल्टीमॉडल मशीन लर्निंग के क्षेत्र में सबसे अधिक उद्धृत बेंचमार्क में से एक बना हुआ है। इसका निरंतर विकास जनरेटिव एआई प्रणालियों के अधिक कठोर और यथार्थवादी मूल्यांकन की ओर व्यापक प्रवृत्ति को दर्शाता है। क्या यह मानक बना रहेगा, यह देखना बाकी है, लेकिन मॉडल विकास पर इसका प्रभाव निर्विवाद है।