MMMU 2025.9 बहु-विषय मल्टीमॉडल समझ (MMMU) बेंचमार्क का नौवां अपडेट है, जो 2025 में जारी किया गया था। यह कृत्रिम बुद्धिमत्ता मॉडलों की कॉलेज-स्तरीय विषयों में पाठ और छवियों को समझने और तर्क करने की क्षमता का मूल्यांकन करता है। यह बेंचमार्क शोधकर्ताओं और कंपनियों द्वारा बड़े भाषा मॉडलों और मल्टीमॉडल प्रणालियों की क्षमताओं की तुलना करने के लिए व्यापक रूप से उपयोग किया जाता है।
MMMU 2025.9 बेंचमार्क की परंपरा को जारी रखता है, जिसमें विश्वविद्यालय की पाठ्यपुस्तकों, व्याख्यान स्लाइड्स और शैक्षणिक पत्रों से प्राप्त प्रश्न प्रस्तुत किए जाते हैं। प्रत्येक प्रश्न में एक छवि शामिल होती है, जैसे आरेख, चार्ट या फोटोग्राफ, साथ ही बहुविकल्पीय उत्तर। बेंचमार्क में कला, जीव विज्ञान, व्यवसाय, रसायन विज्ञान, कंप्यूटर विज्ञान, अर्थशास्त्र, इंजीनियरिंग, भूगोल, इतिहास, साहित्य, गणित, भौतिकी और मनोविज्ञान जैसे विषय शामिल हैं। 2025.9 संस्करण एक नया प्रश्न सेट और अद्यतन स्कोरिंग प्रोटोकॉल पेश करता है।
प्रश्न सेट और संरचना
2025.9 अपडेट में 11,500 प्रश्न शामिल हैं, जो पिछले 2025.8 रिलीज़ के 11,000 प्रश्नों से अधिक है। प्रश्नों को 900 आइटमों के सत्यापन सेट और 10,600 आइटमों के परीक्षण सेट में विभाजित किया गया है। प्रत्येक प्रश्न को मैन्युअल रूप से सत्यापित किया जाता है ताकि यह सुनिश्चित हो सके कि समस्या को हल करने के लिए छवि आवश्यक है, जिससे उत्तर केवल पाठ से प्राप्त नहीं किए जा सकें। विषयों के बीच वितरण संतुलित रहता है, प्रत्येक विषय क्षेत्र में लगभग 850 प्रश्न होते हैं। अपडेट में 500 प्रश्नों का एक नया उपसमूह भी शामिल है जो विशेष रूप से चिकित्सा इमेजिंग और इंजीनियरिंग ब्लूप्रिंट में दृश्य तर्क को लक्षित करता है, जो उभरते अनुप्रयोग क्षेत्रों को दर्शाता है।
मॉडल मूल्यांकन और स्कोर
आधिकारिक सितंबर 2025 मूल्यांकन में, कई प्रमुख मॉडलों का आकलन किया गया। OpenAI के GPT-5.2 ने 82.4% का उच्चतम स्कोर हासिल किया, जो 2025.6 अपडेट में GPT-5.1 द्वारा स्थापित 80.1% के पिछले रिकॉर्ड को पार कर गया। Google DeepMind के Gemini 2.5 Pro ने 79.8% स्कोर किया, जबकि Anthropic के Claude 4.5 Opus ने 77.3% तक पहुंच गया। ओपन-सोर्स मॉडलों ने भी प्रगति दिखाई: Meta के Llama 4.1 405B ने 68.9% स्कोर किया, और Alibaba DAMO Academy के Qwen2.5-VL-72B ने 65.2% हासिल किया। ये स्कोर अधिकांश मॉडलों के लिए पिछले अपडेट की तुलना में 3-5 प्रतिशत अंकों का सुधार दर्शाते हैं, जो मल्टीमॉडल तर्क में स्थिर प्रगति का संकेत देते हैं।
मूल्यांकन पद्धति
MMMU 2025.9 एक शून्य-शॉट मूल्यांकन प्रोटोकॉल का उपयोग करता है, जिसका अर्थ है कि परीक्षण से पहले मॉडलों को बेंचमार्क पर फाइन-ट्यून नहीं किया जाता है। प्रत्येक मॉडल को प्रश्न पाठ और छवि प्राप्त होती है, और उसे चार विकल्पों में से सही उत्तर चुनना होता है। बेंचमार्क एक सख्त सटीकता मीट्रिक का उपयोग करता है, जिसमें आंशिक क्रेडिट नहीं दिया जाता है। भिन्नता को कम करने के लिए, प्रत्येक मॉडल को विभिन्न यादृच्छिक बीजों के साथ तीन बार चलाया जाता है, और औसत स्कोर की रिपोर्ट की जाती है। मूल्यांकन हार्नेस सार्वजनिक रूप से उपलब्ध है, जिससे तीसरे पक्ष परिणामों को पुन: उत्पन्न कर सकते हैं। बेंचमार्क में एक मानव आधार रेखा भी शामिल है: प्रासंगिक प्रमुख विषयों वाले 50 विश्वविद्यालय छात्रों के एक समूह ने औसतन 85.7% स्कोर किया, जो AI प्रदर्शन के लिए एक संदर्भ बिंदु प्रदान करता है।
प्रभाव और उपयोग
MMMU 2025.9 मल्टीमॉडल AI प्रणालियों की तुलना के लिए एक मानक संदर्भ बन गया है। OpenAI, Anthropic और Google DeepMind जैसी कंपनियां अपनी प्रगति को ट्रैक करने और परिणामों को सार्वजनिक करने के लिए बेंचमार्क का उपयोग करती हैं। Stanford AI Lab और Berkeley AI Research सहित शैक्षणिक संस्थान, मल्टीमॉडल लर्निंग और विज़न-लैंग्वेज मॉडल पर पेपरों में MMMU स्कोर का उल्लेख करते हैं। बेंचमार्क ट्रांसफॉर्मर-आधारित आर्किटेक्चर के विकास को भी प्रभावित करता है, क्योंकि शोधकर्ता अटेंशन मैकेनिज्म और क्रॉस-अटेंशन परतों को बेहतर बनाने के लिए विफलता पैटर्न का विश्लेषण करते हैं। 2025.9 अपडेट ने एक लीडरबोर्ड पेश किया जो उपयोगकर्ताओं को मॉडल आकार, डोमेन और तर्क प्रकार के आधार पर परिणामों को फ़िल्टर करने की अनुमति देता है, जिससे अधिक सूक्ष्म विश्लेषण संभव होता है।
भविष्य की दिशाएं
MMMU टीम ने घोषणा की है कि 2025.10 अपडेट प्रश्न सेट को 12,000 आइटमों तक विस्तारित करेगा और वीडियो क्लिप में अस्थायी तर्क के लिए एक नई श्रेणी जोड़ेगा। वे अधिक जटिल बहु-चरणीय समस्याओं के साथ एक "हार्ड मोड" पेश करने की भी योजना बना रहे हैं। बेंचमार्क मानव-स्तरीय AI समझ की ओर प्रगति को मापने के लिए एक प्रमुख उपकरण बना हुआ है, क्योंकि शीर्ष मॉडलों और मानव आधार रेखा के बीच का अंतर कम हो रहा है। सितंबर 2025 तक, सर्वश्रेष्ठ AI मॉडल मानव औसत के 3.3 प्रतिशत अंकों के भीतर है, जो 2024 की शुरुआत में देखे गए 10-अंकों के अंतर से एक महत्वपूर्ण सुधार है।