MMMU 2025.6 विशाल बहु-विषय बहुविध समझ (MMMU) बेंचमार्क का 2025 में छठा अपडेट है, जो जून 2025 में जारी किया गया। यह कृत्रिम बुद्धिमत्ता मॉडलों के लिए एक मानक मूल्यांकन सूट है, विशेष रूप से बड़े भाषा मॉडल जिनमें बहुविध क्षमताएं हैं, जो पाठ और छवियों के बीच समझने और तर्क करने की उनकी क्षमता का परीक्षण करता है। यह बेंचमार्क शोधकर्ताओं और उद्योग प्रयोगशालाओं द्वारा व्यापक रूप से उपयोग किया जाता है ताकि कॉलेज-स्तर के ज्ञान और दृश्य समझ की आवश्यकता वाले कार्यों पर मॉडल के प्रदर्शन की तुलना की जा सके।
MMMU बेंचमार्क मूल रूप से 2023 में कई संस्थानों के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिसमें कार्नेगी मेलन विश्वविद्यालय, स्टैनफोर्ड एआई लैब, और टोरंटो विश्वविद्यालय शामिल थे। 2025.6 संस्करण वार्षिक अपडेट की परंपरा को जारी रखता है, प्रत्येक रिलीज में नए प्रश्न जोड़े जाते हैं, कठिनाई को परिष्कृत किया जाता है, और गहन शिक्षण और जनरेटिव एआई में प्रगति के साथ तालमेल रखने के लिए कवरेज का विस्तार किया जाता है। यह अपडेट शैक्षणिक और उद्योग भागीदारों के एक संघ द्वारा प्रबंधित किया जाता है, हालांकि स्टीयरिंग समिति की सटीक संरचना सार्वजनिक रूप से खुलासा नहीं की गई है।
बेंचमार्क संरचना
MMMU 2025.6 में कॉलेज की पाठ्यपुस्तकों, व्याख्यान स्लाइडों और परीक्षा सामग्री से लिए गए बहुविकल्पीय प्रश्नों का एक सेट शामिल है। प्रत्येक प्रश्न में एक छवि (जैसे चार्ट, आरेख, या फोटोग्राफ) और एक टेक्स्ट प्रॉम्प्ट शामिल होता है, जिसके लिए मॉडल को दृश्य और पाठ्य सूचना को एकीकृत करना आवश्यक होता है। बेंचमार्क छह प्रमुख विषयों को कवर करता है: कला और डिजाइन, व्यवसाय, विज्ञान, स्वास्थ्य और चिकित्सा, मानविकी और सामाजिक विज्ञान, और प्रौद्योगिकी और इंजीनियरिंग। प्रत्येक विषय के भीतर, प्रश्नों को विशिष्ट विषयों जैसे रसायन विज्ञान, इतिहास और कंप्यूटर विज्ञान में विभाजित किया गया है, ताकि व्यापक कवरेज सुनिश्चित हो सके।
2025.6 रिलीज में प्रश्नों की सटीक संख्या आधिकारिक रूप से प्रकाशित नहीं की गई है, लेकिन पिछले संस्करणों में 30 विषयों में 11,500 से अधिक प्रश्न थे। 2025.6 अपडेट में समान या थोड़ा बड़ा आकार होने की उम्मीद है, जिसमें मशीन लर्निंग और तंत्रिका नेटवर्क जैसे क्षेत्रों में हालिया विकास को दर्शाने के लिए नए प्रश्न जोड़े गए हैं। प्रत्येक प्रश्न को सटीकता और स्पष्टता सुनिश्चित करने के लिए मानव एनोटेटरों द्वारा मैन्युअल रूप से सत्यापित किया जाता है, और बेंचमार्क में ओवरफिटिंग को रोकने के लिए एक सत्यापन सेट और एक परीक्षण सेट शामिल है।
मॉडल मूल्यांकन और स्कोर
MMMU 2025.6 का उपयोग ओपन-सोर्स सिस्टम से लेकर मालिकाना सिस्टम तक विभिन्न प्रकार के मॉडलों का मूल्यांकन करने के लिए किया जाता है। जून 2025 रिलीज में, प्रमुख ओपनएआई मॉडल, जैसे GPT-4o और इसके उत्तराधिकारी, ने शीर्ष स्कोर हासिल किए, GPT-4o ने परीक्षण सेट पर लगभग 78% सटीकता प्राप्त की। एंथ्रोपिक के Claude 3.5 Sonnet और Claude 4 मॉडल ने लगभग 75-77% स्कोर किया, जबकि गूगल डीपमाइंड के Gemini 1.5 Pro और Gemini 2.0 मॉडल ने समान परिणाम प्राप्त किए। ओपन-सोर्स मॉडल, जैसे Llama 3.1 405B और Qwen2.5-VL, ने कम स्कोर किया, आमतौर पर 60-70% की सीमा में, जो मालिकाना और ओपन मॉडल के बीच अंतर को दर्शाता है।
प्रदर्शन विषय के अनुसार काफी भिन्न होता है। उदाहरण के लिए, मॉडल प्रौद्योगिकी और इंजीनियरिंग में सबसे अच्छा प्रदर्शन करते हैं, जहां स्कोर 80% से अधिक हो सकते हैं, लेकिन मानविकी और सामाजिक विज्ञान में संघर्ष करते हैं, जहां स्कोर अक्सर 70% से नीचे होते हैं। यह असमानता उन डोमेन में बहुविध तर्क की चुनौती को उजागर करती है जिनमें ऐतिहासिक मानचित्र या कलाकृति जैसे दृश्य डेटा की सूक्ष्म व्याख्या की आवश्यकता होती है। बेंचमार्क प्रति-विषय स्कोर भी रिपोर्ट करता है, जिससे शोधकर्ता विशिष्ट कमजोरियों की पहचान कर सकते हैं, जैसे भौतिकी आरेखों या चिकित्सा इमेजिंग पर खराब प्रदर्शन।
महत्व और उपयोग के मामले
MMMU 2025.6 का प्राथमिक उद्देश्य बहुविध एआई प्रणालियों के लिए एक मानकीकृत, कठोर मूल्यांकन प्रदान करना है। सरल बेंचमार्क के विपरीत जो वस्तु पहचान या कैप्शन पीढ़ी पर केंद्रित होते हैं, MMMU के लिए गहन समझ और तर्क की आवश्यकता होती है, जिससे यह शिक्षा, स्वास्थ्य देखभाल और वैज्ञानिक अनुसंधान जैसे क्षेत्रों में वास्तविक दुनिया के प्रदर्शन का एक मजबूत भविष्यवक्ता बन जाता है। उदाहरण के लिए, एक मॉडल जो छवियों के साथ कॉलेज-स्तर के रसायन विज्ञान प्रश्नों का उत्तर दे सकता है, प्रयोगशाला सेटिंग्स या शैक्षिक उपकरणों में सहायता करने की अधिक संभावना रखता है।
तकनीकी कंपनियां और अनुसंधान प्रयोगशालाएं मॉडल विकास को निर्देशित करने के लिए MMMU स्कोर का उपयोग करती हैं। उदाहरण के लिए, अमेज़न वेब सर्विसेज और माइक्रोसॉफ्ट एज़्योर ने अपनी क्लाउड-आधारित एआई सेवाओं को बेंचमार्क करने के लिए MMMU का उपयोग किया है, जबकि एनवीडिया (हालांकि दी गई सूची में नहीं) और एएमडी ने अपने हार्डवेयर अनुकूलन प्रयासों में MMMU का संदर्भ लिया है। बेंचमार्क को अकादमिक पत्रों और उद्योग रिपोर्टों में भी उद्धृत किया जाता है, जिससे यह बहुविध मूल्यांकन के लिए एक वास्तविक मानक बन गया है।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, MMMU को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क का बहुविकल्पीय प्रारूप खुले अंत वाली तर्क क्षमताओं को पूरी तरह से कैप्चर नहीं करता है, और मॉडल प्रश्नों में सांख्यिकीय पैटर्न का शोषण कर सकते हैं। अन्य लोग ध्यान देते हैं कि बेंचमार्क स्थिर है, जिसका अर्थ है कि एक बार मॉडल को समान डेटा पर प्रशिक्षित किया गया है, तो उसका प्रदर्शन वास्तविक सामान्यीकरण को प्रतिबिंबित नहीं कर सकता है। इसे संबोधित करने के लिए, 2025.6 अपडेट ने नए प्रश्न प्रकार पेश किए, जिनमें बहु-चरण तर्क कार्य और विरोधाभासी जानकारी वाले प्रश्न शामिल हैं, लेकिन मूलभूत सीमाएं बनी हुई हैं।
इसके अतिरिक्त, बेंचमार्क की कॉलेज-स्तर के ज्ञान पर निर्भरता का मतलब है कि यह विशेष डोमेन, जैसे कानूनी या चिकित्सा अभ्यास, में मॉडलों का मूल्यांकन करने के लिए उपयुक्त नहीं हो सकता है, जहां विशेषज्ञ-स्तर के निर्णय की आवश्यकता होती है। इन चिंताओं के बावजूद, MMMU 2025.6 क्षेत्र में सबसे व्यापक और व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क में से एक बना हुआ है।
भविष्य की दिशाएं
MMMU टीम ने भविष्य के अपडेट की योजना की घोषणा की है, जिसमें MMMU 2025.7 और 2025.8 शामिल हैं, जिनमें अधिक गतिशील प्रश्न पीढ़ी और अनुकूली कठिनाई पेश करने की उम्मीद है। बेंचमार्क का विस्तार वीडियो और ऑडियो इनपुट को शामिल करने के लिए भी चर्चा है, जो कई मोडैलिटी को एक साथ संसाधित करने वाले बहुविध मॉडलों में बढ़ती रुचि को दर्शाता है। जैसे-जैसे ट्रांसफार्मर आर्किटेक्चर और मल्टी-हेड अटेंशन तंत्र विकसित होते रहते हैं, MMMU जैसे बेंचमार्क प्रगति को मापने और यह सुनिश्चित करने में महत्वपूर्ण भूमिका निभाएंगे कि एआई सिस्टम सक्षम और विश्वसनीय दोनों हैं।
संक्षेप में, MMMU 2025.6 बहुविध एआई के लिए एक प्रमुख मूल्यांकन उपकरण है, जो छह विषयों में कॉलेज-स्तर के तर्क का एक कठोर परीक्षण प्रदान करता है। इसके स्कोर उद्योग के नेताओं द्वारा बारीकी से देखे जाते हैं, और इसकी पद्धति भविष्य के बेंचमार्क के विकास को प्रभावित करती है। मध्य-2025 तक, यह बहुविध समझ मूल्यांकन में अत्याधुनिक का प्रतिनिधित्व करता है।