MMMU (मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग एंड रीज़निंग बेंचमार्क) एक बेंचमार्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन उन कार्यों पर करता है जिनके लिए कॉलेज-स्तरीय विषय ज्ञान और सुविचारित तर्क की आवश्यकता होती है। नवंबर 2023 में जारी, इसे ओहियो स्टेट यूनिवर्सिटी के जियांग यू और वाटरलू विश्वविद्यालय के वेन्हू चेन के नेतृत्व में 22 शोधकर्ताओं की एक टीम द्वारा बनाया गया था। यह बेंचमार्क CVPR 2024 में एक मौखिक पेपर के रूप में प्रस्तुत किया गया था और तब से यह अत्याधुनिक मल्टीमॉडल मॉडल के लिए एक मानक मूल्यांकन बन गया है।
इस बेंचमार्क में कॉलेज परीक्षाओं, क्विज़ और पाठ्यपुस्तकों से मैन्युअल रूप से एकत्रित 11.5 हजार मल्टीमॉडल प्रश्न शामिल हैं। ये प्रश्न छह विषयों - कला और डिज़ाइन, व्यवसाय, विज्ञान, स्वास्थ्य और चिकित्सा, मानविकी और सामाजिक विज्ञान, और तकनीक और इंजीनियरिंग - में फैले हुए हैं, जो 30 विषयों और 183 उप-क्षेत्रों को कवर करते हैं। प्रश्नों में अत्यधिक विषम छवि प्रकार शामिल हैं, जिनमें चार्ट, आरेख, मानचित्र, तालिकाएँ, संगीत शीट और रासायनिक संरचनाएँ शामिल हैं, जो सामान्य ज्ञान-आधारित दृश्य समझ से परे विशेषज्ञ-स्तर की धारणा, ज्ञान और तर्क का परीक्षण करने के लिए डिज़ाइन किए गए हैं।
डिज़ाइन और उद्देश्य
MMMU को मौजूदा मल्टीमॉडल बेंचमार्क में एक अंतर को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर बुनियादी दृश्य प्रश्न-उत्तर या सामान्य ज्ञान तर्क पर केंद्रित थे। निर्माताओं का लक्ष्य एक ऐसा बेंचमार्क बनाना था जिसके लिए गहन, डोमेन-विशिष्ट ज्ञान और बहु-चरणीय तर्क की आवश्यकता हो, जैसा कि एक कॉलेज छात्र को अपने प्रमुख विषय में समस्याओं को हल करने के लिए करना पड़ता है। प्रत्येक प्रश्न में एक छवि (या कई छवियाँ) और एक टेक्स्ट प्रॉम्प्ट शामिल होता है, जिसमें बहुविकल्पीय उत्तर होते हैं। छवियाँ केवल सजावटी नहीं हैं; वे समस्या को हल करने के लिए अभिन्न हैं, जिसके लिए मॉडल को दृश्य जानकारी को सटीक रूप से निकालने और व्याख्या करने की आवश्यकता होती है।
बेंचमार्क की कठिनाई रिलीज़ के समय मॉडलों के प्रदर्शन में परिलक्षित होती है। सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडलों ने केवल लगभग 56% सटीकता हासिल की, जो मानव विशेषज्ञ सीमा 76-89% से काफी नीचे थी। यह अंतर समकालीन मल्टीमॉडल मॉडल की जटिल, ज्ञान-गहन कार्यों को संभालने में सीमाओं को उजागर करता है।
विषय और विषय-वस्तु
छह विषय शैक्षणिक क्षेत्रों के एक व्यापक स्पेक्ट्रम को कवर करते हैं। कला और डिज़ाइन में चित्रकला, मूर्तिकला और ग्राफिक डिज़ाइन जैसे विषय शामिल हैं। व्यवसाय में वित्त, विपणन और प्रबंधन शामिल हैं। विज्ञान में भौतिकी, रसायन विज्ञान और जीव विज्ञान शामिल हैं। स्वास्थ्य और चिकित्सा में शरीर रचना विज्ञान, औषध विज्ञान और नैदानिक तर्क शामिल हैं। मानविकी और सामाजिक विज्ञान में इतिहास, दर्शनशास्त्र और अर्थशास्त्र शामिल हैं। तकनीक और इंजीनियरिंग में कंप्यूटर विज्ञान, विद्युत इंजीनियरिंग और मैकेनिकल इंजीनियरिंग शामिल हैं। प्रत्येक विषय को आगे उप-क्षेत्रों में विभाजित किया गया है, जिससे कॉलेज-स्तरीय पाठ्यक्रम का व्यापक कवरेज सुनिश्चित होता है।
प्रश्न वास्तविक शैक्षिक सामग्रियों, जैसे परीक्षाओं और पाठ्यपुस्तकों से प्राप्त होते हैं, जो यह सुनिश्चित करता है कि वे उस प्रकार के ज्ञान और तर्क को दर्शाते हैं जो कॉलेज के छात्रों से अपेक्षित है। संगीत शीट और रासायनिक संरचनाओं जैसे विविध छवि प्रकारों का समावेश जटिलता की एक अतिरिक्त परत जोड़ता है, क्योंकि मॉडल को विशेष दृश्य प्रारूपों की व्याख्या करने में कुशल होना चाहिए।
मूल्यांकन और प्रभाव
अपनी रिलीज़ के बाद से, MMMU अत्याधुनिक मल्टीमॉडल मॉडल के लिए एक मानक मूल्यांकन बन गया है। MMMU पर स्कोर नियमित रूप से GPT-4o, Gemini और Qwen-VL जैसी प्रणालियों की तकनीकी रिपोर्टों में रिपोर्ट किए जाते हैं। बेंचमार्क का उपयोग मल्टीमॉडल समझ में प्रगति को ट्रैक करने के लिए किया गया है, जिसमें मॉडल समय के साथ धीरे-धीरे अपनी सटीकता में सुधार कर रहे हैं। हालाँकि, 2025 तक के सबसे उन्नत मॉडल भी मानव विशेषज्ञ प्रदर्शन से कम हैं, जो दर्शाता है कि विशेषज्ञ-स्तर की मल्टीमॉडल तर्क प्राप्त करने में महत्वपूर्ण चुनौतियाँ बनी हुई हैं।
बेंचमार्क ने अन्य मूल्यांकन सुइट्स के विकास को भी प्रभावित किया है, क्योंकि शोधकर्ता अधिक चुनौतीपूर्ण और ज्ञान-गहन बेंचमार्क की आवश्यकता को पहचानते हैं। MMMU का कॉलेज-स्तरीय ज्ञान और सुविचारित तर्क पर जोर मल्टीमॉडल संदर्भों में लार्ज लैंग्वेज मॉडल की क्षमताओं के मूल्यांकन के लिए एक नया मानक स्थापित किया है।
सीमाएँ और आलोचनाएँ
व्यापक रूप से अपनाए जाने के बावजूद, MMMU को कुछ आलोचनाओं का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बहुविकल्पीय प्रारूप वास्तविक दुनिया के तर्क की खुली प्रकृति को पूरी तरह से कैप्चर नहीं कर सकता है। अन्य लोग ध्यान देते हैं कि कॉलेज-स्तरीय ज्ञान पर बेंचमार्क का ध्यान मल्टीमॉडल मॉडल के सभी व्यावहारिक अनुप्रयोगों का प्रतिनिधित्व नहीं कर सकता है। इसके अतिरिक्त, मैन्युअल संग्रह प्रक्रिया, गुणवत्ता सुनिश्चित करते हुए, स्वचालित रूप से उत्पन्न बेंचमार्क की तुलना में डेटासेट के आकार को सीमित करती है।
फिर भी, MMMU वर्तमान मल्टीमॉडल मॉडल की ऊपरी सीमाओं का आकलन करने के लिए एक मूल्यवान उपकरण बना हुआ है। इसके डिज़ाइन ने बेंचमार्क विकास में आगे के शोध को प्रेरित किया है, जिससे क्षेत्र को अधिक कठोर और व्यापक मूल्यांकन विधियों की ओर धकेला गया है।