अंग्रेज़ी से अनुवादित

MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark) एक बेंचमार्क है जो बहुविध बड़े भाषा मॉडलों का मूल्यांकन कॉलेज-स्तरीय कार्यों पर करने के लिए है, जिनमें छह विषयों में विशेषज्ञ ज्ञान और सोच-समझकर तर्क की आवश्यकता होती है।

MMMU (मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग एंड रीज़निंग बेंचमार्क) एक बेंचमार्क है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन उन कार्यों पर करता है जिनके लिए कॉलेज-स्तरीय विषय ज्ञान और सुविचारित तर्क की आवश्यकता होती है। नवंबर 2023 में जारी, इसे ओहियो स्टेट यूनिवर्सिटी के जियांग यू और वाटरलू विश्वविद्यालय के वेन्हू चेन के नेतृत्व में 22 शोधकर्ताओं की एक टीम द्वारा बनाया गया था। यह बेंचमार्क CVPR 2024 में एक मौखिक पेपर के रूप में प्रस्तुत किया गया था और तब से यह अत्याधुनिक मल्टीमॉडल मॉडल के लिए एक मानक मूल्यांकन बन गया है।

इस बेंचमार्क में कॉलेज परीक्षाओं, क्विज़ और पाठ्यपुस्तकों से मैन्युअल रूप से एकत्रित 11.5 हजार मल्टीमॉडल प्रश्न शामिल हैं। ये प्रश्न छह विषयों - कला और डिज़ाइन, व्यवसाय, विज्ञान, स्वास्थ्य और चिकित्सा, मानविकी और सामाजिक विज्ञान, और तकनीक और इंजीनियरिंग - में फैले हुए हैं, जो 30 विषयों और 183 उप-क्षेत्रों को कवर करते हैं। प्रश्नों में अत्यधिक विषम छवि प्रकार शामिल हैं, जिनमें चार्ट, आरेख, मानचित्र, तालिकाएँ, संगीत शीट और रासायनिक संरचनाएँ शामिल हैं, जो सामान्य ज्ञान-आधारित दृश्य समझ से परे विशेषज्ञ-स्तर की धारणा, ज्ञान और तर्क का परीक्षण करने के लिए डिज़ाइन किए गए हैं।

डिज़ाइन और उद्देश्य

MMMU को मौजूदा मल्टीमॉडल बेंचमार्क में एक अंतर को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर बुनियादी दृश्य प्रश्न-उत्तर या सामान्य ज्ञान तर्क पर केंद्रित थे। निर्माताओं का लक्ष्य एक ऐसा बेंचमार्क बनाना था जिसके लिए गहन, डोमेन-विशिष्ट ज्ञान और बहु-चरणीय तर्क की आवश्यकता हो, जैसा कि एक कॉलेज छात्र को अपने प्रमुख विषय में समस्याओं को हल करने के लिए करना पड़ता है। प्रत्येक प्रश्न में एक छवि (या कई छवियाँ) और एक टेक्स्ट प्रॉम्प्ट शामिल होता है, जिसमें बहुविकल्पीय उत्तर होते हैं। छवियाँ केवल सजावटी नहीं हैं; वे समस्या को हल करने के लिए अभिन्न हैं, जिसके लिए मॉडल को दृश्य जानकारी को सटीक रूप से निकालने और व्याख्या करने की आवश्यकता होती है।

बेंचमार्क की कठिनाई रिलीज़ के समय मॉडलों के प्रदर्शन में परिलक्षित होती है। सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडलों ने केवल लगभग 56% सटीकता हासिल की, जो मानव विशेषज्ञ सीमा 76-89% से काफी नीचे थी। यह अंतर समकालीन मल्टीमॉडल मॉडल की जटिल, ज्ञान-गहन कार्यों को संभालने में सीमाओं को उजागर करता है।

विषय और विषय-वस्तु

छह विषय शैक्षणिक क्षेत्रों के एक व्यापक स्पेक्ट्रम को कवर करते हैं। कला और डिज़ाइन में चित्रकला, मूर्तिकला और ग्राफिक डिज़ाइन जैसे विषय शामिल हैं। व्यवसाय में वित्त, विपणन और प्रबंधन शामिल हैं। विज्ञान में भौतिकी, रसायन विज्ञान और जीव विज्ञान शामिल हैं। स्वास्थ्य और चिकित्सा में शरीर रचना विज्ञान, औषध विज्ञान और नैदानिक तर्क शामिल हैं। मानविकी और सामाजिक विज्ञान में इतिहास, दर्शनशास्त्र और अर्थशास्त्र शामिल हैं। तकनीक और इंजीनियरिंग में कंप्यूटर विज्ञान, विद्युत इंजीनियरिंग और मैकेनिकल इंजीनियरिंग शामिल हैं। प्रत्येक विषय को आगे उप-क्षेत्रों में विभाजित किया गया है, जिससे कॉलेज-स्तरीय पाठ्यक्रम का व्यापक कवरेज सुनिश्चित होता है।

प्रश्न वास्तविक शैक्षिक सामग्रियों, जैसे परीक्षाओं और पाठ्यपुस्तकों से प्राप्त होते हैं, जो यह सुनिश्चित करता है कि वे उस प्रकार के ज्ञान और तर्क को दर्शाते हैं जो कॉलेज के छात्रों से अपेक्षित है। संगीत शीट और रासायनिक संरचनाओं जैसे विविध छवि प्रकारों का समावेश जटिलता की एक अतिरिक्त परत जोड़ता है, क्योंकि मॉडल को विशेष दृश्य प्रारूपों की व्याख्या करने में कुशल होना चाहिए।

मूल्यांकन और प्रभाव

अपनी रिलीज़ के बाद से, MMMU अत्याधुनिक मल्टीमॉडल मॉडल के लिए एक मानक मूल्यांकन बन गया है। MMMU पर स्कोर नियमित रूप से GPT-4o, Gemini और Qwen-VL जैसी प्रणालियों की तकनीकी रिपोर्टों में रिपोर्ट किए जाते हैं। बेंचमार्क का उपयोग मल्टीमॉडल समझ में प्रगति को ट्रैक करने के लिए किया गया है, जिसमें मॉडल समय के साथ धीरे-धीरे अपनी सटीकता में सुधार कर रहे हैं। हालाँकि, 2025 तक के सबसे उन्नत मॉडल भी मानव विशेषज्ञ प्रदर्शन से कम हैं, जो दर्शाता है कि विशेषज्ञ-स्तर की मल्टीमॉडल तर्क प्राप्त करने में महत्वपूर्ण चुनौतियाँ बनी हुई हैं।

बेंचमार्क ने अन्य मूल्यांकन सुइट्स के विकास को भी प्रभावित किया है, क्योंकि शोधकर्ता अधिक चुनौतीपूर्ण और ज्ञान-गहन बेंचमार्क की आवश्यकता को पहचानते हैं। MMMU का कॉलेज-स्तरीय ज्ञान और सुविचारित तर्क पर जोर मल्टीमॉडल संदर्भों में लार्ज लैंग्वेज मॉडल की क्षमताओं के मूल्यांकन के लिए एक नया मानक स्थापित किया है।

सीमाएँ और आलोचनाएँ

व्यापक रूप से अपनाए जाने के बावजूद, MMMU को कुछ आलोचनाओं का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बहुविकल्पीय प्रारूप वास्तविक दुनिया के तर्क की खुली प्रकृति को पूरी तरह से कैप्चर नहीं कर सकता है। अन्य लोग ध्यान देते हैं कि कॉलेज-स्तरीय ज्ञान पर बेंचमार्क का ध्यान मल्टीमॉडल मॉडल के सभी व्यावहारिक अनुप्रयोगों का प्रतिनिधित्व नहीं कर सकता है। इसके अतिरिक्त, मैन्युअल संग्रह प्रक्रिया, गुणवत्ता सुनिश्चित करते हुए, स्वचालित रूप से उत्पन्न बेंचमार्क की तुलना में डेटासेट के आकार को सीमित करती है।

फिर भी, MMMU वर्तमान मल्टीमॉडल मॉडल की ऊपरी सीमाओं का आकलन करने के लिए एक मूल्यवान उपकरण बना हुआ है। इसके डिज़ाइन ने बेंचमार्क विकास में आगे के शोध को प्रेरित किया है, जिससे क्षेत्र को अधिक कठोर और व्यापक मूल्यांकन विधियों की ओर धकेला गया है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास