अंग्रेज़ी से अनुवादित

MMMU-Dev, MMMU बेंचमार्क का विकास उपसमुच्चय है, जिसे पूर्ण डेटासेट पर मूल्यांकन से पहले मॉडल समायोजन और सत्यापन के लिए डिज़ाइन किया गया है।

MMMU-Dev मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग (MMMU) बेंचमार्क का विकास उपसमुच्चय है, जो बड़े मल्टीमॉडल मॉडलों की क्षमताओं का मूल्यांकन करने के लिए उपयोग किया जाने वाला एक डेटासेट है। यह प्रश्नों का एक छोटा, क्यूरेटेड संग्रह प्रदान करता है जिसका उपयोग शोधकर्ता और डेवलपर्स मॉडलों को फाइन-ट्यून करने, पाइपलाइनों का परीक्षण करने, और पूर्ण मूल्यांकन सूट चलाने से पहले प्रयोगात्मक सेटअप को मान्य करने के लिए कर सकते हैं। विकास सेट का उद्देश्य मुख्य बेंचमार्क की संरचना और कठिनाई को प्रतिबिंबित करना है, जो पुनरावृत्त मॉडल सुधार के लिए एक व्यावहारिक संसाधन प्रदान करता है।

MMMU-Dev को 2023 में पूर्ण MMMU बेंचमार्क के साथ पेश किया गया था, जिसमें अल्बर्टा विश्वविद्यालय और अन्य शैक्षणिक साझेदारों सहित कई संस्थानों के शोधकर्ताओं की एक टीम शामिल थी। बेंचमार्क को उन कार्यों पर मॉडलों का आकलन करने के लिए डिज़ाइन किया गया था जिनके लिए छह विषयों में कॉलेज-स्तरीय ज्ञान की आवश्यकता होती है: कला और डिज़ाइन, व्यवसाय, विज्ञान, सामाजिक विज्ञान, स्वास्थ्य और चिकित्सा, और मानविकी। विकास सेट में आमतौर पर कुछ सौ प्रश्न होते हैं, जबकि पूर्ण बेंचमार्क में हजारों प्रश्न शामिल होते हैं, जिसमें व्यापक मूल्यांकन के लिए एक सत्यापन सेट और एक परीक्षण सेट होता है।

उद्देश्य और उपयोग के मामले

MMMU-Dev का प्राथमिक उद्देश्य मल्टीमॉडल AI प्रणालियों के विकास चक्र का समर्थन करना है। एक छोटा, प्रबंधनीय डेटासेट प्रदान करके, यह शोधकर्ताओं को सक्षम बनाता है:

  • दृश्य और पाठ्य तर्क दोनों की आवश्यकता वाले कार्यों पर मॉडलों को फाइन-ट्यून करना।
  • डेटा प्रोसेसिंग और मॉडल अनुमान पाइपलाइनों को डीबग करना।
  • विभिन्न घटकों के प्रभाव को समझने के लिए एब्लेशन अध्ययन करना, जैसे कि ध्यान तंत्र या Encoder-Decoder Architecture आर्किटेक्चर।
  • पूर्ण बेंचमार्क पर मूल्यांकन की कम्प्यूटेशनल लागत को वहन किए बिना, Learning Rate Scheduling और Temperature Scaling जैसे हाइपरपैरामीटर विकल्पों को मान्य करना।

क्योंकि विकास सेट बड़े बेंचमार्क का एक उपसमुच्चय है, MMMU-Dev पर परिणाम सत्यापन और परीक्षण सेटों पर अपेक्षित प्रदर्शन के लिए एक प्रॉक्सी के रूप में काम कर सकते हैं, हालांकि वे आधिकारिक मूल्यांकन के विकल्प नहीं हैं।

पूर्ण MMMU बेंचमार्क से संबंध

MMMU-Dev MMMU बेंचमार्क के तीन विभाजनों में से एक है: विकास (dev), सत्यापन (val), और परीक्षण। डेव सेट आमतौर पर मॉडल विकास और आंतरिक प्रयोग के लिए उपयोग किया जाता है, जबकि सत्यापन सेट हाइपरपैरामीटर ट्यूनिंग और मॉडल चयन के लिए उपयोग किया जाता है। परीक्षण सेट अंतिम मूल्यांकन के लिए आरक्षित है और अक्सर मॉडलों की निष्पक्ष तुलना के लिए लीडरबोर्ड में उपयोग किया जाता है। MMMU-Dev में प्रश्न पूर्ण बेंचमार्क के समान वितरण से लिए गए हैं, यह सुनिश्चित करते हुए कि डेव सेट पर प्रशिक्षित या ट्यून किए गए मॉडल किसी विशिष्ट उपसमुच्चय पर ओवरफिट नहीं होते हैं।

बेंचमार्क स्वयं कॉलेज-स्तरीय, विषय-विशिष्ट ज्ञान पर अपने जोर के लिए उल्लेखनीय है, जिसके लिए मॉडलों को छवियों, आरेखों, चार्टों और पाठ से जानकारी को एकीकृत करने की आवश्यकता होती है। यह MMMU-Dev को Large language model और मल्टीमॉडल प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए एक चुनौतीपूर्ण संसाधन बनाता है।

मूल्यांकन मेट्रिक्स और स्कोरिंग

MMMU-Dev पर प्रदर्शन आमतौर पर सटीकता का उपयोग करके मापा जाता है, जिसे सही उत्तर दिए गए प्रश्नों के प्रतिशत के रूप में परिभाषित किया जाता है। प्रत्येक प्रश्न बहुविकल्पीय होता है, जिसमें चार विकल्प होते हैं, और मॉडलों को प्रदान की गई छवि और पाठ के आधार पर सही उत्तर का चयन करना होता है। बेंचमार्क प्रति विषय सटीकता भी रिपोर्ट करता है, जिससे शोधकर्ता विशिष्ट ज्ञान डोमेन में ताकत और कमजोरियों की पहचान कर सकते हैं।

निष्पक्ष तुलना सुनिश्चित करने के लिए, बेंचमार्क एक मानक मूल्यांकन स्क्रिप्ट प्रदान करता है जो उत्तर पार्सिंग और स्कोरिंग को संभालता है। मॉडलों से एक विशिष्ट प्रारूप में उत्तर आउटपुट करने की अपेक्षा की जाती है, और स्क्रिप्ट वाक्यांशों में भिन्नताओं को ध्यान में रखती है। यह मानकीकरण प्रतिलिपि प्रस्तुत करने योग्य अनुसंधान और विभिन्न प्रणालियों में परिणामों की तुलना के लिए महत्वपूर्ण है।

सीमाएं और विचार

जबकि MMMU-Dev एक मूल्यवान संसाधन है, इसकी सीमाएं हैं। डेव सेट अपेक्षाकृत छोटा है, जो प्रदर्शन अनुमानों में उच्च भिन्नता पैदा कर सकता है। इसके अतिरिक्त, प्रश्न स्थिर हैं, जिसका अर्थ है कि यदि डेटासेट का बार-बार फाइन-ट्यूनिंग के लिए उपयोग किया जाता है तो मॉडल अंततः उत्तरों को याद कर सकते हैं। इसे कम करने के लिए, शोधकर्ता अक्सर डेव सेट का उपयोग केवल प्रारंभिक प्रयोगों के लिए करते हैं और अंतिम मॉडल चयन के लिए सत्यापन सेट पर निर्भर करते हैं।

एक और विचार यह है कि MMMU-Dev, पूर्ण बेंचमार्क की तरह, मुख्य रूप से अंग्रेजी में है और पश्चिमी शैक्षणिक ज्ञान पर केंद्रित है। यह अन्य भाषाओं और सांस्कृतिक संदर्भों में इसकी प्रयोज्यता को सीमित कर सकता है, हालांकि अधिक विविध डोमेन में मल्टीमॉडल बेंचमार्क का विस्तार करने के प्रयास चल रहे हैं।

यह भी देखें

  • MMMU (यदि उपलब्ध हो)
  • multimodal-learning (यदि उपलब्ध हो)
  • बेंचमार्क (यदि उपलब्ध हो)
  • evaluation (यदि उपलब्ध हो)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·benchmark·multimodal·evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास