अंग्रेज़ी से अनुवादित

MMMU 2024.3 मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग बेंचमार्क का 2024 का तीसरा अपडेट है, जो कॉलेज-स्तरीय मल्टीमॉडल कार्यों पर AI मॉडलों का मूल्यांकन करने के लिए एक डेटासेट है।

MMMU 2024.3 मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग (MMMU) बेंचमार्क का 2024 में जारी तीसरा अपडेट है, जो कॉलेज-स्तरीय मल्टीमॉडल समझ कार्यों पर कृत्रिम बुद्धिमत्ता प्रणालियों की क्षमताओं को मापने के लिए व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन सुइट है। यह बेंचमार्क कला, व्यवसाय, विज्ञान और मानविकी सहित विभिन्न विषयों में मॉडलों का परीक्षण करने के लिए डिज़ाइन किया गया है, जिसमें ऐसे प्रश्न शामिल हैं जिनके लिए पाठ और छवियों दोनों पर तर्क की आवश्यकता होती है। MMMU 2024.3 सहित प्रत्येक अपडेट, बड़े भाषा मॉडल और मल्टीमॉडल प्रणालियों की तीव्र प्रगति के साथ तालमेल रखने के लिए नए या संशोधित प्रश्न पेश करता है, जिससे यह सुनिश्चित होता है कि बेंचमार्क चुनौतीपूर्ण और प्रासंगिक बना रहे।

MMMU बेंचमार्क मूल रूप से मल्टीमॉडल AI प्रणालियों के कठोर मूल्यांकन की आवश्यकता को पूरा करने के लिए पेश किया गया था, जो दृश्य और पाठ्य जानकारी को संसाधित करने के लिए तंत्रिका नेटवर्क आर्किटेक्चर को जोड़ती हैं। 2024.3 अपडेट विशेष रूप से प्रश्न कठिनाई को परिष्कृत करने, डेटा लीकेज को कम करने, और जनरेटिव AI और तर्क में उभरती क्षमताओं का परीक्षण करने वाले नए उदाहरण जोड़ने पर केंद्रित है। रिलीज़ के समय, MMMU 2024.3 शोधकर्ताओं और डेवलपर्स के लिए ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड जैसे संगठनों, साथ ही स्टैनफोर्ड एआई लैब और बर्कले एआई रिसर्च जैसे शैक्षणिक संस्थानों के मॉडलों के प्रदर्शन की तुलना करने के लिए एक मानक संदर्भ के रूप में कार्य करता है।

बेंचमार्क संरचना

MMMU 2024.3 में छह मुख्य विषयों से लिए गए बहुविकल्पीय प्रश्न शामिल हैं: कला और डिज़ाइन, व्यवसाय, मानविकी, विज्ञान, स्वास्थ्य और चिकित्सा, और सामाजिक विज्ञान। प्रत्येक प्रश्न में एक छवि (जैसे चार्ट, आरेख, या फोटोग्राफ) और एक पाठ संकेत शामिल होता है, जिसके लिए मॉडल को चार विकल्पों में से सही उत्तर चुनने के लिए दृश्य और पाठ्य जानकारी को एकीकृत करना आवश्यक होता है। प्रश्न कॉलेज-स्तरीय होने के लिए डिज़ाइन किए गए हैं, जिनमें अक्सर बहु-चरणीय तर्क और डोमेन-विशिष्ट ज्ञान की आवश्यकता होती है। अपडेट में सभी विषयों में लगभग 11,500 प्रश्न शामिल हैं, जिनका वितरण पिछले संस्करणों के समान है, लेकिन पहले के संस्करणों में पहचानी गई समस्याओं को संबोधित करने के लिए संशोधित सामग्री के साथ।

मूल्यांकन पद्धति

MMMU 2024.3 पर मॉडलों का मूल्यांकन प्राथमिक मीट्रिक के रूप में सटीकता का उपयोग करके किया जाता है, जिसमें परिणाम समग्र डेटासेट और प्रति-विषय उपसमूह दोनों के लिए रिपोर्ट किए जाते हैं। बेंचमार्क को ज़ीरो-शॉट सेटिंग में उपयोग करने के लिए डिज़ाइन किया गया है, जहां मॉडल को डेटासेट पर किसी अतिरिक्त प्रशिक्षण या फाइन-ट्यूनिंग के बिना प्रश्न और छवि दी जाती है। यह दृष्टिकोण सुनिश्चित करता है कि प्रदर्शन मॉडल की अंतर्निहित मल्टीमॉडल समझ और तर्क क्षमताओं को दर्शाता है। व्यवहार में, शोधकर्ता अक्सर बेंचमार्क का उपयोग विभिन्न ट्रांसफॉर्मर आर्किटेक्चर या प्रशिक्षण व्यवस्थाओं वाले मॉडल वेरिएंट की तुलना करने और समय के साथ प्रगति को ट्रैक करने के लिए करते हैं। 2024.3 अपडेट में हाइपरपैरामीटर ट्यूनिंग के लिए एक सत्यापन सेट और अंतिम मूल्यांकन के लिए एक परीक्षण सेट भी शामिल है, जिसमें ओवरफिटिंग को रोकने के लिए परीक्षण सेट के उत्तर निजी रखे जाते हैं।

2024.3 में परिवर्तन

2024.3 अपडेट ने कई प्रमुख परिवर्तन पेश किए। पहला, इसने उन प्रश्नों को हटा दिया जो सार्वजनिक रूप से उपलब्ध हो गए थे या अस्पष्ट उत्तर वाले पाए गए थे, उन्हें नए, अधिक कठोर प्रश्नों से बदल दिया। दूसरा, इसने अस्थायी तर्क की आवश्यकता वाले प्रश्नों की एक नई श्रेणी जोड़ी, जैसे समय-श्रृंखला डेटा की व्याख्या करना या घटनाओं के अनुक्रम को समझना। तीसरा, इसने स्थानिक समझ का बेहतर परीक्षण करने के लिए वैज्ञानिक आंकड़ों और वास्तुशिल्प योजनाओं जैसे जटिल आरेखों से जुड़े प्रश्नों का अनुपात बढ़ाया। अंत में, अपडेट ने उत्तर स्पष्टीकरण की गुणवत्ता में सुधार किया, जो सत्यापन सेट के लिए प्रदान किए जाते हैं, ताकि त्रुटि विश्लेषण में सहायता मिल सके। ये परिवर्तन शोध समुदाय से प्राप्त प्रतिक्रिया के जवाब में और यह सुनिश्चित करने के लिए किए गए थे कि बेंचमार्क अत्याधुनिक प्रदर्शन का विश्वसनीय माप बना रहे।

प्रभाव और स्वीकृति

MMMU 2024.3 को AI शोध समुदाय द्वारा मल्टीमॉडल समझ के लिए एक मानक बेंचमार्क के रूप में व्यापक रूप से अपनाया गया है। इसका उपयोग कई शोध पत्रों और तकनीकी रिपोर्टों में GPT-4V, Claude 3, और Gemini जैसे मॉडलों का मूल्यांकन करने के लिए किया गया है, जिसके परिणाम अक्सर मीडिया कवरेज में उद्धृत किए जाते हैं। बेंचमार्क की कठिनाई और व्यापकता ने इसे गहन शिक्षण और मशीन लर्निंग में प्रगति का एक प्रमुख संकेतक बना दिया है। हालांकि, कुछ शोधकर्ताओं ने नोट किया है कि बेंचमार्क वास्तविक दुनिया के मल्टीमॉडल तर्क को पूरी तरह से कैप्चर नहीं कर सकता है, क्योंकि यह बहुविकल्पीय प्रश्नों और स्थिर छवियों पर निर्भर करता है। इसके बावजूद, MMMU 2024.3 उपलब्ध सबसे व्यापक और चुनौतीपूर्ण बेंचमार्क में से एक बना हुआ है, और इसके अपडेट मल्टीमॉडल AI प्रणालियों पर काम करने वालों द्वारा बारीकी से देखे जाते हैं।

भविष्य की दिशाएँ

जैसे-जैसे AI मॉडल में सुधार जारी है, MMMU बेंचमार्क के और विकसित होने की उम्मीद है। भविष्य के अपडेट में वीडियो या इंटरैक्टिव तत्व शामिल हो सकते हैं, और अधिक विषयों या अधिक सूक्ष्म तर्क कार्यों को शामिल करने के लिए विस्तार हो सकता है। टोरंटो विश्वविद्यालय और कार्नेगी मेलन विश्वविद्यालय जैसे संस्थानों से संबद्ध बेंचमार्क के अनुरक्षकों ने तकनीकी प्रगति के साथ तालमेल रखने के लिए नियमित अपडेट की प्रतिबद्धता व्यक्त की है। 2024.3 अपडेट इस चल रहे प्रयास का प्रमाण है, जो AI समुदाय के लिए एक कठोर और अद्यतित मूल्यांकन उपकरण प्रदान करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास