अंग्रेज़ी से अनुवादित

MMMU 2025.4 बड़े पैमाने पर बहु-विषयक मल्टीमॉडल समझ बेंचमार्क का 2025 में चौथा अद्यतन है, जो कॉलेज-स्तरीय मल्टीमॉडल कार्यों पर एआई मॉडल का मूल्यांकन करने के लिए एक डेटासेट है। इसे दृश्य तर्क और ज्ञान एकीकरण में प्रगति को ट्रैक करने के लिए जारी किया गया था।

MMMU 2025.4, मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग (MMMU) बेंचमार्क का 2025 में जारी चौथा अपडेट है। यह एक डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों, विशेष रूप से दृश्य प्रसंस्करण वाले बड़े भाषा मॉडल की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो कई विषयों में कॉलेज-स्तर के ज्ञान की आवश्यकता वाले कार्यों पर केंद्रित है। बेंचमार्क में ऐसे प्रश्न शामिल हैं जो छवियों, आरेखों और पाठ को जोड़ते हैं, जो मॉडल की दृश्य जानकारी को समझने, उसके बारे में तर्क करने और सही उत्तर देने के लिए डोमेन-विशिष्ट ज्ञान लागू करने की क्षमता का परीक्षण करते हैं।

MMMU बेंचमार्क श्रृंखला को सरल वस्तु पहचान या कैप्शनिंग से परे मल्टीमॉडल एआई प्रणालियों के कठोर मूल्यांकन की आवश्यकता को पूरा करने के लिए बनाया गया था। बुनियादी दृश्य प्रश्न उत्तर पर केंद्रित पहले के बेंचमार्क के विपरीत, MMMU प्रश्न विश्वविद्यालय की पाठ्यपुस्तकों और परीक्षा सामग्री से लिए गए हैं, जिनमें भौतिकी, रसायन विज्ञान, चिकित्सा, कला इतिहास और इंजीनियरिंग जैसे विषय शामिल हैं। प्रत्येक प्रश्न के लिए मॉडल को दृश्य संकेतों को पाठ्य संदर्भ के साथ एकीकृत करना होता है और अक्सर बहु-चरणीय तर्क शामिल होता है। 2025.4 अपडेट इस परंपरा को जारी रखता है, नए प्रश्न जोड़ता है और मॉडल क्षमताओं में तेजी से प्रगति के साथ तालमेल रखने के लिए मूल्यांकन पद्धति को परिष्कृत करता है।

बेंचमार्क संरचना और सामग्री

MMMU 2025.4 अपने पूर्ववर्तियों की मूल संरचना को बनाए रखता है, प्रश्नों को छह व्यापक विषयों में व्यवस्थित करता है: कला और डिज़ाइन, व्यवसाय, विज्ञान, स्वास्थ्य और चिकित्सा, मानविकी और सामाजिक विज्ञान, और प्रौद्योगिकी और इंजीनियरिंग। प्रत्येक विषय को आगे विशिष्ट विषयों में विभाजित किया गया है, जैसे लेखांकन, जीव विज्ञान, कानून, या कंप्यूटर विज्ञान। प्रश्न बहुविकल्पीय हैं, जिनमें चार या पाँच विकल्प होते हैं, और सबसे उन्नत मॉडल के लिए भी चुनौतीपूर्ण होने के लिए डिज़ाइन किए गए हैं। डेटासेट में विकास के लिए एक सत्यापन सेट और अंतिम मूल्यांकन के लिए एक परीक्षण सेट शामिल है, जिसमें डेटा संदूषण को रोकने के लिए उत्तर जनता से छिपाए जाते हैं।

MMMU 2025.4 के प्रश्न जटिल दृश्य इनपुट पर निर्भरता के लिए उल्लेखनीय हैं, जिनमें चार्ट, ग्राफ़, चिकित्सा छवियाँ, सर्किट आरेख और ऐतिहासिक तस्वीरें शामिल हैं। उदाहरण के लिए, एक प्रश्न सर्किट योजनाबद्ध प्रस्तुत कर सकता है और धारा प्रवाह के बारे में पूछ सकता है, या एक हिस्टोलॉजी स्लाइड दिखा सकता है और एक रोग संबंधी स्थिति की पहचान की आवश्यकता हो सकती है। यह डिज़ाइन मॉडल को सूक्ष्म-स्तरीय दृश्य विश्लेषण करने के लिए मजबूर करता है, अक्सर उन्हें विशिष्ट क्षेत्रों पर ज़ूम करने या सूक्ष्म दृश्य अंतरों की व्याख्या करने की आवश्यकता होती है। बेंचमार्क में ऐसे प्रश्न भी शामिल हैं जहाँ दृश्य जानकारी आंशिक रूप से अप्रासंगिक या भ्रामक होती है, जो मॉडल की प्रासंगिक विवरणों पर ध्यान केंद्रित करने की क्षमता का परीक्षण करती है।

मूल्यांकन और स्कोरिंग

मॉडल का मूल्यांकन बहुविकल्पीय प्रश्नों के उत्तर देने में उनकी सटीकता के आधार पर किया जाता है। प्राथमिक मीट्रिक समग्र सटीकता है, लेकिन ताकत और कमजोरियों का विस्तृत दृश्य प्रदान करने के लिए परिणाम प्रति विषय और प्रति अनुशासन भी रिपोर्ट किए जाते हैं। बेंचमार्क ज़ीरो-शॉट मूल्यांकन प्रोटोकॉल का उपयोग करता है, जिसका अर्थ है कि परीक्षण से पहले मॉडल को MMMU डेटा पर फ़ाइन-ट्यून नहीं किया जाता है। इसका उद्देश्य मॉडल की सामान्य तर्क और ज्ञान पुनर्प्राप्ति क्षमताओं को मापना है, न कि बेंचमार्क-विशिष्ट पैटर्न को याद रखने की क्षमता।

स्कोरिंग मॉडल के अनुमानित उत्तर की तुलना वास्तविक उत्तर से करके की जाती है। मुक्त-रूप पाठ उत्पन्न करने वाले मॉडल के लिए, एक पार्सिंग चरण चयनित विकल्प को निकालता है। आधिकारिक लीडरबोर्ड विभिन्न शोध समूहों और कंपनियों से सबमिशन ट्रैक करता है, जिनमें ओपनएआई, एंथ्रोपिक, गूगल डीपमाइंड और अन्य शामिल हैं। 2025.4 अपडेट ने संभावित पूर्वाग्रहों को कम करने के लिए एक सख्त मूल्यांकन हार्नेस पेश किया, जैसे स्थिति पूर्वाग्रह जहाँ मॉडल कुछ उत्तर विकल्पों का पक्ष लेते हैं। इसमें प्रश्नों में उत्तर क्रम को यादृच्छिक करना और अधिक मजबूत उत्तर निष्कर्षण विधि का उपयोग शामिल है।

ऐतिहासिक संदर्भ और विकास

मूल MMMU बेंचमार्क 2023 के अंत में कई विश्वविद्यालयों के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिनमें कार्नेगी मेलन विश्वविद्यालय और स्टैनफोर्ड एआई लैब शामिल हैं। यह VQA और ScienceQA जैसे अन्य बेंचमार्क के साथ, मल्टीमॉडल मॉडल मूल्यांकन के लिए एक मानक संदर्भ बिंदु बन गया। एआई प्रणालियों की बढ़ती जटिलता को दर्शाने के लिए बेंचमार्क को नियमित रूप से अपडेट किया गया है। 2025.4 संस्करण 2025 के भीतर अपडेट की एक श्रृंखला का हिस्सा है, जो 2025.1, 2025.2 और 2025.3 के बाद आता है, प्रत्येक नए प्रश्न जोड़ता है और कभी-कभी उभरते क्षेत्रों को कवर करने के लिए विषय मिश्रण को समायोजित करता है।

2025 के अपडेट में एक महत्वपूर्ण बदलाव अस्थायी या कारण संबंधी तर्क की आवश्यकता वाले अधिक प्रश्नों को शामिल करना है, जो गतिशील प्रक्रियाओं को समझने की दिशा में एआई अनुसंधान में बदलाव को दर्शाता है। उदाहरण के लिए, कुछ प्रश्न जैविक प्रक्रिया में घटनाओं के अनुक्रम या यांत्रिक विफलता की प्रगति के बारे में पूछते हैं। यह बेहतर तर्क क्षमताओं वाले ट्रांसफार्मर आर्किटेक्चर को शामिल करने वाले गहन शिक्षण मॉडल में विकास के साथ संरेखित है। अपडेट ने गैर-पश्चिमी संदर्भों के कवरेज का भी विस्तार किया, जैसे एशियाई या अफ्रीकी कलाकृतियों की विशेषता वाले कला इतिहास प्रश्न, मूल्यांकन में सांस्कृतिक पूर्वाग्रह को कम करने के लिए।

प्रभाव और स्वागत

MMMU 2025.4 का व्यापक रूप से एआई अनुसंधान समुदाय द्वारा नए मॉडल को बेंचमार्क करने के लिए उपयोग किया गया है। बेंचमार्क के परिणाम अक्सर शोध पत्रों और तकनीकी रिपोर्टों में उद्धृत किए जाते हैं, जो मॉडल गुणवत्ता की धारणाओं को प्रभावित करते हैं। उदाहरण के लिए, MMMU पर अच्छा प्रदर्शन करने वाला मॉडल अक्सर मजबूत मल्टीमॉडल तर्क कौशल रखने वाला माना जाता है, जो शिक्षा, स्वास्थ्य सेवा और स्वायत्त प्रणालियों में अनुप्रयोगों के लिए मूल्यवान है। बेंचमार्क का उपयोग अमेज़न वेब सर्विसेज और गूगल क्लाउड जैसी कंपनियों द्वारा अपनी एआई सेवाओं के विकास का मार्गदर्शन करने के लिए आंतरिक रूप से भी किया गया है।

आलोचकों ने नोट किया है कि MMMU, सभी बेंचमार्क की तरह, सीमाएँ हैं। कुछ का तर्क है कि बहुविकल्पीय प्रारूप वास्तविक दुनिया के तर्क को पूरी तरह से कैप्चर नहीं करता है, जहाँ उत्तर पूर्व-निर्धारित नहीं होते हैं। अन्य बताते हैं कि कॉलेज-स्तर के ज्ञान पर बेंचमार्क की निर्भरता रोजमर्रा के उपयोगकर्ताओं की आवश्यकताओं को प्रतिबिंबित नहीं कर सकती है। इन चिंताओं के बावजूद, MMMU 2025.4 जनरेटिव एआई और मल्टीमॉडल समझ में प्रगति को ट्रैक करने के लिए एक प्रमुख उपकरण बना हुआ है। इसके निरंतर अपडेट यह सुनिश्चित करते हैं कि मॉडल विकसित होने पर यह प्रासंगिक बना रहे, एक चलता-फिरता लक्ष्य प्रदान करता है जो क्षेत्र को आगे बढ़ाता है।

भविष्य की दिशाएँ

MMMU के निर्माताओं ने आगे के अपडेट की योजनाओं का संकेत दिया है, जिसमें संभावित रूप से अधिक खुले-अंत वाले प्रश्न और इंटरैक्टिव कार्य शामिल हैं। वीडियो इनपुट को शामिल करने की भी चर्चा है, जिसके लिए मॉडल को फ्रेम में अस्थायी जानकारी संसाधित करने की आवश्यकता होगी। 2026 की शुरुआत तक, अगले संस्करण के बारे में कोई आधिकारिक घोषणा नहीं की गई है, लेकिन त्रैमासिक अपडेट के पैटर्न से पता चलता है कि MMMU 2025.5 या 2026 संस्करण आ सकता है। बेंचमार्क का विकास एआई मूल्यांकन के व्यापक प्रक्षेपवक्र को दर्शाता है, जो सरल पैटर्न पहचान से जटिल, बहु-चरणीय तर्क की ओर बढ़ रहा है जो मानव विशेषज्ञ प्रदर्शन की नकल करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास