अंग्रेज़ी से अनुवादित

MMMU 2025.3 बहु-विषयक मल्टीमॉडल समझ बेंचमार्क का 2025 का तीसरा अद्यतन है, जो विविध शैक्षणिक विषयों और दृश्य इनपुट में मल्टीमॉडल AI मॉडलों के मूल्यांकन के लिए कार्यों का एक समूह है।

MMMU 2025.3, वर्ष 2025 में जारी मैसिव मल्टी-डिसिप्लिन मल्टीमोडल अंडरस्टैंडिंग (MMMU) बेंचमार्क का तीसरा अद्यतन है। यह एक मानकीकृत मूल्यांकन सुइट है जिसे मल्टीमोडल आर्टिफिशियल इंटेलिजेंस सिस्टम, विशेष रूप से दृष्टि घटकों वाले बड़े भाषा मॉडल की क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है, जो शैक्षणिक और व्यावसायिक विषयों की एक विस्तृत श्रृंखला में कार्य करते हैं। यह बेंचमार्क मूल MMMU ढांचे पर आधारित है, जिसे किसी मॉडल की चार्ट, आरेख और छवियों जैसी दृश्य जानकारी को पाठ्य प्रश्नों के साथ समझने और तर्क करने की क्षमता को मापने के लिए पेश किया गया था।

यह अद्यतन बेंचमार्क के आवधिक संशोधनों की श्रृंखला का हिस्सा है, जो मल्टीमोडल AI प्रौद्योगिकी के तीव्र विकास को दर्शाता है। प्रत्येक अद्यतन आमतौर पर नए प्रश्न सेट पेश करता है, मौजूदा कार्यों को परिष्कृत करता है, और मॉडलों को प्रदर्शन मेट्रिक्स को संतृप्त करने से रोकने के लिए कठिनाई स्तरों को समायोजित करता है। MMMU 2025.3 विशेष रूप से पिछले संस्करणों में पहचाने गए अंतरालों को लक्षित करता है, जिसमें अधिक सूक्ष्म दृश्य तर्क, क्रॉस-अनुशासनात्मक प्रश्न और बहु-चरणीय अनुमान की आवश्यकता वाले कार्य शामिल हैं।

बेंचमार्क संरचना

MMMU 2025.3 में विश्वविद्यालय-स्तर की पाठ्यपुस्तकों और व्याख्यान सामग्री से प्राप्त हजारों बहुविकल्पीय प्रश्न शामिल हैं। प्रश्न छह मुख्य विषयों में फैले हुए हैं: कला और डिज़ाइन, व्यवसाय, विज्ञान, स्वास्थ्य और चिकित्सा, मानविकी और सामाजिक विज्ञान, और प्रौद्योगिकी और इंजीनियरिंग। प्रत्येक प्रश्न में एक छवि, एक पाठ्य संकेत और चार उत्तर विकल्प शामिल हैं, जिनमें केवल एक सही उत्तर होता है। बेंचमार्क को केवल दृश्य धारणा ही नहीं, बल्कि डोमेन-विशिष्ट ज्ञान और तार्किक निगमन का परीक्षण करने के लिए डिज़ाइन किया गया है।

2025.3 संस्करण में संशोधित कठिनाई वितरण पेश किया गया है, जिसमें सरल पैटर्न पहचान की तुलना में उन्नत तर्क की आवश्यकता वाले प्रश्नों का अनुपात अधिक है। इसमें नए प्रश्नों का एक उपसमूह भी शामिल है जिसमें कई छवियों की तुलना करना या उच्च जटिलता वाले डेटा विज़ुअलाइज़ेशन, जैसे बहु-अक्ष ग्राफ़ और वैज्ञानिक आरेख, की व्याख्या करना आवश्यक है।

मूल्यांकन पद्धति

मॉडलों का मूल्यांकन प्रश्नों के पूर्ण सेट का उत्तर देने में उनकी सटीकता के आधार पर किया जाता है, जिसमें स्कोर प्रतिशत के रूप में रिपोर्ट किए जाते हैं। बेंचमार्क आमतौर पर एक शून्य-शॉट सेटिंग में प्रशासित किया जाता है, जिसका अर्थ है कि मॉडल को विशिष्ट प्रश्न सेट पर कोई पूर्व उदाहरण या फाइन-ट्यूनिंग नहीं दी जाती है। यह दृष्टिकोण स्मरण के बजाय सामान्यीकरणीय ज्ञान और तर्क क्षमता को मापने का लक्ष्य रखता है।

निष्पक्षता सुनिश्चित करने के लिए, बेंचमार्क एक मानकीकृत संकेत प्रारूप और छवि रिज़ॉल्यूशन का उपयोग करता है। 2025.3 अद्यतन में अस्पष्ट प्रश्नों को संभालने के लिए एक सख्त प्रोटोकॉल भी शामिल है, जिसमें मानव एनोटेटरों का एक पैनल उत्तर वैधता की पुष्टि करने के लिए किनारे के मामलों की समीक्षा करता है। यह मूल्यांकन में शोर को कम करता है और विभिन्न मॉडलों के बीच अधिक विश्वसनीय तुलना प्रदान करता है।

प्रदर्शन रुझान

मूल MMMU रिलीज़ के बाद से प्रदर्शन में काफी सुधार हुआ है। 2023 के शुरुआती मॉडलों ने 40% से कम सटीकता हासिल की, जबकि 2025 की शुरुआत में अग्रणी सिस्टम 70% के करीब पहुंच गए। MMMU 2025.3 से छत को रीसेट करने की उम्मीद है, प्रमुख प्रयोगशालाओं के प्रारंभिक परिणामों से संकेत मिलता है कि शीर्ष-स्तरीय मॉडल, जैसे कि OpenAI, Anthropic और Google DeepMind से, नए सेट पर लगभग 65-75% सटीकता प्राप्त करते हैं। अद्यतन को एक चुनौतीपूर्ण बेंचमार्क बनाए रखने के लिए डिज़ाइन किया गया है जो सतही दृश्य समझ वाले मॉडलों और गहरी तर्क क्षमताओं वाले मॉडलों के बीच अंतर करता है।

विशेष रूप से, 2025.3 सेट ने चिकित्सा और इंजीनियरिंग जैसे विशेष डोमेन को संभालने में मॉडलों की कमजोरियों को उजागर किया है, जहां सटीकता सामान्य विज्ञान या मानविकी की तुलना में काफी कम बनी हुई है। इसने डोमेन-विशिष्ट प्रशिक्षण और बाहरी ज्ञान स्रोतों के एकीकरण में अनुसंधान को प्रेरित किया है।

AI विकास पर प्रभाव

MMMU 2025.3 Artificial intelligence और Machine learning के क्षेत्र में शोधकर्ताओं और डेवलपर्स के लिए एक प्रमुख संदर्भ बिंदु के रूप में कार्य करता है। यह मॉडल आर्किटेक्चर विकल्पों, प्रशिक्षण डेटा क्यूरेशन और मूल्यांकन प्रथाओं को प्रभावित करता है। कई संगठन उत्पाद तत्परता के लिए बेंचमार्क के रूप में MMMU स्कोर का उपयोग करते हैं, विशेष रूप से दस्तावेज़ विश्लेषण, शैक्षिक उपकरण और दृश्य प्रश्न उत्तर से जुड़े अनुप्रयोगों के लिए।

बेंचमार्क मल्टीमोडल तर्क पर शैक्षणिक अनुसंधान को भी सूचित करता है। MMMU 2025.3 का उपयोग करने वाले अध्ययनों ने जटिल दृश्य-पाठ्य इनपुट को संसाधित करने में Multi-Head Attention तंत्रों और Cross-Attention परतों के महत्व पर प्रकाश डाला है। इसके अतिरिक्त, बेंचमार्क ने मॉडल मजबूती बढ़ाने के लिए Data Augmentation तकनीकों और Curriculum Learning रणनीतियों में सुधार में रुचि को बढ़ावा दिया है।

सीमाएं और आलोचनाएं

इसके व्यापक उपयोग के बावजूद, MMMU 2025.3 में सीमाएं हैं। आलोचकों का कहना है कि बहुविकल्पीय प्रारूप मॉडल क्षमता को अधिक आंक सकता है, क्योंकि मॉडल वास्तविक समझ के बिना सही अनुमान लगा सकते हैं। बेंचमार्क भी भारी रूप से अंग्रेजी-भाषा की सामग्री पर निर्भर करता है, जो गैर-अंग्रेजी संदर्भों में इसकी प्रयोज्यता को सीमित करता है। इसके अलावा, प्रश्न सेट की स्थिर प्रकृति का मतलब है कि मॉडलों को अधिक फिट किया जा सकता है यदि प्रशिक्षण डेटा में अनजाने में बेंचमार्क प्रश्न शामिल हैं, हालांकि 2025.3 अद्यतन हाल के प्रकाशनों से नए प्रश्नों को स्रोत करके इसे कम करने का प्रयास करता है।

एक और चिंता पूर्ण बेंचमार्क पर बड़े मॉडलों के मूल्यांकन की कम्प्यूटेशनल लागत है, जो छोटे शोध समूहों के लिए निषेधात्मक हो सकती है। इसे संबोधित करने के लिए, अनुरक्षक त्वरित परीक्षण के लिए एक यादृच्छिक उपसमूह प्रदान करते हैं, लेकिन यह सांख्यिकीय विश्वसनीयता को कम करता है। 2025 के अंत तक, MMMU का एक गतिशील संस्करण बनाने के बारे में चर्चा चल रही है जो मक्खी पर प्रश्न उत्पन्न करता है, हालांकि ऐसा कोई संस्करण जारी नहीं किया गया है।

भविष्य की दिशाएं

MMMU श्रृंखला से आवधिक अद्यतनों के साथ जारी रहने की उम्मीद है, जिसमें MMMU 2025.4 पहले से ही विकास में है। भविष्य के संस्करणों में वीडियो इनपुट, इंटरैक्टिव कार्य और अधिक खुले-अंत प्रश्न प्रारूप शामिल हो सकते हैं। बेंचमार्क का विकास Generative AI में व्यापक रुझानों और AI सिस्टम के अधिक समग्र मूल्यांकन की ओर धक्का को दर्शाता है। जैसे-जैसे मॉडल अधिक सक्षम होते जाते हैं, MMMU जैसे बेंचमार्क को न केवल सटीकता बल्कि तर्क पारदर्शिता, सुरक्षा और मानवीय मूल्यों के साथ संरेखण को मापने के लिए अनुकूलित करने की आवश्यकता होगी।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास