MMMU 2025.1 2025 में मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग बेंचमार्क का पहला अपडेट है। यह मूल MMMU ढांचे का विस्तार करता है, जिसे Artificial intelligence प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया था, जिन्हें दृश्य धारणा और डोमेन-विशिष्ट तर्क दोनों की आवश्यकता वाले कार्यों पर परखा जाता है। यह अपडेट नए प्रश्न प्रारूप, अतिरिक्त विषय, और संशोधित स्कोरिंग प्रोटोकॉल पेश करता है, ताकि आधुनिक Large language model और मल्टीमॉडल मॉडल की क्षमताओं को बेहतर ढंग से प्रतिबिंबित किया जा सके।
यह बेंचमार्क Deep learning प्रणालियों पर काम करने वाले शोधकर्ताओं और डेवलपर्स के लिए एक प्रमुख संदर्भ बना हुआ है, जो दृष्टि और भाषा को जोड़ते हैं। मानकीकृत चुनौतियों का एक सेट प्रदान करके, MMMU 2025.1 विभिन्न मॉडलों के प्रदर्शन की तुलना करने में मदद करता है, जिसमें Transformer (architecture) आर्किटेक्चर और Neural network डिज़ाइन पर निर्मित मॉडल शामिल हैं।
बेंचमार्क संरचना
MMMU 2025.1 मूल बेंचमार्क की मुख्य संरचना को बनाए रखता है, जिसमें विश्वविद्यालय-स्तरीय पाठ्यपुस्तकों और व्याख्यान नोट्स से लिए गए बहुविकल्पीय प्रश्न शामिल हैं। यह अपडेट एक नई श्रेणी के प्रश्न जोड़ता है, जिनमें छवियों और पाठ के बीच बहु-चरणीय तर्क की आवश्यकता होती है, जिससे उन मॉडलों के लिए कठिनाई बढ़ जाती है जो केवल Generative AI तकनीकों पर निर्भर हैं। बेंचमार्क भौतिकी, रसायन विज्ञान, चिकित्सा, और इंजीनियरिंग जैसे विषयों को कवर करता है, जिसमें प्रत्येक प्रश्न एक या अधिक छवियों के साथ जोड़ा जाता है जो सही उत्तर देने के लिए आवश्यक हैं।
2025.1 संस्करण एक संशोधित स्कोरिंग प्रणाली भी पेश करता है जो आत्मविश्वासपूर्ण लेकिन गलत उत्तरों को अधिक दंडित करती है, जिससे मॉडलों को अपनी अनिश्चितता को कैलिब्रेट करने के लिए प्रोत्साहित किया जाता है। यह परिवर्तन Machine learning मूल्यांकन में हाल के रुझानों के साथ संरेखित है, जहां कैलिब्रेशन को कच्ची सटीकता के समान महत्वपूर्ण माना जाता है।
मूल्यांकन प्रोटोकॉल
मॉडलों का मूल्यांकन शून्य-शॉट आधार पर किया जाता है, जिसका अर्थ है कि उन्हें परीक्षण से पहले MMMU डेटा पर फाइन-ट्यून नहीं किया जाता है। यह प्रोटोकॉल सुनिश्चित करता है कि प्रदर्शन मॉडल की सामान्य तर्क क्षमताओं को दर्शाता है, न कि रटने को। बेंचमार्क में विकास के लिए एक सत्यापन सेट और अंतिम स्कोरिंग के लिए एक परीक्षण सेट शामिल है, जिसमें परिणाम सटीकता प्रतिशत के रूप में रिपोर्ट किए जाते हैं।
2025.1 अपडेट के लिए, मूल्यांकन पाइपलाइन को बड़े मॉडल आउटपुट को संभालने के लिए स्वचालित किया गया है, जिसमें OpenAI के GPT-4o और Anthropic के Claude 3.5 Sonnet शामिल हैं, जो परीक्षण किए गए पहले मॉडलों में से थे। प्रोटोकॉल Google DeepMind और अन्य प्रमुख प्रयोगशालाओं के मॉडलों का भी समर्थन करता है, जिससे व्यापक प्रयोज्यता सुनिश्चित होती है।
पिछले संस्करणों से मुख्य परिवर्तन
MMMU 2025.1 में एक प्रमुख परिवर्तन अस्थायी तर्क की आवश्यकता वाले प्रश्नों का समावेश है, जहां छवियों के अनुक्रम में घटनाओं का क्रम महत्वपूर्ण होता है। यह जोड़ मॉडल की गतिशील दृश्यों को समझने की क्षमता का परीक्षण करता है, जो Waymo के स्वायत्त ड्राइविंग और Tesla जैसे अनुप्रयोगों के लिए महत्वपूर्ण है।
एक और परिवर्तन दृश्य इनपुट प्रकारों का विस्तार है। स्थिर तस्वीरों और आरेखों के अलावा, बेंचमार्क में अब चार्ट, ग्राफ़, और सॉफ़्टवेयर इंटरफ़ेस से स्क्रीनशॉट शामिल हैं। यह विविधता मॉडलों को विभिन्न दृश्य प्रारूपों से जानकारी निकालने की चुनौती देती है, जो कई Deep learning प्रणालियों के लिए कठिन बना हुआ है।
अपडेट क्रॉस-मोडल तर्क की आवश्यकता वाले प्रश्नों का एक नया उपसमूह भी पेश करता है, जहां उत्तर छवि और साथ के पाठ दोनों से जानकारी को संयोजित करने पर निर्भर करता है। यह उपसमूह दृश्य और भाषाई समझ के एकीकरण का परीक्षण करने के लिए डिज़ाइन किया गया है, जो आधुनिक ट्रांसफॉर्मर में Multi-Head Attention तंत्र का एक मुख्य लक्ष्य है।
प्रदर्शन रुझान
MMMU 2025.1 के शुरुआती परिणाम दिखाते हैं कि अग्रणी मॉडल 70% से अधिक सटीकता दर प्राप्त करते हैं, लेकिन मानव प्रदर्शन, जो लगभग 90% है, और सर्वश्रेष्ठ AI प्रणालियों के बीच अभी भी एक महत्वपूर्ण अंतर है। जो मॉडल Chain-of-thought प्रॉम्प्टिंग या समान तर्क तकनीकों का उपयोग करते हैं, वे बेहतर प्रदर्शन करते हैं, जो सुझाव देता है कि स्पष्ट तर्क चरण जटिल मल्टीमॉडल कार्यों में मदद करते हैं।
हालांकि, बेंचमार्क वर्तमान मॉडलों में लगातार कमजोरियों को भी उजागर करता है, विशेष रूप से उन कार्यों में जिनमें सटीक स्थानिक तर्क या सूक्ष्म दृश्य विवरणों की समझ की आवश्यकता होती है। उदाहरण के लिए, चिकित्सा इमेजिंग या इंजीनियरिंग आरेखों से जुड़े प्रश्न अक्सर सबसे उन्नत प्रणालियों को भी विफल कर देते हैं, जो Computer vision और मल्टीमॉडल लर्निंग में आगे के शोध की आवश्यकता को उजागर करता है।
AI विकास के लिए निहितार्थ
MMMU 2025.1 की रिलीज़ के व्यापक AI समुदाय के लिए निहितार्थ हैं। यह मल्टीमॉडल समझ में प्रगति का मूल्यांकन करने के लिए एक कठोर परीक्षण मंच प्रदान करता है, जो वास्तविक दुनिया के वातावरण में काम कर सकने वाली AI प्रणालियों को विकसित करने के लिए आवश्यक है। Amazon Web Services और Google Cloud जैसी कंपनियां अपने स्वयं के मॉडलों का आकलन करने और अपनी AI सेवाओं में सुधार का मार्गदर्शन करने के लिए बेंचमार्क का उपयोग कर रही हैं।
Stanford AI Lab और BAIR (Berkeley AI Research) जैसे संस्थानों के शोधकर्ताओं ने वर्तमान मॉडलों की सीमाओं का अध्ययन करने के लिए MMMU 2025.1 को एक मूल्यवान संसाधन के रूप में उद्धृत किया है। बेंचमार्क Model Pruning और Data Augmentation में नई तकनीकों के लिए एक मानक के रूप में भी कार्य करता है, क्योंकि डेवलपर्स सटीकता का त्याग किए बिना दक्षता में सुधार करना चाहते हैं।
कुल मिलाकर, MMMU 2025.1 मल्टीमॉडल AI के मूल्यांकन में एक कदम आगे का प्रतिनिधित्व करता है, जो क्षेत्र को अधिक मजबूत और सक्षम प्रणालियों की ओर धकेलता है।