MMMU 2025 एक बेंचमार्क है जिसे मल्टीमॉडल कृत्रिम बुद्धिमत्ता प्रणालियों की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, विशेष रूप से दृश्य समझ वाले बड़े भाषा मॉडल। यह मूल MMMU (मैसिव मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग) बेंचमार्क का विस्तार है, जिसे 2023 के अंत में अल्बर्टा विश्वविद्यालय और कार्लटन विश्वविद्यालय सहित संस्थानों के शोधकर्ताओं के एक समूह द्वारा जारी किया गया था। 2025 संस्करण बेंचमार्क को जनरेटिव एआई और बड़े भाषा मॉडल अनुसंधान में तेजी से हुई प्रगति को दर्शाने के लिए अद्यतन करता है, जिसमें नए कार्य और अधिक चुनौतीपूर्ण प्रश्न शामिल हैं जिनके लिए कई विषयों में गहन तर्क की आवश्यकता होती है।
बेंचमार्क मॉडल की दृश्य जानकारी - जैसे छवियों, आरेखों और चार्टों - को पाठ्य प्रश्नों के साथ संयोजित करके अनुभव करने और तर्क करने की क्षमता का आकलन करता है। यह विषयों की एक विस्तृत श्रृंखला को कवर करता है, जिसमें मानविकी, सामाजिक विज्ञान, STEM क्षेत्र और चिकित्सा तथा कानून जैसे पेशेवर डोमेन शामिल हैं। MMMU 2025 को कॉलेज-स्तर की समझ का एक कठोर परीक्षण होने के लिए डिज़ाइन किया गया है, जिसके लिए मॉडलों को न केवल दृश्य तत्वों को पहचानना होता है, बल्कि डोमेन-विशिष्ट ज्ञान और बहु-चरणीय तर्क को भी लागू करना होता है। यह बेंचमार्क ओपनएआई, एंथ्रोपिक और गूगल डीपमाइंड जैसे संगठनों के अग्रणी एआई सिस्टम के प्रदर्शन की तुलना करने के लिए एक मानक संदर्भ बिंदु बन गया है।
कार्य डिज़ाइन और मूल्यांकन
MMMU 2025 में बहुविकल्पीय प्रश्न शामिल हैं, जिनमें से प्रत्येक एक छवि या छवियों के सेट के साथ जोड़ा गया है। प्रश्नों को दृश्य संकेतों और पाठ्य संदर्भ के संश्लेषण की आवश्यकता के लिए तैयार किया गया है, जिसमें अक्सर सरल पैटर्न पहचान से परे ज्ञान की मांग होती है। उदाहरण के लिए, एक प्रश्न एक सर्किट आरेख प्रस्तुत कर सकता है और एक घटक परिवर्तन के प्रभाव के बारे में पूछ सकता है, या एक ऐतिहासिक पेंटिंग दिखा सकता है और उसके सांस्कृतिक महत्व के बारे में पूछताछ कर सकता है। बेंचमार्क में 30 विषयों में 30,000 से अधिक प्रश्न शामिल हैं, जिसमें उन प्रश्नों पर ध्यान केंद्रित किया गया है जो वर्तमान मॉडलों के लिए चुनौतीपूर्ण हैं।
मूल्यांकन प्राथमिक मीट्रिक के रूप में सटीकता का उपयोग करके किया जाता है, जिसमें मॉडलों को विकल्पों के एक सेट से एक सही उत्तर आउटपुट करना आवश्यक होता है। बेंचमार्क विषय और प्रश्न प्रकार के अनुसार प्रदर्शन को भी ट्रैक करता है, जिससे शोधकर्ताओं को विशिष्ट ताकत और कमजोरियों की पहचान करने की अनुमति मिलती है। 2025 संस्करण में, प्रश्नों का एक नया उपसमूह जोड़ा गया था जिसके लिए मॉडलों को एक साथ कई छवियों पर तर्क करने की आवश्यकता होती है, जो दृश्य जानकारी की तुलना और विरोधाभास करने की उनकी क्षमता का परीक्षण करता है। यह डिज़ाइन मॉडलों को सरल छवि कैप्शनिंग से आगे और दृश्य तर्क और समस्या-समाधान के क्षेत्र में धकेलता है।
प्रमुख निष्कर्ष और मॉडल प्रदर्शन
2025 की शुरुआत तक, MMMU 2025 पर सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल मध्य-80 प्रतिशत सीमा में सटीकता स्कोर प्राप्त करते हैं, जो मूल MMMU की तुलना में एक महत्वपूर्ण सुधार है जहां शीर्ष मॉडलों ने लगभग 50-60% स्कोर किया था। यह प्रगति ट्रांसफॉर्मर आर्किटेक्चर में प्रगति, बड़े प्रशिक्षण डेटासेट और आरएलएआईएफ और पाठ्यक्रम-शिक्षण जैसी बेहतर प्रशिक्षण तकनीकों के लिए जिम्मेदार है। विशेष रूप से, ओपनएआई और गूगल डीपमाइंड के मॉडल लगातार लीडरबोर्ड में शीर्ष पर रहे हैं, उनके नवीनतम रिलीज़ भौतिकी और जीव विज्ञान जैसे कुछ विषयों पर लगभग मानव-स्तर का प्रदर्शन प्रदर्शित करते हैं।
हालांकि, बेंचमार्क लगातार अंतराल को उजागर करता है। मॉडल अभी भी उन प्रश्नों के साथ संघर्ष करते हैं जिनके लिए अमूर्त तर्क, सामान्य ज्ञान या जटिल स्थानिक संबंधों की समझ की आवश्यकता होती है। प्रदर्शन विषयों के बीच भी काफी भिन्न होता है, मानविकी और सामाजिक विज्ञान अक्सर शुद्ध STEM क्षेत्रों की तुलना में अधिक कठिन साबित होते हैं। बेंचमार्क के निर्माता इस बात पर जोर देते हैं कि MMMU 2025 एक हल की गई समस्या नहीं है, और यह मल्टी-हेड अटेंशन और क्रॉस-अटेंशन तंत्र जैसे क्षेत्रों में अनुसंधान के लिए एक प्रेरक के रूप में कार्य करना जारी रखता है जो दृश्य और पाठ्य जानकारी को बेहतर ढंग से एकीकृत कर सकते हैं।
अन्य बेंचमार्क के साथ तुलना
MMMU 2025 एआई मूल्यांकन बेंचमार्क के एक व्यापक पारिस्थितिकी तंत्र का हिस्सा है। यह विज़ुअल प्रश्न उत्तर (VQA) बेंचमार्क और सामान्य भाषा समझ मूल्यांकन (GLUE) सुइट जैसे अन्य प्रसिद्ध परीक्षणों का पूरक है। VQA के विपरीत, जो रोजमर्रा के दृश्यों के बारे में सरल प्रश्नों पर केंद्रित है, MMMU 2025 कॉलेज-स्तर की शैक्षणिक सामग्री को लक्षित करता है, जो इसे शिक्षा और पेशेवर कार्यों में सहायता कर सकने वाले एआई विकसित करने के लक्ष्य के साथ अधिक संरेखित करता है। GLUE जैसे केवल-पाठ बेंचमार्क की तुलना में, MMMU 2025 दृश्य समझ का महत्वपूर्ण आयाम जोड़ता है, जो स्वायत्त ड्राइविंग, चिकित्सा इमेजिंग और रोबोटिक्स जैसे अनुप्रयोगों के लिए आवश्यक है।
बेंचमार्क मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (MMLU) जैसे नए मल्टीमॉडल बेंचमार्क से भी भिन्न है, क्योंकि इसमें प्रत्येक प्रश्न के लिए दृश्य इनपुट की आवश्यकता होती है, जबकि MMLU केवल-पाठ है। यह MMMU 2025 को वास्तविक दुनिया के डेटा को संभालने की मॉडल की क्षमता का अधिक प्रत्यक्ष परीक्षण बनाता है, जो अक्सर मल्टीमॉडल होता है। शोधकर्ता अक्सर मॉडल की क्षमताओं का एक व्यापक दृश्य प्राप्त करने के लिए अन्य बेंचमार्क के साथ MMMU 2025 का उपयोग करते हैं, क्योंकि कोई भी एकल बेंचमार्क बुद्धिमत्ता के सभी पहलुओं को कैप्चर नहीं कर सकता है।
प्रभाव और भविष्य की दिशाएँ
MMMU 2025 की शुरुआत ने कृत्रिम बुद्धिमत्ता के क्षेत्र पर महत्वपूर्ण प्रभाव डाला है। इसने अधिक मजबूत दृश्य एन्कोडर, दृश्य और पाठ्य सुविधाओं के बेहतर संलयन और अधिक कुशल प्रशिक्षण विधियों में अनुसंधान को प्रेरित किया है। एएमडी, इंटेल और टीएसएमसी जैसी कंपनियों ने भी ध्यान दिया है, क्योंकि बेंचमार्क की कम्प्यूटेशनल मांगें इन मॉडलों को कुशलतापूर्वक चलाने के लिए एडब्ल्यूएस ट्रेनियम और ग्रोक जैसे विशेष हार्डवेयर की आवश्यकता को उजागर करती हैं।
आगे देखते हुए, MMMU 2025 के निर्माता और भी अधिक चुनौतीपूर्ण प्रश्नों के साथ अद्यतन संस्करण जारी करने की योजना बना रहे हैं, जिसमें खुले-अंत वाले कार्य शामिल हैं जिनके लिए मॉडलों को केवल उत्तर चुनने के बजाय स्पष्टीकरण उत्पन्न करने की आवश्यकता होती है। वीडियो और ऑडियो मोडैलिटी को शामिल करने की भी चर्चा है, जो मल्टीमॉडल समझ की सीमाओं को और आगे बढ़ाएगी। जैसे-जैसे एआई मॉडल में सुधार जारी है, MMMU 2025 जैसे बेंचमार्क प्रगति को मापने और उन क्षेत्रों की पहचान करने में महत्वपूर्ण भूमिका निभाएंगे जहां मानव-स्तर की बुद्धिमत्ता पहुंच से बाहर है।