अंग्रेज़ी से अनुवादित

MMMU 2025.1是海量多学科多模态理解基准测试的2025年首次更新,引入了新任务并修订了多模态AI系统的评估协议。

MMMU 2025.1 2025 में मल्टी-डिसिप्लिन मल्टीमॉडल अंडरस्टैंडिंग बेंचमार्क का पहला अपडेट है। यह मूल MMMU ढांचे का विस्तार करता है, जिसे Artificial intelligence प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया था, जिन्हें दृश्य धारणा और डोमेन-विशिष्ट तर्क दोनों की आवश्यकता वाले कार्यों पर परखा जाता है। यह अपडेट नए प्रश्न प्रारूप, अतिरिक्त विषय, और संशोधित स्कोरिंग प्रोटोकॉल पेश करता है, ताकि आधुनिक Large language model और मल्टीमॉडल मॉडल की क्षमताओं को बेहतर ढंग से प्रतिबिंबित किया जा सके।

यह बेंचमार्क Deep learning प्रणालियों पर काम करने वाले शोधकर्ताओं और डेवलपर्स के लिए एक प्रमुख संदर्भ बना हुआ है, जो दृष्टि और भाषा को जोड़ते हैं। मानकीकृत चुनौतियों का एक सेट प्रदान करके, MMMU 2025.1 विभिन्न मॉडलों के प्रदर्शन की तुलना करने में मदद करता है, जिसमें Transformer (architecture) आर्किटेक्चर और Neural network डिज़ाइन पर निर्मित मॉडल शामिल हैं।

बेंचमार्क संरचना

MMMU 2025.1 मूल बेंचमार्क की मुख्य संरचना को बनाए रखता है, जिसमें विश्वविद्यालय-स्तरीय पाठ्यपुस्तकों और व्याख्यान नोट्स से लिए गए बहुविकल्पीय प्रश्न शामिल हैं। यह अपडेट एक नई श्रेणी के प्रश्न जोड़ता है, जिनमें छवियों और पाठ के बीच बहु-चरणीय तर्क की आवश्यकता होती है, जिससे उन मॉडलों के लिए कठिनाई बढ़ जाती है जो केवल Generative AI तकनीकों पर निर्भर हैं। बेंचमार्क भौतिकी, रसायन विज्ञान, चिकित्सा, और इंजीनियरिंग जैसे विषयों को कवर करता है, जिसमें प्रत्येक प्रश्न एक या अधिक छवियों के साथ जोड़ा जाता है जो सही उत्तर देने के लिए आवश्यक हैं।

2025.1 संस्करण एक संशोधित स्कोरिंग प्रणाली भी पेश करता है जो आत्मविश्वासपूर्ण लेकिन गलत उत्तरों को अधिक दंडित करती है, जिससे मॉडलों को अपनी अनिश्चितता को कैलिब्रेट करने के लिए प्रोत्साहित किया जाता है। यह परिवर्तन Machine learning मूल्यांकन में हाल के रुझानों के साथ संरेखित है, जहां कैलिब्रेशन को कच्ची सटीकता के समान महत्वपूर्ण माना जाता है।

मूल्यांकन प्रोटोकॉल

मॉडलों का मूल्यांकन शून्य-शॉट आधार पर किया जाता है, जिसका अर्थ है कि उन्हें परीक्षण से पहले MMMU डेटा पर फाइन-ट्यून नहीं किया जाता है। यह प्रोटोकॉल सुनिश्चित करता है कि प्रदर्शन मॉडल की सामान्य तर्क क्षमताओं को दर्शाता है, न कि रटने को। बेंचमार्क में विकास के लिए एक सत्यापन सेट और अंतिम स्कोरिंग के लिए एक परीक्षण सेट शामिल है, जिसमें परिणाम सटीकता प्रतिशत के रूप में रिपोर्ट किए जाते हैं।

2025.1 अपडेट के लिए, मूल्यांकन पाइपलाइन को बड़े मॉडल आउटपुट को संभालने के लिए स्वचालित किया गया है, जिसमें OpenAI के GPT-4o और Anthropic के Claude 3.5 Sonnet शामिल हैं, जो परीक्षण किए गए पहले मॉडलों में से थे। प्रोटोकॉल Google DeepMind और अन्य प्रमुख प्रयोगशालाओं के मॉडलों का भी समर्थन करता है, जिससे व्यापक प्रयोज्यता सुनिश्चित होती है।

पिछले संस्करणों से मुख्य परिवर्तन

MMMU 2025.1 में एक प्रमुख परिवर्तन अस्थायी तर्क की आवश्यकता वाले प्रश्नों का समावेश है, जहां छवियों के अनुक्रम में घटनाओं का क्रम महत्वपूर्ण होता है। यह जोड़ मॉडल की गतिशील दृश्यों को समझने की क्षमता का परीक्षण करता है, जो Waymo के स्वायत्त ड्राइविंग और Tesla जैसे अनुप्रयोगों के लिए महत्वपूर्ण है।

एक और परिवर्तन दृश्य इनपुट प्रकारों का विस्तार है। स्थिर तस्वीरों और आरेखों के अलावा, बेंचमार्क में अब चार्ट, ग्राफ़, और सॉफ़्टवेयर इंटरफ़ेस से स्क्रीनशॉट शामिल हैं। यह विविधता मॉडलों को विभिन्न दृश्य प्रारूपों से जानकारी निकालने की चुनौती देती है, जो कई Deep learning प्रणालियों के लिए कठिन बना हुआ है।

अपडेट क्रॉस-मोडल तर्क की आवश्यकता वाले प्रश्नों का एक नया उपसमूह भी पेश करता है, जहां उत्तर छवि और साथ के पाठ दोनों से जानकारी को संयोजित करने पर निर्भर करता है। यह उपसमूह दृश्य और भाषाई समझ के एकीकरण का परीक्षण करने के लिए डिज़ाइन किया गया है, जो आधुनिक ट्रांसफॉर्मर में Multi-Head Attention तंत्र का एक मुख्य लक्ष्य है।

प्रदर्शन रुझान

MMMU 2025.1 के शुरुआती परिणाम दिखाते हैं कि अग्रणी मॉडल 70% से अधिक सटीकता दर प्राप्त करते हैं, लेकिन मानव प्रदर्शन, जो लगभग 90% है, और सर्वश्रेष्ठ AI प्रणालियों के बीच अभी भी एक महत्वपूर्ण अंतर है। जो मॉडल Chain-of-thought प्रॉम्प्टिंग या समान तर्क तकनीकों का उपयोग करते हैं, वे बेहतर प्रदर्शन करते हैं, जो सुझाव देता है कि स्पष्ट तर्क चरण जटिल मल्टीमॉडल कार्यों में मदद करते हैं।

हालांकि, बेंचमार्क वर्तमान मॉडलों में लगातार कमजोरियों को भी उजागर करता है, विशेष रूप से उन कार्यों में जिनमें सटीक स्थानिक तर्क या सूक्ष्म दृश्य विवरणों की समझ की आवश्यकता होती है। उदाहरण के लिए, चिकित्सा इमेजिंग या इंजीनियरिंग आरेखों से जुड़े प्रश्न अक्सर सबसे उन्नत प्रणालियों को भी विफल कर देते हैं, जो Computer vision और मल्टीमॉडल लर्निंग में आगे के शोध की आवश्यकता को उजागर करता है।

AI विकास के लिए निहितार्थ

MMMU 2025.1 की रिलीज़ के व्यापक AI समुदाय के लिए निहितार्थ हैं। यह मल्टीमॉडल समझ में प्रगति का मूल्यांकन करने के लिए एक कठोर परीक्षण मंच प्रदान करता है, जो वास्तविक दुनिया के वातावरण में काम कर सकने वाली AI प्रणालियों को विकसित करने के लिए आवश्यक है। Amazon Web Services और Google Cloud जैसी कंपनियां अपने स्वयं के मॉडलों का आकलन करने और अपनी AI सेवाओं में सुधार का मार्गदर्शन करने के लिए बेंचमार्क का उपयोग कर रही हैं।

Stanford AI Lab और BAIR (Berkeley AI Research) जैसे संस्थानों के शोधकर्ताओं ने वर्तमान मॉडलों की सीमाओं का अध्ययन करने के लिए MMMU 2025.1 को एक मूल्यवान संसाधन के रूप में उद्धृत किया है। बेंचमार्क Model Pruning और Data Augmentation में नई तकनीकों के लिए एक मानक के रूप में भी कार्य करता है, क्योंकि डेवलपर्स सटीकता का त्याग किए बिना दक्षता में सुधार करना चाहते हैं।

कुल मिलाकर, MMMU 2025.1 मल्टीमॉडल AI के मूल्यांकन में एक कदम आगे का प्रतिनिधित्व करता है, जो क्षेत्र को अधिक मजबूत और सक्षम प्रणालियों की ओर धकेलता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·multimodal·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास