अंग्रेज़ी से अनुवादित

MMLU-Pro, विशाल मल्टीटास्क भाषा समझ बेंचमार्क का एक विस्तारित, अधिक चुनौतीपूर्ण संस्करण है, जिसे कठिन, तर्क-केंद्रित प्रश्नों और अधिक उत्तर विकल्पों को जोड़कर बड़े भाषा मॉडलों का बेहतर मूल्यांकन करने के लिए डिज़ाइन किया गया है।

MMLU-Pro एक बेंचमार्क डेटासेट है जो बड़े भाषा मॉडल की ज्ञान और तर्क क्षमताओं का मूल्यांकन करने के लिए है। यह मूल मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (MMLU) बेंचमार्क का विस्तार है, जिसे 2020 में मानविकी से लेकर STEM क्षेत्रों तक, विषयों की एक विस्तृत श्रृंखला में मॉडलों के प्रदर्शन को मापने के लिए पेश किया गया था। MMLU-Pro नवंबर 2024 में वाटरलू विश्वविद्यालय और टोरंटो विश्वविद्यालय के शोधकर्ताओं की एक टीम द्वारा जारी किया गया था, और यह जल्दी ही अत्याधुनिक AI प्रणालियों की तुलना करने के लिए एक मानक संदर्भ बिंदु बन गया।

MMLU-Pro के पीछे प्राथमिक प्रेरणा मूल MMLU की सीमाओं को संबोधित करना था। जैसे-जैसे मॉडलों में सुधार हुआ, MMLU पर उनके स्कोर संतृप्त होने लगे, जिससे शीर्ष-प्रदर्शन करने वाली प्रणालियों के बीच अंतर करना मुश्किल हो गया। MMLU-Pro कई प्रमुख परिवर्तन पेश करता है: इसमें प्रति प्रश्न अधिक उत्तर विकल्प शामिल हैं (चार के बजाय दस), यह उन प्रश्नों को फ़िल्टर करता है जो बहुत आसान हैं या जिन्हें सरल पैटर्न मिलान के माध्यम से उत्तर दिया जा सकता है, और इसमें बहु-चरणीय तर्क की आवश्यकता वाले प्रश्नों का एक बड़ा अनुपात जोड़ता है। डेटासेट में भौतिकी, कानून, मनोविज्ञान और कंप्यूटर विज्ञान सहित 14 डोमेन में 12,000 से अधिक प्रश्न शामिल हैं, जिसमें अधिक जटिल, तर्क-भारी कार्यों पर ध्यान केंद्रित किया गया है।

डिज़ाइन और निर्माण

MMLU-Pro के निर्माण में एक बहु-चरणीय पाइपलाइन शामिल थी। शोधकर्ताओं ने मूल MMLU प्रश्नों से शुरुआत की और उन्हें पेशेवर परीक्षाओं और शैक्षणिक पाठ्यपुस्तकों जैसे अन्य स्रोतों से अतिरिक्त प्रश्नों के साथ बढ़ाया। फिर उन्होंने अस्पष्ट या तुच्छ प्रश्नों को हटाने के लिए स्वचालित फ़िल्टरिंग और मानव एनोटेशन के संयोजन का उपयोग किया। विशेष रूप से, उन्होंने उम्मीदवार प्रश्न उत्पन्न करने के लिए एक बड़े भाषा मॉडल का उपयोग किया और फिर मानव विशेषज्ञों से उन्हें सत्यापित और परिष्कृत करवाया। अंतिम डेटासेट को यह सुनिश्चित करने के लिए क्यूरेट किया गया था कि प्रत्येक प्रश्न का एक स्पष्ट, असंदिग्ध उत्तर हो और कठिनाई स्तर मूल MMLU की तुलना में काफी अधिक हो।

MMLU-Pro की एक उल्लेखनीय विशेषता प्रति प्रश्न दस उत्तर विकल्पों का उपयोग है, जो मॉडल के संयोग से सही अनुमान लगाने की संभावना को कम करता है (मूल चार-विकल्प प्रारूप में 25% से 10% तक)। यह डिज़ाइन विकल्प बेंचमार्क को अधिक विभेदक बनाता है, जिसका अर्थ है कि मॉडल क्षमता में छोटे अंतर स्कोर अंतर में प्रतिबिंबित होने की अधिक संभावना रखते हैं। डेटासेट में एक "कठिन" उपसमुच्चय, MMLU-Pro/Reasoning भी शामिल है, जो विशेष रूप से उन प्रश्नों पर केंद्रित है जिनके लिए स्पष्ट तर्क चरणों की आवश्यकता होती है, जैसे गणितीय शब्द समस्याएं और तार्किक निगमन।

मूल्यांकन और प्रभाव

MMLU-Pro को शैक्षणिक शोधकर्ताओं और उद्योग प्रयोगशालाओं दोनों द्वारा व्यापक रूप से अपनाया गया है। OpenAI, Anthropic और Google DeepMind सहित प्रमुख AI डेवलपर्स ने अपने प्रमुख मॉडलों के लिए MMLU-Pro स्कोर की रिपोर्ट की है। उदाहरण के लिए, OpenAI के GPT-4o और Anthropic के Claude 3.5 Sonnet दोनों का MMLU-Pro पर मूल्यांकन किया गया है, जिसमें स्कोर आमतौर पर 70-80% की सीमा में हैं, जबकि मानव विशेषज्ञ प्रदर्शन समान प्रश्नों पर लगभग 80-90% अनुमानित है। बेंचमार्क का उपयोग Generative AI प्रणालियों में प्रगति को ट्रैक करने के लिए भी किया गया है, और यह मॉडल रिलीज़ घोषणाओं और तकनीकी रिपोर्टों में एक सामान्य मीट्रिक बन गया है।

MMLU-Pro की शुरुआत ने Artificial intelligence मूल्यांकन के व्यापक क्षेत्र को प्रभावित किया है। इसने अधिक मजबूत बेंचमार्क की आवश्यकता के बारे में चर्चाओं को प्रेरित किया है जो मॉडल क्षमताओं में तेजी से सुधार के साथ तालमेल रख सकते हैं। पहले के बेंचमार्क के विपरीत जो स्मरण या सरल पुनर्प्राप्ति पर केंद्रित थे, MMLU-Pro तर्क और समस्या-समाधान पर जोर देता है, जो Machine learning अनुसंधान के लक्ष्यों के साथ संरेखित है ताकि ऐसे मॉडल बनाए जा सकें जो प्रशिक्षण डेटा से परे सामान्यीकरण कर सकें। बेंचमार्क का उपयोग मानव प्रतिक्रिया से सुदृढीकरण सीखने जैसी घटनाओं और तर्क प्रदर्शन पर इसके प्रभाव का अध्ययन करने के लिए भी किया गया है।

अन्य बेंचमार्क के साथ तुलना

MMLU-Pro की तुलना अक्सर AI2 रीजनिंग चैलेंज (ARC), HellaSwag और Big-Bench Hard (BBH) कार्यों जैसे अन्य मूल्यांकन सुइट्स के साथ की जाती है। जबकि ARC और HellaSwag सामान्य ज्ञान तर्क और पाठ भविष्यवाणी पर केंद्रित हैं, MMLU-Pro शैक्षणिक विषयों की एक व्यापक श्रृंखला को कवर करता है, जो इसे सामान्य ज्ञान का आकलन करने के लिए अधिक व्यापक बनाता है। BBH, जो BIG-bench सुइट का एक उपसमुच्चय है, में 23 चुनौतीपूर्ण कार्य शामिल हैं, लेकिन MMLU-Pro का संरचित प्रारूप और बहुविकल्पीय डिज़ाइन इसे प्रशासित करने और लगातार स्कोर करने में आसान बनाता है। व्यवहार में, MMLU-Pro स्कोर अन्य तर्क-भारी बेंचमार्क के साथ दृढ़ता से सहसंबंधित होते हैं, लेकिन यह विभिन्न डोमेन में एक मॉडल की ताकत और कमजोरियों का अधिक सूक्ष्म दृश्य प्रदान करता है।

MMLU-Pro की एक सीमा यह है कि यह एक स्थिर बेंचमार्क है, जिसका अर्थ है कि एक बार मॉडल समान प्रश्नों पर प्रशिक्षित हो जाते हैं, तो उनके स्कोर वास्तविक सामान्यीकरण को प्रतिबिंबित नहीं कर सकते हैं। इसे कम करने के लिए, शोधकर्ताओं ने होल्ड-आउट प्रश्नों के साथ एक संस्करण जारी किया है जो सार्वजनिक रूप से उपलब्ध नहीं हैं, जो नियंत्रित सेटिंग्स में अधिक विश्वसनीय मूल्यांकन की अनुमति देता है। इसके अतिरिक्त, बेंचमार्क की संभावित संदूषण के लिए आलोचना की गई है, जहां मॉडल प्रीट्रेनिंग के दौरान प्रश्नों को देख सकते हैं, हालांकि लेखकों ने कम सामान्य परीक्षाओं और पाठ्यपुस्तकों से प्रश्नों को स्रोत करके इसे कम करने के लिए कदम उठाए हैं।

भविष्य की दिशाएँ

MMLU-Pro की सफलता ने और भी चुनौतीपूर्ण बेंचमार्क बनाने के प्रयासों को प्रेरित किया है। शोधकर्ता गतिशील प्रश्न निर्माण को शामिल करने के तरीकों की खोज कर रहे हैं, जहां नए प्रश्न तुरंत बनाए जाते हैं, और आरेख और चार्ट जैसे मल्टीमॉडल तत्वों को शामिल करने के लिए, जो वास्तविक दुनिया की समस्या-समाधान में आम हैं। ऐसे बेंचमार्क विकसित करने में भी रुचि है जो न केवल शुद्धता बल्कि मॉडल तर्क की दक्षता और व्याख्यात्मकता को भी मापते हैं। जैसे-जैसे Deep learning मॉडल विकसित होते रहते हैं, MMLU-Pro जैसे बेंचमार्क प्रगति को मापने और तंत्रिका नेटवर्क आर्किटेक्चर और प्रशिक्षण विधियों में भविष्य के अनुसंधान का मार्गदर्शन करने के लिए आवश्यक उपकरण बने रहने की संभावना है।

संक्षेप में, MMLU-Pro बड़े भाषा मॉडल के मूल्यांकन में एक महत्वपूर्ण कदम आगे का प्रतिनिधित्व करता है, जो उनकी क्षमताओं का अधिक कठोर और सूक्ष्म माप प्रदान करता है। कठिन प्रश्नों और तर्क पर इसका जोर इसे क्षेत्र में एक मानक संदर्भ बना चुका है, और इसका प्रभाव संभवतः बना रहेगा क्योंकि AI प्रणालियाँ अधिक उन्नत होती जा रही हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·evaluation·natural-language-processing·ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास