अंग्रेज़ी से अनुवादित

MMLU (मापन विशाल बहु-कार्य भाषा समझ) बड़े भाषा मॉडलों के मूल्यांकन के लिए एक बेंचमार्क है, जिसे 2020 में 57 विषयों में 15,908 प्रश्नों के साथ जारी किया गया था। यह व्यापक रूप से उपयोग किया जाने लगा, लेकिन त्रुटियों और डेटा संदूषण के लिए आलोचना का सामना करना पड़ा।

MMLU बेंचमार्क (मेजरिंग मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बड़े भाषा मॉडल की क्षमताओं का आकलन करने के लिए व्यापक रूप से उपयोग किया जाने वाला एक मूल्यांकन उपकरण है। 7 सितंबर 2020 को डैन हेंड्रिक्स और शोधकर्ताओं की एक टीम द्वारा जारी किया गया, इसे GLUE जैसे पहले के बेंचमार्क की तुलना में अधिक चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया था, क्योंकि मॉडल सरल परीक्षणों में मनुष्यों से बेहतर प्रदर्शन करने लगे थे। MMLU में 57 विषयों में फैले 15,908 बहुविकल्पीय प्रश्न शामिल हैं, जिनमें STEM क्षेत्रों और अंतर्राष्ट्रीय कानून से लेकर पोषण और धर्म तक शामिल हैं। इनमें से 1,540 प्रश्न तापमान, बैच आकार और सीखने की दर जैसे इष्टतम मॉडल सेटिंग्स का चयन करने के लिए आरक्षित हैं। जुलाई 2024 तक, बेंचमार्क को 100 मिलियन से अधिक बार डाउनलोड किया गया था, जिससे यह कृत्रिम बुद्धिमत्ता समुदाय में मॉडल प्रदर्शन की तुलना करने के लिए सबसे आम उपकरणों में से एक बन गया।

जब MMLU पेश किया गया था, तब अधिकांश मौजूदा मॉडलों ने यादृच्छिक संभावना (25%) के करीब स्कोर किया था, जिसमें सर्वश्रेष्ठ मॉडल, GPT-3 175B, ने 43.9% सटीकता हासिल की थी। रचनाकारों ने अनुमान लगाया कि मानव क्षेत्र विशेषज्ञ लगभग 89.8% सटीकता प्राप्त करेंगे। 2024 के मध्य तक, Claude 3.5 Sonnet, GPT-4o और Llama 3.1 405B जैसे अग्रणी मॉडल लगातार लगभग 88% सटीकता तक पहुँच गए। हालाँकि, 2025 तक, MMLU को आंशिक रूप से अधिक कठिन विकल्पों के पक्ष में चरणबद्ध तरीके से हटा दिया गया है, जो मॉडल क्षमताओं में तेजी से प्रगति को दर्शाता है।

संरचना और सामग्री

बेंचमार्क विषयों की एक विस्तृत श्रृंखला को कवर करता है, जिसमें अमूर्त बीजगणित, अंतर्राष्ट्रीय कानून, पेशेवर चिकित्सा और कई अन्य शामिल हैं। प्रत्येक प्रश्न चार विकल्पों वाला एक बहुविकल्पीय आइटम है, और मॉडल का मूल्यांकन सभी विषयों में उनकी सटीकता के आधार पर किया जाता है। विषयों की विविधता का उद्देश्य न केवल तथ्यात्मक ज्ञान बल्कि तर्क और क्रॉस-डोमेन समझ का परीक्षण करना है। 1,540-प्रश्न विकास सेट का उपयोग हाइपरपैरामीटर ट्यून करने के लिए किया जाता है, जिससे मॉडलों के बीच उचित तुलना सुनिश्चित होती है।

MMLU ने कई स्पिन-ऑफ और वेरिएंट को प्रेरित किया है, जैसे MMLU-Pro, MMMLU और MMLU-Redux, जिनका उद्देश्य मूल बेंचमार्क की कुछ सीमाओं को संबोधित करना या अधिक चुनौतीपूर्ण मूल्यांकन प्रदान करना है। इन व्युत्पन्नों ने मशीन लर्निंग अनुसंधान में मॉडल मूल्यांकन के चल रहे विकास में योगदान दिया है।

सीमाएँ और आलोचना

अपनी लोकप्रियता के बावजूद, MMLU को महत्वपूर्ण आलोचना का सामना करना पड़ा है। 5 जून 2024 को, विशेषज्ञों ने 5,700 प्रश्नों के मैन्युअल विश्लेषण का विवरण देते हुए एक पेपर जारी किया, जिसमें बड़ी संख्या में ग्राउंड-ट्रुथ त्रुटियों का खुलासा हुआ। उदाहरण के लिए, "वायरोलॉजी" उपसमुच्चय में 57% प्रश्नों में त्रुटियाँ पाई गईं, जिनमें कई सही उत्तर (4%), अस्पष्ट प्रश्न (14%), या पूरी तरह से गलत उत्तर (33%) शामिल थे। कुल मिलाकर, विश्लेषण ने अनुमान लगाया कि MMLU के 6.5% प्रश्नों में त्रुटि थी, यह सुझाव देते हुए कि अधिकतम प्राप्त करने योग्य स्कोर 100% से काफी नीचे था।

डेटा संदूषण ने भी बेंचमार्क की वैधता के लिए एक गंभीर खतरा पैदा किया। कंपनियाँ अनजाने में या जानबूझकर MMLU प्रश्नों और उत्तरों को अपने मॉडलों के प्रशिक्षण डेटा में शामिल कर सकती हैं, जिससे सामान्यीकरण के माप के रूप में बेंचमार्क प्रभावी रूप से बेकार हो जाता है। यह मुद्दा जनरेटिव एआई मूल्यांकन के क्षेत्र में आम है, जहाँ मॉडल अक्सर विशाल इंटरनेट कॉर्पोरा पर प्रशिक्षित होते हैं जिनमें बेंचमार्क प्रश्न शामिल हो सकते हैं।

उदाहरण प्रश्न

निम्नलिखित उदाहरण MMLU में प्रश्नों के प्रकारों को दर्शाते हैं, जो "अमूर्त बीजगणित", "अंतर्राष्ट्रीय कानून" और "पेशेवर चिकित्सा" कार्यों से लिए गए हैं। सही उत्तर बोल्डफेस में चिह्नित हैं।

प्रश्न 1 (अमूर्त बीजगणित):

सभी \( c \) को \( \mathbb{Z}_3 \) में खोजें जैसे कि \( \mathbb{Z}_3[x]/(x^2 + c) \) एक क्षेत्र है।

(A) 0 (B) 1 (C) 2 (D) 3

प्रश्न 2 (अंतर्राष्ट्रीय कानून):

क्या नागरिक और राजनीतिक अधिकारों पर अंतर्राष्ट्रीय अनुबंध (ICCPR) में यातना की परिभाषा के लिए एक आरक्षण समकालीन व्यवहार में स्वीकार्य होगा?

(A) यह एक स्वीकार्य आरक्षण है यदि आरक्षण देने वाले देश का कानून एक अलग परिभाषा का उपयोग करता है।

(B) यह एक अस्वीकार्य आरक्षण है क्योंकि यह ICCPR के उद्देश्य और लक्ष्य के विपरीत है।

(C) यह एक अस्वीकार्य आरक्षण है क्योंकि ICCPR में यातना की परिभाषा प्रथागत अंतर्राष्ट्रीय कानून के अनुरूप है।

(D) यह एक स्वीकार्य आरक्षण है क्योंकि सामान्य अंतर्राष्ट्रीय कानून के तहत राज्यों को संधियों में आरक्षण दर्ज करने का अधिकार है।

प्रश्न 3 (पेशेवर चिकित्सा):

एक 33 वर्षीय व्यक्ति थायरॉयड कैंसर के लिए रेडिकल थायरॉयडेक्टोमी से गुजरता है। ऑपरेशन के दौरान, मध्यम रक्तस्राव के कारण गर्दन के बाईं ओर कई वाहिकाओं के बंधन की आवश्यकता होती है। पोस्टऑपरेटिव रूप से, सीरम अध्ययन कैल्शियम सांद्रता 7.5 mg/dL, एल्ब्यूमिन सांद्रता 4 g/dL और पैराथायराइड हार्मोन सांद्रता 200 pg/mL दिखाते हैं। इस रोगी में निष्कर्षों का कारण निम्नलिखित में से किस वाहिका को नुकसान था?

(A) कोस्टोसर्वाइकल ट्रंक की शाखा।

(B) बाहरी कैरोटिड धमनी की शाखा।

(C) थायरोसर्वाइकल ट्रंक की शाखा।

(D) आंतरिक जुगुलर नस की सहायक नस।

प्रभाव और भविष्य

MMLU ने बड़े भाषा मॉडल की प्रगति को ट्रैक करने में महत्वपूर्ण भूमिका निभाई है और इसे ओपनएआई, एंथ्रोपिक और गूगल डीपमाइंड सहित अनुसंधान प्रयोगशालाओं और कंपनियों द्वारा व्यापक रूप से अपनाया गया है। इसका प्रभाव अन्य बेंचमार्क और मूल्यांकन पद्धतियों तक फैला हुआ है, जो क्षेत्र को अधिक मजबूत और चुनौतीपूर्ण परीक्षणों की ओर धकेलता है। हालाँकि, पहचानी गई त्रुटियों और संदूषण के मुद्दों ने नए बेंचमार्क की ओर क्रमिक बदलाव किया है जो इन समस्याओं के प्रति अधिक प्रतिरोधी हैं। 2025 तक, MMLU एक ऐतिहासिक संदर्भ बिंदु बना हुआ है, लेकिन अत्याधुनिक मॉडल तुलना में इसकी भूमिका घट रही है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·large-language-models·evaluation·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास