MMLU बेंचमार्क (मेजरिंग मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बड़े भाषा मॉडल की क्षमताओं का आकलन करने के लिए व्यापक रूप से उपयोग किया जाने वाला एक मूल्यांकन उपकरण है। 7 सितंबर 2020 को डैन हेंड्रिक्स और शोधकर्ताओं की एक टीम द्वारा जारी किया गया, इसे GLUE जैसे पहले के बेंचमार्क की तुलना में अधिक चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया था, क्योंकि मॉडल सरल परीक्षणों में मनुष्यों से बेहतर प्रदर्शन करने लगे थे। MMLU में 57 विषयों में फैले 15,908 बहुविकल्पीय प्रश्न शामिल हैं, जिनमें STEM क्षेत्रों और अंतर्राष्ट्रीय कानून से लेकर पोषण और धर्म तक शामिल हैं। इनमें से 1,540 प्रश्न तापमान, बैच आकार और सीखने की दर जैसे इष्टतम मॉडल सेटिंग्स का चयन करने के लिए आरक्षित हैं। जुलाई 2024 तक, बेंचमार्क को 100 मिलियन से अधिक बार डाउनलोड किया गया था, जिससे यह कृत्रिम बुद्धिमत्ता समुदाय में मॉडल प्रदर्शन की तुलना करने के लिए सबसे आम उपकरणों में से एक बन गया।
जब MMLU पेश किया गया था, तब अधिकांश मौजूदा मॉडलों ने यादृच्छिक संभावना (25%) के करीब स्कोर किया था, जिसमें सर्वश्रेष्ठ मॉडल, GPT-3 175B, ने 43.9% सटीकता हासिल की थी। रचनाकारों ने अनुमान लगाया कि मानव क्षेत्र विशेषज्ञ लगभग 89.8% सटीकता प्राप्त करेंगे। 2024 के मध्य तक, Claude 3.5 Sonnet, GPT-4o और Llama 3.1 405B जैसे अग्रणी मॉडल लगातार लगभग 88% सटीकता तक पहुँच गए। हालाँकि, 2025 तक, MMLU को आंशिक रूप से अधिक कठिन विकल्पों के पक्ष में चरणबद्ध तरीके से हटा दिया गया है, जो मॉडल क्षमताओं में तेजी से प्रगति को दर्शाता है।
संरचना और सामग्री
बेंचमार्क विषयों की एक विस्तृत श्रृंखला को कवर करता है, जिसमें अमूर्त बीजगणित, अंतर्राष्ट्रीय कानून, पेशेवर चिकित्सा और कई अन्य शामिल हैं। प्रत्येक प्रश्न चार विकल्पों वाला एक बहुविकल्पीय आइटम है, और मॉडल का मूल्यांकन सभी विषयों में उनकी सटीकता के आधार पर किया जाता है। विषयों की विविधता का उद्देश्य न केवल तथ्यात्मक ज्ञान बल्कि तर्क और क्रॉस-डोमेन समझ का परीक्षण करना है। 1,540-प्रश्न विकास सेट का उपयोग हाइपरपैरामीटर ट्यून करने के लिए किया जाता है, जिससे मॉडलों के बीच उचित तुलना सुनिश्चित होती है।
MMLU ने कई स्पिन-ऑफ और वेरिएंट को प्रेरित किया है, जैसे MMLU-Pro, MMMLU और MMLU-Redux, जिनका उद्देश्य मूल बेंचमार्क की कुछ सीमाओं को संबोधित करना या अधिक चुनौतीपूर्ण मूल्यांकन प्रदान करना है। इन व्युत्पन्नों ने मशीन लर्निंग अनुसंधान में मॉडल मूल्यांकन के चल रहे विकास में योगदान दिया है।
सीमाएँ और आलोचना
अपनी लोकप्रियता के बावजूद, MMLU को महत्वपूर्ण आलोचना का सामना करना पड़ा है। 5 जून 2024 को, विशेषज्ञों ने 5,700 प्रश्नों के मैन्युअल विश्लेषण का विवरण देते हुए एक पेपर जारी किया, जिसमें बड़ी संख्या में ग्राउंड-ट्रुथ त्रुटियों का खुलासा हुआ। उदाहरण के लिए, "वायरोलॉजी" उपसमुच्चय में 57% प्रश्नों में त्रुटियाँ पाई गईं, जिनमें कई सही उत्तर (4%), अस्पष्ट प्रश्न (14%), या पूरी तरह से गलत उत्तर (33%) शामिल थे। कुल मिलाकर, विश्लेषण ने अनुमान लगाया कि MMLU के 6.5% प्रश्नों में त्रुटि थी, यह सुझाव देते हुए कि अधिकतम प्राप्त करने योग्य स्कोर 100% से काफी नीचे था।
डेटा संदूषण ने भी बेंचमार्क की वैधता के लिए एक गंभीर खतरा पैदा किया। कंपनियाँ अनजाने में या जानबूझकर MMLU प्रश्नों और उत्तरों को अपने मॉडलों के प्रशिक्षण डेटा में शामिल कर सकती हैं, जिससे सामान्यीकरण के माप के रूप में बेंचमार्क प्रभावी रूप से बेकार हो जाता है। यह मुद्दा जनरेटिव एआई मूल्यांकन के क्षेत्र में आम है, जहाँ मॉडल अक्सर विशाल इंटरनेट कॉर्पोरा पर प्रशिक्षित होते हैं जिनमें बेंचमार्क प्रश्न शामिल हो सकते हैं।
उदाहरण प्रश्न
निम्नलिखित उदाहरण MMLU में प्रश्नों के प्रकारों को दर्शाते हैं, जो "अमूर्त बीजगणित", "अंतर्राष्ट्रीय कानून" और "पेशेवर चिकित्सा" कार्यों से लिए गए हैं। सही उत्तर बोल्डफेस में चिह्नित हैं।
प्रश्न 1 (अमूर्त बीजगणित):
सभी \( c \) को \( \mathbb{Z}_3 \) में खोजें जैसे कि \( \mathbb{Z}_3[x]/(x^2 + c) \) एक क्षेत्र है।
(A) 0 (B) 1 (C) 2 (D) 3
प्रश्न 2 (अंतर्राष्ट्रीय कानून):
क्या नागरिक और राजनीतिक अधिकारों पर अंतर्राष्ट्रीय अनुबंध (ICCPR) में यातना की परिभाषा के लिए एक आरक्षण समकालीन व्यवहार में स्वीकार्य होगा?
(A) यह एक स्वीकार्य आरक्षण है यदि आरक्षण देने वाले देश का कानून एक अलग परिभाषा का उपयोग करता है।
(B) यह एक अस्वीकार्य आरक्षण है क्योंकि यह ICCPR के उद्देश्य और लक्ष्य के विपरीत है।
(C) यह एक अस्वीकार्य आरक्षण है क्योंकि ICCPR में यातना की परिभाषा प्रथागत अंतर्राष्ट्रीय कानून के अनुरूप है।
(D) यह एक स्वीकार्य आरक्षण है क्योंकि सामान्य अंतर्राष्ट्रीय कानून के तहत राज्यों को संधियों में आरक्षण दर्ज करने का अधिकार है।
प्रश्न 3 (पेशेवर चिकित्सा):
एक 33 वर्षीय व्यक्ति थायरॉयड कैंसर के लिए रेडिकल थायरॉयडेक्टोमी से गुजरता है। ऑपरेशन के दौरान, मध्यम रक्तस्राव के कारण गर्दन के बाईं ओर कई वाहिकाओं के बंधन की आवश्यकता होती है। पोस्टऑपरेटिव रूप से, सीरम अध्ययन कैल्शियम सांद्रता 7.5 mg/dL, एल्ब्यूमिन सांद्रता 4 g/dL और पैराथायराइड हार्मोन सांद्रता 200 pg/mL दिखाते हैं। इस रोगी में निष्कर्षों का कारण निम्नलिखित में से किस वाहिका को नुकसान था?
(A) कोस्टोसर्वाइकल ट्रंक की शाखा।
(B) बाहरी कैरोटिड धमनी की शाखा।
(C) थायरोसर्वाइकल ट्रंक की शाखा।
(D) आंतरिक जुगुलर नस की सहायक नस।
प्रभाव और भविष्य
MMLU ने बड़े भाषा मॉडल की प्रगति को ट्रैक करने में महत्वपूर्ण भूमिका निभाई है और इसे ओपनएआई, एंथ्रोपिक और गूगल डीपमाइंड सहित अनुसंधान प्रयोगशालाओं और कंपनियों द्वारा व्यापक रूप से अपनाया गया है। इसका प्रभाव अन्य बेंचमार्क और मूल्यांकन पद्धतियों तक फैला हुआ है, जो क्षेत्र को अधिक मजबूत और चुनौतीपूर्ण परीक्षणों की ओर धकेलता है। हालाँकि, पहचानी गई त्रुटियों और संदूषण के मुद्दों ने नए बेंचमार्क की ओर क्रमिक बदलाव किया है जो इन समस्याओं के प्रति अधिक प्रतिरोधी हैं। 2025 तक, MMLU एक ऐतिहासिक संदर्भ बिंदु बना हुआ है, लेकिन अत्याधुनिक मॉडल तुलना में इसकी भूमिका घट रही है।