अंग्रेज़ी से अनुवादित

MMLU (Massive Multitask Language Understanding) एक 2020 का बेंचमार्क है जो भाषा मॉडलों का परीक्षण 57 शैक्षणिक और व्यावसायिक विषयों में बहुविकल्पीय प्रश्नों के माध्यम से करता है, जिसका व्यापक रूप से व्यापक ज्ञान मापने के लिए उपयोग किया जाता है जब तक कि प्रदर्शन संतृप्त नहीं हो जाता।

MMLU, जिसका पूरा नाम Massive Multitask Language Understanding है, एक बेंचमार्क है जिसे 2020 में Dan Hendrycks और उनके सहयोगियों द्वारा पेश किया गया था, ताकि भाषा मॉडलों के ज्ञान की व्यापकता और तर्क करने की क्षमता को मापा जा सके। इसमें लगभग 15,900 बहुविकल्पीय प्रश्न शामिल हैं, जो 57 विषयों में फैले हैं, जिनमें प्रारंभिक गणित, अमेरिकी इतिहास, कंप्यूटर विज्ञान, कानून और पेशेवर चिकित्सा शामिल हैं, जो अधिकतर वास्तविक परीक्षाओं और पाठ्यपुस्तकों से लिए गए हैं, और जिनकी कठिनाई प्रारंभिक विद्यालय से लेकर पेशेवर और विशेषज्ञ स्तर तक होती है।

डिज़ाइन और उद्देश्य

MMLU को उस प्रकार के व्यापक विश्व ज्ञान का परीक्षण करने के लिए डिज़ाइन किया गया था जो एक मॉडल को मुख्य रूप से पूर्व-प्रशिक्षण के माध्यम से बड़े पाठ कोषों पर प्राप्त करना होता है, न कि कार्य-विशिष्ट फाइन-ट्यूनिंग के माध्यम से, जिससे यह इस बात का प्रॉक्सी बनता है कि एक मॉडल विभिन्न विषयों में कितना जानता है, बजाय इसके कि वह किसी एक संकीर्ण कार्य में कितना अच्छा प्रदर्शन करता है। इसके निर्माता, Dan Hendrycks, बाद में एक प्रमुख AI सुरक्षा शोधकर्ता बने और Center for AI Safety की स्थापना की, और MMLU का निर्माण एलएलएम मूल्यांकन को पढ़ने की समझ या एकल-डोमेन प्रश्नोत्तर जैसे संकीर्ण बेंचमार्क से आगे बढ़ाकर सामान्य ज्ञान के करीब कुछ करने के शुरुआती प्रयास को दर्शाता था।

अपनाया जाना

GPT-3 और उसके बाद के बड़े भाषा मॉडलों के युग के साथ अपनी रिलीज़ के बाद, MMLU मॉडल रिलीज़ पेपरों और तकनीकी रिपोर्टों में सबसे व्यापक रूप से रिपोर्ट किए जाने वाले बेंचमार्क में से एक बन गया, जिसे लगभग हर प्रमुख प्रयोगशाला, जिसमें OpenAI, Anthropic, Google DeepMind और Meta AI शामिल हैं, ने एक शीर्ष क्षमता मीट्रिक के रूप में उद्धृत किया। इसकी सर्वव्यापकता ने इसे विभिन्न संगठनों द्वारा विभिन्न तरीकों से प्रशिक्षित मॉडलों के बीच तुलना का एक सामान्य बिंदु बना दिया, जो एक दशक पहले कंप्यूटर दृष्टि के लिए ImageNet ने जो भूमिका निभाई थी, उसके समान भूमिका निभाता है।

संतृप्ति

प्रारंभिक भाषा मॉडलों ने चार-विकल्प वाले प्रश्नों पर यादृच्छिक अनुमान से अपेक्षित 25% से केवल थोड़ा अधिक अंक प्राप्त किए, लेकिन मॉडलों के बड़े होने के साथ प्रदर्शन तेज़ी से बढ़ा: मॉडलों ने कुछ वर्षों के भीतर 80% से अधिक अंक प्राप्त किए, और 2024 तक अग्रणी मॉडलों ने 90% से अधिक पार कर लिया, जो विशेषज्ञ मानव पैनल के संभावित स्कोर के अनुमानों के करीब पहुंच गया। इस संतृप्ति ने शीर्ष मॉडलों के बीच अंतर करने की MMLU की क्षमता को कम कर दिया और कठिन उत्तराधिकारी बेंचमार्क बनाने को प्रेरित किया, जिनमें MMLU-Pro शामिल है, जिसने कठिन प्रश्न जोड़े और उत्तर विकल्पों का विस्तार किया ताकि अनुमान का प्रभाव कम हो सके।

आलोचना

MMLU ने कई आधारों पर आलोचना आकर्षित की है: शोधकर्ताओं ने मूल डेटासेट में त्रुटिपूर्ण या अस्पष्ट प्रश्नों और उत्तर कुंजियों की एक गैर-तुच्छ दर की पहचान की; क्योंकि यह सार्वजनिक रूप से उपलब्ध परीक्षा सामग्री से लिया गया है, डेटा संदूषण एक लगातार चिंता है, क्योंकि कुछ प्रश्न या उनके लगभग-डुप्लिकेट संभवतः वेब-स्केल डेटा में दिखाई देते हैं जिनका उपयोग कई मॉडलों के पूर्व-प्रशिक्षण में किया जाता है; और बहुविकल्पीय प्रारूप उत्पादन के बजाय पहचान को पुरस्कृत करता है, जो वास्तविक दुनिया में मॉडलों के खुले-अंत कार्यों में उपयोग को प्रतिबिंबित नहीं कर सकता है। इनमें से कुछ मुद्दों को बाद के संस्करणों में आंशिक रूप से संबोधित किया गया था, लेकिन MMLU का मूल डिज़ाइन 2020-युग की मूल्यांकन प्राथमिकताओं का एक स्नैपशॉट बना हुआ है।

विरासत

संतृप्ति और आलोचना के बावजूद, MMLU मॉडल तुलनाओं में एक आधारभूत संदर्भ बिंदु के रूप में व्यापक रूप से उद्धृत किया जाता है और शीर्ष-स्तरीय मॉडलों को सार्थक रूप से अलग करना बंद करने के बाद भी रिलीज़ घोषणाओं में दिखाई देता रहता है, जो एक व्यापक पैटर्न को दर्शाता है जिसमें प्रभावशाली बेंचमार्क अपनी विभेदक शक्ति कम होने के बाद भी एक सामान्य शब्दावली के रूप में बने रहते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-evaluation·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास