अंग्रेज़ी से अनुवादित

CMMLU एक चीनी मासिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग बेंचमार्क है, जो बड़े भाषा मॉडलों के ज्ञान और तर्क क्षमता का मूल्यांकन करने के लिए एक व्यापक मूल्यांकन सूट है, जो चीनी भाषा और सांस्कृतिक संदर्भों पर केंद्रित है।

CMMLU (चीनी मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) एक बेंचमार्क डेटासेट है जिसे चीनी भाषा और सांस्कृतिक संदर्भ में बड़े भाषा मॉडल (LLM) के ज्ञान और तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे मुख्य रूप से अंग्रेजी पर केंद्रित मूल्यांकन संसाधनों में अंतर को दूर करने के लिए पेश किया गया था, जो मानविकी और सामाजिक विज्ञान से लेकर STEM क्षेत्रों तक के विषयों की एक व्यापक परीक्षण श्रृंखला प्रदान करता है। बेंचमार्क का उद्देश्य न केवल तथ्यात्मक स्मरण को मापना है, बल्कि चीनी भाषाई बारीकियों और सांस्कृतिक समझ को प्रतिबिंबित करने वाले तरीकों से ज्ञान को लागू करने की क्षमता को भी मापना है।

CMMLU में दर्जनों विषयों में बहुविकल्पीय प्रश्न शामिल हैं, जिनमें प्रत्येक प्रश्न के चार उत्तर विकल्प होते हैं। डेटासेट को मॉडलों के लिए चुनौतीपूर्ण बनाने के लिए तैयार किया गया है, जिसमें सतही पैटर्न मिलान के बजाय गहन समझ की आवश्यकता होती है। इसमें चीनी साहित्य, इतिहास, कानून और पारंपरिक चिकित्सा जैसे विषय शामिल हैं, साथ ही गणित, भौतिकी और कंप्यूटर विज्ञान जैसे मानक शैक्षणिक विषय भी शामिल हैं। बेंचमार्क का उपयोग विभिन्न LLM के प्रदर्शन की तुलना करने के लिए किया गया है, जिससे चीनी-विशिष्ट ज्ञान और जटिल तर्क कार्यों को संभालने की उनकी क्षमता में महत्वपूर्ण अंतर उजागर हुए हैं।

डिज़ाइन और संरचना

CMMLU बेंचमार्क विषयों के एक समूह में व्यवस्थित है, जिनमें से प्रत्येक में परिवर्तनीय संख्या में प्रश्न होते हैं। कुल डेटासेट में हजारों प्रश्न शामिल हैं, जिन्हें विकास और परीक्षण सेटों में विभाजित किया गया है। विकास सेट का उपयोग मॉडल ट्यूनिंग या कुछ-शॉट प्रदर्शन के लिए किया जाता है, जबकि परीक्षण सेट का उपयोग अंतिम मूल्यांकन के लिए किया जाता है। प्रत्येक प्रश्न को एक संदर्भ, एक प्रश्न और A, B, C, और D लेबल वाले चार विकल्पों के साथ एक प्रॉम्प्ट के रूप में स्वरूपित किया गया है। सही उत्तर विकास सेट में प्रदान किया जाता है, लेकिन निष्पक्ष मूल्यांकन सुनिश्चित करने के लिए परीक्षण सेट में इसे छिपाया जाता है।

CMMLU में विषयों को व्यापक डोमेन में वर्गीकृत किया गया है, जिसमें STEM (विज्ञान, प्रौद्योगिकी, इंजीनियरिंग, गणित), मानविकी, सामाजिक विज्ञान और अन्य विशेष क्षेत्र शामिल हैं। यह वर्गीकरण विभिन्न ज्ञान प्रकारों में मॉडल की ताकत और कमजोरियों का विस्तृत विश्लेषण करने की अनुमति देता है। बेंचमार्क में सांस्कृतिक साक्षरता की आवश्यकता वाले विषय भी शामिल हैं, जैसे चीनी भूगोल, चीनी कानून और चीनी साहित्य, जो अक्सर अंग्रेजी-केंद्रित बेंचमार्क में कम प्रतिनिधित्व रखते हैं।

मूल्यांकन पद्धति

CMMLU पर मॉडलों का मूल्यांकन सटीकता को प्राथमिक मीट्रिक के रूप में उपयोग करके किया जाता है, जिसकी गणना परीक्षण सेट में सही उत्तर दिए गए प्रश्नों के अनुपात के रूप में की जाती है। बेंचमार्क शून्य-शॉट और कुछ-शॉट मूल्यांकन सेटिंग्स दोनों का समर्थन करता है। शून्य-शॉट में, मॉडल को बिना किसी उदाहरण के केवल प्रश्न और विकल्प दिए जाते हैं। कुछ-शॉट में, विकास सेट से कुछ उदाहरण प्रॉम्प्ट में प्रदान किए जाते हैं ताकि अपेक्षित प्रारूप और तर्क पैटर्न प्रदर्शित किया जा सके। यह लचीलापन शोधकर्ताओं को विभिन्न परिस्थितियों में मॉडल का आकलन करने और उनकी अनुकूलनशीलता की तुलना करने की अनुमति देता है।

निष्पक्ष तुलना सुनिश्चित करने के लिए, मानक मूल्यांकन प्रोटोकॉल का पालन किया जाता है, जैसे कि एक निश्चित प्रॉम्प्ट टेम्पलेट और सुसंगत उत्तर निष्कर्षण विधियों का उपयोग। कुछ मॉडल प्रदर्शन में सुधार के लिए चेन-ऑफ-थॉट प्रॉम्प्टिंग का उपयोग कर सकते हैं, लेकिन पारदर्शिता बनाए रखने के लिए इसे आमतौर पर अलग से रिपोर्ट किया जाता है। बेंचमार्क को शैक्षणिक और औद्योगिक अनुसंधान समूहों दोनों द्वारा व्यापक रूप से अपनाया गया है, जिसके परिणाम मॉडल कार्ड और तकनीकी रिपोर्टों में प्रकाशित किए जाते हैं।

प्रदर्शन अंतर्दृष्टि

CMMLU के परिणामों से पता चला है कि जबकि कई बड़े भाषा मॉडल अंग्रेजी बेंचमार्क पर अच्छा प्रदर्शन करते हैं, वे अक्सर CMMLU पर पीछे रह जाते हैं, विशेष रूप से चीनी सांस्कृतिक ज्ञान की आवश्यकता वाले विषयों पर। उदाहरण के लिए, मुख्य रूप से अंग्रेजी डेटा पर प्रशिक्षित मॉडल चीनी इतिहास या पारंपरिक त्योहारों के बारे में प्रश्नों पर संघर्ष कर सकते हैं। इसके विपरीत, महत्वपूर्ण चीनी प्रशिक्षण डेटा वाले मॉडल, जैसे कि चीनी कंपनियों द्वारा विकसित, इन सांस्कृतिक रूप से विशिष्ट विषयों पर उच्च स्कोर प्राप्त करते हैं।

बेंचमार्क ने तर्क क्षमताओं में अंतर भी उजागर किया है। गणितीय और वैज्ञानिक तर्क में उत्कृष्ट मॉडल चीनी सामाजिक मानदंडों की सूक्ष्म समझ की आवश्यकता वाले कानूनी या नैतिक प्रश्नों पर विफल हो सकते हैं। इससे विविध प्रशिक्षण डेटा के महत्व और बड़े भाषा मॉडल के विकास में सांस्कृतिक रूप से जागरूक मूल्यांकन मीट्रिक की आवश्यकता के बारे में अंतर्दृष्टि प्राप्त हुई है।

प्रभाव और उपयोग

CMMLU कृत्रिम बुद्धिमत्ता के क्षेत्र में चीनी भाषा समझ का मूल्यांकन करने के लिए एक मानक संदर्भ बिंदु बन गया है। इसे अक्सर शोध पत्रों में उद्धृत किया जाता है और डेवलपर्स द्वारा नए मॉडल जारी करने से पहले बेंचमार्क करने के लिए उपयोग किया जाता है। बेंचमार्क ने अन्य भाषाओं और सांस्कृतिक संदर्भों के लिए समान मूल्यांकन सुइट्स के निर्माण को भी प्रेरित किया है, जो बहुभाषी और बहुसांस्कृतिक AI मूल्यांकन की ओर व्यापक आंदोलन में योगदान देता है।

शैक्षणिक उपयोग से परे, CMMLU परिणाम अक्सर मॉडल दस्तावेज़ीकरण और AI कंपनियों द्वारा विपणन सामग्री में शामिल किए जाते हैं। उदाहरण के लिए, अलीबाबा जैसे चीनी प्रदाताओं के मॉडल और अन्य ने चीनी में अपनी दक्षता प्रदर्शित करने के लिए अपने CMMLU स्कोर की रिपोर्ट की है। बेंचमार्क का उपयोग OpenAI और Anthropic जैसे संगठनों द्वारा आंतरिक मूल्यांकन में भी किया गया है ताकि उनके मॉडलों के ज्ञान में अंतर की पहचान की जा सके, हालांकि वे सभी परिणाम सार्वजनिक रूप से जारी नहीं करते हैं।

सीमाएं और भविष्य की दिशाएं

अपनी व्यापकता के बावजूद, CMMLU की सीमाएं हैं। बहुविकल्पीय प्रारूप खुले-अंत तर्क या उत्पादन क्षमताओं को पूरी तरह से कैप्चर नहीं कर सकता है। इसके अतिरिक्त, बेंचमार्क स्थिर है, जिसका अर्थ है कि यह नए ज्ञान के साथ स्वचालित रूप से अपडेट नहीं होता है, जो मॉडलों में सुधार के रूप में संतृप्ति का कारण बन सकता है। शोधकर्ताओं ने इन मुद्दों को संबोधित करने के लिए गतिशील बेंचमार्क और प्रतिकूल परीक्षण का प्रस्ताव दिया है, लेकिन CMMLU मानकीकृत तुलना के लिए एक मूल्यवान उपकरण बना हुआ है।

भविष्य के काम में CMMLU का विस्तार अधिक विषयों, कठिन प्रश्नों या इंटरैक्टिव मूल्यांकन प्रारूपों को शामिल करने के लिए किया जा सकता है। चीनी में शैक्षिक ट्यूटरिंग या कानूनी सहायता जैसे वास्तविक दुनिया के अनुप्रयोगों से CMMLU प्रदर्शन को जोड़ने में भी रुचि है। जैसे-जैसे मशीन लर्निंग विकसित होता रहता है, CMMLU जैसे बेंचमार्क यह सुनिश्चित करने में महत्वपूर्ण भूमिका निभाएंगे कि मॉडल न केवल तकनीकी रूप से सक्षम हैं बल्कि सांस्कृतिक रूप से भी सक्षम हैं।

निष्कर्ष

CMMLU गैर-अंग्रेजी भाषाओं के लिए बड़े भाषा मॉडल के मूल्यांकन में एक महत्वपूर्ण कदम का प्रतिनिधित्व करता है। एक समृद्ध, सांस्कृतिक रूप से आधारित परीक्षण सुइट प्रदान करके, यह शोधकर्ताओं और डेवलपर्स को मॉडल क्षमताओं और सीमाओं को बेहतर ढंग से समझने में सक्षम बनाता है। इसका व्यापक रूप से अपनाना AI प्रणालियों के प्रशिक्षण और मूल्यांकन के तरीके को प्रभावित करता है, जो अधिक समावेशी और मजबूत जनरेटिव AI विकास को बढ़ावा देता है। जैसे-जैसे क्षेत्र आगे बढ़ता है, CMMLU संभवतः चीनी भाषा समझ के लिए एक प्रमुख बेंचमार्क बना रहेगा, जो प्रौद्योगिकी और पद्धति दोनों में सुधार को बढ़ावा देगा।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·chinese-language·evaluation·large-language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास